Articolo di ricerca

Modello di rilevamento in tempo reale degli oggetti per l'identificazione dei marchi di sigarette basato su un'architettura di regressione a singolo stadio migliorata

DOI:

10.3791/69657

9 gennaio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Per affrontare sfide come l'occlusione e i cambiamenti di illuminazione nei magazzini automatizzati, questo articolo introduce un'Architettura di Regressione a Singolo Stadio migliorata per il rilevamento dei marchi delle scatole di sigarette. Integrando il downsampling adattivo, un meccanismo di attenzione multiscala invertito, efficiente e una testa di rilevamento dinamica, il modello proposto ottiene un inventario intelligente accurato e in tempo reale.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il riconoscimento visivo per l'inventario automatizzato di sigarette affronta ostacoli significativi, tra cui cambiamenti di illuminazione, dimensioni diverse delle scatole e occlusione parziale delle caratteristiche, che complicano la verifica del marchio e il rilevamento delle scatole spostate male. Questo articolo propone un modello migliorato di rilevamento in tempo reale per affrontare i problemi di riconoscimento delle immagini e migliorare la precisione. In primo luogo, viene implementato un modulo di downsampling adattivo per sostituire il modulo di convoluzione downsampling sia nella rete backbone che nel manico della serie YOLO come rivelatore di base o originale, che mantiene di fatto più dettagli delle caratteristiche e realizza la leggerezza del modello. In secondo luogo, viene introdotto un modulo di attenzione multiscala invertito, efficiente, per catturare le informazioni contestuali spaziali di diverse scale e generare una mappa dell'attenzione spaziale più accurata, che migliora la precisione di previsione del modello di base per caratteristiche complesse e obiettivi di occlusione. Infine, un modulo di testa di rilevamento dinamico sostituisce la testa di rilevamento originale del modello di base ed esegue la rilevazione di oggetti multiscala sulla feature map estratta dalle reti della spina dorsale e del collo per ottenere un posizionamento accurato e una divisione di categoria del bersaglio previsto. Per valutare le prestazioni del modello migliorato sul campo, abbiamo costruito un dataset visivo del marchio delle scatole di sigarette. Il dataset è stato arricchito utilizzando tecniche di copia-incolla specifiche per regione e tecniche di aumento tradizionali, e il dataset ottenuto include background complessi, occlusione e sovrapposizione, piccoli target e altri fattori. L'esperimento dimostra che il modello migliorato presentato in questo articolo soddisfa efficacemente i requisiti per la rilevazione in tempo reale sul campo. Il modello proposto raggiunge un mAP del 97,9%, con parametri e FLOP rispettivamente di 1.849.679 e 5,1 G. Rispetto al modello di base, il modello proposto migliora la mAP dello 0,9% riducendo i parametri del 28,78% e le operazioni in virgola mobile di 1,4 G. Inoltre, il modello raggiunge una velocità di inferenza di 38,5 FPS, soddisfacendo i requisiti per la rilevazione industriale in tempo reale.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La produzione e la logistica moderne si affidano fortemente ai Sistemi Automatizzati di Stoccaggio e Recupero (AS/RS)1 per ottenere uno stoccaggio ad alta densità, una gestione efficiente dei materiali e una gestione accurata dell'inventario. AS/RS è diventato un mezzo cruciale che può aiutare le imprese a migliorare l'efficienza del magazzino e a ridurre i costi, grazie alla sua elevata efficienza e alle caratteristiche intelligenti. Con una base di scaffali multistrato, varie attrezzature per il carico e lo scarico, l'AS/RS è un sistema meccatronico controllato da computer, che integra molteplici tecnologie tra cui meccanica, elettronica, informatica, comunicazioni, reti, sensori e controlloautomatico 2,3. L'AS/RS realizza lo stoccaggio e la gestione efficiente, accurata e sicura delle merci grazie all'integrazione e all'ottimizzazione di scaffali, gru impillate, linee di trasporto, sistemi di controllo e altre attrezzature, aumentando notevolmente l'efficienza dello stoccaggio. L'integrazione della visione artificiale in AS/RS, un aspetto chiave dell'Industria 4.0, consente livelli senza precedenti di automazione e intelligenza consentendo ai sistemi di vedere e prendere decisioni basate sui dativisivi 4.

Con l'ampia applicazione dell'AS/RS nelle fabbriche ditabacco 5, è stato proposto un nuovo requisito di scorte per i marchi di scatole di sigarette. I metodi tradizionali di calcolo manuale soffrono di inefficienza, alti tassi di rilevamento di falsi errori e rischi per la sicurezza, che non soddisfano le esigenze AS/RS. Con il continuo avanzamento della tecnologia di visione artificiale, le soluzioni di visione artificiale sono sempre più applicate nei domini di ispezioneindustriale 6,7,8. Poiché informazioni sul marchio con motivi e testo unici sono stampate su ogni scatola di sigarette, la tecnologia di riconoscimento delle immagini basata sulla visione artificiale consente l'identificazione del marchio e lo stoccaggio delle scatole di sigarette.

Dal 2012, gli algoritmi di rilevamento degli oggetti basati sul deep learning hanno portato importanti scoperte nel riconoscimento delle immagini 9,10,11. Dai primi modelli di rilevamento oggetti a due stadi come R-CNN12 ai modelli contemporanei di rilevamento oggetti a singolo stadio dominati dai modelli della serie YOLO come rivelatore di baseo originale 13,14,15, questi approcci hanno dato un contributo significativo allo sviluppo degli algoritmi di rilevamento oggetti. I compiti di inventario intelligente utilizzano sempre più i modelli di rilevamento degli oggetti per identificare e localizzare con precisione più bersagli in immagini o video. Li et al.16 hanno proposto un metodo intelligente di bilanciamento che integra sensori di pesatura e tecnologia di riconoscimento delle immagini per migliorare l'efficienza e la precisione dello stocking. Wang et al.17 hanno utilizzato la maschera R-CNN per segmentare il numero della libreria e la posizione del titolo dall'immagine del dorso del libro. Sun et al.18 progettarono un sistema integrato di riconoscimento visivo, che utilizzava OpenCV per riconoscere i codici bidimensionali su materiali e scaffali in modalità multipla. Hanno ottimizzato il rivelatore originale (v5) introducendo il meccanismo di attenzione C3CBAM e l'assegnazione di etichette SimOTA per migliorare le funzioni di perdita e garantire una rilevazione accurata multi-materiale.

Nel campo del rilevamento degli oggetti, mentre i modelli a due stadi — rappresentati da Faster R-CNN — possiedono tradizionali vantaggi nella precisione di rilevamento, i loro complessi meccanismi di generazione di proposte di regione portano a velocità di inferenza relativamente lente. Di conseguenza, faticano a soddisfare i rigorosi requisiti di prestazioni in tempo reale in scenariindustriali 19,20. Al contrario, l'architettura basata sulla regressione tratta il rilevamento degli oggetti come un singolo problema di regressione, prevedendo direttamente le posizioni dei target e le probabilità delle categorie dalle immagini di input. Questo design architettonico consente ai modelli di superare significativamente la maggior parte dei modelli a due stadi in termini di efficienza di inferenza, alleggerimento e flessibilità di implementazione, mantenendo al contempo una precisione competitiva. Pertanto, questa architettura è diventata la soluzione preferita per il rilevamento industrialein tempo reale 21.

L'ecosistema originale del modello continua a evolversi rapidamente, con varianti recenti che affrontano sfide specifiche. Ad esempio, il rilevatore originale (v12)22 si concentra ulteriormente sul miglioramento dell'ottimizzazione dei tempi di addestramento e sul perfezionamento architettonico per migliori compromessi tra precisione ed efficienza. Nel frattempo, il rivelatore originale (World)23 introduce capacità di rilevamento a vocabolario aperto, permettendo l'inferenza in tempo reale di una vasta gamma di oggetti oltre le categorie del set di addestramento sfruttando la modellazione del linguaggio di visione. Sebbene questi progressi spingano i confini del rilevamento di oggetti a scopo generale, questo lavoro si concentra su un'applicazione industriale specializzata dove la robustezza a sfide specifiche, come l'occlusione parziale e la varianza di illuminazione, è fondamentale, e lo spazio delle categorie è fisso e noto in anterio. Essendo la versione più calda di questa famiglia di modelli, il modellobase 24 eredita vantaggi dal rivelatore originale (v8)25,26; Non solo riduce il numero di parametri del modello, ma considera anche un equilibrio tra efficienza di rilevamento e accuratezza. Rispetto ad altri modelli di rilevamento oggetti, si distingue nei compiti di riconoscimento visivo.

La sfida di rilevare scatole di sigarette piccole o parzialmente occlute è una manifestazione di un problema più ampio nella visione artificiale. Il rilevamento di piccoli oggetti è stato attivamente studiato, con approcci che vanno dalle raffinazioni della rete a piramide di caratteristiche(FPN) 27 ai meccanismi di attenzione consapevoli del contesto, che ispirano l'integrazione dell'elaborazione delle caratteristiche su scala multipla. Inoltre, la ricerca dell'efficienza operativa in un contesto industriale richiede un modello leggero. Ispirati dai concetti di architettura efficiente esplorati in MobileNetV328 eGhostNet 29, questi concetti utilizzano convoluzioni profonde e trasformazioni lineari per ridurre la complessità computazionale mantenendo la capacità di presentazione, quindi scegliamo alcuni moduli leggeri per migliorare il modello. Pertanto, per gestire l'inventario dei marchi delle scatole di sigarette e i fattori che influenzano la scorta di scatole, come le variazioni di illuminazione, le differenze di dimensione delle caratteristiche tra i vari marchi e l'occlusione parziale tra le scatole di sigarette, proponiamo in questo articolo un modello migliorato di rilevamento degli oggetti con architettura di regressione a singolo stadio.

Le principali innovazioni del modello proposto sono tre. Innanzitutto, il modulo Adaptive Downsampling (ADown)30è implementato per sostituire il downsampling convoluzionale standard sia nella rete backbone che in quella neck. Questo design innovativo mitiga la perdita di informazioni durante la compressione delle funzionalità, fondamentale per preservare loghi e testi di piccoli marchi. In secondo luogo, viene introdotto un meccanismo invertito di Attenzione Multiscala Efficiente (iEMA) per potenziare il modello con una percezione contestuale dinamica e su più scala, migliorandone significativamente le prestazioni su scatole di sigarette piccole e parzialmente occlute. In terzo luogo, la testa di rilevamento originale viene sostituita dal modulo DynamicHead31 , che unifica le attenzioni di scala, spaziali e compiti, consentendo una localizzazione e classificazione più precise su bersagli di dimensioni molto diverse. Queste modifiche architettoniche sono progettate in modo coerente per affrontare i punti critici specifici dell'identificazione dei marchi di sigaretta negli ambienti industriali.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il dataset utilizzato in questo articolo è stato acquisito dal campo AS/RS del Dipartimento Logistica di Longyan Tobacco Industry Co., Ltd. Questo studio non ha coinvolto partecipanti umani né animali. Non era richiesta un'approvazione etica.

Acquisizione e configurazione dei dataset
Configurazione hardware: Montare una fotocamera industriale (ad esempio MV-CA013-A0GM) equipaggiata con un obiettivo a lunghezza focale da 8 mm (ad esempio, MVL-HF0828M-6MPE) sulla piattaforma di carico della gru impilatrice. Collega la fotocamera a un PC di controllo tramite un cavo GigE e un dispositivo AP wireless (ad esempio, BH-ANT5158S-14HV, BH-MS-AC1600HWH). Posizionare una striscia LED (ad esempio MV-LLDS-1002-38-W) attorno alla fotocamera per garantire un'illuminazione uniforme.

Impostazione parametri della fotocamera: Configura la telecamera utilizzando il software del produttore (ad esempio, MVS). Imposta la risoluzione di acquisizione a 1280 x 1024 pixel. Imposta la modalità di innesco su Hardware Trigger e sincronizzala con il sistema di posizionamento della gru impilatrice. Imposta il tempo di esposizione a 100 ms e il guadagno a 5 dB per minimizzare la sfocatura e il rumore. La distanza di lavoro tra la telecamera e le scatole di sigarette è di circa 550 mm.

Raccolta immagini: Una fotocamera industriale con grilletto cattura automaticamente un'immagine ogni volta che un vassoio viene posizionato durante la conservazione e il recupero delle scatole di sigarette. Raccogli un totale di 4.835 immagini grezze; immagini tipiche sono mostrate nella Figura 1.

Annotazione immagini: Usa lo strumento open-source LabelImg. Per ogni immagine, disegna delle riquadre delimitate attorno a ogni caratteristica visibile della marca di sigaretta. Assegnare il nome di marca corretto (ad esempio, Hongzhuang, Gutian) come etichetta di classe per ogni riquadro di delimitazione. Salva le annotazioni in un formato standard di rilevamento a singolo stadio, con un file txt per ogni immagine.

Controllo qualità: Un secondo annotatore esamina casualmente il 20% delle immagini annotate. Eventuali discrepanze vengono discusse e risolte, garantendo la coerenza dell'etichettatura.

Strategia di aumento dei dati
Questa sezione dettaglia sia le tecniche di aumento tradizionali che avanzate applicate ai dataset. I dati iniziali e i dati aumentati vengono combinati in un nuovo dataset, che viene poi suddiviso in set di addestramento, set di validazione e set di test per garantire l'equità nella valutazione.

Aumento tradizionale deidati 32: Queste trasformazioni vengono applicate in tempo reale dalla pipeline di addestramento (ad esempio, utilizzando le librerie Albumentations o PyTorch Transforms) con una probabilità definita per ogni lotto.

Trasformazioni geometriche: Rotazione: ruotare casualmente le immagini con un angolo compreso tra -45° e +45°. Scala: Scala casualmente le immagini di un fattore compreso tra 0,8 e 1,2. Ribaltamento orizzontale: Inverti le immagini in orizzontale con una probabilità del 100%. Ritaglio casuale: ritaglia casualmente una sezione tra l'80% e il 100% dell'area originale dell'immagine.

Trasformazioni fotometriche: Luminosità e contrasto: Regolare luminosità e contrasto con un fattore scelto casualmente da [0.6, 1.4]. Rumore gaussiano: Aggiungi rumore gaussiano con una deviazione standard scelta casualmente da [0, 0,01 * 255] al 10% delle immagini. Sfocatura gaussiana: applica una sfocatura gaussiana con una dimensione del nucleo da 3x3 al 10% delle immagini.

Simulazione di occlusione: Posizionare casualmente da 1 a 3 chiazze rettangolari di occlusione (che coprono fino al 5% ciascuna dell'area dell'immagine) sulle immagini. Le patch sono riempite con rumore casuale o valori medi di pixel dell'immagine.

Potenziamento avanzato dei dati: copia-incolla specifica per regione
Motivazione e impatto: La motivazione principale di questo aumento miro era affrontare un problema critico dei dati: diversi marchi di sigarette avevano pochissimi casi (anche solo una foto). Una divisione standard casuale di test di validazione del treno potrebbe potenzialmente allocare tutte le istanze di un marchio raro a un unico insieme (ad esempio, tutte al set di test), facendo sì che il modello non abbia opportunità di apprendere o convalidare quel marchio. Questo metodo ha aumentato artificialmente la dimensione del campione per questi marchi sottorappresentati, assicurando che ogni marchio abbia un numero sufficiente di istanze distribuite tra i set di addestramento, validazione e test. Questo passaggio fondamentale previene fallimenti catastrofici in categorie rare ed è un prerequisito per qualsiasi performance significativa e generalizzazione del modello sull'intero insieme dei marchi.

Questo passaggio richiede un modello di base segmentale pre-addestrato sul dataset iniziale e il Segment Anything Model (SAM)33.

Segmenta oggetti sorgente: Per immagini di scatole di sigarette di marchi sottorappresentati, usa il modello SAM per generare maschere di segmentazione precise. Usa la modalità punto a spunto, cliccando sulla Funzione Marca della Scatola delle Sigarette per avviare la segmentazione. Valida e affina manualmente le maschere generate per garantire accuratezza. Salva le immagini segmentate delle scatole di sigarette con sfondi trasparenti come file PNG. Questo crea una libreria di istanze isolate di oggetti.

Genera maschere di sfondo: Usa il modello segmentale di base pre-addestrato per eseguire la segmentazione delle istanze su un insieme di immagini di sfondo (immagini con ampio spazio libero o sfondi semplici). Il modello produrrà maschere binarie che indicano le regioni già occupate dagli oggetti.

Maschere di processo e incolla oggetti: Per ogni maschera di sfondo, si utilizza la libreria OpenCV (funzione 'cv2.approxPolyDP' con un fattore epsilon di 0,02 * perimetro di contorno) per eseguire l'adattamento delle curve e linearizzare i bordi della maschera, ottenendo una rappresentazione poligonale semplificata dello spazio libero. Identifica la più grande area di poligoni contigui all'interno della maschera di sfondo come la regione della pasta target. Seleziona casualmente un oggetto sorgente segmentato dalla libreria. Ridimensionarla (mantenendo il rapporto d'aspetto) e applicare una trasformazione affine (rotazione minore tra -5° e +5°, e leggera taglio) per adattarla naturalmente all'interno della regione della pasta target, assicurandosi che non si sovrapponi ai confini degli oggetti esistenti. Usa l'alpha blending per incollare senza soluzione di continuità l'oggetto trasformato sull'immagine di sfondo nella posizione calcolata. Il quadro complessivo della tecnologia di aumento dei dati, basato sulla tecnica copia-incolla in aree specifiche, è mostrato nella Figura 2. Genera in modo programmatico un nuovo file di annotazione txt corrispondente per l'oggetto incollato, aggiornando le coordinate della scatola delimitatrice e l'etichetta della classe.

Dataset finale aumentato: Questo processo offline genera 600 nuove immagini sintetiche. Combinandole con le 4.835 immagini originali e altre 1.167 immagini generate applicando le tecniche di aumento tradizionali descritte sopra per formare il dataset finale di 6.602 immagini. Dividere il dataset finale in set di addestramento (70%, 4.621 immagini), validazione (20%, 1.320 immagini) e test (10%, 661 immagini), assicurandosi che le immagini della stessa sequenza originale siano mantenute all'interno della stessa divisione per prevenire perdite di dati.

Modifica del modello per la costruzione del rivelatore migliorato proposto
Gli algoritmi ottimizzati per il rilevamento degli oggetti34 hanno raggiunto notevoli progressi nell'ispezione industriale negli ultimi anni. Questa sezione fornisce una procedura dettagliata passo dopo passo per modificare l'architettura del modello di base per creare il modello proposto. Le modifiche vengono implementate modificando il file di configurazione del modello (ad esempio, config.yaml) e assicurandosi che le corrispondenti definizioni personalizzate dei moduli siano incluse nella base di codice. La motivazione di ciascuna modifica viene fornita per chiarirne il ruolo nell'affrontare specifiche sfide di rilevamento. La struttura del modello proposto è mostrata nella Figura 3.

Sostituzione dei moduli di downsampling con il modulo ADown: Il modulo standard Convolution-BatchNorm-SiLU (CBS) impiega una singola convoluzione strided che può agire come collo di bottigliainformativo 35, potenzialmente eliminando caratteristiche a grana fine cruciali per riconoscere piccole scatole di sigarette e loghi dettagliati del marchio. Il modulo ADown è progettato per alleviare questo problema implementando una struttura a doppio ramo che cattura e preserva un insieme più ricco di caratteristiche durante la riduzione della risoluzione spaziale. Un ramo dà priorità alla conservazione dei dettagli locali ad alta frequenza, mentre l'altro cattura una panoramica più ampia e ricca di contesto. La fusione di queste caratteristiche complementari porta a una rappresentazione più robusta e informativa per i livelli successivi.

Passaggi di implementazione
Definizione del modulo: Assicurarsi che un modulo personalizzato di PyTorch chiamato ADown sia definito all'interno dei file di definizione del modello del progetto. Questo modulo deve contenere due rami paralleli. Il primo ramo dovrebbe consistere in uno strato convoluzionale bidimensionale con un nucleo 3x3 e una stride di 2. Il secondo ramo dovrebbe consistere sequencialmente in uno strato di max-pooling 2x2 (con passo 2) seguito da uno strato di convoluzione 1x1. Gli output di questi due rami devono essere concatenati lungo la dimensione del canale, e la mappa delle caratteristiche risultante viene poi passata attraverso uno strato finale di convoluzione 1x1 per integrare i canali e produrre l'output. La struttura del modulo ADown è mostrata nella Figura 4.

Modifica file di configurazione: Apri il file di configurazione del modello di base (config.yaml). Identifica sistematicamente ogni istanza del modulo CBS configurata per il downsampling (cioè dove il parametro stride è impostato a 2). Sostituire ciascuna di queste voci del modulo CBS con il nuovo modulo ADown.

Motivazione progettuale: Il design di ADown è motivato dalla necessità di mitigare la perdita di informazioni nelle convoluzioni standard strided convolutions, che possono essere dannose per oggetti piccoli. La sua struttura a doppio ramo è ispirata all'idea dell'elaborazione parallela per catturare sia dettagli spaziali ad alta frequenza (tramite convoluzione) sia informazioni contestuali a bassa frequenza (tramite pooling), fornendo così una rappresentazione più ricca delle caratteristiche multiscala per i livelli successivi.

Integrazione del modulo iEMA
Motivazione e principio progettuale: Per migliorare la capacità del modello di rilevare piccoli bersagli e quelli parzialmente oscurati, è essenziale incorporare un meccanismo che possa modellare efficacemente contesti spaziali su più scala. Il modulo iEMA ottiene questo obiettivo incorporando un componente Efficient Multi-scale Attention (EMA)36 all'interno di una struttura a blocco residuo invertito (iRMB)37 . L'iRMB fornisce una base computazionalmente efficiente utilizzando convoluzioni separabili in profondità, mentre la componente EMA cattura esplicitamente interazioni spaziali su scala trasversale attraverso un design parallelo multiramo. Questa integrazione permette al modello di ricalibrare dinamicamente i pesi delle caratteristiche, concentrando l'attenzione sulle regioni spaziali più discriminative su diverse scale, migliorando così il riconoscimento in caso di occlusione e per oggetti piccoli.

Passi di azione-implementazione
Definizione del modulo: Assicurarsi che sia definito un modulo personalizzato di PyTorch chiamato iEMA. Questo modulo dovrebbe prima implementare un blocco residuo invertito. Questo blocco tipicamente inizia con una convoluzione punto a punto per l'espansione del canale, seguita da una convoluzione in profondità (ad esempio, 3x3) per l'estrazione delle caratteristiche spaziali, e infine una convoluzione puntuale per la proiezione del canale. Immediatamente dopo questo blocco, dovrebbe essere implementato il meccanismo di attenzione EMA. Il meccanismo EMA tipicamente impiega convoluzioni raggruppate e interazioni trasversali per generare in modo efficiente una mappa di attenzione spaziale su più scala senza un eccessivo sovraccarico computazionale. La struttura del modulo iEMA è mostrata nella Figura 5.

Modifica del file di configurazione: Nel file di configurazione config.yaml, individua le sezioni che definiscono la rete del collo, in particolare i livelli immediatamente successivi ai moduli C2F. In queste posizioni strategiche, inserire un nuovo livello che richiama il modulo iEMA.

Motivazione progettuale: Il modulo iEMA si basa sul principio di migliorare la discriminabilità delle caratteristiche integrando l'estrazione locale delle caratteristiche (tramite convoluzione in profondità) con un meccanismo di modellazione globale del contesto (EMA) leggero ma efficace. Questo approccio ibrido permette al modello di concentrarsi in modo adattivo su regioni informative su diverse scale, cosa cruciale per riconoscere loghi e testi di brand parzialmente visibili.

Sostituzione della testina di rilevamento con il modulo DynamicHead
Motivazione e principio progettuale: La testa di rilevamento originale potrebbe non gestire in modo ottimale la significativa variazione di scala delle scatole di sigarette e la complessa interazione tra compiti di localizzazione e classificazione. Il modulo DynamicHead affronta questo obiettivo unificando tre forme di attenzione in una struttura coerente: consapevole della scala, consapevole dello spazio e attenzione consapevole del compito. Il componente consapevole della scala fonde dinamicamente caratteristiche provenienti da diversi livelli della piramide delle caratteristiche, assicurando che oggetti di tutte le dimensioni siano rappresentati efficacemente. La componente spaziale utilizza una strategia di campionamento scarno per concentrare le risorse computazionali sulle regioni più informative all'interno delle feature map. La componente task-aware adatta la rappresentazione delle caratteristiche specificamente per gli obiettivi distinti della regressione delle scatole delimitanti e della classificazione delle categorie. Questo approccio unificato porta a previsioni più accurate e solide.

Passi di azione-implementazione
Definizione del modulo: Questo è un modulo complesso che comprende i tre meccanismi di attenzione descritti dalle Equazioni (1) fino a (4). La sua struttura interna includerà strati per calcolare pesi su scala, eseguire attenzione spaziale deformabile e applicare trasformazioni di caratteristiche specifiche per compito.

Equazione 1(1)

Equazione 2(2)

Equazione 3(3)

Equazione 4(4)

Dove WL(F) indica la mappa finale delle caratteristiche affinate dell'attenzione, ottenuta applicando sequenzialmente i meccanismi di attenzione consapevoli della scala π L(F), consapevoli dello spazio πS(F) e i meccanismi di attenzione consapevoli del compito π C(F) alla caratteristica di input F. In particolare, nell'Equazione (2), πL(F) calcola un peso di attenzione scala a scala facendo prima una media tra le dimensioni spaziali (S) e del canale (C), passandolo attraverso una funzione lineare f(⋅) e un'attivazione sigmoide rigida σ(⋅). Nell'Eq. (3), πS(F) esegue un'attenzione spaziale scarsa aggregando caratteristiche da K punti chiave campionati pk, ciascuno con uno spostamento apprendibile Δp k per concentrarsi su regioni discriminative e uno scalare di importanza Δm k. Nell'Eq. (4), πC(F) implementa un'attenzione consapevole del compito applicando una trasformazione lineare (governata da parametri appresi (α1, β1,α 2,β 2)) a ciascun canale e selezionando la risposta massima, permettendo alla testa di specializzarsi per compiti di classificazione e regressione. La struttura del modulo DynamicHead è mostrata nella Figura 6.

Modifica del file di configurazione: Nel file config.yaml, trova la sezione che definisce la testa del modello, che originariamente contiene il modulo Detect. Sostituiscila con una nuova voce che chiama il modulo DynamicHead.

Motivazione di progettazione: Il modulo DynamicHead si basa sull'osservazione che le teste di rilevamento degli oggetti dovrebbero essere adattive alla scala, alla posizione spaziale e al compito. Il suo quadro di attenzione unificato, formalizzato in Equalizzazioni. (1-4), consente al modello di ricalibrare dinamicamente le risposte delle caratteristiche basandosi su queste tre dimensioni, portando a previsioni più robuste contro variazioni di scala e disordini di fondo.

Addestramento al modello
Assicurati che PyTorch 2.1.0, CUDA 12.1 e tutte le dipendenze siano installate.

Comando di addestramento
Prima di riaddestrarsi, preparare i dati dell'immagine divisa e quelli delle annotazioni in un formato standard di rilevamento a singolo stadio. Crea un file .yaml contenente il percorso immagine e la categoria dati. Secondo il miglioramento del modello, il file .yaml originale del rilevatore viene sostituito dal file .yaml del modello proposto. Scrivi il file train.py, importi il pacchetto rilevatore a singolo stadio, carichi il modello di addestramento e il percorso dati, e imposta alcuni parametri di addestramento, tra cui imgze=640, epochs=100, batch=4, workers=0, device='0', ottimizzatore='SGD', close_mosaic=10, ecc.

Iperparametri: I parametri chiave sono: dimensione dell'immagine di input (640 x 640), dimensione del lotto (4), tasso di apprendimento iniziale (0,01) con scheduler di ricottura coseno, ottimizzatore SGD con quantità di moto (0,937) e decadimento del peso (0,0005). L'augmentazione Mosaic è abilitata di default.

Monitoraggio dell'addestramento: Il processo di addestramento fornirà metriche per ogni epoca. Monitorare le curve per perdite di addestramento/validazione e mAP a 0,5 per garantire la convergenza ed evitare sovrafitting. L'addestramento per 100 epoche è generalmente sufficiente.

Valutazione e distribuzione del modello
Valutazione: Dopo l'allenamento, il modello migliore viene salvato come runs/allenamento/esperienza/pesi/best.pt. Valutalo sul set val usando: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Lo script riproduce Precisione, Richiuro, mAP a 0,5, ecc. Conferma che il mAP raggiunga la soglia richiesta (ad esempio, 97,9%).

Inferenza per la verifica: Esegui inferenza su immagini di esempio per verificare visivamente i risultati della rilevazione: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Verificando il ragionamento, si possono ottenere i risultati di rilevamento di ogni immagine e la velocità di rilevamento del modello.

Implementazione: Per il dispiegamento in tempo reale sul sistema della gru impilatrice, convertite il modello PyTorch (best.pt, ~4,7 MB) in un formato come TensorRT o ONNX per ottimizzare la velocità di inferenza. L'output finale è costituito da riquadri di delimitazione con etichette di classe (nomi di marchi) e punteggi di confidenza.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ambiente sperimentale e impostazione dei parametri
Sono stati condotti esperimenti per verificare le prestazioni del modello proposto sul framework di deep learning PyTorch, e i dettagli dell'ambiente sperimentale sono elencati nella Tabella 1. Qui abbiamo utilizzato un dataset speciale contenente 6.602 immagini suddiviso casualmente in set di addestramento, validazione e test con un rapporto di 7:2:1. Tutti gli esperimenti utilizzavano immagini di input con una risoluzione di 640 x 6...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Compromesso precisione-efficienza
Un risultato centrale di questo modello è il suo superiore equilibrio tra accuratezza ed efficienza computazionale. Come evidenziato nella Tabella 2, il modello presentato raggiunge il massimo mAP pur avendo il minor numero di parametri e il secondo FLOP più basso tra i modelli a singolo stadio confrontati. Questo si traduce direttamente in benefici pratici: un modello più piccolo è più veloce da distribuire, richiede...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi finanziari diretti in concorrenza. Questa ricerca è stata condotta in collaborazione con Longyan Tobacco Industrial Co., Ltd., dove sono impiegati gli autori Hongli Deng e Wencan Li, e con Baoji Taborum Factory, dove è impiegato l'autore Baobin Luo. Queste affiliazioni fornivano lo scenario applicativo e i dati di campo per lo studio. Gli autori accademici (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) dichiarano che non ci sono conflitti di interesse finanziari o non finanziari riguardo alla pubblicazione di quest'opera.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato finanziato finanziariamente dal Metodo di Misurazione della Temperatura per la Fusione del Billette basato su riflettore precedente e multi-lunghezza d'onda (No.LZY24E050002) finanziato dai Fondi Congiunti della Zhejiang Provincial Natural Science Foundation of Zhejiang Provincial Natural Science Foundation, e dal Metodo Online di Misurazione del Campeggio della Temperatura della Cavità a Mestolo Non Chiuso e Non Isotermico (No. 2023K231) finanziato dal Progetto di Pianificazione Scientifica e Tecnologica di Quzhou.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Lettore di codiceHikvisionID5050Apparecchiatura Hikvision: usata per leggere i codici a barre sui pallet, è necessario collegare l'alimentatore 24V
Fotocamera industrialeHikvisionMV-CA013-A0GM, MV-CS016-10GMÈ necessario collegare l'alimentatore a 24V
Luce LEDHIKROBOTMV-LLDS-1002-38-WUna sorgente luminosa a striscia di un metro fornisce condizioni di illuminazione sufficienti per la fotocamera
ObiettivoHikvisionMVL-HF0828M-6MPELunghezza focale: 8mm, apertura di apertura: F2.8~F16, pixel: 6 milioni
MVSHikvisionV4.5.1Software Hikvision: Utilizzato per il debug delle telecamere, l'impostazione dei parametri della telecamera e la raccolta dati
PycharmJetBrains2020.1.3 x64Utilizzato per addestrare modelli di deep learning e sviluppare sistemi di rilevamento
Diverse staffe metallicheLongyan Tobacco Industrial Co., Ltd.7075-T6 Lega di AlluminioUtilizzato per riparare telecamere e lettori di codice
Diversi cavi di reteLongyan Tobacco Industrial Co., Ltd.RJ45 Crystal HeadCollega la stazione base tra il computer industriale e l'AP wireless, collega la telecamera e l'interruttore, ecc
SwicthTP-LinkTL-SH1005Ci sono 8 interfacce via cavo Ethernet che richiedono un alimentatore da 220V
Visione MaestroHikvisionV4.3.0Software Hikvision: Utilizzato per il matching dei template e il rilevamento dei risultati delle immagini
Dispositivo AP wirelessShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHA causa del grande movimento richiesto dalla gru impilatrice, il cavo di rete non può collegare la telecamera al computer industriale, ed è necessario un dispositivo wireless AP per garantire il funzionamento fluido della rete telecamera

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Video in arrivo

Articoli correlati