Il riconoscimento visivo per l'inventario automatizzato di sigarette affronta ostacoli significativi, tra cui cambiamenti di illuminazione, dimensioni diverse delle scatole e occlusione parziale delle caratteristiche, che complicano la verifica del marchio e il rilevamento delle scatole spostate male. Questo articolo propone un modello migliorato di rilevamento in tempo reale per affrontare i problemi di riconoscimento delle immagini e migliorare la precisione. In primo luogo, viene implementato un modulo di downsampling adattivo per sostituire il modulo di convoluzione downsampling sia nella rete backbone che nel manico della serie YOLO come rivelatore di base o originale, che mantiene di fatto più dettagli delle caratteristiche e realizza la leggerezza del modello. In secondo luogo, viene introdotto un modulo di attenzione multiscala invertito, efficiente, per catturare le informazioni contestuali spaziali di diverse scale e generare una mappa dell'attenzione spaziale più accurata, che migliora la precisione di previsione del modello di base per caratteristiche complesse e obiettivi di occlusione. Infine, un modulo di testa di rilevamento dinamico sostituisce la testa di rilevamento originale del modello di base ed esegue la rilevazione di oggetti multiscala sulla feature map estratta dalle reti della spina dorsale e del collo per ottenere un posizionamento accurato e una divisione di categoria del bersaglio previsto. Per valutare le prestazioni del modello migliorato sul campo, abbiamo costruito un dataset visivo del marchio delle scatole di sigarette. Il dataset è stato arricchito utilizzando tecniche di copia-incolla specifiche per regione e tecniche di aumento tradizionali, e il dataset ottenuto include background complessi, occlusione e sovrapposizione, piccoli target e altri fattori. L'esperimento dimostra che il modello migliorato presentato in questo articolo soddisfa efficacemente i requisiti per la rilevazione in tempo reale sul campo. Il modello proposto raggiunge un mAP del 97,9%, con parametri e FLOP rispettivamente di 1.849.679 e 5,1 G. Rispetto al modello di base, il modello proposto migliora la mAP dello 0,9% riducendo i parametri del 28,78% e le operazioni in virgola mobile di 1,4 G. Inoltre, il modello raggiunge una velocità di inferenza di 38,5 FPS, soddisfacendo i requisiti per la rilevazione industriale in tempo reale.