Forschungsartikel

Echtzeit-Objekterkennungsmodell zur Markenidentifikation von Zigaretten basierend auf einer verbesserten einstufigen Regressionsarchitektur

DOI:

10.3791/69657

9. Januar 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um Herausforderungen wie Verschluss- und Lichtänderungen in automatisierten Lagerhäusern anzugehen, stellt dieses Papier eine verbesserte Einstufige Regressionsarchitektur für die Markenerkennung von Zigarettenschachteln vor. Durch die Integration adaptiver Downsampling, eines inverted effizienten multiskaligen Aufmerksamkeitsmechanismus und eines dynamischen Detektionskopfes erreicht das vorgeschlagene Modell eine präzise, Echtzeit-intelligente Bestandsaufnahme.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die visuelle Erkennung für automatisierte Zigarettenbestände steht vor erheblichen Hürden, darunter Beleuchtungsänderungen, unterschiedliche Verpackungsgrößen und teilweise Funktionsverschluss, was die Markenüberprüfung und die Erkennung von fehlplatzierten Verpackungen erschwert. Dieser Artikel schlägt ein verbessertes Echtzeit-Erkennungsmodell vor, um Bilderkennungsprobleme zu lösen und die Genauigkeit zu verbessern. Erstens wird ein adaptives Downsampling-Modul eingesetzt, um das Downsampling-Faltungsmodul sowohl im Backbone- als auch im Nackennetz der YOLO-Serie als Basis- oder Originaldetektor zu ersetzen, wodurch mehr Funktionsdetails erhalten bleiben und das Leichtgewicht des Modells realisiert werden. Zweitens wird ein invertiertes, effizientes, multiskaliges Aufmerksamkeitsmodul eingeführt, das die räumlichen Kontextinformationen verschiedener Skalen erfasst und eine genauere räumliche Aufmerksamkeitskarte erzeugt, was die Vorhersagegenauigkeit des Basismodells für komplexe Merkmale und Okklusionsziele verbessert. Schließlich ersetzt ein dynamisches Detektionskopfmodul den ursprünglichen Detektionskopf des Baseline-Modells und führt eine multiskalige Objekterkennung auf der Merkmalskarte durch, die aus Rückgrat- und Nackennetzwerken extrahiert wurde, um eine genaue Positionierung und Kategorienteilung des vorhergesagten Ziels zu erreichen. Um die Leistung des verbesserten Modells vor Ort zu bewerten, haben wir einen visuellen Datensatz der Marke Zigarettenschachtel erstellt. Der Datensatz wurde mit regionsspezifischen Copy-Paste- und traditionellen Augmentationstechniken erweitert, und der erhaltene Datensatz enthält komplexe Hintergrund-, Verschluss- und Überlappungsfaktoren, kleine Ziele und weitere Faktoren. Das Experiment zeigt, dass das in diesem Artikel vorgestellte verbesserte Modell die Anforderungen für Echtzeiterkennung im Feld effektiv erfüllt. Das vorgeschlagene Modell erreicht eine mAP von 97,9 % mit Parametern und FLOPs von 1.849.679 bzw. 5,1 G. Im Vergleich zum Basismodell verbessert das vorgeschlagene Modell den mAP um 0,9 %, reduziert die Parameter um 28,78 % und Gleitkommaoperationen um 1,4 G. Darüber hinaus erreicht das Modell eine Schlussfolgergeschwindigkeit von 38,5 FPS, was die Anforderungen an die Echtzeit-Industriedetektion erfüllt.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Moderne Fertigung und Logistik sind stark auf automatisierte Lager- und Rückholsysteme (AS/RS)1 angewiesen, um eine hochdichte Lagerung, effiziente Materialhandhabung und präzises Bestandsmanagement zu erreichen. AS/RS ist aufgrund seiner hohen Effizienz und intelligenten Eigenschaften zu einem entscheidenden Mittel geworden, das Unternehmen dabei helfen kann, die Effizienz im Lager zu steigern und Kosten zu senken. Mit einer Grundlage aus mehrschichtigen Regalen sowie verschiedenen Be- und Entladegeräten ist das AS/RS ein computergesteuertes Mechatroniksystem, das mehrere Technologien integriert, darunter Mechanik, Elektronik, Informatik, Kommunikation, Netzwerke, Sensoren und automatische Steuerung 2,3. Die AS/RS realisiert eine effiziente, präzise und sichere Lagerung und Handhabung von Gütern durch die Integration und Optimierung von Regalen, Stapelkranen, Förderleitungen, Steuerungssystemen und anderer Ausrüstung, was die Lagereffizienz erheblich steigert. Die Integration von Computer Vision in AS/RS, ein zentraler Aspekt von Industrie 4.0, ermöglicht ein beispielloses Maß an Automatisierung und Intelligenz, indem sie es Systemen ermöglicht, visuelle Daten zu sehen und auf Basis dieser Entscheidungenzu treffen 4.

Mit der weitverbreiteten Anwendung des AS/RS in Tabakfabriken5 wurde eine neue Bestandsaufnahme für Zigarettenschachtelmarken vorgeschlagen. Traditionelle manuelle Bestandsaufnahmeverfahren leiden unter Ineffizienz, hohen Fehlerkennungsraten und Sicherheitsrisiken, die die Anforderungen der AS/RS nicht erfüllen. Mit dem kontinuierlichen Fortschritt der Computer-Vision-Technologie werden maschinelle Vision-Lösungen zunehmend in industriellen Inspektionsbereichen 6,7,8 eingesetzt. Da Markeninformationen mit einzigartigen Mustern und Text auf jeder Zigarettenschachtel aufgedruckt sind, ermöglicht maschinelle Bilderkennungstechnologie die Markenidentifikation und Bestandsaufnahme der Zigarettenschachtel.

Seit 2012 haben Deep-Learning-basierte Objekterkennungsalgorithmen bedeutende Durchbrüche bei der Bilderkennunggebracht. Von frühen zweistufigen Objekterkennungsmodellen wie R-CNN12 bis hin zu zeitgenössischen einstufigen Objekterkennungsmodellen, die von YOLO-Serienmodellen als Basis oder ursprünglicher Detektor 13,14,15 dominiert werden, haben diese Ansätze einen bedeutenden Beitrag zur Entwicklung von Objekterkennungsalgorithmen geleistet. Intelligente Bestandsaufnahmen verwenden immer häufiger Objekterkennungsmodelle, um mehrere Ziele in Bildern oder Videos genau zu identifizieren und zu lokalisieren. Li et al.16 schlugen eine intelligente Bestandsaufnahmemethode vor, die Wiegesensoren und Bilderkennungstechnologie integriert, um die Effizienz und Genauigkeit der Bestandsaufnahme zu verbessern. Wang et al.17 verwendeten Maske R-CNN, um die Regalnummer und die Titelposition aus dem Buchrückenbild zu segmentieren. Sun et al.18 entwickelten ein integriertes visuelles Erkennungssystem, das OpenCV nutzte, um die zweidimensionalen Codes auf Materialien und Regalen in Multimode zu erkennen. Sie optimierten den ursprünglichen Detektor (v5s) durch Einführung des C3CBAM-Aufmerksamkeitsmechanismus und der SimOTA-Labelzuweisung, um die Verlustfunktionen für eine genaue Multimaterialerkennung zu verbessern.

Im Bereich der Objekterkennung verfügen zweistufige Modelle – dargestellt durch Faster R-CNN – zwar über traditionelle Vorteile bei der Erkennungspräzision, doch ihre komplexen Mechanismen zur Generierung von Regionenvorschlägen führen zu relativ langsamen Inferenzgeschwindigkeiten. Folglich haben sie Schwierigkeiten, die strengen Anforderungen an die Echtzeitleistung in industriellen Szenarien zu erfüllen19,20. Im Gegensatz dazu behandelt die regressionsbasierte Architektur die Objekterkennung als ein einzelnes Regressionsproblem und sagt gezielt Zielpositionen und Kategorienwahrscheinlichkeiten aus Eingabebildern vorher. Dieses architektonische Design ermöglicht es Modellen, die meisten zweistufigen Modelle hinsichtlich Inferenzeffizienz, Leichtgewichtung und Einsatzflexibilität deutlich zu übertreffen, während gleichzeitig die Wettbewerbsgenauigkeit erhalten bleibt. Daher ist diese Architektur zur bevorzugten Lösung für Echtzeit-Industriedetektion21.

Das ursprüngliche Modellökosystem entwickelt sich weiterhin rasant, wobei neuere Varianten spezifische Herausforderungen adressieren. Beispielsweise konzentriert sich der ursprüngliche Detektor(v12)22 darauf, die Trainingszeitoptimierung und architektonische Verfeinerung weiter zu verbessern, um bessere Genauigkeitseffizienz-Kompromisse zu erzielen. Unterdessen führt der ursprüngliche Detektor (World)23 Open-Vokabular-Erkennungsfunktionen ein, die eine Echtzeit-Inferenz einer Vielzahl von Objekten jenseits der Trainingskategorien durch Nutzung von Vision-Sprach-Modellierung ermöglichen. Während diese Fortschritte die Grenzen der allgemeinen Objekterkennung erweitern, konzentriert sich diese Arbeit auf eine spezialisierte industrielle Anwendung, bei der die Robustheit gegenüber spezifischen Herausforderungen wie partieller Okklusion und Beleuchtungsvarianz von größter Bedeutung ist und der Kategorienraum a priori festgelegt und bekannt ist. Als heißeste Version dieser Modellfamilie erbt das Baseline-Modell24 Vorteile vom ursprünglichen Detektor(v8)25,26; Sie reduziert nicht nur die Anzahl der Modellparameter, sondern berücksichtigt auch ein Gleichgewicht zwischen Erkennungseffizienz und Genauigkeit. Im Vergleich zu anderen Objekterkennungsmodellen hebt es sich bei visuellen Erkennungsaufgaben hervor.

Die Herausforderung, kleine oder teilweise verstopfte Zigarettenschachteln zu erkennen, ist ein Ausdruck eines umfassenderen Problems in der Computervision. Die Erkennung kleiner Objekte wurde aktiv erforscht, mit Ansätzen von Feature-Pyramid-Netzwerk-(FPN)-Verfeinerungen27 bis hin zu kontextbewussten Aufmerksamkeitsmechanismen, die die Integration von Multi-Scale-Feature-Verarbeitung inspirieren. Darüber hinaus erfordert das Streben nach operativer Effizienz in einem industriellen Umfeld ein leichtes Modelldesign. Inspiriert von den effizienten Architekturkonzepten, die in MobileNetV328 und GhostNet29 erforscht wurden, nutzen diese Konzepte tiefe Faltung und lineare Transformation, um die Rechenkomplexität zu reduzieren und gleichzeitig die Präsentationsfähigkeit zu erhalten, weshalb wir einige leichte Module wählen, um das Modell zu verbessern. Daher schlagen wir in diesem Artikel ein verbessertes einstufiges Modell zur Objekterkennung einer einstufigen Regressionsarchitektur und der einflussreichen Faktoren wie Beleuchtungsänderungen, Merkmalgrößenunterschiede verschiedener Marken und teilweise Verschluss zwischen den Zigarettenschachteln vor.

Die wichtigsten Neuerungen des vorgeschlagenen Modells sind dreifach. Erstens wird das Adaptive Downsampling (ADown)30-Moduleingesetzt, um das standardmäßige konvolutionelle Downsampling sowohl im Backbone- als auch im Nackennetzwerk zu ersetzen. Dieses neuartige Design mindert Informationsverluste während der Feature-Kompression, was entscheidend ist, um kleine Markenlogos und -texte zu erhalten. Zweitens wird ein inverted Efficient Multi-scale Attention (iEMA)-Mechanismus eingeführt, der dem Modell eine dynamische, multiskalige kontextuelle Wahrnehmung verleiht und seine Leistung bei kleinen und teilweise verstopften Zigarettenschachteln deutlich steigert. Drittens wird der ursprüngliche Detektionskopf durch das DynamicHead31-Modul ersetzt, das Maßstab, räumliche und aufgabenbewusste Aufmerksamkeit vereint und so eine präzisere Lokalisierung und Klassifikation über Ziele sehr unterschiedlicher Größe ermöglicht. Diese architektonischen Änderungen sind kohärent entworfen, um die spezifischen Probleme der Zigarettenmarkenidentifikation in industriellen Umgebungen zu adressieren.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Der in diesem Artikel verwendete Datensatz stammt aus dem AS/RS-Bereich der Logistikabteilung der Longyan Tobacco Industry Co., Ltd. Diese Studie umfasste weder menschliche Teilnehmer noch Tiere. Eine ethische Genehmigung war nicht erforderlich.

Datensatzerfassung und -einrichtung
Hardware-Konfiguration: Montage einer Industriekamera (z. B. MV-CA013-A0GM), ausgestattet mit einem 8-mm-Brennweitenobjektiv (z. B. MVL-HF0828M-6MPE), auf der Ladeplattform des Stapelkrans. Verbinden Sie die Kamera mit einem Steuer-PC über ein GigE-Kabel und ein kabelloses AP-Gerät (z. B. BH-ANT5158S-14HV, BH-MS-AC1600HWH). Positionieren Sie eine LED-Streifenlampe (z. B. MV-LLDS-1002-38-W) um die Kamera, um eine gleichmäßige Beleuchtung zu gewährleisten.

Kameraparametereinstellung: Konfigurieren Sie die Kamera mit der Software des Herstellers (z. B. MVS). Stellen Sie die Aufnahmeauflösung auf 1280 x 1024 Pixel ein. Stellen Sie den Trigger-Modus auf Hardware Trigger ein und synchronisieren Sie ihn mit dem Positionierungssystem des Stackerkrans. Stellen Sie die Belichtungszeit auf 100 ms und die Verstärkung auf 5 dB ein, um Bewegungsunschärfe und Rauschen zu minimieren. Der Arbeitsabstand zwischen der Kamera und den Zigarettenschachteln beträgt etwa 550 mm.

Bildsammlung: Eine Industriekamera mit Abzug nimmt jedes Mal automatisch ein Bild auf, wenn ein Tablett während der Lagerung und Abnahme von Zigarettenschachteln positioniert wird. Sammeln Sie insgesamt 4.835 Rohbilder; typische Bilder sind in Abbildung 1 dargestellt.

Bildannotation: Verwenden Sie das Open-Source-Tool LabelImg. Für jedes Bild zeichnen Sie Begrenzungsboxen um jedes sichtbare Merkmal der Zigarettenmarke. Weisen Sie für jedes Begrenzungsfeld den richtigen Markennamen (z. B. Hongzhuang, Gutian) als Klassenetikett zu. Speichere die Annotationen in einem standardisierten einstufigen Erkennungsformat, mit einer txt-Datei pro Bild.

Qualitätskontrolle: Ein zweiter Annotator überprüft zufällig ausgewählte 20 % der annotierten Bilder. Etwaige Unstimmigkeiten werden besprochen und behoben, um die Konsistenz der Beschriftung zu gewährleisten.

Datenaugmentationsstrategie
Dieser Abschnitt beschreibt sowohl traditionelle als auch fortgeschrittene Augmentationstechniken, die auf die Datensätze angewendet werden. Die Anfangsdaten und erweiterten Daten werden zu einem neuen Datensatz kombiniert, der dann in Trainings-, Validierungs- und Testset unterteilt wird, um Fairness in der Bewertung zu gewährleisten.

Traditionelle Datenerweiterung32: Diese Transformationen werden in Echtzeit von der Trainingspipeline (z. B. unter Verwendung der Albumentations- oder PyTorch-Transformations-Bibliotheken) mit einer definierten Wahrscheinlichkeit für jeden Batch angewendet.

Geometrische Transformationen: Rotation: Drehen Sie Bilder zufällig um einen Winkel zwischen -45° und +45°. Skalierung: Bilder werden zufällig um einen Faktor zwischen 0,8 und 1,2 skaliert. Horizontaler Flip: Bilder zufällig horizontal mit 100 % Wahrscheinlichkeit umdrehen. Zufälliges Zuschneiden: Schneiden Sie einen Abschnitt zufällig zwischen 80 % und 100 % des ursprünglichen Bildbereichs zu.

Photometrische Transformationen: Helligkeit und Kontrast: Helligkeit und Kontrast werden durch einen zufällig gewählten Faktor aus [0,6, 1,4] angepasst. Gaußsches Rauschen: Fügen Sie Gaußsches Rauschen mit einer zufällig gewählten Standardabweichung von [0, 0,01 * 255] auf 10 % der Bilder hinzu. Gaußsche Unschärfe: Wende eine Gaußsche Unschärfe mit einer Kerngröße von 3x3 auf 10 % der Bilder an.

Okklusionssimulation: Platzieren Sie zufällig 1 bis 3 rechteckige Okklusionsflecken (die jeweils bis zu 5 % der Bildfläche abdecken) auf die Bilder. Die Patches sind mit zufälligem Rauschen oder mittleren Bildpixelwerten gefüllt.

Fortgeschrittene Datenerweiterung: regionsspezifisches Copy-Paste
Motivation und Wirkung: Die Hauptmotivation für diese gezielte Erweiterung war es, ein kritisches Datenproblem anzugehen: Mehrere Zigarettenmarken hatten nur sehr wenige Fälle (so wenig wie ein Bild). Eine standardisierte Zufalls-Train-Validierungstest-Aufteilung könnte potenziell alle Instanzen einer seltenen Marke einer einzigen Menge zuordnen (z. B. alle dem Testsatz), sodass das Modell keine Möglichkeit hat, diese Marke zu lernen oder zu validieren. Diese Methode hat die Stichprobengröße dieser unterrepräsentierten Marken künstlich erhöht und sichergestellt, dass jede Marke eine ausreichende Anzahl von Beispielen über Trainings-, Validierungs- und Testsets verteilt hat. Dieser grundlegende Schritt verhindert katastrophale Fehlschläge in seltenen Kategorien und ist eine Voraussetzung für jede sinnvolle Modellleistung und Verallgemeinerung auf die gesamte Marke der Marken.

Dieser Schritt erfordert ein vortrainiertes segmentales Basismodell auf dem ursprünglichen Datensatz und dem Segment Anything Model (SAM)33.

Segmentiere Quellobjekte: Für Zigarettenschachtel-Bilder von unterrepräsentierten Marken verwenden Sie das SAM-Modell, um präzise Segmentierungsmasken zu erzeugen. Verwenden Sie den Punktprompt-Modus und klicken Sie auf die Markenfunktion der Zigarettenschachtel , um die Segmentierung zu starten. Validieren und verfeinern Sie generierte Masken manuell, um die Genauigkeit sicherzustellen. Speichere die segmentierten Zigarettenschachtel-Bilder mit transparentem Hintergrund als PNG-Dateien. Dies erzeugt eine Bibliothek isolierter Objektinstanzen.

Hintergrundmasken generieren: Verwenden Sie das vortrainierte segmentale Baseline-Modell, um eine Instanzsegmentierung an einer Reihe von Hintergrundbildern (Bilder mit ausreichend freiem Platz oder einfachen Hintergründen) durchzuführen. Das Modell gibt binäre Masken aus, die die bereits von Objekten besetzten Bereiche anzeigen.

Letzter erweiterter Datensatz: Dieser Offline-Prozess erzeugt 600 neue synthetische Bilder. Kombinieren Sie sie mit den ursprünglichen 4.835 Bildern und weiteren 1.167 Bildern, die durch Anwendung der oben beschriebenen traditionellen Augmentationstechniken erzeugt wurden, um den endgültigen Datensatz von 6.602 Bildern zu bilden. Teilen Sie den finalen Datensatz in Trainingssätze (70 %, 4.621 Bilder), Validierung (20 %, 1.320 Bilder) und Testsätze (10 %, 661 Bilder) auf, um sicherzustellen, dass Bilder aus derselben Originalsequenz innerhalb derselben Aufteilung bleiben, um Datenlecks zu vermeiden.

Modellmodifikation zum Bau des vorgeschlagenen verbesserten Detektors
Optimierte Objekterkennungsalgorithmen34 haben in den letzten Jahren bemerkenswerte Fortschritte in der industriellen Inspektion erzielt. Dieser Abschnitt bietet ein detailliertes, schrittweises Verfahren zur Änderung der Basismodellarchitektur, um das vorgeschlagene Modell zu erstellen. Die Änderungen werden durch die Bearbeitung der Konfigurationsdatei des Modells (z. B. config.yaml) umgesetzt und sichergestellt, dass entsprechende benutzerdefinierte Moduldefinitionen in der Codebasis enthalten sind. Die Begründung für jede Änderung wird angegeben, um ihre Rolle bei der Bewältigung spezifischer Erkennungsherausforderungen zu erläutern. Die Struktur des vorgeschlagenen Modells ist in Abbildung 3 dargestellt.

Ersatz von Downsampling-Modulen durch das ADown-Modul: Das Standardmodul Convolution-BatchNorm-SiLU (CBS), das für das Downsampling verwendet wird, verwendet eine einstufige Faltung, die als Informationsengpass35 fungieren kann und dabei feinkörnige Merkmale aufgibt, die für die Erkennung kleiner Zigarettenschachteln und detaillierte Markenlogos entscheidend sind. Das ADown-Modul ist darauf ausgelegt, dies zu lindern, indem eine Dual-Branch-Struktur implementiert wird, die während der räumlichen Auflösungsreduktion eine reichere Menge an Merkmalen erfasst und erhält. Ein Zweig priorisiert den Erhalt hochfrequenter lokaler Details, während der andere einen breiteren, kontextreicheren Überblick einfängt. Die Verschmelzung dieser komplementären Merkmale führt zu einer robusteren und informativeren Darstellung für nachfolgende Schichten.

Aktions-Implementierungsschritte
Moduldefinition: Stellen Sie sicher, dass ein benutzerdefiniertes PyTorch-Modul namens ADown in den Modelldefinitionsdateien des Projekts definiert ist. Dieses Modul muss zwei parallele Zweige enthalten. Der erste Zweig sollte aus einer zweidimensionalen Faltungsschicht mit einem 3x3-Kern und einem Schritt von 2 bestehen. Der zweite Ast sollte sequentiell aus einer 2x2 Max-Pooling-Schicht (mit Schritt 2) bestehen, gefolgt von einer 1x1 Faltungsschicht. Die Ausgaben dieser beiden Zweige werden entlang der Kanaldimension verkettet, und die resultierende Merkmalsabbildung wird dann durch eine abschließende 1x1-Faltungsschicht geleitet, um die Kanäle zu integrieren und die Ausgabe zu erzeugen. Die Struktur des ADown-Moduls ist in Abbildung 4 dargestellt.

Konfigurationsdatei-Bearbeitung: Öffnen Sie die Basismodell-Konfigurationsdatei (config.yaml). Identifizieren Sie systematisch jede Instanz des CBS-Moduls, die für Downsampling konfiguriert ist (d. h. bei der der Schrittparameter auf 2 gesetzt ist). Ersetze jeden dieser CBS-Moduleinträge durch das neue ADown-Modul.

Designmotivation: Das Design von ADown wird durch die Notwendigkeit motiviert, Informationsverluste bei Standard-Schritt-Faltungen zu mindern, was für kleine Objekte nachteilig sein kann. Seine Dual-Branch-Struktur ist inspiriert von der Idee der parallelen Verarbeitung, um sowohl hochfrequente räumliche Details (durch Faltung) als auch niederfrequente kontextuelle Informationen (durch Pooling) zu erfassen und so eine reichhaltigere mehrskalige Merkmalsrepräsentation für nachfolgende Schichten zu bieten.

Integration des iEMA-Moduls
Begründung und Designprinzip: Um die Fähigkeit des Modells zu verbessern, kleine Ziele und teilweise verdeckte Ziele zu erkennen, ist es unerlässlich, einen Mechanismus zu integrieren, der einen multiskaligen räumlichen Kontext effektiv modellieren kann. Das iEMA-Modul erreicht dies, indem es eine Efficient Multi-scale Attention (EMA)36-Komponente in eine invertierte Residualblock-(iRMB)37-Struktur einbettet. Das iRMB bietet eine recheneffiziente Grundlage mit tiefenseparablen Faltungen, während die EMA-Komponente explizit räumliche Interaktionen über mehrere Zweige erfasst. Diese Integration ermöglicht es dem Modell, Merkmalgewichte dynamisch neu zu kalibrieren und die Aufmerksamkeit auf die diskriminierendsten räumlichen Bereiche über verschiedene Skalen hinweg zu lenken, wodurch die Erkennung unter Okklusion und bei kleinen Objekten verbessert wird.

Aktions-Implementierungsschritte
Moduldefinition: Stellen Sie sicher, dass ein benutzerdefiniertes PyTorch-Modul namens iEMA definiert ist. Dieses Modul sollte zunächst einen invertierten Restblock implementieren. Dieser Block beginnt typischerweise mit einer punktweisen Faltung zur Kanalerweiterung, gefolgt von einer tiefenweisen Faltung (z. B. 3x3) zur räumlichen Merkmalsextraktion und schließlich einer punktweisen Faltung für die Kanalprojektion. Unmittelbar nach diesem Block sollte der EMA-Aufmerksamkeitsmechanismus eingeführt werden. Der EMA-Mechanismus verwendet typischerweise gruppierte Faltungen und dimensionsübergreifende Interaktionen, um effizient eine multiskalierte räumliche Aufmerksamkeitskarte ohne übermäßigen Rechenaufwand zu erzeugen. Die Struktur des iEMA-Moduls ist in Abbildung 5 dargestellt.

Konfigurationsdatei-Bearbeitung: In der config.yaml-Konfigurationsdatei finden Sie die Abschnitte, die das Neck-Netzwerk definieren, insbesondere die Schichten unmittelbar nach den C2f-Modulen. An diesen strategischen Stellen wird eine neue Ebene eingefügt, die das iEMA-Modul aufruft.

Designmotivation: Das iEMA-Modul basiert auf dem Prinzip, die Merkmale-Unterscheidbarkeit zu verbessern, indem lokale Merkmalsextraktion (durch tiefenweise Faltung) mit einem leichten, aber effektiven globalen Kontextmodellierungsmechanismus (EMA) integriert wird. Dieser hybride Ansatz ermöglicht es dem Modell, sich adaptiv auf informative Bereiche über verschiedene Maßstäbe hinweg zu konzentrieren, was entscheidend ist, um teilweise sichtbare Markenlogos und -texte zu erkennen.

Ersatz des Detektionskopfes durch das DynamicHead-Modul
Begründung und Designprinzip: Der ursprüngliche Detektionskopf kann möglicherweise nicht optimal die erhebliche Variation der Zigarettenschachteln und das komplexe Zusammenspiel zwischen Lokalisierungs- und Klassifizierungsaufgaben bewältigen. Das DynamicHead-Modul adressiert dies, indem es drei Formen der Aufmerksamkeit zu einer kohärenten Struktur vereint: maßstabsbewusst, räumlich bewusst und aufgabenbewusste Aufmerksamkeit. Die skalenbewusste Komponente fusioniert dynamisch Features aus verschiedenen Ebenen der Feature-Pyramide und stellt sicher, dass Objekte aller Größen effektiv dargestellt werden. Die räumlich bewusste Komponente verwendet eine Sparse-Sampling-Strategie, um die Rechenressourcen auf die informativsten Regionen innerhalb der Merkmalskarten zu konzentrieren. Die aufgabenbewusste Komponente passt die Merkmalsrepräsentation speziell für die unterschiedlichen Ziele der Begrenzungsbox-Regression und Kategorienklassifikation an. Dieser einheitliche Ansatz führt zu genaueren und robusteren Vorhersagen.

Aktions-Implementierungsschritte
Moduldefinition: Dies ist ein komplexes Modul, das die drei Aufmerksamkeitsmechanismen umfasst, die in den Gleichungen (1) bis (4) beschrieben werden. Seine interne Struktur wird Schichten zur Berechnung skalenweiser Gewichte, zur Durchführung deformierbarer räumlicher Aufmerksamkeit und zur Anwendung aufgabenspezifischer Merkmalstransformationen umfassen.

Gleichung 1(1)

Gleichung 2(2)

Gleichung 3(3)

Gleichung 4(4)

Wobei WL(F) die endgültige aufmerksamkeitsoptimierte Merkmalskarte bezeichnet, die durch sequentielle Anwendung der skalenbewussten πL(F), räumlich bewussten πS(F) und aufgabenbewussten πC(F)-Aufmerksamkeitsmechanismen auf das Eingabemerkmal F erhalten wird. Konkret π in Gleichung (2) L(F) berechnet ein skalenweise Aufmerksamkeitsgewicht, indem zunächst über räumliche (S) und Kanal-(C)-Dimensionen gemittelt wird, diese durch eine lineare Funktion f(⋅) und eine hart-sigmoide Aktivierung σ(⋅) geleitet wird. In Gleichung (3) führt π S(F) spärliche räumliche Aufmerksamkeit durch, indem es Merkmale aus K gesampelten Schlüsselpunkten pk aggregiert, jeweils mit einem lernbaren Offset Δpk, um sich auf diskriminierende Regionen und einen wichtigen Skalar Δmk zu konzentrieren. In Gleichung (4) implementiert πC(F) eine aufgabenbewusste Aufmerksamkeit, indem es auf jeden Kanal eine lineare Transformation (gesteuert durch gelernte Parameter (α1, β1,α 2,β 2)) anwendet und die maximale Antwort auswählt, sodass der Kopf sich auf Klassifikations- und Regressionsaufgaben spezialisieren kann. Die Struktur des DynamicHead-Moduls ist in Abbildung 6 dargestellt.

Bearbeitung der Konfigurationsdatei: In der config.yaml-Datei finden Sie den Abschnitt, der den Kopf des Modells definiert, der ursprünglich das Detect-Modul enthält. Ersetze es durch einen neuen Eintrag, der das DynamicHead-Modul aufruft.

Designmotivation: Das DynamicHead-Modul basiert auf der Beobachtung, dass Objekterkennungsköpfe anpassungsfähig an Skalierung, räumliche Lage und Aufgabe sein sollten. Sein einheitlicher Aufmerksamkeitsrahmen, formalisiert in Gleichungen. (1-4), ermöglicht es dem Modell, Merkmalsreaktionen dynamisch auf Basis dieser drei Dimensionen neu zu kalibrieren, was zu robusteren Vorhersagen gegen Skalenschwankungen und Hintergrundüberlastung führt.

Modelltraining
Stellen Sie sicher, dass PyTorch 2.1.0, CUDA 12.1 und alle Abhängigkeiten installiert sind.

Ausbildungskommando
Vor dem Umschulen bereiten Sie die geteilten Bilddaten und Annotationsdaten in einem standardisierten einstufigen Erkennungsformat vor. Erstellen Sie eine .yaml-Datei mit der Bildpfad- und Datenkategorie. Laut der Modellverbesserung wird die ursprüngliche Detektor-.yaml-Datei durch die vorgeschlagene Modell .yaml-Datei ersetzt. Schreiben Sie die train.py-Datei, importieren Sie das einstufige Detektorpaket, laden Sie das Trainingsmodell und den Datenpfad und setzen Sie einige Trainingsparameter, darunter imgze=640, epochs=100, batch=4, workers=0, device='0', optimierer='SGD', close_mosaic=10 usw.

Hyperparameter: Die wichtigsten Parameter sind: Eingabebildgröße (640 x 640), Batchgröße (4), initiale Lernrate (0,01) mit Kosinus-Annealing-Scheduler, SGD-Optimierer mit Impuls (0,937) und Gewichtsabfall (0,0005). Mosaik-Augmentation ist standardmäßig aktiviert.

Trainingsüberwachung: Der Trainingsprozess liefert für jede Epoche Metriken. Überwachen Sie die Kurven auf Trainings-/Validierungsverlust und mAP bei 0,5, um Konvergenz sicherzustellen und Überanpassungen zu vermeiden. Eine Ausbildung über 100 Epochen reicht in der Regel aus.

Modellbewertung und -einführung
Bewertung: Nach dem Training wird das beste Modell als Läufe/Training/Erfahrung/Gewichte/best.pt gespeichert. Evaluiere es am Valset mit: Bash Python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Das Skript gibt Precision, Recall, mAP bei 0,5 usw. aus. Bestätigen Sie, dass der mAP die erforderliche Schwelle erfüllt (z. B. 97,9 %).

Inferenz zur Verifikation: Führen Sie Inferenz auf Beispielbildern durch, um die Erkennungsergebnisse visuell zu überprüfen: Bash Python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0,5. Durch Überprüfung der Argumentation können die Detektionsergebnisse jedes Bildes und die Erkennungsgeschwindigkeit des Modells ermittelt werden.

Bereitstellung: Für die Echtzeit-Bereitstellung auf dem System des Stackerkrans wird das PyTorch-Modell (best.pt, ~4,7 MB) in ein Format wie TensorRT oder ONNX umgewandelt, um eine optimale Inferenzgeschwindigkeit zu gewährleisten. Die endgültige Ausgabe sind Begrenzungsboxen mit Klassenlabels (Markennamen) und Vertrauenswerten.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentelle Umgebung und Parametereinstellung
Experimente zur Überprüfung der Leistung des vorgeschlagenen Modells wurden mit dem Deep-Learning-Framework PyTorch durchgeführt, und Details zur experimentellen Umgebung sind in Tabelle 1 aufgeführt. Hier verwendeten wir einen speziellen Datensatz mit 6.602 Bildern, der zufällig in Trainings-, Validierungs- und Testsätze im Verhältnis 7:2:1 aufgeteilt wurde. Alle Experimente verwendeten Eingabebilder mit einer Auflösung von 640 x 640 b...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Genauigkeits-Effizienz-Kompromiss
Eine zentrale Errungenschaft dieses Modells ist sein überlegenes Gleichgewicht zwischen Genauigkeit und Recheneffizienz. Wie in Tabelle 2 gezeigt, erreicht das dargestellte Modell die höchste mAP und gleichzeitig die geringste Anzahl an Parametern und die zweitniedrigsten FLOPs unter den verglichen Einzelstufendetektormodellen. Dies führt direkt zu praktischen Vorteilen: Ein kleineres Modell ist schneller bereitzustel...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren geben keine direkten konkurrierenden finanziellen Interessen an. Diese Forschung wurde in Zusammenarbeit mit Longyan Tobacco Industrial Co., Ltd. durchgeführt, wo die Autoren Hongli Deng und Wencan Li beschäftigt sind, sowie mit der Baoji Cigarette Factory, in der der Autor Baobin Luo arbeitet. Diese Zugehörigkeiten lieferten das Anwendungsszenario und die Felddaten für die Studie. Die akademischen Autoren (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) geben keine finanziellen oder nicht-finanziellen Interessenkonflikte im Zusammenhang mit der Veröffentlichung dieses Werks an.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wurde finanziell durch die Temperaturmessungsmethode für das Gießen von Billet auf Basis von Vorgängerreflektor und Mehrwellenlängen (Nr. LZY24E050002) unterstützt, die von den gemeinsamen Mitteln der Zhejiang Provincial Natural Science Foundation of China finanziert wurde, sowie die Online-Temperaturfeldmessungsmethode für nicht-geschlossene und nicht-isotherme Kellenhöhle (Nr. 2023K231), finanziert vom Quzhou Science and Technology Planning Project.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
CodeleserHikvisionID5050Hikvision-Geräte: Verwendet zum Lesen von Barcodes auf Paletten, muss eine 24V-Stromversorgung anschließen
IndustriekameraHikvisionMV-CA013-A0GM, MV-CS016-10GMMuss 24V-Netzteil anschließen
LED-LichtHIKROBOTMV-LLDS-1002-38-WEine ein Meter breite Lichtquelle sorgt für ausreichende Lichtverhältnisse für die Kamera
LinseHikvisionMVL-HF0828M-6MPEBrennweite: 8 mm, Blendenbereich: F2,8~F16, Pixel: 6 Millionen
MVSHikvisionV4.5.1Hikvision-Software: Verwendet zum Debuggen von Kameras, zum Setzen von Kameraparametern und zur Datenerfassung
PycharmJetBrains2020.1.3 x64Verwendet zum Training von Deep-Learning-Modellen und Entwicklung von Detektionssystemen
Mehrere MetallhalterungenLongyan Tobacco Industrial Co., Ltd.7075-T6 AluminiumlegierungVerwendet zum Reparieren von Kameras und Codelesern
Mehrere NetzwerkkabelLongyan Tobacco Industrial Co., Ltd.RJ45-KristallkopfVerbinden Sie die Basisstation zwischen dem Industriecomputer und dem drahtlosen AP, verbinden Sie die Kamera und den Switch usw
SwicthTP-LinkTL-SH1005Es gibt 8 Ethernet-Kabelanschlüsse, die eine 220V-Stromversorgung benötigen
Vision MasterHikvisionV4.3.0Hikvision-Software: Verwendet zum Abgleichen von Vorlagen und zur Erkennung von Bildergebnissen
Drahtloses AP-GerätShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHAufgrund der großflächigen Bewegung, die vom Stapelkran erforderlich ist, kann das Netzwerkkabel die Kamera nicht mit dem Industriecomputer verbinden, und ein drahtloses AP-Gerät wird benötigt, um den reibungslosen Betrieb des Kameranetzwerks sicherzustellen

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Video demnächst verfügbar

Verwandte Artikel