Onderzoeksartikel

Real-time object detectiemodel voor sigarettenmerkidentificatie gebaseerd op een verbeterde eentraps regressiearchitectuur

DOI:

10.3791/69657

9 januari 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om uitdagingen zoals occlusie- en verlichtingsveranderingen in geautomatiseerde magazijnen aan te pakken, introduceert dit artikel een verbeterde Single-stage Regression Architecture voor het herkennen van sigarettendoosjes. Door adaptieve downsampling, een omgekeerd efficiënt multi-schaal aandachtsmechanisme en een dynamisch detectiehoofd te integreren, bereikt het voorgestelde model nauwkeurige, realtime intelligente inventarisstelling.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Visuele herkenning voor geautomatiseerde sigarettenvoorraad kent aanzienlijke obstakels, waaronder verlichtingsveranderingen, verschillende afmetingen van de doos en gedeeltelijke functie-occlusie, wat merkverificatie en detectie van verkeerd geplaatste doosjes bemoeilijkt. Dit artikel stelt een verbeterd realtime detectiemodel voor om beeldherkenningsproblemen aan te pakken en de nauwkeurigheid te verbeteren. Ten eerste wordt een adaptieve downsamplingmodule ingezet ter vervanging van de downsampling convolutiemodule in zowel het backbone- als het neknetwerk van de YOLO-serie als basislijn of originele detector, die effectief meer featuredetails behoudt en het lichtgewicht van het model realiseert. Ten tweede wordt een omgekeerde efficiënte multi-scale aandachtmodule geïntroduceerd om de ruimtelijke contextinformatie van verschillende schalen vast te leggen en een nauwkeurigere ruimtelijke aandachtskaart te genereren, wat de voorspellingsnauwkeurigheid van het basismodel voor complexe kenmerken en occlusiedoelen verbetert. Ten slotte vervangt een dynamische detectiekopmodule de oorspronkelijke detectiekop van het basismodel en voert multischaal objectdetectie uit op de featuremap die is geëxtraheerd uit de ruggengraat- en neknetwerken om nauwkeurige positionering en categorieverdeling van het voorspelde doel te bereiken. Om de prestaties van het verbeterde model in het veld te evalueren, hebben we een visuele dataset van het sigarettendoosmerk opgebouwd. De dataset werd uitgebreid met regio-specifieke copy-paste- en traditionele augmentatietechnieken, en de verkregen dataset bevat complexe achtergrond-, occlusie- en overlap-, kleine doelwitten en andere factoren. Het experiment toont aan dat het verbeterde model dat in dit artikel wordt gepresenteerd effectief voldoet aan de eisen voor realtime detectie in het veld. Het voorgestelde model behaalt een mAP van 97,9%, met parameters en FLOPs van respectievelijk 1.849.679 en 5,1 G. Vergeleken met het basismodel verbetert het voorgestelde model de mAP met 0,9%, terwijl de parameters met 28,78% worden verminderd en de floating-point-operaties met 1,4 G. Daarnaast bereikt het model een inferentiesnelheid van 38,5 FPS, waarmee wordt voldaan aan de eisen voor realtime industriële detectie.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Moderne productie en logistiek zijn sterk afhankelijk van Automated Storage and Retrieval Systems (AS/RS)1 om hoge dichtheid te bereiken, efficiënte materiaalverwerking en nauwkeurig voorraadbeheer. AS/RS is een cruciaal middel geworden dat ondernemingen kan helpen de magazijnefficiëntie te verbeteren en kosten te verlagen, dankzij de hoge efficiëntie en intelligente eigenschappen. Met een basis van meerlaagse planken, diverse laad- en losseapparatuur is de AS/RS een computergestuurd mechatronicasysteem, dat meerdere technologieën integreert, waaronder mechanica, elektronica, informatica, communicatie, netwerken, sensoren en automatische besturing 2,3. De AS/RS realiseert efficiënte, nauwkeurige en veilige opslag en verwerking van goederen door de integratie en optimalisatie van planken, stapelkranen, transportbanden, regelsystemen en andere apparatuur, wat de opslagefficiëntie aanzienlijk verhoogt. De integratie van computer vision in AS/RS, een belangrijk aspect van Industrie 4.0, maakt ongekende niveaus van automatisering en intelligentie mogelijk doordat systemen visuele data kunnen zien en besluiten nemen4.

Met de brede toepassing van AS/RS in tabaksfabrieken5 is er een nieuwe voorraadopstelling voor sigarettendoosmerken voorgesteld. Traditionele handmatige voorraadopnamingsmethoden lijden onder inefficiëntie, hoge valse detectiepercentages en veiligheidsrisico's, die niet voldoen aan de AS/RS-behoeften. Met de voortdurende vooruitgang van computervisietechnologie worden machine vision-oplossingen steeds vaker toegepast in industriële inspectiedomeinen 6,7,8. Omdat merkinformatie met unieke patronen en tekst op elke sigarettendoos is afgedrukt, maakt machinevisie-gebaseerde beeldherkenningstechnologie het mogelijk om het merk en inventarisatie van sigarettendoosjes te herkennen.

Sinds 2012 hebben deep learning-gebaseerde objectdetectiealgoritmen belangrijke doorbraken gebracht in beeldherkenning 9,10,11. Van vroege tweetraps objectdetectiemodellen zoals R-CNN12 tot hedendaagse eentraps objectdetectiemodellen die worden gedomineerd door YOLO-serie modellen als basis of oorspronkelijke detector 13,14,15, hebben deze benaderingen een belangrijke bijdrage geleverd aan de ontwikkeling van objectdetectie-algoritmen. Intelligente inventaristaken maken steeds vaker gebruik van objectdetectiemodellen om meerdere doelen nauwkeurig te identificeren en te lokaliseren in afbeeldingen of video's. Li et al.16 stelden een intelligente voorraadopnemingsmethode voor die weegsensoren en beeldherkenningstechnologie integreert om de efficiëntie en nauwkeurigheid van de inventarisatie te verbeteren. Wang et al.17 gebruikten masker R-CNN om het boekenkastnummer en de titelpositie te segmenteren van de rugafbeelding van het boek. Sun et al.18 ontwierpen een geïntegreerd visueel herkenningssysteem, dat OpenCV gebruikte om de tweedimensionale codes op materialen en planken in multimodus te herkennen. Ze optimaliseerden de oorspronkelijke detector(v5's) door het C3CBAM-aandachtmechanisme en SimOTA-labeltoewijzing te introduceren om verliesfuncties te verbeteren voor nauwkeurige detectie van meerdere materialen.

Op het gebied van objectdetectie hebben tweestapsmodellen – vertegenwoordigd door Faster R-CNN – traditionele voordelen in detectieprecisie, maar hun complexe mechanismen voor regiovoorstellen resulteren in relatief trage inferentiesnelheden. Daardoor hebben ze moeite om te voldoen aan de strenge eisen voor realtime prestaties in industriële scenario's19,20. Daarentegen behandelt de regressie-gebaseerde architectuur objectdetectie als een enkel regressieprobleem, waarbij doellocaties en categoriekansen direct worden voorspeld op basis van invoerbeelden. Dit architectonische ontwerp stelt modellen in staat om de meeste tweestapsmodellen aanzienlijk te overtreffen op het gebied van inferentie-efficiëntie, lichtgewicht en implementatieflexibiliteit, terwijl de competitieve nauwkeurigheid behouden blijft. Zo is deze architectuur de voorkeursoplossing geworden voor realtime industriële detectie21.

Het oorspronkelijke modelecosysteem blijft zich snel ontwikkelen, waarbij recente varianten specifieke uitdagingen aanpakken. Zo richt de oorspronkelijke detector(v12)22 zich op het verder verbeteren van optimalisatie van trainingstijd en architecturale verfijning voor betere nauwkeurigheid-efficiëntie afwegingen. Ondertussen introduceert de oorspronkelijke detector (World)23 open-vocabulaire detectiemogelijkheden, waardoor realtime afleiding mogelijk is van een groot aantal objecten buiten de trainingscategorieën door gebruik te maken van visie-taalmodellering. Hoewel deze ontwikkelingen de grenzen van algemene objectdetectie verleggen, richt dit werk zich op een gespecialiseerde industriële toepassing waarbij robuustheid tegen specifieke uitdagingen, zoals gedeeltelijke occlusie en verlichtingsvariatie, van groot belang is, en de categorieruimte is vastgelegd en a priori bekend. Als de heetste versie van deze modelfamilie erft het basismodel24 voordelen van de oorspronkelijke detector(v8)25,26; Het vermindert niet alleen het aantal modelparameters, maar houdt ook rekening met een balans tussen detectie-efficiëntie en nauwkeurigheid. In vergelijking met andere objectdetectiemodellen valt het op bij visuele herkenningstaken.

De uitdaging om kleine of gedeeltelijk verstopte sigarettendoosjes te detecteren is een manifestatie van een breder probleem in computer vision. Kleine objectdetectie is actief onderzocht, met benaderingen variërend van feature pyramid network (FPN) verfijningen27 tot contextbewuste aandachtsmechanismen, die de integratie van multischaal featureverwerking inspireren. Bovendien vereist het nastreven van operationele efficiëntie in een industriële omgeving een lichtgewicht modelontwerp. Geïnspireerd door de efficiënte architectuurconcepten die zijn onderzocht in MobileNetV328 en GhostNet29, gebruiken deze concepten diepe convolutie en lineaire transformatie om de rekencomplexiteit te verminderen terwijl de presentatiemogelijkheid behouden blijft, dus kiezen we enkele lichte modules om het model te verbeteren. Daarom stellen wij, om rekening te houden met de voorraadopstelling van sigarettendoosmerken en de beïnvloedende factoren bij de inventaris, zoals verlichtingsveranderingen, verschillen in kenmerken tussen verschillende merken en gedeeltelijke occlusie tussen de sigarettendoosjes, in dit artikel een verbeterd enkeltraps regressiearchitectuur objectdetectiemodel.

De belangrijkste innovaties van het voorgestelde model zijn drieledig. Ten eerste wordt de Adaptive Downsampling (ADown)30-moduleingezet ter vervanging van de standaard convolutionele downsampling in zowel het backbone- als het neknetwerk. Dit nieuwe ontwerp beperkt informatieverlies tijdens featurecompressie, wat cruciaal is voor het behouden van kleine merklogo's en tekst. Ten tweede wordt een omgekeerd Efficient Multi-scale Attention (iEMA)-mechanisme geïntroduceerd om het model te voorzien van dynamische, multi-schaal contextuele waarneming, wat de prestaties op kleine en gedeeltelijk afgesloten sigarettendoosjes aanzienlijk verbetert. Ten derde wordt de oorspronkelijke detectiekop vervangen door de DynamicHead31-module , die schaal-, ruimtelijk- en taakbewuste aandacht verenigt, waardoor nauwkeurigere lokalisatie en classificatie mogelijk is over doelen van sterk verschillende grootte. Deze architectonische aanpassingen zijn samenhangend ontworpen om de specifieke pijnpunten van sigarettenmerkidentificatie in industriële omgevingen aan te pakken.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De dataset die in dit artikel wordt gebruikt, is verkregen uit het AS/RS-veld van de Logistics Department van Longyan Tobacco Industry Co., Ltd. Deze studie betrof geen menselijke deelnemers of dieren. Ethische goedkeuring was niet vereist.

Dataset-acquisitie en -installatie
Hardwareconfiguratie: Monter een industriële camera (bijv. MV-CA013-A0GM) uitgerust met een 8 mm brandpuntslens (bijv. MVL-HF0828M-6MPE) op het laadplatform van de stapelkraan. Verbind de camera met een controle-pc via een GigE-kabel en een draadloos AP-apparaat (bijv. BH-ANT5158S-14HV, BH-MS-AC1600HWH). Plaats een LED-strip (bijv. MV-LLDS-1002-38-W) rond de camera om een uniforme verlichting te garanderen.

Cameraparameters: Configureer de camera met de software van de fabrikant (bijv. MVS). Stel de opnameresolutie in op 1280 x 1024 pixels. Stel de triggermodus in op Hardware Trigger en synchroniseer deze met het positioneringssysteem van de stapelkraan. Stel de belichtingstijd in op 100 ms en de versterking op 5 dB om bewegingsonscherpte en ruis te minimaliseren. De werkafstand tussen de camera en de sigarettendoosjes is ongeveer 550 mm.

Beeldverzameling: Een industriële camera met een trigger maakt automatisch een beeld elke keer dat een tray wordt geplaatst tijdens het opbergen en terughalen van sigarettendoosjes. Verzamel in totaal 4.835 ruwe beelden; typische afbeeldingen zijn te zien in Figuur 1.

Afbeeldingsannotatie: Gebruik de open-source tool LabelImg. Teken voor elke afbeelding begrenzende vakjes rond elk zichtbaar kenmerk van sigarettenmerk. Wijs de juiste merknaam toe (bijv. Hongzhuang, Gutian) als klasselabel voor elke begrenzingsbox. Sla de annotaties op in een standaard enkelvoudig detectieformaat, met één txt-bestand per afbeelding.

Kwaliteitscontrole: Een tweede annotator beoordeelt willekeurig 20% van de geannoteerde afbeeldingen. Eventuele afwijkingen worden besproken en opgelost, zodat de etikettering consistent blijft.

Data-augmentatiestrategie
Deze sectie beschrijft zowel traditionele als geavanceerde augmentatietechnieken die op de datasets worden toegepast. De initiële data en de aangevulde data worden gecombineerd tot een nieuwe dataset, die vervolgens wordt verdeeld in trainingsset, validatieset en testset om eerlijkheid in de evaluatie te waarborgen.

Traditionele data-augmentatie32: Deze transformaties worden in realtime toegepast door de trainingspijplijn (bijvoorbeeld met behulp van de Albumentations- of PyTorch Transforms-bibliotheken) met een gedefinieerde kans voor elke batch.

Geometrische transformaties: Rotatie: Afbeeldingen willekeurig roteren met een hoek tussen -45° en +45°. Schaalvergelijking: Schaal afbeeldingen willekeurig met een factor tussen 0,8 en 1,2. Horizontale omdraai: Afbeeldingen willekeurig horizontaal omdraaien met een kans van 100%. Willekeurige bijsnijding: Snijd willekeurig een gedeelte bij tussen 80% en 100% van het oorspronkelijke beeldgebied.

Fotometrische transformaties: Helderheid en contrast: Pas helderheid en contrast aan met een factor die willekeurig wordt gekozen uit [0,6, 1,4]. Gaussiaanse ruis: Voeg Gaussiaanse ruis toe met een standaarddeviatie die willekeurig wordt gekozen van [0, 0,01 * 255] tot 10% van de beelden. Gaussische blur: Pas een Gaussian blur toe met een kernelgrootte van 3x3 tot 10% van de afbeeldingen.

Occlusiesimulatie: Plaats willekeurig 1 tot 3 rechthoekige occlusiepatches (die elk tot 5% van het beeldoppervlak bedekken) op de beelden. De patches zijn gevuld met willekeurige ruis of gemiddelde pixelwaarden van het beeld.

Geavanceerde data-augmentatie: regio-specifieke copy-paste
Motivatie en impact: De belangrijkste motivatie voor deze gerichte augmentatie was het aanpakken van een belangrijk dataprobleem: verschillende sigarettenmerken hadden zeer weinig gevallen (zo weinig als één afbeelding). Een standaard willekeurige treinvalidatietestsplitsing kan mogelijk alle instanties van een zeldzaam merk aan één set toewijzen (bijvoorbeeld allemaal aan de testset), waardoor het model geen kans krijgt om dat merk te leren of te valideren. Deze methode heeft de steekproefgrootte voor deze ondervertegenwoordigde merken kunstmatig vergroot, zodat elk merk een voldoende aantal gevallen verspreid heeft over de trainings-, validatie- en testsets. Deze fundamentele stap voorkomt catastrofale mislukkingen in zeldzame categorieën en is een voorwaarde voor elke betekenisvolle modelprestatie en generalisatie van de volledige set merken.

Deze stap vereist een vooraf getraind segmenteel basismodel op de initiële dataset en het Segment Anything Model (SAM)33.

Segmentele bronobjecten: Voor sigarettendoosafbeeldingen van ondervertegenwoordigde merken gebruik je het SAM-model om precieze segmentatiemaskers te genereren. Gebruik de puntpromptmodus en klik op de Merkfunctie van de sigarettendoos om segmentatie te starten. Valideer en verfijn handmatig gegenereerde maskers om de nauwkeurigheid te waarborgen. Bewaar de gesegmenteerde sigarettendoosjes met transparante achtergronden als PNG-bestanden. Dit creëert een bibliotheek van geïsoleerde objectinstanties.

Genereer achtergrondmaskers: Gebruik het vooraf getrainde segmentale baselinemodel om instance-segmentatie uit te voeren op een set achtergrondafbeeldingen (afbeeldingen met voldoende vrije ruimte of eenvoudige achtergronden). Het model zal binaire maskers uitvoeren die de gebieden aangeven die al door objecten worden bezet.

Procesmaskers en plakobjecten: Voor elk achtergrondmasker gebruik je de OpenCV-bibliotheek ('cv2.approxPolyDP'-functie met een epsilonfactor van 0,02 * contouromtrek) om curve fitting uit te voeren en de maskerranden te lineariseren, waardoor een vereenvoudigde polygonweergave van de vrije ruimte wordt verworven. Identificeer het grootste aaneengesloten polygongebied binnen het achtergrondmasker als het doel-pastagebied. Selecteer willekeurig een gesegmenteerd bronobject uit de bibliotheek. Verander de grootte (behoud van de beeldverhouding) en pas een affiene transformatie toe (kleine rotatie tussen -5° en +5°, en lichte schuif) zodat deze natuurlijk binnen het doelpastegebied past, zodat het niet overlapt met de grenzen van bestaande objecten. Gebruik alpha blending om het getransformeerde object naadloos op de achtergrondafbeelding op de berekende locatie te plakken. Het algemene kader van data-augmentatietechnologie gebaseerd op de copy-paste-techniek in specifieke gebieden wordt weergegeven in Figuur 2. Genereer programmatisch een bijpassend nieuw txt-annotatiebestand voor het geplakte object, waarbij de coördinaten van de begrenzingsbox en het klasselabel worden bijgewerkt.

Laatste uitgebreide dataset: Dit offline proces genereert 600 nieuwe synthetische afbeeldingen. Combineer deze met de oorspronkelijke 4.835 afbeeldingen en nog eens 1.167 beelden die zijn gegenereerd door de traditionele augmentatietechnieken zoals hierboven beschreven toe te passen, om de uiteindelijke dataset van 6.602 afbeeldingen te vormen. Splits de uiteindelijke dataset op in trainingssets (70%, 4.621 afbeeldingen), validatie (20%, 1.320 afbeeldingen) en testsets (10%, 661 afbeeldingen), zodat beelden uit dezelfde oorspronkelijke sequentie binnen dezelfde splitsing blijven om datalekken te voorkomen.

Modelaanpassing voor het bouwen van de voorgestelde verbeterde detector
Geoptimaliseerde algoritmen voor objectdetectie34 hebben de afgelopen jaren aanzienlijke vooruitgang geboekt in industriële inspectie. Deze sectie biedt een gedetailleerde, stapsgewijze procedure voor het aanpassen van de basismodelarchitectuur om het voorgestelde model te creëren. De aanpassingen worden geïmplementeerd door het configuratiebestand van het model (bijv. config.yaml) te bewerken en ervoor te zorgen dat overeenkomstige aangepaste moduledefinities in de codebase zijn opgenomen. De motivatie voor elke wijziging wordt gegeven om de rol ervan bij het aanpakken van specifieke detectieproblemen te verduidelijken. De structuur van het voorgestelde model is weergegeven in Figuur 3.

Vervanging van downsamplingmodules door de ADown-module: De standaard Convolution-BatchNorm-SiLU (CBS) module die wordt gebruikt voor downsampling gebruikt een single strided convolutie, die kan fungeren als een informatiebottleneck35, waarbij mogelijk fijnmazige kenmerken worden weggegooid die cruciaal zijn voor het herkennen van kleine sigarettendoosjes en gedetailleerde merklogo's. De ADown-module is ontworpen om dit te verlichten door een dual-branch structuur te implementeren die een rijkere set kenmerken vastlegt en behoudt tijdens het verminderen van de ruimtelijke resolutie. De ene tak geeft prioriteit aan het behouden van hoogfrequente lokale details, terwijl de andere een breder, contextrijk overzicht vastlegt. De samensmelting van deze complementaire kenmerken resulteert in een robuustere en informatievere representatie voor latere lagen.

Actie-implementatiestappen
Moduledefinitie: Zorg ervoor dat een aangepaste PyTorch-module genaamd ADown is gedefinieerd binnen de modeldefinitiebestanden van het project. Deze module moet twee parallelle vertakkingen bevatten. De eerste tak moet bestaan uit een tweedimensionale convolutielaag met een 3x3 kern en een stride van 2. De tweede tak moet sequentieel bestaan uit een 2x2 max-poolinglaag (met stride 2) gevolgd door een 1x1 convolutielaag. De uitgangen van deze twee takken worden langs de kanaaldimensie samengevoegd, waarna de resulterende featuremap door een laatste 1x1 convolutielaag wordt gestuurd om de kanalen te integreren en de output te produceren. De structuur van de ADown-module is weergegeven in Figuur 4.

Bewerking van configuratiebestand: Open het basismodelconfiguratiebestand (config.yaml). Identificeer systematisch elke instantie van de CBS-module die is geconfigureerd voor downsampling (d.w.z. waarbij de stride-parameter op 2 is gezet). Vervang elk van deze CBS-modulevermeldingen door de nieuwe ADown-module.

Ontwerpmotivatie: Het ontwerp van ADown wordt gemotiveerd door de noodzaak om informatieverlies in standaard getrapte convoluties te beperken, wat nadelig kan zijn voor kleine objecten. De dual-branch structuur is geïnspireerd op het idee van parallelle verwerking om zowel hoogfrequente ruimtelijke details (via convolutie) als laagfrequente contextuele informatie (via pooling) vast te leggen, waardoor een rijkere multi-scale feature-representatie voor volgende lagen mogelijk wordt.

Integratie van de iEMA-module
Redenering en ontwerpprincipe: Om het vermogen van het model te verbeteren om kleine doelen en gedeeltelijk verduisterde doelen te detecteren, is het essentieel een mechanisme te integreren dat effectief multischaal ruimtelijke context kan modelleren. De iEMA-module bereikt dit door een Efficient Multi-scale Attention (EMA)36-component in een omgekeerd residueel blok (iRMB)37-structuur in te betten. De iRMB biedt een computationeel efficiënte basis met behulp van diepte-separabele convoluties, terwijl de EMA-component expliciet ruimtelijke interacties op verschillende schaalniveaus vastlegt via een parallel multi-branch ontwerp. Deze integratie stelt het model in staat om featuregewichten dynamisch te herkalibreren, waarbij de aandacht wordt gericht op de meest onderscheidende ruimtelijke gebieden over verschillende schalen, waardoor de herkenning onder occlusie en voor kleine objecten verbetert.

Actie-implementatiestappen
Moduledefinitie: Zorg ervoor dat een aangepaste PyTorch-module genaamd iEMA is gedefinieerd. Deze module moet eerst een omgekeerd residueel blok implementeren. Dit blok begint doorgaans met een puntgewijze convolutie voor kanaalexpansie, gevolgd door een diepteconvolutie (bijv. 3x3) voor ruimtelijke feature-extractie, en tenslotte een puntgewijze convolutie voor kanaalprojectie. Direct na deze blokkade moet het EMA-aandachtsmechanisme worden ingevoerd. Het EMA-mechanisme maakt doorgaans gebruik van gegroepeerde convoluties en cross-dimensionale interacties om efficiënt een ruimtelijke aandachtskaart op meerdere schaalniveaus te genereren zonder overmatige rekenkundige overhead. De structuur van de iEMA-module is weergegeven in Figuur 5.

Bewerking van configuratiebestanden: In het configuratiebestand config.yaml vind je de secties die het neknetwerk definiëren, specifiek de lagen direct na de C2f-modules. Op deze strategische locaties voeg je een nieuwe laag in die de iEMA-module aanroept.

Ontwerpmotivatie: De iEMA-module is gebaseerd op het principe om de discriminatie van kenmerken te verbeteren door lokale feature-extractie (via diepteconvolutie) te integreren met een lichtgewicht maar effectief global context modeling mechanism (EMA). Deze hybride aanpak stelt het model in staat zich adaptief te richten op informatieve gebieden op verschillende schalen, wat cruciaal is voor het herkennen van gedeeltelijk zichtbare merklogo's en tekst.

Vervanging van de detectiekop door de DynamicHead-module
Redenering en ontwerpprincipe: De oorspronkelijke detectiekop kan mogelijk niet optimaal omgaan met de aanzienlijke schaalvariatie van sigarettendoosjes en de complexe wisselwerking tussen lokalisatie- en classificatietaken. De DynamicHead-module pakt dit aan door drie vormen van aandacht te verenigen tot een coherente structuur: schaalbewust, ruimtelijk bewust en taakbewuste aandacht. De schaalbewuste component fuseert dynamisch features van verschillende niveaus van de feature-piramide, zodat objecten van alle groottes effectief worden weergegeven. De ruimtelijk bewuste component gebruikt een sparse samplingstrategie om de rekenkracht te richten op de meest informatieve gebieden binnen de featuremaps. De taakbewuste component past de feature-representatie specifiek aan voor de specifieke doelstellingen van bounding box-regressie en categorieclassificatie. Deze uniforme aanpak leidt tot nauwkeurigere en robuustere voorspellingen.

Actie-implementatiestappen
Moduledefinitie: Dit is een complexe module die de drie aandachtsmechanismen omvat die worden beschreven door vergelijkingen (1) tot en met (4). De interne structuur zal lagen bevatten voor het berekenen van schaalgewijze gewichten, het uitvoeren van vervormbare ruimtelijke aandacht en het toepassen van taakspecifieke feature-transformaties.

Vergelijking 1(1)

Vergelijking 2(2)

Vergelijking 3(3)

Vergelijking 4(4)

Waar WL(F) de uiteindelijke aandacht-verfijnde featuremap aanduidt, verkregen door sequentieel de schaalbewuste πL(F), ruimtelijk-bewuste πS(F) en taakbewuste πC(F)-aandachtsmechanismen toe te passen op de invoerfunctie F. Specifiek, in vergelijking (2), πL(F)) berekent een schaalgewijze aandachtsgewicht door eerst te middelen over ruimtelijke (S) en kanaal (C) dimensies, dit door een lineaire functie f(⋅) en een hard-sigmoïde activatie σ(⋅) te laten gaan. In vergelijking (3) verricht πS(F) spaarzame ruimtelijke aandacht door kenmerken te aggregeren van K bemonsterde sleutelpunten pk, elk met een leerbare offset Δpk om zich te richten op discriminerende gebieden en een belangrijke scalair Δmk. In vergelijking (4) implementeert πC(F) een taakbewuste aandacht door een lineaire transformatie toe te passen (beheerst door geleerde parameters (α1, β1,α 2,β 2)) op elk kanaal en het maximale antwoord te selecteren, waardoor de hoofd zich kan specialiseren voor classificatie- en regressietaken. De structuur van de DynamicHead-module wordt weergegeven in Figuur 6.

Bewerking van configuratiebestanden: In het config.yaml-bestand vind je de sectie die het hoofd van het model definieert, dat oorspronkelijk de Detect-module bevat. Vervang het door een nieuwe invoer die de DynamicHead-module aanroept.

Ontwerpmotivatie: De DynamicHead-module is gebaseerd op de observatie dat objectdetectiekoppen adaptief moeten zijn voor schaal, ruimtelijke locatie en taak. Het eenheid van aandachtsraamwerk, geformaliseerd in Eqs. (1-4), stelt het model in staat om feature-responsen dynamisch te herkalibreren op basis van deze drie dimensies, wat leidt tot robuustere voorspellingen tegen schaalvariatie en achtergrondrommel.

Modeltraining
Zorg ervoor dat PyTorch 2.1.0, CUDA 12.1 en alle afhankelijkheden zijn geïnstalleerd.

Opleidingscommando
Bereid vóór de hertraining de verdeelde beeldgegevens en de annotatiegegevens voor in een standaard enkelvoudig detectieformaat. Maak een .yaml-bestand aan met het afbeeldingspad en de datacategorie. Volgens de modelverbetering wordt het oorspronkelijke detector .yaml-bestand vervangen door het voorgestelde model .yaml-bestand. Schrijf het train.py-bestand, importeer het single-stage detectorpakket, laad het trainingsmodel en het datapad, en stel enkele trainingsparameters in, waaronder imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10, enzovoort.

Hyperparameters: De belangrijkste parameters zijn: inputbeeldgrootte (640 x 640), batchgrootte (4), initiële leersnelheid (0,01) met cosinus-annealing scheduler, SGD-optimizer met impuls (0,937) en gewichtsafname (0,0005). Mozaïekaugmentatie is standaard ingeschakeld.

Trainingsmonitoring: Het trainingsproces levert metrieken voor elk tijdperk. Monitor de curves op trainings-/validatieverlies en mAP bij 0,5 om convergentie te waarborgen en overfitting te voorkomen. Training voor 100 epochs is doorgaans voldoende.

Modelevaluatie en -implementatie
Evaluatie: Na training wordt het beste model opgeslagen als runs/train/exp/weights/best.pt. Evalueer het op de valset met: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Het script geeft Precision, Recall, mAP op 0,5, enzovoort. Bevestig dat de mAP aan de vereiste drempel voldoet (bijv. 97,9%).

Inferentie voor verificatie: Voer inferentie uit op voorbeeldafbeeldingen om detectieresultaten visueel te verifiëren: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Door de redenering te verifiëren, kunnen de detectieresultaten van elk beeld en de detectiesnelheid van het model worden verkregen.

Implementatie: Voor realtime implementatie op het systeem van de stapelkraan, converteer het PyTorch-model (best.pt, ~4,7 MB) naar een formaat zoals TensorRT of ONNX voor geoptimaliseerde inferentiesnelheid. De uiteindelijke output bestaat uit bounding boxes met klassenlabels (merknamen) en betrouwbaarheidsscores.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentele omgeving en parameterinstelling
Experimenten om de prestaties van het voorgestelde model te verifiëren werden uitgevoerd op het deep learning-framework PyTorch, en details van de experimentele omgeving staan vermeld in Tabel 1. Hier gebruikten we een speciale dataset met 6.602 afbeeldingen, die willekeurig werd opgesplitst in trainings-, validatie- en testsets in een verhouding van 7:2:1. Alle experimenten gebruikten invoerbeelden met een resolutie van 640 x 640 en een i...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nauwkeurigheid-efficiëntie afweging
Een centrale prestatie van dit model is de superieure balans tussen nauwkeurigheid en rekenkundige efficiëntie. Zoals te zien is in Tabel 2, behaalt het gepresenteerde model de hoogste mAP terwijl het tegelijkertijd het laagste aantal parameters en de op één na laagste FLOP's heeft van de vergeleken enkeltrapsdetectormodellen. Dit vertaalt zich direct in praktische voordelen: een kleiner model is sneller te implemen...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren geen directe concurrerende financiële belangen. Dit onderzoek werd uitgevoerd in samenwerking met Longyan Tobacco Industrial Co., Ltd., waar auteurs Hongli Deng en Wencan Li in dienst zijn, en Baoji Cigarette Factory, waar auteur Baobin Luo werkzaam is. Deze affiliaties leverden het toepassingsscenario en veldgegevens voor de studie. De academische auteurs (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) geven geen financiële of niet-financiële belangenconflicten aan met betrekking tot de publicatie van dit werk.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk werd financieel ondersteund door de Temperatuurmeetmethode voor het gieten van billet gebaseerd op voorafgaande reflector en multigolflengte (nr.LZY24E050002), gefinancierd door de gezamenlijke fondsen van de Zhejiang Provincial Natural Science Foundation of China, en de Online Temperatuurveldmeetmethode van niet-gesloten en niet-isotherme lepelholte (nr. 2023K231), gefinancierd door het Quzhou Science and Technology Planning Project.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
code readerHikvisionID5050Hikvision-apparatuur: Wordt gebruikt om barcodes op pallets te lezen, moet worden verbonden met 24V-voeding
industriële cameraHikvisionMV-CA013-A0GM, MV-CS016-10GMMoet worden verbonden met 24V-voeding
LED-lichtHIKROBOTMV-LLDS-1002-38-WEen lichtbron van een meter biedt voldoende verlichtingscondities voor de camera
lensHikvisionMVL-HF0828M-6MPEbrandpuntsafstand: 8 mm, Diafragmabereik: F2.8~F16, pixel: 6 miljoen
MVSHikvisionV4.5.1Hikvision-software: wordt gebruikt voor het debuggen van camera's, het instellen van cameraparameters en het verzamelen van gegevens
PycharmJetBrains2020.1.3 x64Wordt gebruikt voor het trainen van deep learning-modellen en het ontwikkelen van detectiesystemen
Meerdere metalen beugelsLongyan Tobacco Industrial Co., Ltd.7075-T6 AluminiumlegeringWordt gebruikt voor het bevestigen van camera's en codelezers
Meerdere netwerkkabelsLongyan Tobacco Industrial Co., Ltd.RJ45 Crystal HeadVerbind de basisstation tussen de industriële computer en draadloze AP, verbind de camera en schakelaar, enz.
SwicthTP-LinkTL-SH1005Er zijn 8 Ethernet-kabelinterfaces die 220V-voeding vereisen
Vision MasterHikvisionV4.3.0Hikvision-software: wordt gebruikt voor sjabloonvergelijking en het detecteren van beeldresultaten
draadloos AP-apparaatShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHVanwege de grootschalige beweging die door de stapelkraan vereist is, kan de netwerkkabel de camera niet verbinden met de industriële computer, en is een draadloos AP-apparaat nodig om de soepele werking van het cameranetwerk te garanderen

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Video binnenkort beschikbaar

Gerelateerde artikelen