Article de recherche

Modèle de détection d’objets en temps réel pour l’identification de marques de cigarettes basé sur une architecture de régression à un seul étage améliorée

DOI :

10.3791/69657

9 janvier 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour répondre à des défis tels que l’occlusion et les changements d’éclairage dans les entrepôts automatisés, cet article introduit une architecture de régression à un seul stade améliorée pour la détection des marques de boîtes de cigarettes. En intégrant un échantillonnage adaptatif vers le bas, un mécanisme d’attention inversé efficace et multi-échelle, et une tête de détection dynamique, le modèle proposé permet un inventaire intelligent précis et en temps réel.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La reconnaissance visuelle pour l’inventaire automatisé de cigarettes rencontre des obstacles importants, notamment des changements d’éclairage, des dimensions variées des boîtes et une occlusion partielle des caractéristiques, qui compliquent la vérification de la marque et la détection des boîtes mal placées. Cet article propose un modèle amélioré de détection en temps réel pour traiter les problèmes de reconnaissance d’image et améliorer la précision. Tout d’abord, un module adaptatif de réduction d’échantillonnage est déployé pour remplacer le module de convolution de sous-échantillonnage dans les réseaux de la colonne vertébrale et du col de la série YOLO en tant que détecteur de référence ou original, ce qui conserve effectivement plus de détails de caractéristiques et permet de réaliser la légèreté du modèle. Deuxièmement, un module d’attention multi-échelle inversé efficace est introduit pour capturer les informations contextuelles spatiales de différentes échelles et générer une carte d’attention spatiale plus précise, ce qui améliore la précision de prédiction du modèle de base pour les caractéristiques complexes et les cibles d’occlusion. Enfin, un module de tête de détection dynamique remplace la tête de détection originale du modèle de base et effectue la détection d’objets à plusieurs échelles sur la carte de caractéristiques extraite des réseaux de la colonne vertébrale et du cou afin d’obtenir un positionnement précis et une division de catégorie de la cible prédite. Pour évaluer la performance du modèle amélioré sur le terrain, nous avons construit un ensemble de données visuel de la marque de boîte de cigarettes. L’ensemble de données a été enrichi à l’aide de techniques de copier-coller spécifiques à la région et de techniques traditionnelles d’augmentation, et l’ensemble de données obtenu inclut un fond complexe, une occlusion et un chevauchement, une cible petite et d’autres facteurs. L’expérience démontre que le modèle amélioré présenté dans cet article répond efficacement aux exigences de détection en temps réel sur le terrain. Le modèle proposé atteint un mAP de 97,9 %, avec des paramètres et des FLOP de 1 849 679 et 5,1 G respectivement. Comparé au modèle de base, le modèle proposé améliore la mAP de 0,9 % tout en réduisant les paramètres de 28,78 % et les opérations en virgule flottante de 1,4 G. De plus, le modèle atteint une vitesse d’inférence de 38,5 FPS, satisfaisant les exigences de détection industrielle en temps réel.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fabrication et la logistique modernes reposent fortement sur les systèmes automatisés de stockage et de récupération (AS/RS)1 pour obtenir un stockage à haute densité, une gestion efficace des matériaux et une gestion précise des stocks. AS/RS est devenu un moyen crucial qui peut aider les entreprises à améliorer l’efficacité des entrepôts et à réduire les coûts, grâce à sa grande efficacité et ses caractéristiques intelligentes. Avec une base d’étagères multicouches, divers équipements de chargement et de déchargement, l’AS/RS est un système mécatronique contrôlé par ordinateur, qui intègre plusieurs technologies, notamment la mécanique, l’électronique, l’informatique, les communications, les réseaux, les capteurs et le contrôleautomatique 2,3. L’AS/RS assure un stockage et une manipulation efficaces, précises et sûres des marchandises grâce à l’intégration et à l’optimisation des étagères, des grues empilées, des lignes de convoyeur, des systèmes de contrôle et d’autres équipements, ce qui augmente considérablement l’efficacité du stockage. L’intégration de la vision par ordinateur dans AS/RS, un aspect clé de l’Industrie 4.0, permet des niveaux sans précédent d’automatisation et d’intelligence en permettant aux systèmes de voir et de prendre des décisions basées sur des donnéesvisuelles 4.

Avec l’application généralisée de l’AS/RS dans les usines de tabac5, une nouvelle exigence de stockage pour les marques de boîtes de cigarettes a été proposée. Les méthodes traditionnelles de contrôle manuel souffrent d’inefficacité, de taux élevés de détection de fausses anomalies et de risques pour la sécurité, qui ne répondent pas aux besoins AS/RS. Avec l’avancement continu de la technologie de la vision par ordinateur, les solutions de vision artificielle sont de plus en plus appliquées dans les domainesd’inspection industrielle 6,7,8. Puisque des informations de marque avec des motifs et des textes uniques sont imprimées sur chaque boîte de cigarettes, la technologie de reconnaissance d’image basée sur la vision artificielle permet d’identifier la marque et de faire des stocks.

Depuis 2012, les algorithmes de détection d’objets basés sur l’apprentissage profond ont apporté des avancées significatives dans la reconnaissanced’images 9, 10, 11. Des premiers modèles de détection d’objets à deux étapes comme R-CNN12 aux modèles contemporains de détection d’objets à un seul étage dominés par les modèles de la série YOLO comme détecteur de référenceou original 13, 14, 15, ces approches ont apporté une contribution significative au développement des algorithmes de détection d’objets. Les tâches de inventaire intelligents utilisent de plus en plus les modèles de détection d’objets pour identifier et localiser avec précision plusieurs cibles dans des images ou des vidéos. Li et al.16 ont proposé une méthode intelligente de prise de points intégrant capteurs de pesée et technologie de reconnaissance d’image afin d’améliorer l’efficacité et la précision du stock. Wang et al.17 ont utilisé le masque R-CNN pour segmenter le numéro de la bibliothèque et la position du titre à partir de l’image de la tranche du livre. Sun et al.18 ont conçu un système intégré de reconnaissance visuelle, qui utilisait OpenCV pour reconnaître les codes bidimensionnels sur les matériaux et les étagères en mode multiple. Ils ont optimisé le détecteur original (v5) en introduisant le mécanisme d’attention C3CBAM et l’attribution d’étiquettes SimOTA pour améliorer les fonctions de perte et une détection multi-matériau précise.

Dans le domaine de la détection d’objets, bien que les modèles à deux étapes — représentés par Faster R-CNN — possèdent des avantages traditionnels en matière de précision de détection, leurs mécanismes complexes de génération de propositions de régions entraînent des vitesses d’inférence relativement lentes. Par conséquent, ils peinent à répondre aux exigences strictes de performance en temps réel dans les scénariosindustriels 19, 20. En revanche, l’architecture basée sur la régression traite la détection d’objets comme un problème de régression unique, prédisant directement les emplacements cibles et les probabilités de catégorie à partir des images d’entrée. Cette conception architecturale permet aux modèles de surpasser nettement la plupart des modèles à deux étapes en termes d’efficacité d’inférence, d’allégement et de flexibilité de déploiement, tout en maintenant une précision concurrentielle. Ainsi, cette architecture est devenue la solution privilégiée pour la détection industrielleen temps réel 21.

L’écosystème du modèle original continue d’évoluer rapidement, avec des variantes récentes répondant à des défis spécifiques. Par exemple, le détecteur original (v12)22 vise à améliorer davantage l’optimisation du temps d’entraînement et l’affinement architectural pour de meilleurs compromis précision-efficacité. Par ailleurs, le détecteur original (World)23 introduit des capacités de détection à vocabulaire ouvert, permettant l’inférence en temps réel d’une vaste gamme d’objets au-delà des catégories d’ensembles d’entraînement grâce à la modélisation du langage visuel. Bien que ces avancées repoussent les limites de la détection d’objets à usage général, ce travail se concentre sur une application industrielle spécialisée où la robustesse face à des défis spécifiques, tels que l’occlusion partielle et la variance d’illumination, est primordiale, et où l’espace des catégories est fixe et connu a priori. En tant que version la plus en vue de cette famille de modèles, le modèlede base 24 hérite des avantages du détecteur original (v8)25,26 ; Elle réduit non seulement le nombre de paramètres du modèle, mais prend aussi en compte un équilibre entre efficacité de détection et précision. Comparé à d’autres modèles de détection d’objets, il se distingue dans les tâches de reconnaissance visuelle.

Le défi de détecter de petites boîtes de cigarettes ou partiellement obstruées est une manifestation d’un problème plus large en vision par ordinateur. La détection de petits objets a fait l’objet de recherches actives, avec des approches allant des raffinements du réseau de pyramide de caractéristiques (FPN) 27 aux mécanismes d’attention contextuels, qui inspirent l’intégration du traitement des caractéristiques à plusieurs échelles. De plus, la recherche de l’efficacité opérationnelle dans un environnement industriel nécessite une conception de modèle légère. Inspirés par les concepts d’architecture efficace explorés dansMobileNetV3 28 etGhostNet 29, ces concepts utilisent une convolution profonde et une transformation linéaire pour réduire la complexité computationnelle tout en maintenant la capacité de présentation, nous avons donc choisi quelques modules légers pour améliorer le modèle. Ainsi, pour traiter le stock des marques de boîtes de cigarettes et les facteurs influençants dans ce stock, tels que les changements d’illumination, les différences de taille des caractéristiques entre différentes marques et l’occlusion partielle entre les boîtes de cigarettes, nous proposons dans cet article un modèle amélioré de détection d’objets à l’architecture de régression à un seul stade.

Les principales innovations du modèle proposé sont triples. Tout d’abord, le module Adaptive Downsampling (ADown)30est déployé pour remplacer le downsampling convolutionnel standard dans les réseaux dorsales et neck. Ce design novateur atténue la perte d’information lors de la compression des fonctionnalités, ce qui est essentiel pour préserver les petits logos et textes de marques. Deuxièmement, un mécanisme d’attention multi-échelle inversée (iEMA) est introduit pour permettre au modèle une perception contextuelle dynamique et multi-échelle, améliorant significativement ses performances sur de petites boîtes de cigarettes partiellement occultées. Troisièmement, la tête de détection d’origine est remplacée par le module DynamicHead31 , qui unifie les attentions d’échelle, spatiales et de tâches, permettant une localisation et une classification plus précises entre des cibles de tailles très différentes. Ces modifications architecturales sont conçues de manière cohérente pour répondre aux points sensibles spécifiques liés à l’identification des marques de cigarettes dans les environnements industriels.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’ensemble de données utilisé dans cet article a été acquis dans le domaine AS/RS du département logistique de Longyan Tobacco Industry Co., Ltd. Cette étude n’a pas impliqué de participants humains ni d’animaux. Aucune approbation éthique n’était requise.

Acquisition et mise en place des jeux de données
Configuration matérielle : Monter un appareil photo industriel (par exemple, MV-CA013-A0GM) équipé d’un objectif de 8 mm à distance focale (par exemple, MVL-HF0828M-6MPE) sur la plateforme de cargaison de la grue empilière. Connectez la caméra à un PC de contrôle via un câble GigE et un dispositif d’accès sans fil (par exemple, BH-ANT5158S-14HV, BH-MS-AC1600HWH). Placez une bande lumineuse LED (par exemple, MV-LLDS-1002-38-W) autour de l’appareil pour assurer un éclairage uniforme.

Paramètres de la caméra : Configurez la caméra à l’aide du logiciel du fabricant (par exemple, MVS). Réglez la résolution d’acquisition à 1280 x 1024 pixels. Réglez le mode de déclenchement sur Déclencheur matériel et synchronisez-le avec le système de positionnement de la grue empileur. Réglez le temps d’exposition à 100 ms et le gain à 5 dB pour minimiser le flou de mouvement et le bruit. La distance de travail entre la caméra et les boîtes à cigarettes est d’environ 550 mm.

Collecte d’images : Un appareil photo industriel avec déclencheur capture automatiquement une image à chaque position d’un plateau lors du stockage et de la récupération des boîtes de cigarettes. Collectez un total de 4 835 images brutes ; des images typiques sont montrées à la Figure 1.

Annotation d’image : Utilisez l’outil open source LabelImg. Pour chaque image, dessinez des encadrés englobants autour de chaque caractéristique visible de la marque de cigarette. Attribuez le nom de marque correct (par exemple, Hongzhuang, Gutian) comme étiquette de classe pour chaque boîte englobante. Sauvegardez les annotations dans un format standard de détection à un seul étage, avec un fichier txt par image.

Contrôle qualité : Un second annoteur examine aléatoirement 20 % des images annotées. Toute incohérence est discutée et résolue, garantissant la cohérence de l’étiquetage.

Stratégie d’augmentation des données
Cette section détaille à la fois les techniques d’augmentation traditionnelles et avancées appliquées aux ensembles de données. Les données initiales et les données augmentées sont combinées dans un nouveau jeu de données, qui est ensuite divisé en ensemble d’entraînement, ensemble de validation et ensemble de test afin d’assurer l’équité dans l’évaluation.

Augmentation traditionnelle des données32 : Ces transformations sont appliquées en temps réel par le pipeline d’entraînement (par exemple, en utilisant les bibliothèques Albumentations ou PyTorch Transforms) avec une probabilité définie pour chaque lot.

Transformations géométriques : Rotation : Faire tourner aléatoirement les images d’un angle compris entre -45° et +45°. Mise à l’échelle : Mettez les images à l’échelle aléatoire d’un facteur entre 0,8 et 1,2. Retournement horizontal : Inverser les images horizontalement au hasard avec une probabilité de 100 %. Recadrage aléatoire : recadrez aléatoirement une section entre 80 % et 100 % de la zone originale de l’image.

Transformations photométriques : Luminosité et contraste : Ajustez la luminosité et le contraste d’un facteur choisi au hasard parmi [0,6, 1,4]. Bruit gaussienne : Ajoutez le bruit gaussienne avec un écart-type choisi aléatoirement entre [0, 0,01 * 255] à 10 % des images. Flou gaussienne : Appliquer un flou gaussienne avec une taille de noyau de 3x3 à 10 % des images.

Simulation d’occlusion : placer aléatoirement 1 à 3 plaques rectangulaires d’occlusion (couvrant chacune jusqu’à 5 % de la surface de l’image) sur les images. Les patches sont remplis de bruit aléatoire ou de valeurs moyennes de pixels d’image.

Augmentation avancée des données : copier-coller spécifique à une région
Motivation et impact : La motivation principale de cette augmentation ciblée était de résoudre un problème crucial de données : plusieurs marques de cigarettes ont eu très peu de cas (jusqu’à une seule image). Une division standard aléatoire de test de validation de train pourrait potentiellement attribuer toutes les instances d’une marque rare à un seul ensemble (par exemple, toutes à l’ensemble de test), ce qui empêcherait le modèle d’apprendre ou de valider cette marque. Cette méthode a artificiellement augmenté la taille de l’échantillon pour ces marques sous-représentées, garantissant que chaque marque dispose d’un nombre suffisant d’instances réparties sur les ensembles de formation, de validation et de test. Cette étape fondamentale évite les échecs catastrophiques dans les catégories rares et constitue une condition préalable à toute performance significative du modèle et à une généralisation sur l’ensemble des marques.

Cette étape nécessite un modèle de référence segmentaire pré-entraîné sur le jeu de données initial et le Segment Anything Model (SAM)33.

Segmenter les objets sources : Pour les images de boîtes à cigarettes de marques sous-représentées, utilisez le modèle SAM pour générer des masques de segmentation précis. Utilisez le mode invite de point, cliquez sur la fonction Marque de la boîte à cigarettes pour lancer la segmentation. Validez et affinez manuellement les masques générés pour garantir la précision. Sauvegardez les images segmentées des boîtes de cigarettes avec des arrière-plans transparents sous forme de fichiers PNG. Cela crée une bibliothèque d’instances d’objets isolés.

Générez des masques d’arrière-plan : Utilisez le modèle segmentaire de base pré-entraîné pour effectuer la segmentation des instances sur un ensemble d’images d’arrière-plan (images avec un espace libre suffisant ou des arrière-plans simples). Le modèle produira des masques binaires indiquant les régions déjà occupées par les objets.

Masques de procédé et collage d’objets : Pour chaque masque d’arrière-plan, utilisez la bibliothèque OpenCV (fonction 'cv2.approxPolyDP' avec un facteur épsilon de 0,02 * périmètre de contour) pour effectuer l’ajustement des courbes et linéariser les arêtes du masque, obtenant ainsi une représentation polygonale simplifiée de l’espace libre. Identifiez la plus grande zone de polygones contiguës dans le masque d’arrière-plan comme la région de la pâte cible. Sélectionnez aléatoirement un objet source segmenté dans la bibliothèque. Redimensionnez-la (en conservant le format d’aspect) et appliquez une transformation affine (rotation mineure entre -5° et +5°, et légère cisaillement) pour qu’elle s’adapte naturellement à la région de la pâte cible, afin de s’assurer qu’elle ne chevauche pas les limites des objets existants. Utilisez le mélange alpha pour coller sans interruption l’objet transformé sur l’image de fond à l’emplacement calculé. Le cadre global de la technologie d’augmentation de données, basé sur la technique de copier-coller dans des domaines spécifiques, est illustré à la Figure 2. Générez programmatiquement un nouveau fichier d’annotation txt correspondant pour l’objet collé, en mettant à jour les coordonnées de la boîte englobante et l’étiquette de classe.

Jeu de données final augmenté : Ce processus hors ligne génère 600 nouvelles images synthétiques. Combinez-les avec les 4 835 images originales et 1 167 images supplémentaires générées en appliquant les techniques d’augmentation traditionnelles décrites ci-dessus pour former le jeu de données final de 6 602 images. Divisez le jeu de données final en ensembles d’entraînement (70 %, 4 621 images), de validation (20 %, 1 320 images) et de test (10 %, 661 images), en veillant à ce que les images de la même séquence originale soient conservées dans la même division pour éviter toute fuite de données.

Modification du modèle pour la construction du détecteur amélioré proposé
Les algorithmes optimisés de détectiond’objets 34 ont réalisé des progrès notables dans l’inspection industrielle ces dernières années. Cette section fournit une procédure détaillée étape par étape pour modifier l’architecture de base du modèle afin de créer le modèle proposé. Les modifications sont mises en œuvre en modifiant le fichier de configuration du modèle (par exemple, config.yaml) et en s’assurant que les définitions personnalisées correspondantes des modules sont incluses dans la base de code. La justification de chaque modification est fournie pour en élucider le rôle dans la résolution de défis spécifiques de détection. La structure du modèle proposé est illustrée à la Figure 3.

Remplacement des modules de downsampling par le module ADown : Le module standard Convolution-BatchNorm-SiLU (CBS) utilisé pour le downsampling utilise une convolution à une seule stridée, qui peut agir comme un goulot d’étranglementd’information 35, éliminant potentiellement des fonctionnalités fines cruciales pour reconnaître les petites boîtes de cigarettes et les logos détaillés de marque. Le module ADown est conçu pour atténuer cela en implémentant une structure à double branchement qui capture et préserve un ensemble plus riche de caractéristiques lors de la réduction de la résolution spatiale. Une branche privilégie la conservation des détails locaux à haute fréquence, tandis que l’autre offre une vue d’ensemble plus large et riche en contexte. La fusion de ces caractéristiques complémentaires aboutit à une représentation plus robuste et informative pour les couches suivantes.

Étapes d’action et de mise en œuvre
Définition du module : Assurez-vous qu’un module PyTorch personnalisé nommé ADown est défini dans les fichiers de définition du modèle du projet. Ce module doit contenir deux branches parallèles. La première branche doit consister en une couche de convolution bidimensionnelle avec un noyau de 3x3 et une foulée de 2. La seconde branche doit consister séquentiellement en une couche de max-pooling 2x2 (avec la foulée 2) suivie d’une couche de convolution 1x1. Les sorties de ces deux branches doivent être concaténées le long de la dimension du canal, et la carte de caractéristiques résultante est ensuite passée à travers une couche finale de convolution 1x1 pour intégrer les canaux et produire la sortie. La structure du module ADown est illustrée à la Figure 4.

Édition du fichier de configuration : Ouvrez le fichier de configuration de base du modèle (config.yaml). Identifier systématiquement chaque instance du module CBS configurée pour le downsampling (c’est-à-dire où le paramètre stride est fixé à 2). Remplacez chacune de ces entrées de module CBS par le nouveau module ADown.

Motivation de conception : La conception d’ADown est motivée par la nécessité de limiter la perte d’information dans les convolutions standard stridées, ce qui peut être préjudiciable pour les petits objets. Sa structure à double branche s’inspire de l’idée du traitement parallèle pour capturer à la fois des détails spatiaux à haute fréquence (par convolution) et des informations contextuelles à basse fréquence (via le pooling), offrant ainsi une représentation des caractéristiques multi-échelle plus riche pour les couches suivantes.

Intégration du module iEMA
Rationalisation et principe de conception : Pour améliorer la capacité du modèle à détecter de petites cibles et celles partiellement obscurcies, il est essentiel d’incorporer un mécanisme capable de modéliser efficacement un contexte spatial à plusieurs échelles. Le module iEMA y parvient en intégrant un composant Efficient Multi-scale Attention (EMA)36 dans une structure de bloc résiduel inversé (iRMB)37 . L’iRMB fournit une base efficace en calcul grâce à des convolutions séparables en profondeur, tandis que la composante EMA capture explicitement les interactions spatiales à l’échelle croisée via une conception parallèle à plusieurs branches. Cette intégration permet au modèle de recalibrer dynamiquement les poids des caractéristiques, en concentrant l’attention sur les régions spatiales les plus discriminantes à différentes échelles, améliorant ainsi la reconnaissance sous occlusion et pour les petits objectifs.

Étapes d’action et de mise en œuvre
Définition du module : Assurez-vous qu’un module PyTorch personnalisé nommé iEMA est défini. Ce module doit d’abord implémenter un bloc résiduel inversé. Ce bloc commence généralement par une convolution ponctuelle pour l’expansion du canal, suivie d’une convolution en profondeur (par exemple, 3x3) pour l’extraction des caractéristiques spatiales, et enfin une convolution ponctuelle pour la projection du canal. Immédiatement après ce blocage, le mécanisme d’attention EMA devrait être mis en œuvre. Le mécanisme EMA utilise typiquement des convolutions groupées et des interactions interdimensionnelles pour générer efficacement une carte d’attention spatiale multi-échelle sans surcharge computationnelle excessive. La structure du module iEMA est illustrée à la Figure 5.

Édition du fichier de configuration : Dans le fichier config.yaml, localisez les sections définissant le réseau neck, en particulier les couches immédiatement après les modules C2f. À ces emplacements stratégiques, insérez une nouvelle couche qui appelle le module iEMA.

Motivation de conception : Le module iEMA repose sur le principe d’amélioration de la discriminabilité des caractéristiques en intégrant l’extraction locale des caractéristiques (via convolution en profondeur) avec un mécanisme de modélisation globale du contexte (EMA) léger mais efficace. Cette approche hybride permet au modèle de se concentrer de manière adaptative sur des régions informatives à différentes échelles, ce qui est crucial pour reconnaître les logos et textes partiellement visibles de la marque.

Remplacement de la tête de détection par le module DynamicHead
Rationalité et principe de conception : La tête de détection originale peut ne pas gérer de manière optimale la variation significative d’échelle des boîtes de cigarettes et l’interaction complexe entre les tâches de localisation et de classification. Le module DynamicHead répond à cela en unifiant trois formes d’attention dans une structure cohérente : consciente de l’échelle, consciente de l’espace et attentive à la tâche. La composante sensible à l’échelle fusionne dynamiquement des éléments provenant de différents niveaux de la pyramide des caractéristiques, garantissant que les objets de toutes tailles sont représentés efficacement. La composante spatiale utilise une stratégie d’échantillonnage clairsemé pour concentrer les ressources computationnelles sur les régions les plus informatives des cartes de caractéristiques. La composante consciente de la tâche adapte la représentation des caractéristiques spécifiquement aux objectifs distincts de la régression par boîtes englobantes et de la classification des catégories. Cette approche unifiée conduit à des prédictions plus précises et robustes.

Étapes d’action et de mise en œuvre
Définition du module : Il s’agit d’un module complexe qui englobe les trois mécanismes d’attention décrits par les équations (1) à (4). Sa structure interne comprendra des couches pour calculer des poids à l’échelle, effectuer une attention spatiale déformable et appliquer des transformations de caractéristiques spécifiques à la tâche.

Équation 1(1)

Équation 2(2)

Équation 3(3)

Équation 4(4)

WL(F) désigne la carte finale de caractéristiques affinées par l’attention, obtenue en appliquant séquentiellement les mécanismes d’attention conscients de l’échelle π L(F), les mécanismes d’attention conscients de l’échelle πS(F) et conscients de la tâche π C(F) à la caractéristique d’entrée F. Plus précisément, dans l’équation (2), πL(F) calcule un poids d’attention par échelle en faisant d’abord une moyenne entre les dimensions spatiales (S) et du canal (C), en le faisant passer par une fonction linéaire f(⋅) et une activation sigmoïde dure σ(⋅). Dans l’équation (3), πS(F) effectue une attention spatiale clairsemée en agrégeant des caractéristiques de K points clés échantillonnés pk, chacun avec un décalage apprenable Δp k pour se concentrer sur les régions discriminatives et un scalaire d’importance Δm k. Dans l’Équation (4), πC(F) implémente une attention consciente de la tâche en appliquant une transformation linéaire (régie par des paramètres appris (α1, β1,α 2,β 2)) à chaque canal et en sélectionnant la réponse maximale, permettant à la tête de se spécialiser pour les tâches de classification et de régression. La structure du module DynamicHead est illustrée à la Figure 6.

Édition du fichier de configuration : Dans le fichier config.yaml, trouvez la section qui définit la tête du modèle, qui contient à l’origine le module Detect. Remplacez-le par une nouvelle entrée qui appelle le module DynamicHead.

Motivation de conception : Le module DynamicHead repose sur l’observation que les têtes de détection d’objets doivent être adaptatives à l’échelle, à la localisation spatiale et à la tâche. Son cadre d’attention unifié, formalisé dans les équations (1-4), permet au modèle de recalibrer dynamiquement les réponses des caractéristiques en fonction de ces trois dimensions, ce qui conduit à des prédictions plus robustes contre la variation d’échelle et le bruit d’arrière-plan.

Entraînement des modèles
Assurez-vous que PyTorch 2.1.0, CUDA 12.1 et toutes les dépendances sont installées.

Commandement de formation
Avant de réentraîner, préparez les données d’image divisée et les données d’annotation dans un format standard de détection à une seule étape. Créez un fichier .yaml contenant le chemin de l’image et la catégorie de données. Selon l’amélioration du modèle, le fichier .yaml du détecteur original est remplacé par le fichier .yaml proposé pour le modèle. Écrire le fichier train.py, importer le package détecteur à un seul étage, charger le modèle d’entraînement et le chemin des données, et définir certains paramètres d’entraînement, notamment imgze=640, epochs=100, batch=4, workers=0, device='0', optimiser='SGD', close_mosaic=10, etc.

Hyperparamètres : Les paramètres clés sont : taille de l’image d’entrée (640 x 640), taille du lot (4), taux d’apprentissage initial (0,01) avec planificateur de recuit cosinus, optimiseur SGD avec quantité de mouvement (0,937) et décroissance en poids (0,0005). L’augmentation en mosaïque est activée par défaut.

Surveillance de la formation : Le processus d’entraînement génère des métriques pour chaque époque. Surveillez les courbes pour la perte d’entraînement/validation et le mAP à 0,5 afin d’assurer la convergence et éviter le surapprentissage. Une formation de 100 époques est généralement suffisante.

Évaluation et déploiement du modèle
Évaluation : Après l’entraînement, le meilleur modèle est enregistré sous forme de runs/train/exp/weights/best.pt. Évaluez-le sur l’ensemble val en utilisant : bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Le script affichera Précision, Rappel, mAP à 0,5, etc. Confirmez que le mAP atteint le seuil requis (par exemple, 97,9 %).

Inférence pour la vérification : Exécutez l’inférence sur des images d’échantillon pour vérifier visuellement les résultats de détection : bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. En vérifiant le raisonnement, on peut obtenir les résultats de détection de chaque image et la vitesse de détection du modèle.

Déploiement : Pour un déploiement en temps réel sur le système de la grue empileur, convertissez le modèle PyTorch (best.pt, ~4,7 Mo) vers un format comme TensorRT ou ONNX pour une vitesse d’inférence optimisée. Le résultat final est constitué de boîtes englobantes avec des étiquettes de classes (noms de marques) et des scores de confiance.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Environnement expérimental et réglage des paramètres
Des expériences pour vérifier la performance du modèle proposé ont été menées sur le cadre d’apprentissage profond PyTorch, et les détails de l’environnement expérimental sont listés dans le Tableau 1. Ici, nous avons utilisé un jeu de données spécial contenant 6 602 images, divisé aléatoirement en ensembles d’entraînement, de validation et de test dans un ratio de 7:2:1. Toutes les expériences utilisaient des images d’entrée avec u...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Compromis précision-efficacité
Un accomplissement central de ce modèle est son équilibre supérieur entre précision et efficacité computationnelle. Comme le montre le tableau 2, le modèle présenté atteint le plus haut mAP tout en ayant simultanément le plus faible nombre de paramètres et le deuxième plus faible FLOP parmi les modèles de détecteurs à étage unique comparés. Cela se traduit directement par des avantages pratiques : un modèle plus petit es...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs ne déclarent aucun intérêt financier concurrent direct. Cette recherche a été menée en collaboration avec Longyan Tobacco Industrial Co., Ltd., où travaillent les auteurs Hongli Deng et Wencan Li, et Baoji Cigarette Factory, où l’auteur Baobin Luo est employé. Ces affiliations ont fourni le scénario d’application et les données de terrain pour l’étude. Les auteurs universitaires (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) ne déclarent aucun conflit d’intérêts financier ou non financier concernant la publication de cet ouvrage.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été financé par la méthode de mesure de température pour couler le billet basée sur un réflecteur précédé et une longueur d’onde multi-longueur (n°LZY24E050002) financée par les fonds conjoints de la Fondation provinciale des sciences naturelles du Zhejiang en Chine, ainsi que par la méthode de mesure en ligne des champs de température de la cavité à louches non fermée et non isothermique (n° 2023K231) financée par le projet de planification scientifique et technologique de Quzhou.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Lecteur de codeHikvisionID5050Équipement Hikvision : utilisé pour lire les codes-barres sur les palettes, besoin de connecter une alimentation 24V
Caméra industrielleHikvisionMV-CA013-A0GM, MV-CS016-10GMIl faut connecter une alimentation 24V
Lumière LEDHIKROBOTMV-LLDS-1002-38-WUne bande lumineuse d’un mètre offre des conditions d’éclairage suffisantes pour l’appareil photo
ObjectifHikvisionMVL-HF0828M-6MPEDistance focale : 8 mm, plage d’ouverture : F2,8~F16, pixel : 6 millions
MVSHikvisionV4.5.1Logiciel Hikvision : utilisé pour déboger des caméras, régler les paramètres de la caméra et collecter des données
PycharmJetBrains2020.1.3 x64Utilisé pour l’entraînement de modèles d’apprentissage profond et le développement de systèmes de détection
Plusieurs supports métalliquesLongyan Tobacco Industrial Co., Ltd.Alliage d’aluminium 7075-T6Utilisé pour réparer des caméras et des lecteurs de code
Plusieurs câbles réseauLongyan Tobacco Industrial Co., Ltd.RJ45 Crystal HeadConnectez la station de base entre l’ordinateur industriel et le point d’accès sans fil, connectez la caméra et l’interrupteur, etc
SwicthTP-LinkTL-SH1005Il existe 8 interfaces câbles Ethernet nécessitant une alimentation 220V
Maître de la VisionHikvisionV4.3.0Logiciel Hikvision : Utilisé pour la correspondance de modèles et la détection des résultats d’images
Dispositif de point d’accès sans filShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHEn raison du mouvement à grande échelle requis par la grue empileur, le câble réseau ne peut pas connecter la caméra à l’ordinateur industriel, et un dispositif d’accès sans fil est nécessaire pour assurer le bon fonctionnement du réseau caméra

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Real Time DetectionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Vidéo bientôt disponible

Articles connexes