Dans la production industrielle moderne, la sécurité est le pilier essentiel garantissant l'efficacité de la production et le bien-être du personnel. L'environnement de la chaîne de production implique généralement des équipements mécaniques à grande vitesse, des procédés technologiques complexes et des opérations collaboratives combinant plusieurs tâches. Le moindre risque potentiel pour la sécurité peut entraîner de graves accidents industriels, provoquant d'importantes pertes économiques et même des décès. Il est donc crucial de mettre en place un système de surveillance de la sécurité efficace, intelligent et en temps réel afin d'améliorer la sécurité dans la production industrielle1,2.
Les méthodes traditionnelles de surveillance de la sécurité reposent principalement sur la surveillance vidéo manuelle et divers capteurs (tels que les capteurs infrarouges, de fumée et de vibration)3. La surveillance manuelle n'est pas seulement inefficace, mais elle est également sujette à des détections manquées en raison de la fatigue du personnel de surveillance, et elle ne peut pas assurer une couverture continue et complète. Bien que les capteurs puissent offrir une certaine fonction d'alerte précoce, leur portée de détection est limitée et ils sont sensibles aux interférences environnementales, ce qui entraîne des problèmes importants de fausses alarmes4. Les systèmes de surveillance intelligents sont devenus un domaine de recherche de plus en plus important. L'analyse en temps réel d'un flux vidéo à l'aide d'un algorithme d'apprentissage profond permet d'identifier automatiquement les événements anormaux, les comportements dangereux et les risques potentiels, améliorant ainsi considérablement l'intelligence du système de surveillance4,5.
La détection d'objets est une technologie fondamentale dans la surveillance intelligente. En tant que représentants des détecteurs d'objets monocouche, les algorithmes de la série You Only Look Once (YOLO) présentent des avantages significatifs. De YOLOv1 à YOLOv8, cet ensemble d'algorithmes a connu un développement continu, avec des améliorations apportées à l'architecture du réseau, à la fonction de perte et à la méthodologie d'entraînement, entre autres aspects6,7. YOLOv11, en particulier, a atteint une précision de détection plus élevée tout en conservant un taux d'images par seconde élevé, notamment lorsqu'il est confronté à des arrière-plans complexes et à des cibles densément regroupées8.
Cependant, malgré ses excellentes performances dans les tâches générales de détection d'objets, YOLOv11 fait toujours face à des défis dans des scénarios spécifiques de surveillance de la sécurité en ligne de production9. Par exemple, la précision de détection de YOLOv11 peut diminuer lorsque les travailleurs sont partiellement masqués par des équipements ou lorsque les panneaux de sécurité sont petits et présentent une forte ressemblance avec la couleur du fond. Cela exige du modèle des capacités plus poussées d'extraction de caractéristiques et de compréhension sémantique10.
Les réseaux neuronaux convolutifs (CNN) possèdent de solides capacités en matière d'extraction de caractéristiques d'image11. En concevant des architectures de réseau plus profondes et plus complexes, les CNN peuvent apprendre des caractéristiques d'image plus riches et plus abstraites. Le couplage d'un CNN avec YOLOv11 exploite les capacités de détection rapide de YOLOv11 et l'extraction approfondie de caractéristiques du CNN, permettant ainsi de construire un système de surveillance de sécurité plus robuste et plus intelligent.
Sur cette base, cet article propose un système de surveillance de la sécurité en ligne de production utilisant YOLOv11 et un CNN. Les aspects innovants de cette étude comprennent : (1) la proposition d'une architecture de fusion profonde combinant YOLOv11 et un CNN amélioré ; (2) l'introduction d'une fusion de caractéristiques multi-échelle et d'un mécanisme d'attention composite afin d'améliorer la reconnaissance des caractéristiques clés de sécurité ; et (3) la vérification des avantages en performance du modèle sur un jeu de données de scènes complexes construit par nos soins.
Développement des algorithmes de la série YOLO
Depuis sa première présentation par Redmon et al. en 201512, l'algorithme You Only Look Once (YOLO) a suscité un grand intérêt. Contrairement aux détecteurs à deux étapes qui s'appuient sur des propositions de régions, YOLO aborde la détection d'objets comme une tâche de régression. En prédisant directement les classes et les positions des objets dans une image, YOLO augmente nettement la vitesse de détection, ce qui le rend adapté à une utilisation en temps réel13.
En tant que travail pionnier de cette série, YOLOv1 parvient pour la première fois à une détection de cibles de bout en bout14. YOLOv1 consiste à diviser l'image d'entrée en une structure en grille, où chaque cellule de grille, généralement organisée selon un format S × S, est chargée de détecter les objets situés dans ses limites.
Plus précisément, la sortie de YOLOv1 est un tenseur. Parmi les S × S × (B × 5 + C), la prédiction de chaque boîte englobante contient 5 éléments : les coordonnées du centre (x,y), la largeur w, la hauteur h et la confiance c. Le processus de calcul est illustré dans l'équation (1) :
(1)
Parmi eux, Pr(Object) représente la probabilité qu'il y ait une cible dans la grille, et IOU représente le rapport entre l'intersection et l'union entre la boîte englobante prédite et la boîte de référence. Chaque grille prédit également un ensemble de probabilités de classe, Pr représentant la probabilité que la cible appartienne à la i-ième classe en présence d'une cible. La fonction de perte de YOLOv1 est composée de trois composantes principales : la perte liée à la prédiction des coordonnées, la perte liée à l'estimation de la confiance et la perte liée à la prédiction de la catégorie15.
YOLOv2 introduit la normalisation par lots, un classificateur à haute résolution et une stratégie d'apprentissage multi-échelle, ce qui améliore la stabilité et la précision16. YOLOv3 utilise Darknet-53 comme réseau de base et s'inspire du concept de réseau pyramidal de caractéristiques (FPN) pour améliorer la détection des objets17.
YOLOv4 a apporté de nombreuses optimisations par rapport à YOLOv3, en introduisant des technologies telles que le Cross Stage Partial Network (CSPNet)18, le Path Aggregation Network (PANet)19 et l'amélioration des données Mosaic afin d'améliorer davantage les performances du modèle. YOLOv5 a apporté des contributions significatives en matière d'ingénierie, en proposant une implémentation plus facile à utiliser et plus efficace20.
Ces dernières années, la série YOLO n’a cessé d’évoluer, avec la sortie successive des versions YOLOv6, YOLOv7 et YOLOv8. En introduisant la structure Extended Efficient Layer Aggregation Network (E-ELAN) ainsi que des techniques de re-paramétrisation de modèle, YOLOv7 réalise de nouvelles avancées en termes de vitesse et de précision. Ces améliorations augmentent non seulement l'efficacité de l'apprentissage des caractéristiques, mais optimisent également les performances d'inférence du réseau, permettant à YOLOv7 de surpasser les versions précédentes ainsi que de nombreux détecteurs dominants dans diverses tâches de détection d'objets en temps réel. YOLOv8 optimise davantage la structure du réseau, adopte une conception sans ancres, simplifie le modèle et améliore sa capacité de généralisation21.
S'appuyant sur les avantages des versions précédentes, YOLOv11, utilisé dans cette étude, a été optimisé pour des scénarios industriels complexes. Ses améliorations principales incluent un réseau d'extraction de caractéristiques, un module de fusion de caractéristiques plus efficace et une conception de fonction de perte plus robuste. Ces améliorations permettent à YOLOv11 de mieux performer lorsqu'il s'agit de gérer les occultations, les petites cibles et les arrière-plans complexes dans les environnements de production. YOLOv11 est une version de la série YOLO publiée par Ultralytics. Par rapport à YOLOv8, elle améliore le module C3K2 et le chemin de fusion de caractéristiques, et introduit une stratégie d'ancrage adaptative, offrant ainsi une robustesse de détection accrue dans les scénarios industriels.
Fondements et progrès du réseau neuronal convolutif (CNN)
Le réseau neuronal convolutif (CNN) est un modèle fondamental qui a profondément influencé le succès de l'apprentissage profond en vision par ordinateur. Il fonctionne en extrayant des caractéristiques locales des images au moyen d'opérations de convolution, puis en réduisant la dimensionnalité des caractéristiques par des opérations de regroupement (pooling), permettant ainsi une abstraction hiérarchique des images22.
Un CNN typique est composé de plusieurs couches de convolution, de regroupement et entièrement connectées. La couche de convolution analyse l'image d'entrée à l'aide d'un noyau de convolution, calcule des produits scalaires sur des régions locales et produit une carte de caractéristiques. Le processus de calcul est illustré dans l'équation (2) :
(2)
Où x est l'image d'entrée, wk et bk sont respectivement les poids et le biais du noyau de convolution, et
sont les valeurs de la carte de caractéristiques en sortie à la position (i,j). La couche de regroupement utilise généralement le regroupement maximal (Max Pooling) ou le regroupement moyen (Average Pooling). La couche entièrement connectée est chargée d'extraire les caractéristiques et de prédire les probabilités de classification.
Sur cette base, cet article conçoit un module d'amélioration des caractéristiques CNN pour YOLOv11, composé de deux branches parallèles : une branche de convolution multi-échelle qui utilise des noyaux de convolution 3 × 3 et 5 × 5 pour extraire des caractéristiques multi-échelles ; et une branche d'attention qui connecte successivement les modules d'attention de canal (Squeeze-and-Excitation) et d'attention spatiale afin de renforcer les caractéristiques discriminantes des cibles principales. Les sorties des deux branches sont fusionnées par addition élément par élément, et la fonction de perte correspondante pour l'amélioration des caractéristiques est indiquée dans la formule (3) :
(3)
Lcoord est la perte de régression des coordonnées de la boîte englobante ; Lconf est la perte de confiance vis-à-vis de la cible ; Lcls est la perte de classification par catégorie ; Lfeat est la perte d'amélioration des caractéristiques, utilisée pour contraindre les caractéristiques discriminantes des petites cibles et des cibles partiellement masquées extraites par le module d'amélioration du CNN ; λcoord, λconf, λcls, λfeat sont les coefficients de pondération des termes de perte correspondants. Pour cette tâche, on fixe λfeat = 0,05, et les poids restants sont ajustés selon les exigences de la tâche de détection.
Les structures classiques de CNN, telles que VGGNet23 et ResNet24, ont connu un grand succès dans les tâches de classification d'images. Parmi ces architectures, ResNet atténue efficacement le problème de disparition du gradient lors de l'entraînement de réseaux profonds, facilitant ainsi la construction de structures de réseaux plus profondes et plus complexes.
Dans les tâches de détection d'objets, le CNN est généralement utilisé comme extracteur de caractéristiques (backbone). Par exemple, Darknet, le Darknet partiel en plusieurs étapes (CSPDarknet), etc., dans la série d'algorithmes YOLO, sont tous basés sur le CNN25. Pour améliorer les capacités d'extraction de caractéristiques, les chercheurs ont proposé de nombreuses structures de CNN améliorées. Par exemple, le module Inception extrait des caractéristiques en parallèle à l’aide de noyaux de convolution multi-échelles. DenseNet renforce la réutilisation des caractéristiques grâce à des connexions denses. Le réseau Squeeze-and-Excitation ajuste de manière adaptative l’importance des canaux de caractéristiques au moyen de mécanismes d’attention26.
Dans cette étude, nous avons conçu un module CNN amélioré afin de renforcer les capacités d'extraction de caractéristiques de YOLOv11. Ce module associe une fusion de caractéristiques multi-échelle à un mécanisme d'attention pour capturer plus efficacement les informations critiques en matière de sécurité dans les scénarios de ligne de production.
État d'application de l'apprentissage profond dans la surveillance de la sécurité industrielle
L'apprentissage profond a considérablement gagné en importance dans le domaine de la surveillance de la sécurité industrielle. Les algorithmes basés sur les réseaux neuronaux convolutifs (CNN) sont utilisés pour déterminer si les travailleurs portent correctement leurs casques de sécurité, détecter les intrusions non autorisées dans des zones dangereuses et surveiller l'état d'équipements défectueux27.
En ce qui concerne la reconnaissance du comportement, les réseaux neuronaux convolutifs 3D et les réseaux neuronaux récurrents sont utilisés pour analyser le comportement opérationnel des travailleurs et identifier des actions potentiellement dangereuses. Par exemple, en analysant les séquences de postures des travailleurs, il est possible de déterminer s'ils violent les procédures de sécurité28.
YOLO et Faster R-CNN sont largement utilisés pour la détection de personnel et d'équipements dans des vidéos de surveillance en temps réel. Par exemple, un système de détection de casques en temps réel basé sur YOLOv5 a été proposé dans la littérature, améliorant efficacement l'intelligence de la gestion de la sécurité sur les chantiers29.
Bien que des progrès aient été réalisés dans les recherches existantes, plusieurs défis demeurent. Premièrement, les scènes industrielles présentent généralement des éclairages complexes, des occultations et des interférences de fond, ce qui impose des exigences strictes quant à la robustesse de l'algorithme. Deuxièmement, la performance en temps réel est une exigence clé, et l'algorithme doit réaliser une inférence à haute vitesse tout en maintenant sa précision. Enfin, les recherches existantes se concentrent principalement sur la détection mono-tâche et manquent d'exploration de la fusion d'informations provenant de multiples sources ainsi que d'analyses globales30.
Dans cette étude, le modèle de fusion proposé YOLOv11 et CNN vise à relever les défis susmentionnés et à assurer une surveillance complète et en temps réel des risques liés à la sécurité sur la ligne de production, en améliorant les capacités d'extraction et de fusion des caractéristiques.