Article de méthode

Surveillance en temps réel de la sécurité des lignes de production utilisant la détection d'objets et l'amélioration des caractéristiques basées sur l'apprentissage profond

36 vues

DOI :

10.3791/70968

21 août 2026

Dans cet article

Résumé

Cet article propose une méthode de surveillance de la sécurité dans une chaîne de production combinant You Only Look Once version 11 (YOLOv11) avec des réseaux neuronaux convolutifs. Elle atteint une précision moyenne à un seuil d'intersection sur union de 0,5 (mAP@0,5) de 0,91, un mAP@0,5:0,95 de 0,82 et un débit de 120 images par seconde sur une unité de traitement graphique, surpassant ainsi les modèles de référence évalués.

Résumé

Avec l'approfondissement de l'industrie 4.0, les niveaux d'automatisation et d'intelligence des chaînes de production se sont considérablement améliorés, ce qui accroît les exigences en matière de performance en temps réel, de précision et de sécurité du suivi. Les systèmes de surveillance traditionnels, qui reposent sur des inspections manuelles ou des décisions basées sur des seuils simples, souffrent généralement de temps de réponse lents, de taux élevés de fausses alarmes et d'une intelligence limitée. Par conséquent, cet article propose un système de surveillance de la sécurité des chaînes de production intégrant You Only Look Once version 11 (YOLOv11) à un réseau neuronal convolutif (CNN). Premièrement, les images acquises ont été prétraitées. Ensuite, YOLOv11 a été utilisé pour identifier en temps réel les travailleurs, les équipements et les dangers potentiels. Puis, un réseau CNN amélioré, doté d'une fusion de caractéristiques multi-échelle et de mécanismes d'attention, a été introduit afin d'améliorer les capacités d'extraction de caractéristiques pour les cibles petites et partiellement masquées. Enfin, les résultats de détection ont été fusionnés avec les caractéristiques renforcées par le CNN pour évaluer l'état de sécurité. Des expériences ont été menées à l'aide d'un jeu de données sur la sécurité en chaîne de production construit en interne, en utilisant l'optimiseur de descente de gradient stochastique (SGD) avec un momentum de 0,9, un taux d'apprentissage initial de 0,01, une décroissance du poids de 0,0005, un ajustement du taux d'apprentissage par recuit cosinus, une taille de lot de 32 et un entraînement sur 200 époques. Le mAP@0,5 et la vitesse de détection en images par seconde (FPS) ont été utilisés comme métriques d'évaluation pour la comparaison avec les algorithmes de référence évalués. Les résultats montrent que le système proposé a atteint un mAP@0,5 de 0,91 et une vitesse de détection de 120 FPS. Il a également démontré des performances robustes dans des conditions complexes telles que l'ombrage et des variations d'éclairage, confirmant ainsi son efficacité et son potentiel d'application pratique dans la surveillance de la sécurité des chaînes de production.

Introduction

Dans la production industrielle moderne, la sécurité est le pilier essentiel garantissant l'efficacité de la production et le bien-être du personnel. L'environnement de la chaîne de production implique généralement des équipements mécaniques à grande vitesse, des procédés technologiques complexes et des opérations collaboratives combinant plusieurs tâches. Le moindre risque potentiel pour la sécurité peut entraîner de graves accidents industriels, provoquant d'importantes pertes économiques et même des décès. Il est donc crucial de mettre en place un système de surveillance de la sécurité efficace, intelligent et en temps réel afin d'améliorer la sécurité dans la production industrielle1,2.

Les méthodes traditionnelles de surveillance de la sécurité reposent principalement sur la surveillance vidéo manuelle et divers capteurs (tels que les capteurs infrarouges, de fumée et de vibration)3. La surveillance manuelle n'est pas seulement inefficace, mais elle est également sujette à des détections manquées en raison de la fatigue du personnel de surveillance, et elle ne peut pas assurer une couverture continue et complète. Bien que les capteurs puissent offrir une certaine fonction d'alerte précoce, leur portée de détection est limitée et ils sont sensibles aux interférences environnementales, ce qui entraîne des problèmes importants de fausses alarmes4. Les systèmes de surveillance intelligents sont devenus un domaine de recherche de plus en plus important. L'analyse en temps réel d'un flux vidéo à l'aide d'un algorithme d'apprentissage profond permet d'identifier automatiquement les événements anormaux, les comportements dangereux et les risques potentiels, améliorant ainsi considérablement l'intelligence du système de surveillance4,5.

La détection d'objets est une technologie fondamentale dans la surveillance intelligente. En tant que représentants des détecteurs d'objets monocouche, les algorithmes de la série You Only Look Once (YOLO) présentent des avantages significatifs. De YOLOv1 à YOLOv8, cet ensemble d'algorithmes a connu un développement continu, avec des améliorations apportées à l'architecture du réseau, à la fonction de perte et à la méthodologie d'entraînement, entre autres aspects6,7. YOLOv11, en particulier, a atteint une précision de détection plus élevée tout en conservant un taux d'images par seconde élevé, notamment lorsqu'il est confronté à des arrière-plans complexes et à des cibles densément regroupées8.

Cependant, malgré ses excellentes performances dans les tâches générales de détection d'objets, YOLOv11 fait toujours face à des défis dans des scénarios spécifiques de surveillance de la sécurité en ligne de production9. Par exemple, la précision de détection de YOLOv11 peut diminuer lorsque les travailleurs sont partiellement masqués par des équipements ou lorsque les panneaux de sécurité sont petits et présentent une forte ressemblance avec la couleur du fond. Cela exige du modèle des capacités plus poussées d'extraction de caractéristiques et de compréhension sémantique10.

Les réseaux neuronaux convolutifs (CNN) possèdent de solides capacités en matière d'extraction de caractéristiques d'image11. En concevant des architectures de réseau plus profondes et plus complexes, les CNN peuvent apprendre des caractéristiques d'image plus riches et plus abstraites. Le couplage d'un CNN avec YOLOv11 exploite les capacités de détection rapide de YOLOv11 et l'extraction approfondie de caractéristiques du CNN, permettant ainsi de construire un système de surveillance de sécurité plus robuste et plus intelligent.

Sur cette base, cet article propose un système de surveillance de la sécurité en ligne de production utilisant YOLOv11 et un CNN. Les aspects innovants de cette étude comprennent : (1) la proposition d'une architecture de fusion profonde combinant YOLOv11 et un CNN amélioré ; (2) l'introduction d'une fusion de caractéristiques multi-échelle et d'un mécanisme d'attention composite afin d'améliorer la reconnaissance des caractéristiques clés de sécurité ; et (3) la vérification des avantages en performance du modèle sur un jeu de données de scènes complexes construit par nos soins.

Développement des algorithmes de la série YOLO
Depuis sa première présentation par Redmon et al. en 201512, l'algorithme You Only Look Once (YOLO) a suscité un grand intérêt. Contrairement aux détecteurs à deux étapes qui s'appuient sur des propositions de régions, YOLO aborde la détection d'objets comme une tâche de régression. En prédisant directement les classes et les positions des objets dans une image, YOLO augmente nettement la vitesse de détection, ce qui le rend adapté à une utilisation en temps réel13.

En tant que travail pionnier de cette série, YOLOv1 parvient pour la première fois à une détection de cibles de bout en bout14. YOLOv1 consiste à diviser l'image d'entrée en une structure en grille, où chaque cellule de grille, généralement organisée selon un format S × S, est chargée de détecter les objets situés dans ses limites.

Plus précisément, la sortie de YOLOv1 est un tenseur. Parmi les S × S × (B × 5 + C), la prédiction de chaque boîte englobante contient 5 éléments : les coordonnées du centre (x,y), la largeur w, la hauteur h et la confiance c. Le processus de calcul est illustré dans l'équation (1) :
Formule de la probabilité et de l'intersection sur l'union (IoU) pour l'analyse de détection d'objets.   (1)

Parmi eux, Pr(Object) représente la probabilité qu'il y ait une cible dans la grille, et IOU représente le rapport entre l'intersection et l'union entre la boîte englobante prédite et la boîte de référence. Chaque grille prédit également un ensemble de probabilités de classe, Pr représentant la probabilité que la cible appartienne à la i-ième classe en présence d'une cible. La fonction de perte de YOLOv1 est composée de trois composantes principales : la perte liée à la prédiction des coordonnées, la perte liée à l'estimation de la confiance et la perte liée à la prédiction de la catégorie15.

YOLOv2 introduit la normalisation par lots, un classificateur à haute résolution et une stratégie d'apprentissage multi-échelle, ce qui améliore la stabilité et la précision16. YOLOv3 utilise Darknet-53 comme réseau de base et s'inspire du concept de réseau pyramidal de caractéristiques (FPN) pour améliorer la détection des objets17.

YOLOv4 a apporté de nombreuses optimisations par rapport à YOLOv3, en introduisant des technologies telles que le Cross Stage Partial Network (CSPNet)18, le Path Aggregation Network (PANet)19 et l'amélioration des données Mosaic afin d'améliorer davantage les performances du modèle. YOLOv5 a apporté des contributions significatives en matière d'ingénierie, en proposant une implémentation plus facile à utiliser et plus efficace20.

Ces dernières années, la série YOLO n’a cessé d’évoluer, avec la sortie successive des versions YOLOv6, YOLOv7 et YOLOv8. En introduisant la structure Extended Efficient Layer Aggregation Network (E-ELAN) ainsi que des techniques de re-paramétrisation de modèle, YOLOv7 réalise de nouvelles avancées en termes de vitesse et de précision. Ces améliorations augmentent non seulement l'efficacité de l'apprentissage des caractéristiques, mais optimisent également les performances d'inférence du réseau, permettant à YOLOv7 de surpasser les versions précédentes ainsi que de nombreux détecteurs dominants dans diverses tâches de détection d'objets en temps réel. YOLOv8 optimise davantage la structure du réseau, adopte une conception sans ancres, simplifie le modèle et améliore sa capacité de généralisation21.

S'appuyant sur les avantages des versions précédentes, YOLOv11, utilisé dans cette étude, a été optimisé pour des scénarios industriels complexes. Ses améliorations principales incluent un réseau d'extraction de caractéristiques, un module de fusion de caractéristiques plus efficace et une conception de fonction de perte plus robuste. Ces améliorations permettent à YOLOv11 de mieux performer lorsqu'il s'agit de gérer les occultations, les petites cibles et les arrière-plans complexes dans les environnements de production. YOLOv11 est une version de la série YOLO publiée par Ultralytics. Par rapport à YOLOv8, elle améliore le module C3K2 et le chemin de fusion de caractéristiques, et introduit une stratégie d'ancrage adaptative, offrant ainsi une robustesse de détection accrue dans les scénarios industriels.

Fondements et progrès du réseau neuronal convolutif (CNN)
Le réseau neuronal convolutif (CNN) est un modèle fondamental qui a profondément influencé le succès de l'apprentissage profond en vision par ordinateur. Il fonctionne en extrayant des caractéristiques locales des images au moyen d'opérations de convolution, puis en réduisant la dimensionnalité des caractéristiques par des opérations de regroupement (pooling), permettant ainsi une abstraction hiérarchique des images22.

Un CNN typique est composé de plusieurs couches de convolution, de regroupement et entièrement connectées. La couche de convolution analyse l'image d'entrée à l'aide d'un noyau de convolution, calcule des produits scalaires sur des régions locales et produit une carte de caractéristiques. Le processus de calcul est illustré dans l'équation (2) :

Schéma de l'opération de convolution ; notation mathématique pour les modèles d'apprentissage automatique.   (2)

x est l'image d'entrée, wk et bk sont respectivement les poids et le biais du noyau de convolution, et Expression mathématique y_ij^k, potentiellement liée à des opérations matricielles ou tensorielles utilisées dans des algorithmes. sont les valeurs de la carte de caractéristiques en sortie à la position (i,j). La couche de regroupement utilise généralement le regroupement maximal (Max Pooling) ou le regroupement moyen (Average Pooling). La couche entièrement connectée est chargée d'extraire les caractéristiques et de prédire les probabilités de classification.

Sur cette base, cet article conçoit un module d'amélioration des caractéristiques CNN pour YOLOv11, composé de deux branches parallèles : une branche de convolution multi-échelle qui utilise des noyaux de convolution 3 × 3 et 5 × 5 pour extraire des caractéristiques multi-échelles ; et une branche d'attention qui connecte successivement les modules d'attention de canal (Squeeze-and-Excitation) et d'attention spatiale afin de renforcer les caractéristiques discriminantes des cibles principales. Les sorties des deux branches sont fusionnées par addition élément par élément, et la fonction de perte correspondante pour l'amélioration des caractéristiques est indiquée dans la formule (3) :

 Formule mathématique pour la coordination de la fonction de perte L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord est la perte de régression des coordonnées de la boîte englobante ; Lconf est la perte de confiance vis-à-vis de la cible ; Lcls est la perte de classification par catégorie ; Lfeat est la perte d'amélioration des caractéristiques, utilisée pour contraindre les caractéristiques discriminantes des petites cibles et des cibles partiellement masquées extraites par le module d'amélioration du CNN ; λcoord, λconf, λcls, λfeat sont les coefficients de pondération des termes de perte correspondants. Pour cette tâche, on fixe λfeat = 0,05, et les poids restants sont ajustés selon les exigences de la tâche de détection.

Les structures classiques de CNN, telles que VGGNet23 et ResNet24, ont connu un grand succès dans les tâches de classification d'images. Parmi ces architectures, ResNet atténue efficacement le problème de disparition du gradient lors de l'entraînement de réseaux profonds, facilitant ainsi la construction de structures de réseaux plus profondes et plus complexes.

Dans les tâches de détection d'objets, le CNN est généralement utilisé comme extracteur de caractéristiques (backbone). Par exemple, Darknet, le Darknet partiel en plusieurs étapes (CSPDarknet), etc., dans la série d'algorithmes YOLO, sont tous basés sur le CNN25. Pour améliorer les capacités d'extraction de caractéristiques, les chercheurs ont proposé de nombreuses structures de CNN améliorées. Par exemple, le module Inception extrait des caractéristiques en parallèle à l’aide de noyaux de convolution multi-échelles. DenseNet renforce la réutilisation des caractéristiques grâce à des connexions denses. Le réseau Squeeze-and-Excitation ajuste de manière adaptative l’importance des canaux de caractéristiques au moyen de mécanismes d’attention26.

Dans cette étude, nous avons conçu un module CNN amélioré afin de renforcer les capacités d'extraction de caractéristiques de YOLOv11. Ce module associe une fusion de caractéristiques multi-échelle à un mécanisme d'attention pour capturer plus efficacement les informations critiques en matière de sécurité dans les scénarios de ligne de production.

État d'application de l'apprentissage profond dans la surveillance de la sécurité industrielle
L'apprentissage profond a considérablement gagné en importance dans le domaine de la surveillance de la sécurité industrielle. Les algorithmes basés sur les réseaux neuronaux convolutifs (CNN) sont utilisés pour déterminer si les travailleurs portent correctement leurs casques de sécurité, détecter les intrusions non autorisées dans des zones dangereuses et surveiller l'état d'équipements défectueux27.

En ce qui concerne la reconnaissance du comportement, les réseaux neuronaux convolutifs 3D et les réseaux neuronaux récurrents sont utilisés pour analyser le comportement opérationnel des travailleurs et identifier des actions potentiellement dangereuses. Par exemple, en analysant les séquences de postures des travailleurs, il est possible de déterminer s'ils violent les procédures de sécurité28.

YOLO et Faster R-CNN sont largement utilisés pour la détection de personnel et d'équipements dans des vidéos de surveillance en temps réel. Par exemple, un système de détection de casques en temps réel basé sur YOLOv5 a été proposé dans la littérature, améliorant efficacement l'intelligence de la gestion de la sécurité sur les chantiers29.

Bien que des progrès aient été réalisés dans les recherches existantes, plusieurs défis demeurent. Premièrement, les scènes industrielles présentent généralement des éclairages complexes, des occultations et des interférences de fond, ce qui impose des exigences strictes quant à la robustesse de l'algorithme. Deuxièmement, la performance en temps réel est une exigence clé, et l'algorithme doit réaliser une inférence à haute vitesse tout en maintenant sa précision. Enfin, les recherches existantes se concentrent principalement sur la détection mono-tâche et manquent d'exploration de la fusion d'informations provenant de multiples sources ainsi que d'analyses globales30.

Dans cette étude, le modèle de fusion proposé YOLOv11 et CNN vise à relever les défis susmentionnés et à assurer une surveillance complète et en temps réel des risques liés à la sécurité sur la ligne de production, en améliorant les capacités d'extraction et de fusion des caractéristiques.

Protocole

YOLOv11 et algorithme CNN

Architecture générale du système
Le système de surveillance de la sécurité en ligne de production proposé dans cet article adopte une architecture hybride combinant YOLOv11 à un CNN amélioré afin d'assurer une surveillance en temps réel avec une grande précision et une vitesse élevée. Comme illustré dans la Figure 1, le système se compose principalement d'un module de prétraitement des entrées, d'un module de détection d'objets YOLOv11, d'un module d'amélioration des caractéristiques par CNN et d'un module de décision par fusion. L'image d'entrée est d'abord normalisée et augmentée par le module de prétraitement afin d'améliorer la capacité de généralisation du modèle. Ensuite, les caractéristiques sont extraites par le squelette CSPDarknet, et le champ réceptif est étendu par le module de regroupement par pyramide spatiale rapide (SPPF). Les caractéristiques multi-échelles sont fusionnées après remise à l'échelle, puis l'attention sur les canaux et l'attention spatiale sont appliquées successivement aux caractéristiques fusionnées afin d'améliorer davantage la représentation discriminante des cibles clés. Le module d'amélioration des caractéristiques par CNN est inséré après les sorties des couches C3, C4 et C5 du réseau squelette YOLOv11, recevant des cartes de caractéristiques multi-échelles de dimensions respectives 80 × 80 × 256, 40 × 40 × 512 et 20 × 20 × 1 024. Ce module d'amélioration renforce davantage l'extraction des caractéristiques pour les cibles petites et partiellement occultées. Enfin, le module de décision par fusion combine les résultats de détection de YOLOv11 avec les caractéristiques améliorées par CNN et les optimise conjointement au moyen d'une fonction de perte conçue, afin de produire la position exacte, la catégorie et le score de confiance de la cible.

Cadre de détection YOLOv11
YOLOv11 a introduit plusieurs améliorations essentielles qui exploitent les atouts du cadre de détection monoculaire de la série YOLO. Son architecture est divisée en trois composants principaux : un réseau squelette, un réseau de fusion de caractéristiques et une tête de détection. Le réseau squelette utilise une structure CSPDarknet améliorée. Le réseau de fusion de caractéristiques intègre des connexions locales inter-étapes et des convolutions séparables par profondeur, s'inspirant des réseaux pyramidaux de caractéristiques et des réseaux d'agrégation de chemins afin de fusionner efficacement des caractéristiques multi-échelles.

Module d'amélioration des caractéristiques
Le module d'amélioration des caractéristiques vise à accroître la sensibilité du modèle aux caractéristiques clés de sécurité. Il traite les cartes de caractéristiques produites par chaque couche du réseau principal YOLOv11, en fusionnant les informations à différentes échelles grâce à des opérations de suréchantillonnage et de sous-échantillonnage. Plus précisément, la branche multi-échelle capture la diversité des échelles spatiales, tandis que la branche d'attention renforce dynamiquement les canaux et les réponses de position clés. Ces deux branches n'agissent pas indépendamment, mais sont complémentaires et fusionnées par des connexions résiduelles et une recalibration des caractéristiques. La carte de caractéristiques traitée par le module d'amélioration à chaque échelle est ajustée pour correspondre au nombre de canaux de la carte de caractéristiques d'origine à l'aide d'une convolution 1 × 1, puis fusionnée avec la carte de caractéristiques YOLOv11 d'origine par addition élément par élément. La carte de caractéristiques fusionnée est ensuite transmise au réseau pyramidal de caractéristiques (FPN) suivant pour une fusion multi-échelle, formant ainsi une représentation hiérarchique des caractéristiques de sécurité. Afin d'assurer une intégration transparente entre les modules, une stratégie d'apprentissage conjointe de bout en bout est adoptée, la fonction de perte comprenant la perte de détection YOLOv11 et la perte d'amélioration des caractéristiques du module CNN.

Schéma du réseau neuronal convolutif ; inclut les modules Conv, ELAN, SPPF pour le processus de détection d'images.
Figure 1. Algorithme YOLOv11-CNN. Le module d'amélioration des caractéristiques vise à amplifier la sensibilité du modèle aux caractéristiques critiques de sécurité. Il traite les cartes de caractéristiques provenant de différentes couches du réseau principal YOLOv11, en fusionnant des caractéristiques à différentes échelles par des opérations de suréchantillonnage et de sous-échantillonnage. De plus, il intègre des mécanismes d'attention spatiale et par canal. Afin d'assurer une intégration fluide entre les modules YOLOv11 et CNN, une stratégie d'apprentissage conjointe est utilisée. Pendant l'apprentissage, les paramètres des deux modules sont optimisés de bout en bout. La fonction de perte combine la perte de détection de YOLOv11 avec la perte d'amélioration des caractéristiques du module CNN. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Résultats

Afin de vérifier l'efficacité du modèle de fusion proposé YOLOv11 et CNN pour la surveillance de la sécurité en ligne de production, un jeu de données couvrant divers scénarios de risques sécuritaires a été construit. Ce jeu de données contient 12 000 images de scènes de lignes de production, réparties en ensembles d'apprentissage, de validation et de test selon un ratio de 7:1,5:1,5, avec une graine aléatoire fixe de 42. Il couvre diverses conditions de travail, notamment un éclairage standard, un faible éclairage, une occultation partielle, une occultation importante, un flou de mouvement et des arrière-plans complexes. Le seuil de confiance pour l'inférence a été fixé à 0,5, et le seuil de suppression non maximale (NMS) a été fixé à 0,45. Toutes les expériences ont été répétées trois fois, et les résultats sont rapportés sous la forme moyenne ± écart-type. Les catégories d'annotation sont les travailleurs, les casques de sécurité, les bras robotiques, les zones dangereuses, les outils et les véhicules, en utilisant le format PASCAL Visual Object Classes (VOC). Le seuil d'intersection sur union (IoU) est fixé à 0,5, et la cohérence des annotations est vérifiée par une validation croisée à deux personnes. Les images d'entrée ont été uniformément redimensionnées à 640 × 640 et augmentées avec des données Mosaic. L'entraînement a été effectué à l'aide de l'optimiseur SGD avec un taux d'apprentissage initial de 0,01, une inertie de 0,9, une décroissance du poids de 0,0005 et une taille de lot de 32. L'entraînement a duré 200 époques, et un recuit cosinusoidal a été utilisé pour ajuster le taux d'apprentissage.

Afin d'évaluer de manière approfondie l'efficacité du modèle, plusieurs métriques d'évaluation ont été utilisées : la précision moyenne (mAP), les images par seconde (FPS) pour mesurer le taux de traitement des images, la précision pour évaluer l'exactitude des prédictions positives, le rappel pour quantifier la capacité du modèle à détecter les vrais positifs, et l'aire sous la courbe (AUC) pour indiquer la surface sous la courbe caractéristique de fonctionnement du récepteur (ROC), reflétant ainsi la capacité globale de classification du modèle. Les formules de calcul sont présentées dans les équations (4), (5), (6), (7), (8), (9), (10), (11) :

formule de calcul du mAP, mAP@0,5=1/NΣ(Ni=1)APi, métrique, précision, analyse de données.  (4)
formule de calcul de la précision moyenne (mAP) ; équation Σ pour l'analyse d'évaluation des données.  (5)
formule de précision, TP/(TP+FP), équation pour l'analyse des résultats d'apprentissage automatique, métrique concise.  (6)
Rappel formule de précision, TP/(TP+FN), équation, analyse statistique, évaluation en apprentissage automatique. (7)
équation d'équilibre statique FPS=F/T illustrant le calcul de la force par unité de temps en physique.  (8)
formule du taux de vrais positifs, TPR=TP/(TP+FN), équation d'analyse statistique.  (9)
formule du taux de faux positifs, FPR=FP/(FP+TN), analyse statistique, usage pédagogique.  (10)
formule de l'AUC, AUC=∫₀¹TPR(x)dx ; diagramme mathématique pour l'interprétation de l'analyse de données.  (11)

Métriques précision-rappel ; mAP@0,5, mAP@[0,5:0,95], VP, FP, FN, précision, rappel ; analyse de données.  Ici, mAP@0,5 indique la précision moyenne moyenne à un seuil d’IoU de 0,5 ; N est le nombre de catégories ; APi est la précision moyenne de la i-ème catégorie ; et mAP@[0,5:0,95] est la mAP moyenne calculée sur des seuils d’IoU allant de 0,5 à 0,95. TP, FP, FN et TN représentent respectivement les nombres de vrais positifs, de faux positifs, de faux négatifs et de vrais négatifs. F est le nombre total d’images traitées, T est le temps total de traitement, TPR est le taux de vrais positifs et FPR est le taux de faux positifs.
Pour le composant de détection YOLOv11, la fonction de perte est indiquée dans l’équation (12) :

Formule de la fonction de perte : \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

Schéma de l'équation d'équilibre statique : L_coord, L_conf, L_class ; λ_coord, λ_conf, λ_class.  Où Lcoord désigne l'écart entre la trame prédite et la trame réelle, Lconf mesure l'erreur de confiance de la trame prédite, Lclass mesure l'erreur de prédiction de catégorie, et λcoord, λconf et λclass sont les coefficients de poids utilisés pour équilibrer les pertes correspondantes.

L'analyse des données du Tableau 1 montre que la méthode proposée atteint un mAP@0.5 de 0,91 et un mAP@0.5:0.95 de 0,82, représentant des améliorations respectives de 0,04 et 0,04 par rapport à YOLOv5. Son score F1 est de 0,935, également supérieur à ceux des modèles de comparaison. La vitesse de détection est de 120 images par seconde (FPS), quatre fois plus élevée que celle de Faster R-CNN, mais légèrement inférieure à celles de YOLOv10 et YOLOv11. Le nombre de paramètres est de 6,7 M, seulement 1,5 M de plus que YOLOv11, avec une amélioration de 0,03 en mAP@0.5. Comparé à EfficientDet, qui présente un coût computationnel similaire, la précision est supérieure de 0,06, tandis que le nombre de paramètres est 56 % plus faible. Ces données démontrent que le mécanisme proposé de fusion multi-échelle et d'attention améliore efficacement la précision de détection des petites cibles, atteignant un bon équilibre entre vitesse et précision. En résumé, notre méthode proposée parvient à un équilibre entre précision et rapidité de détection. Le mAP@0.5 est de 0,02 supérieur à celui du deuxième meilleur modèle, le score F1 atteint 0,935, et les 6,7 millions de paramètres sont suffisants pour un déploiement pratique. Le mécanisme de fusion multi-échelle et d'attention améliore la reconnaissance des petites cibles et des cibles partiellement occultées dans des scènes complexes. Le modèle équilibre précision et efficacité, ce qui le rend adapté à des scénarios en temps réel tels que la surveillance de la sécurité industrielle. À noter que tous les modèles de comparaison utilisent des poids pré-entraînés officiels, avec une résolution d'entrée uniforme de 640 × 640, un seuil NMS de 0,45 et un seuil de confiance de 0,5.

MéthodemAP@0.5mAP@0.5:0.95Score-F1FPSParamètres (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
NOTRE MÉTHODE0.910.820.9351206.7

Tableau 1 : Tableau comparatif complet des performances des modèles. L'analyse des données montre que la méthode proposée atteint un mAP@0.5 de 0,91 et un mAP@0.5:0.95 de 0,82, représentant des améliorations respectives de 0,04 et 0,04 par rapport à YOLOv5. Son score F1 est de 0,935, également supérieur à ceux des modèles de comparaison. La vitesse de détection est de 120 images par seconde (FPS), quatre fois supérieure à celle de Faster R-CNN, mais légèrement inférieure à celles de YOLOv10 et YOLOv11. Le nombre de paramètres est de 6,7 M, seulement 1,5 M de plus que YOLOv11, avec une amélioration de 0,03 en mAP@0.5. Par rapport à EfficientDet, dont le coût computationnel est similaire, la précision est supérieure de 0,06, tandis que le nombre de paramètres est inférieur de 56 %. Les données démontrent que la fusion multi-échelle et le mécanisme d'attention introduits améliorent efficacement la précision de la détection des petites cibles, atteignant un bon équilibre entre vitesse et précision. En résumé, notre méthode proposée parvient à un équilibre entre précision et rapidité de détection. Le mAP@0.5 est de 0,02 supérieur à celui du deuxième meilleur modèle, le score F1 atteint 0,935, et les 6,7 millions de paramètres sont suffisants pour un déploiement pratique. Le mécanisme de fusion multi-échelle et d'attention améliore la reconnaissance des cibles petites et partiellement occultées dans des scènes complexes. Le modèle équilibre précision et efficacité, ce qui le rend adapté à des scénarios en temps réel tels que la surveillance de la sécurité industrielle. À noter que tous les modèles de comparaison utilisent des poids pré-entraînés officiels, avec une résolution d'entrée uniforme de 640 × 640, un seuil NMS uniforme de 0,45 et un seuil de confiance uniforme de 0,5.

Figure 2 présente une analyse approfondie des types d'erreurs de détection du modèle. YOLOv11 + CNN affiche le taux d'erreurs de détection le plus faible dans les arrière-plans (85 fois/10 000 images), la majorité des fausses détections se produisant sur des objets similaires (62 fois) et dans des scènes partiellement occultées (48 fois). L'analyse de la courbe ROC indique que la sensibilité du modèle atteint 0,9 (AUC = 0,98) pour un taux de faux positifs de 0,1, et l'espacement le plus étroit entre les courbes soutient la grande fiabilité de la confiance en la détection. Ces résultats d'analyse valident non seulement les performances du modèle, mais offrent également une feuille de route technique claire pour l'optimisation ultérieure des fausses détections, en particulier en renforçant sa capacité à distinguer les objets similaires.

Courbe ROC et diagramme en barres comparant les modèles de détection d'objets : AUC, analyse des fausses alarmes par type.
Figure 2. Analyse des erreurs. Analyse des types de détections erronées du modèle. YOLOv11 + CNN présente le taux de fausses détections le plus faible dans le fond (85 fois/10 000 images), la majorité des fausses détections étant concentrée sur des objets similaires (62 fois) et des scènes partiellement occultées (48 fois). L'analyse de la courbe ROC indique que la sensibilité du modèle atteint 0,9 (AUC = 0,98) pour un taux de faux positifs de 0,1, et l'espacement le plus étroit entre les courbes soutient la fiabilité de la confiance en la détection. Ces résultats d'analyse soutiennent non seulement les performances du modèle, mais fournissent également une feuille de route technique claire pour l'optimisation ultérieure des fausses détections, en particulier en renforçant sa capacité à distinguer des objets similaires. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 3 compare les performances du modèle sur diverses plateformes matérielles. YOLOv11 + CNN atteint une latence ultra-faible de 18 ms sur l'unité de traitement tensoriel (TPU) Edge, avec une fluctuation de seulement ±2 ms, et la consommation d'énergie est maintenue à 15 W. Les tests de débit montrent que le modèle atteint une vitesse de traitement de 70 images par seconde (FPS) sur les dispositifs de calcul embarqué Jetson Xavier, la latence au 99e centile étant maintenue en dessous de 50 ms. Ces indicateurs de performance en déploiement permettent au modèle de s'adapter aux besoins de déploiement sur diverses plateformes de calcul dans les domaines industriels. L'analyse des erreurs montre en outre que le modèle peut maintenir des performances stables dans des environnements à ressources limitées, démontrant ainsi son applicabilité en ingénierie.

Graphiques comparatifs de débit et de latence des modèles YOLO sur différents appareils ; analyse des performances des dispositifs.
Figure 3. Performances de déploiement. Comparaison des performances du modèle sur diverses plateformes matérielles. YOLOv11 + CNN atteint une latence ultra-faible de 18 ms sur l'Edge TPU (avec une fluctuation de seulement ±2 ms), et la consommation d'énergie est maintenue à 15 W. Les tests de débit montrent que le modèle atteint une vitesse de traitement de 70 images par seconde (FPS) sur les dispositifs de calcul embarqué Jetson Xavier, la latence au 99e centile étant maintenue en dessous de 50 ms. Ces indicateurs de performance de déploiement indiquent qu'il peut s'adapter aux besoins de déploiement sur diverses plateformes informatiques dans les domaines industriels. L'analyse des erreurs montre en outre que le modèle peut maintenir des performances stables dans des environnements à ressources limitées, démontrant ainsi son applicabilité en ingénierie. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 4 compare les différences de performances de détection de chaque modèle à travers six catégories cibles. YOLOv11 + CNN a atteint une précision de 0,96 dans la tâche de reconnaissance du casque de sécurité, dépassant le modèle de référence de 4 points de pourcentage. Le tracé en pointillés indique que le modèle présente des fluctuations minimales de performance entre les catégories (±0,05), reflétant ses capacités de généralisation. La matrice de confusion, présentée sous forme de carte thermique, révèle une erreur de détection mutuelle de 15 % entre la zone dangereuse et le bras robotique. Cette observation fournit une direction claire pour l'optimisation ultérieure du modèle.

Matrice de confusion et graphique des performances par catégorie ; analyse de la précision, du rappel et du score F1, modèle de sécurité.
Figure 4. Analyse de la détection par catégorie. Comparaison des différences de performances de détection de chaque modèle sur six catégories cibles. YOLOv11 + CNN a atteint une exactitude de 0,96 dans la tâche de reconnaissance des casques de sécurité, dépassant le modèle de référence de 4 points de pourcentage. Le tracé en pointillés indique que le modèle présente des fluctuations minimales de performance entre les catégories (±0,05), reflétant ses capacités de généralisation. La matrice de confusion, présentée sous forme de carte thermique, révèle un taux de fausses détections mutuelles de 15 % entre la zone dangereuse et le bras robotique. Cette observation fournit une direction claire pour l'optimisation ultérieure du modèle. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 fournit un enregistrement complet du processus d'entraînement pour chaque modèle. YOLOv11 + CNN présente la vitesse de convergence la plus rapide, la perte chutant à 0,1 en moins de 30 époques, et l'écart entre sa courbe de mAP sur l'ensemble de validation et celle sur l'ensemble d'entraînement reste constamment inférieur à 1 %. L'analyse du tracé de la bande d'erreur montre que la mAP@0,5 finale sur l'ensemble de validation du modèle est stable à 0,94 ± 0,01, et sa plage de fluctuation de performance n'est que le tiers de celle de RetinaNet. Ces résultats confirment l'efficacité du protocole d'entraînement conjoint. Le modèle présente des avantages de performance dès les premières étapes de l'entraînement, ce qui indique que sa conception architecturale lui permet d'apprendre rapidement les caractéristiques.

Graphique en boîte et graphique en violon comparant le mAP de validation et la perte d'apprentissage des modèles d'apprentissage automatique.
Figure 5. Analyse du processus d'apprentissage. Enregistrement du processus d'apprentissage pour chaque modèle. YOLOv11 + CNN présente la vitesse de convergence la plus rapide (la perte tombe à 0,1 en moins de 30 époques), et l'écart entre sa courbe de mAP sur l'ensemble de validation et celle sur l'ensemble d'apprentissage reste toujours inférieur à 1 %. L'analyse des bandes d'erreur montre que le mAP@0,5 final sur l'ensemble de validation du modèle est stable à 0,94 ± 0,01, et la plage de fluctuation des performances n'est qu'un tiers de celle de RetinaNet. Ces résultats confirment l'efficacité du protocole d'apprentissage conjoint. Le modèle présente des avantages de performance dès les premières étapes de l'apprentissage, ce qui indique que sa conception architecturale lui permet d'apprendre rapidement les caractéristiques. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Tableau 2 présente les résultats quantitatifs de performance pour différents modèles de détection dans des environnements complexes. Les données de test, recueillies dans des conditions d'éclairage standard et divers scénarios extrêmes, montrent que YOLOv11 + CNN conserve des performances optimales dans toutes les conditions. Dans des conditions d'éclairage standard, la mAP@0,5 de ce modèle atteint 0,91, ce qui est nettement supérieur à YOLOv5 (0,87) et à Faster R-CNN (0,84). Lorsque les conditions environnementales se dégradent, les performances de chaque modèle diminuent dans des proportions variables, mais YOLOv11 + CNN fait preuve de la plus grande robustesse environnementale : en conditions de faible luminosité (< 50 lux), ses performances ne baissent que de 3 % (jusqu'à 0,88), ce qui est meilleur que la réduction de 5 % observée pour les modèles comparatifs ; dans des scénarios fortement occultés (> 50 %), sa mAP reste maintenue à 0,78, et la dégradation des performances (13 %) est nettement inférieure à celle de YOLOv5 (15 %) et de Faster R-CNN (16 %). Ces résultats démontrent que YOLOv11 + CNN améliore l'adaptabilité du modèle aux facteurs complexes, tels que les variations d'éclairage et les occultations, grâce à des mécanismes améliorés de fusion de caractéristiques et d'attention, soutenant ainsi des applications pratiques dans des contextes industriels.

Condition de testYOLOv11 + CNNYOLOv5Faster R-CNNFluctuation de performance
Éclairage standard0.910.870.840.01
Faible luminosité (< 50 lux)0.88 (-3 %)0.82 (-5 %)0.79 (-5 %)0.02
Occlusion partielle (30 %–50 %)0.85 (-6 %)0.80 (-7 %)0.76 (-8 %)0.03
Occlusion importante (> 50 %)0.78 (-13 %)0.72 (-15 %)0.68 (-16 %)0.04
Flou de mouvement0.83 (-8 %)0.77 (-10 %)0.73 (-11 %)0.05

Tableau 2 : Tableau d'analyse quantitative de l'adaptabilité environnementale. Performance de différents modèles de détection dans des environnements complexes par analyse quantitative. Les données de test, allant de conditions d'éclairage standard à divers scénarios extrêmes, montrent que YOLOv11 + CNN conserve la performance la plus élevée dans toutes les conditions d'essai. Dans des conditions d'éclairage standard, la mAP@0,5 de ce modèle atteint 0,91, nettement supérieure à celle de YOLOv5 (0,87) et de Faster R-CNN (0,84). Lorsque les conditions environnementales se dégradent, la performance de chaque modèle diminue dans des proportions variables, mais YOLOv11 + CNN présente la plus grande robustesse environnementale parmi les modèles évalués : en conditions de faible luminosité (< 50 lux), sa performance ne diminue que de 3 % (jusqu'à 0,88), ce qui est meilleur que la réduction de 5 % observée pour les modèles comparatifs ; dans des scénarios fortement occultés (> 50 %), sa mAP reste maintenue à 0,78, et la dégradation de performance (13 %) est nettement inférieure à celle de YOLOv5 (15 %) et de Faster R-CNN (16 %). Ces résultats démontrent que YOLOv11 + CNN améliore l'adaptabilité du modèle aux facteurs complexes, tels que les variations d'éclairage et les interférences par occultation, grâce à un mécanisme de fusion de caractéristiques amélioré et à une conception d'attention optimisée, soutenant ainsi des applications pratiques dans des contextes industriels.

Tableau 3 indique que l'optimiseur SGD a été utilisé dans cette expérience, avec une inertie de 0,9 afin d'accélérer la convergence et de réduire les oscillations. Un taux d'apprentissage initial de 0,01 a été appliqué avec un recuit cosinus, qui a progressivement diminué au cours de l'entraînement pour affiner l'optimisation. Une décroissance du poids de 0,0005 a été introduite afin d'appliquer une régularisation L2 et de réduire le surajustement. Une taille de lot de 32 a permis d'équilibrer l'efficacité computationnelle et la stabilité de l'estimation du gradient. Les 200 époques d'entraînement ont assuré une convergence suffisante. Les paramètres ont été adaptés à la tâche de détection en une seule étape, en équilibrant la vitesse et la précision de l'entraînement.

ParamètreValeur
OptimiseurSGD
Taux d'apprentissage initial0.01
Quantité de mouvement0.9
Décroissance du poids0.0005
Taille du lot32
Époques d'entraînement200
Programmation du taux d'apprentissageRecuit cosinus

Tableau 3 : Tableau des hyperparamètres d'entraînement. L'optimiseur SGD a été utilisé dans cette expérience, avec une inertie de 0,9 afin d'accélérer la convergence et de supprimer les oscillations. Un taux d'apprentissage initial de 0,01 a été appliqué avec un recuit cosinus, qui a progressivement diminué durant l'entraînement afin d'affiner l'optimisation. Une décroissance du poids de 0,0005 a été introduite pour appliquer une régularisation L2 et réduire le surajustement. Une taille de lot de 32 a permis d'équilibrer l'efficacité computationnelle et la stabilité de l'estimation du gradient. Les 200 époques d'entraînement ont assuré une convergence suffisante. Les paramètres ont été adaptés à la tâche de détection en une seule étape, en équilibrant vitesse et précision d'entraînement.

Tableau 4 montre que, en utilisant YOLOv11 comme référence, le mAP@0,5 est de 0,89. L'introduction de la fusion multi-échelle seule réduit la précision à 0,88. L'ajout successif de l'attention de canal et de l'attention spatiale améliore respectivement la précision à 0,90 et 0,89. La précision combinée de tous les modules atteint 0,91, soit une amélioration de 0,02 par rapport à la référence. Les données montrent que l'attention de canal améliore directement la précision, et que la performance combinée de la multi-échelle et de l'attention est optimale.

ConfigurationmAP@0.5
YOLOv11 (valeur de référence)0.89
+ Fusion multi-échelle0.88
+ Multi-échelle + attention sur les canaux0.9
+ Multi-échelle + attention spatiale0.89
Module complet (YOLOv11 + CNN)0.91

Tableau 4 : Tableau des tests d'ablation. En utilisant YOLOv11 comme référence, le mAP@0.5 est de 0,89. L'introduction de la fusion multi-échelle seule réduit la précision à 0,88. L'ajout d'une attention sur les canaux ou d'une attention spatiale après la fusion multi-échelle améliore la précision respectivement à 0,90 et 0,89. La précision combinée de tous les modules atteint 0,91, soit une amélioration de 0,02 par rapport à la référence. Les données montrent que l'attention sur les canaux procure des gains supérieurs à l'attention spatiale dans ce contexte, et que la performance combinée de la fusion multi-échelle et des mécanismes d'attention est optimale.

Figure 6 évalue systématiquement les performances du modèle dans des environnements extrêmes. Le mAP de YOLOv11 + CNN a diminué de seulement 6 % (à 0,88) dans des conditions de faible luminosité et maintenait encore un mAP de 0,78 (8 % devant le référentiel) dans des scènes fortement occultées. Ces résultats démontrent que le modèle présente une adaptabilité environnementale, permettant de traiter efficacement les variations courantes d'éclairage et les problèmes d'occultation locale dans la production industrielle, soutenant ainsi le fonctionnement stable du système de détection.

Graphiques de performance du modèle de détection d'objets ; analyse de l'impact de l'éclairage et de l'occultation ; métriques mAP@0,5.
Figure 6. Adaptabilité environnementale. Une évaluation systématique des performances du modèle dans des environnements extrêmes. Le mAP de YOLOv11 + CNN a diminué de seulement 6 % (à 0,88) dans des conditions de faible luminosité, et maintenait encore un mAP de 0,78 (8 % au-dessus du référentiel) dans des scènes fortement occultées. Ces résultats démontrent que le modèle présente une adaptabilité environnementale, permettant de traiter efficacement les variations courantes d'éclairage et les problèmes d'occultation partielle dans la production industrielle, soutenant ainsi le fonctionnement stable du système de détection. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 compare les différences de distribution des caractéristiques entre YOLOv11 et YOLOv11 + CNN sur six types de cibles industrielles à l’aide de la réduction de dimensionnalité t-SNE. La figure de gauche montre que les caractéristiques du modèle de base YOLOv11 présentent une dispersion importante au sein des classes (distance intraclasse de 2,34 ± 0,15), en particulier dans la « Zone dangereuse » (rouge) et le « Véhicule » (violet), où l’on observe un chevauchement significatif, ce qui est conforme au taux de détection erronée de 15 % dans le groupe expérimental 3. La figure de droite montre que le modèle amélioré YOLOv11 + CNN améliore considérablement la compacité intraclasse grâce au module d’amélioration des caractéristiques, augmentant ainsi la distance moyenne entre les centres des groupes au sein de chaque catégorie d’un facteur 1,8.

Graphique de regroupement des caractéristiques YOLOv11 contre YOLOv11+CNN, analyse de la distance intra-classe, visualisation des données.
Figure 7. Comparaison de la répartition des caractéristiques en t-SNE. Comparaison des différences de répartition des caractéristiques entre YOLOv11 et YOLOv11 + CNN sur six types de cibles industrielles, obtenue par réduction de dimensionnalité t-SNE. Le graphique de gauche montre que les caractéristiques du modèle de base YOLOv11 présentent une dispersion importante au sein des classes (distance intra-classe de 2,34 ± 0,15), en particulier dans la « Zone dangereuse » (rouge) et le « Véhicule » (violet), où l'on observe un chevauchement substantiel, ce qui est cohérent avec un taux de détection erronée de 15 % dans le groupe expérimental 3. Le graphique de droite montre que le modèle amélioré YOLOv11 + CNN améliore significativement la compacité intra-classe grâce au module d'amélioration des caractéristiques, et que la distance moyenne entre les centres des groupes pour chaque catégorie augmente d’un facteur 1,8. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 8 vérifie la contribution de chaque module au moyen d'expériences d'ablation systématiques. Les résultats d'ablation montrent que l'ajout d'une attention sur les canaux après la fusion multi-échelle augmente le mAP@0.5 à 0,90, tandis que l'ajout d'une attention spatiale augmente le mAP@0.5 à 0,89. Le module complet atteint le mAP@0.5 le plus élevé, de 0,91. La visualisation sous forme de carte thermique montre que le mécanisme d'attention composé peut simultanément renforcer la réponse de détection au centre de la zone dangereuse (valeur d'activation : +0,15) et aux petites cibles situées en périphérie (+0,08). Les données expérimentales démontrent que la fusion de caractéristiques multi-échelle et les mécanismes d'attention ont un effet cumulatif, permettant au modèle de répondre aux exigences de détection de cibles à différentes échelles.

Graphique d'étude d'ablation de l'amélioration des caractéristiques dans les cadres YOLO avec des cartes d'attention ; analyse des performances.
Figure 8. Expérience d'ablation modulaire. Vérification de la contribution de chaque module par des expériences d'ablation systématiques. Les résultats d'ablation montrent que l'ajout d'une attention de canal après la fusion multi-échelle augmente le mAP@0,5 à 0,90, tandis que l'ajout d'une attention spatiale augmente le mAP@0,5 à 0,89. Le module complet atteint le mAP@0,5 le plus élevé de 0,91. La visualisation par carte thermique montre que le mécanisme d'attention composé peut simultanément renforcer la réponse de détection au centre de la zone dangereuse (valeur d'activation : +0,15) et aux petites cibles situées en périphérie (+0,08). Les données expérimentales démontrent que la fusion de caractéristiques multi-échelle et les mécanismes d'attention ont un effet cumulatif, permettant au modèle de répondre aux exigences de détection de cibles à différentes échelles. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

DISPONIBILITÉ DES DONNÉES :
Les images complètes brutes et les flux vidéo de la chaîne de production sont soumis à des restrictions de confidentialité industrielle et ne sont pas publiés publiquement. Une description de l'ensemble de données supplémentaire (Fichier supplémentaire 1) fournit les détails relatifs à l'acquisition des données, aux distributions des catégories et des scénarios, aux spécifications d'annotation, aux procédures de contrôle de qualité, à la répartition des données, au prétraitement et aux méthodes d'augmentation. Un cadre de pseudocode et de reproductibilité (Fichier supplémentaire 2) présente un flux de travail au niveau du pseudocode, des descriptions de configuration et des recommandations pour la reproduction. Un sous-ensemble anonymisé et des documents complémentaires peuvent être demandés auprès de l'auteur correspondant pour une recherche académique à but non lucratif, sous réserve des restrictions institutionnelles et de confidentialité.

Fichier supplémentaire 1. Description du jeu de données supplémentaire. Ce fichier décrit le protocole d'acquisition du jeu de données, la couverture des scénarios, la répartition des classes, les spécifications d'annotation, les procédures de contrôle de qualité, la partitionnement en ensembles d'apprentissage, de validation et de test, le prétraitement et les procédures d'augmentation. Veuillez cliquer ici pour télécharger ce fichier.

Fichier supplémentaire 2. Pseudocode et cadre de reproductibilité. Ce fichier fournit au niveau du pseudocode les détails relatifs au flux de travail et à la configuration pour le prétraitement, l'entraînement, l'évaluation et le déploiement, et décrit les restrictions concernant les séquences brutes industrielles ainsi que l'accès aux matériaux complémentaires. Veuillez cliquer ici pour télécharger ce fichier.

Discussion

Les résultats expérimentaux montrent que le modèle de fusion YOLOv11–CNN proposé améliore la précision de détection et les performances en temps réel pour la surveillance de la sécurité en ligne de production. En exploitant la détection efficace en une seule étape de YOLOv11 et l'amélioration des caractéristiques par le module CNN, le système a identifié les travailleurs, les équipements et les zones dangereuses dans des conditions complexes d'éclairage et d'occultation. La fusion de caractéristiques multi-échelles et les mécanismes d'attention ont renforcé la capacité à se concentrer sur les éléments clés de sécurité, fournissant des preuves visuelles interprétables pour l'alerte précoce.

Le système présente une valeur pratique pour les chaînes de production dans des contextes tels que la fabrication automobile et l'assemblage électronique, où la surveillance en temps réel peut réduire la dépendance à l'inspection manuelle et raccourcir les délais de réponse face à des risques potentiels pour la sécurité. Pour de petites cibles, telles que des vis et des outils, ainsi que pour des travailleurs partiellement masqués par des bras robotiques ou d'autres équipements, la fusion de caractéristiques multi-échelle et les mécanismes d'attention améliorent la capacité du modèle à extraire et à mettre en évidence les caractéristiques liées à la sécurité. Ces améliorations sont pertinentes pour les environnements de production dans lesquels les cibles varient en taille et en visibilité.

Toutefois, cette étude présente encore des limites évidentes. En cas d'occultation sévère ou d'éclairement très faible, les performances du modèle peuvent diminuer, car l'information relative aux caractéristiques de la cible devient incomplète et les caractéristiques convolutionnelles existantes peuvent s'avérer insuffisantes. Le module d'amélioration des caractéristiques CNN nouvellement ajouté introduit 1,5 million de paramètres supplémentaires, ce qui peut augmenter la charge de calcul pour les dispositifs embarqués peu coûteux et limiter le déploiement dans des environnements à ressources contraintes. Cette étude utilise des données d'images en lumière visible et n'intègre pas d'informations provenant de capteurs multimodaux, tels que l'imagerie thermique infrarouge ou le radar millimétrique ; par conséquent, ses performances peuvent être limitées dans des scènes industrielles extrêmes, comme l'obscurité totale ou la présence de fumée.

Les recherches futures s'orienteront vers les axes suivants : l'allègement des modèles basé sur l'élagage structuré et la distillation des connaissances afin de réduire la charge en paramètres tout en maintenant les performances de détection ; la construction d'un cadre de détection par fusion multimodale visible-infrarouge pour améliorer la capacité de détection dans des environnements à éclairage extrême ou enfumés ; l'introduction d'un module Transformer léger pour remplacer une partie des couches de convolution et renforcer l'extraction des caractéristiques contextuelles à longue distance ; et le développement d'un sous-système de reconnaissance des comportements anormaux de bout en bout afin de soutenir l'ensemble du flux de travail, de la détection des cibles à l'alerte précoce sur les comportements.

En conclusion, cette étude porte sur un système de surveillance de la sécurité en ligne de production qui fusionne les algorithmes YOLOv11 et CNN afin de permettre la détection en temps réel et l'alerte précoce des risques potentiels dans des environnements industriels complexes. Grâce à une vérification expérimentale, le modèle fusionné a montré des avantages en termes de précision de détection d'objets et de vitesse d'inférence. Grâce à son architecture de détection unique efficace et à son extraction de caractéristiques optimisée, YOLOv11 a bien performé dans l'identification rapide des travailleurs, des équipements et des zones dangereuses, tout en capturant avec précision les éléments clés de sécurité dans les scénarios de lignes de production. Par ailleurs, l'introduction du module CNN amélioré a renforcé davantage la capture des caractéristiques et la détection des cibles partiellement occultées. Dans la surveillance de la sécurité en ligne de production, le modèle se concentre automatiquement sur les zones clés de sécurité dans l'image par analyse visuelle, fournissant ainsi une base interprétable aux alertes de sécurité. Le modèle fusionné a démontré une forte adaptabilité et stabilité dans divers scénarios de lignes de production, notamment l'usinage, l'assemblage et le stockage. Les principales réalisations de cet article sont les suivantes :

(1) Une architecture de fusion profonde de YOLOv11 et de CNN a été conçue pour équilibrer la vitesse et la précision de détection.
(2) Un mécanisme de fusion de caractéristiques multi-échelles et d'optimisation par attention a été mis en place afin d'améliorer la capacité à se concentrer sur les éléments de sécurité clés dans des scénarios complexes.
(3) Des expériences menées sur un jeu de données de sécurité de ligne de production construit en interne ont montré que le modèle atteint un mAP@0.5 de 0,91 et une vitesse de détection de 120 images par seconde. Lors de tests croisés de scénarios, le modèle a présenté des performances stables.

Des études de cas typiques ont montré que, dans des conditions d'éclairage standard, un casque de sécurité avec seulement 40 % d'exposition était correctement détecté par la fusion multi-échelle et l'attention sur les canaux (confiance de 0,93), tandis que le modèle de référence l'identifiait à tort comme un fond. Dans des scénarios de faible luminosité, lorsqu'un travailleur pénétrait dans une zone dangereuse, l'attention spatiale parvenait correctement à délimiter la cible à l'aide de lignes directionnelles, alors que la méthode comparative échouait à la détecter. Les échecs observés comprenaient la détection erronée d'une clé à molette comme un outil en raison de la similarité de texture avec le fond sous une occlusion sévère, ainsi qu'un casque de sécurité non détecté en raison d'un faible rapport signal-sur-bruit à distance dans des conditions de faible éclairage, révélant ainsi des limites dans la représentation des caractéristiques dans des conditions extrêmes. Ces résultats indiquent que le modèle est robuste dans des scénarios normaux et modérément complexes, mais nécessite encore des améliorations dans des conditions extrêmes.

Déclarations de divulgation

Les auteurs n'ont aucune incompatibilité d'intérêts à déclarer.

Remerciements

Ce travail a été financé en partie par la Fondation de recherche scientifique de l'Université de Taizhou pour les talents avancés « Recherche sur les technologies clés de la détection de précision pour la fabrication intelligente » (TZXY2020QDJJ006).

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
API COCO   N/AOutil d'évaluation utilisé pour mesurer la précision de détection de la cible et effectuer des analyses statistiques.
CUDA 11.4NVIDIAN/APlateforme de calcul parallèle utilisée conjointement avec le cadre PyTorch 1.12.
Edge TPU   N/APlateforme de déploiement utilisée pour les tests de latence et de consommation d'énergie ; la latence signalée était de 18 ms et la consommation d'énergie de 15 W.
Dispositif de calcul en périphérie Jetson XavierNVIDIA   Dispositif de calcul en périphérie utilisé pour les tests de débit ; la vitesse de traitement signalée était de 70 images par seconde avec une latence au 99e centile inférieure à 50 ms.
GPU NVIDIA Tesla V100NVIDIA   GPU utilisé sur le serveur d'entraînement/évaluation.
PyTorch 1.12   N/ACadre d'apprentissage profond utilisé pour l'entraînement et l'évaluation du modèle.
scikit-learn    N/AOutil d'évaluation et d'analyse statistique utilisé pour l'évaluation du modèle.
Jeu de données personnel sur la sécurité en ligne de productionN/AN/AJeu de données composé de 12 000 images de scènes de lignes de production au format VOC, couvrant des conditions d'éclairage normales, faible éclairage, occlusion partielle, occlusion importante, flou de mouvement et arrière-plans complexes ; six catégories d'annotations : travailleurs, casques de sécurité, bras robotiques, zones dangereuses, outils et véhicules.
Serveur d'entraînement       Serveur équipé d'un GPU NVIDIA Tesla V100 et d'un système d'exploitation Ubuntu 20.04.
Système d'exploitation Ubuntu 20.04     N/ASystème d'exploitation utilisé sur le serveur d'entraînement/évaluation.
Format d'annotation VOCN/AN/AFormat d'annotation utilisé pour le jeu de données personnel sur la sécurité en ligne de production.
Modèle de détection d'objets YOLOv11UltralyticsN/AModèle de détection d'objets utilisé pour détecter en temps réel les travailleurs, les équipements et les dangers potentiels.

Références

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Réimpressions et autorisations

Étiquettes

Surveillance en temps r eld tection par apprentissage profondYOLOv11r seau neuronal convolutionnelfusion de caract ristiques multi chellesm canisme d attentionautomatisation industrielle