In de moderne industriële productie is veiligheid de hoeksteen voor het waarborgen van productie-efficiëntie en het welzijn van personeel. De productieomgeving omvat doorgaans snelle mechanische apparatuur, complexe technologische processen en samenwerkende operaties met meerdere taken. Elk klein potentieel veiligheidsrisico kan leiden tot ernstige productie-ongelukken, met aanzienlijke economische verliezen en zelfs dodelijke slachtoffers tot gevolg. Daarom is het van cruciaal belang een efficiënt, intelligent en real-time veiligheidstoezichtsysteem op te zetten om de veiligheid in de industriële productie te verbeteren1,2.
Traditionele methoden voor veiligheidsbewaking zijn voornamelijk gebaseerd op handmatige videobewaking en diverse sensoren (zoals infrarood-, rook- en trillingssensoren)3. Handmatige bewaking is niet alleen inefficiënt, maar ook gevoelig voor gemiste detecties door vermoeidheid van het bewakingspersoneel, en kan geen continue en uitgebreide dekking bieden. Hoewel sensoren een bepaalde functie voor vroegtijdige waarschuwing kunnen bieden, is hun detectiebereik beperkt en zijn ze gevoelig voor omgevingsinterferentie, wat leidt tot opvallende problemen met valse alarmen4. Intelligente bewakingssystemen zijn steeds meer een onderzoeksfocus geworden. Echtijdanalyse van een videostream met behulp van een deep learning-algoritme kan automatisch abnormale gebeurtenissen, onveilige gedragingen en potentiële gevaren identificeren, waardoor de intelligentie van het bewakingssysteem sterk verbetert4,5.
Objectdetectie is een kerntechnologie binnen intelligente monitoring. Als vertegenwoordigers van single-stage objectdetectoren tonen de You Only Look Once (YOLO)-reeksalgoritmen aanzienlijke voordelen. Van YOLOv1 tot YOLOv8 heeft deze verzameling algoritmen een voortdurende ontwikkeling doorgemaakt, met verbeteringen aan de netwerkarchitectuur, verliesfunctie en trainingsmethodologie, onder andere6,7. YOLOv11 heeft met name een hogere detectieprecisie bereikt terwijl een hoog beeldsnelheid gehandhaafd blijft, vooral bij complexe achtergronden en dicht opeengepakte doelen8.
Toch ondervindt YOLOv11, ondanks zijn uitstekende prestaties bij algemene objectdetectietaken, nog steeds uitdagingen in specifieke veiligheidsbewakingscenario's op productielijnen9. Bijvoorbeeld kan de detectie-accuratesse van YOLOv11 afnemen wanneer werknemers gedeeltelijk worden verhuld door apparatuur of wanneer veiligheidstekens klein zijn en sterk op de achtergrondkleur lijken. Dit vereist dat het model over sterkere mogelijkheden beschikt met betrekking tot functie-extractie en semantisch begrip10.
Convolutionele neurale netwerken (CNN's) beschikken over krachtige mogelijkheden bij het extraheren van beeldkenmerken11. Door diepere en complexere netwerkarchitecturen te ontwerpen, kunnen CNN's rijkere en meer abstracte beeldkenmerken leren. Het combineren van een CNN met YOLOv11 maakt gebruik van de snelle detectiemogelijkheden van YOLOv11 en de diepe kenmerkenextractie van het CNN, waardoor een robuustere en intelligente veiligheidsmonitoring opgebouwd wordt.
Op basis hiervan stelt dit artikel een veiligheidsbewakingssysteem voor productielijnen voor, dat gebruikmaakt van YOLOv11 en een CNN. De innovatieve aspecten van dit onderzoek zijn: (1) het voorstellen van een diepe fusie-architectuur van YOLOv11 en een verbeterde CNN; (2) het introduceren van fusie van kenmerken op meerdere schalen en een samengesteld aandachtsmechanisme om de herkenning van belangrijke veiligheidskenmerken te verbeteren; en (3) het verifiëren van de prestatievoordelen van het model op een zelf opgebouwde dataset van complexe scènes.
Ontwikkeling van YOLO-serie algoritmen
Sinds de eerste introductie door Redmon et al. in 201512 heeft het You Only Look Once (YOLO)-algoritme aanzienlijke belangstelling gewekt. In tegenstelling tot tweestadige detectoren die afhankelijk zijn van regiovoorstellingen, beschouwt YOLO objectdetectie als een regressietaak. Door rechtstreeks de klassen en posities van objecten in een afbeelding te voorspellen, verhoogt YOLO aanzienlijk de detectiesnelheid, waardoor het geschikt is voor gebruik in real-time13.
Als baanbrekend werk in deze serie bereikt YOLOv1 voor het eerst end-to-end doeldetectie14. YOLOv1 houdt in dat de ingangsafbeelding wordt opgedeeld in een roosterstructuur, waarbij elke roostercel, doorgaans georganiseerd in een S × S-indeling, verantwoordelijk is voor het detecteren van objecten die binnen zijn grenzen vallen.
Specifiek is de uitvoer van YOLOv1 een tensor. Van de S × S × (B × 5 + C) bevat de voorspelling van elke begrenzende rechthoek 5 elementen: coördinaat van het middelpunt (x,y), breedte w, hoogte h en betrouwbaarheid c. Het berekeningsproces is weergegeven in Vergelijking (1):
(1)
Daaronder stelt Pr(Object) de kans voor dat er zich een doelwit in het rooster bevindt, en IOU stelt de verhouding voor van de intersectie ten opzichte van de unie tussen de voorspelde begrenzende rechthoek en de werkelijke rechthoek. Elk rooster voorspelt ook een reeks klassenkansen, waarbij Pr de kans aangeeft dat het doelwit behoort tot de i-de klasse indien er een doelwit aanwezig is. De verliesfunctie van YOLOv1 bestaat uit drie hoofdcomponenten: het verlies voor coördinaatvoorspelling, het verlies voor betrouwbaarheidsschatting en het verlies voor categorievoorspelling15.
YOLOv2 introduceert Batch Normalisatie, een hoge-resolutie classificator en een multi-schaal trainingsstrategie, die de stabiliteit en nauwkeurigheid verbeteren16. YOLOv3 gebruikt Darknet-53 als basisnetwerk en put inspiratie uit het Feature Pyramid Network (FPN)-concept om doeldetectie te verbeteren17.
YOLOv4 heeft op basis van YOLOv3 talrijke optimalisaties doorgevoerd, waarbij technologieën zoals Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 en Mosaic-data-verbetering zijn geïntroduceerd om de prestaties van het model verder te verbeteren. YOLOv5 heeft belangrijke bijdragen geleverd aan de engineering, met een gebruiksvriendelijkere en efficiëntere implementatie20.
De afgelopen jaren is de YOLO-serie blijven evolueren, met versies zoals YOLOv6, YOLOv7 en YOLOv8 die achtereenvolgens zijn uitgebracht. Door de introductie van de Extended Efficient Layer Aggregation Network (E-ELAN)-structuur en model re-parameterisatie-technieken, bereikt YOLOv7 nieuwe doorbraken op het gebied van zowel snelheid als nauwkeurigheid. Deze verbeteringen verhogen niet alleen de efficiëntie van het leerproces van kenmerken, maar optimaliseren ook de inferentieprestaties van het netwerk, waardoor YOLOv7 betere resultaten levert dan eerdere versies en vele gangbare detectoren bij diverse real-time objectdetectietaken. YOLOv8 optimaliseert de netwerkstructuur verder, hanteert een ankerloze ontwerpmethode, vereenvoudigt het model en verbetert de generalisatiecapaciteit21.
Voortbouwend op de voordelen van eerdere versies, is YOLOv11, gebruikt in dit onderzoek, geoptimaliseerd voor complexe industriële scenario's. De kernverbeteringen omvatten een netwerk voor functie-extractie, een efficiëntere module voor functiefusie en een robuustere ontwerp van de verliesfunctie. Deze verbeteringen stellen YOLOv11 in staat beter te presteren bij het verwerken van verduisteringen, kleine doelen en complexe achtergronden in productieomgevingen. YOLOv11 is een versie uit de YOLO-serie die is uitgegeven door Ultralytics. In vergelijking met YOLOv8 verbetert het de C3K2-module en het pad voor functiefusie, en introduceert een adaptieve ankerboxstrategie, waardoor een sterkere detectierobuustheid in industriële scenario's wordt geboden.
Grondslag en vooruitgang van het convolutionele neurale netwerk (CNN)
Het convolutionele neurale netwerk (CNN) is een cruciaal model dat het succes van deep learning binnen computervisie diepgaand heeft beïnvloed. Het werkt door lokale beeldfuncties te extraheren via convolutionele operaties en vervolgens de dimensionaliteit van de functies te verlagen via poolingoperaties, waardoor een hiërarchische beeldabstractie wordt bereikt22.
Een typisch CNN bestaat uit meerdere convolutie-, pooling- en volledig verbonden lagen. De convolutielag scant het invoerbeeld met een convolutiekern, berekent inwendige producten over lokale gebieden en genereert een kenmerkkaart. Het berekingsproces wordt weergegeven in Vergelijking (2):
(2)
Waarbij x de invoerafbeelding is, wk en bk respectievelijk het gewicht en de bias van de convolutiekern zijn, en
de waarden zijn van de uitvoerende functiekaart op positie (i,j). De poolinglaag gebruikt meestal Max Pooling of Average Pooling. De volledig verbonden laag is verantwoordelijk voor het extraheren van kenmerken en het voorspellen van classificatiekansen.
Op basis hiervan ontwerpt dit artikel een CNN-featureverbeteringsmodule voor YOLOv11, die bestaat uit twee parallelle takken: een multischaalconvolutietak die 3 × 3- en 5 × 5-convolutiekernels gebruikt om multischaalkenmerken te extraheren; en een aandachtstak die achtereenvolgens de kanaalaandacht (Squeeze-and-Excitation) en ruimtelijke aandachtsmodules verbindt om de discriminerende kenmerken van belangrijke doelen te versterken. De uitgangen van de twee takken worden samengevoegd door middel van elementsgewijze optelling, en de overeenkomstige verliesfunctie voor featureverbetering staat weergegeven in formule (3):
(3)
Lcoord is het regressieverlies van de coördinaten van de omkaderende rechthoek; Lconf is het verlies van de doelbetrouwbaarheid; Lcls is het verlies van de categorieclassificatie; Lfeat is het verlies van de functieverbetering, gebruikt om de discriminerende kenmerken van kleine doelen en verhulde doelen die zijn geëxtraheerd door de CNN-verbeteringsmodule te beperken; λcoord, λconf, λcls, λfeat zijn de gewichtscoëfficiënten van de overeenkomstige verliescomponenten. Voor deze taak is λfeat = 0,05 ingesteld, en de resterende gewichten worden gebalanceerd op basis van de vereisten van de detectietaak.
Klassieke CNN-structuren, zoals VGGNet23 en ResNet24, hebben groot succes behaald bij beeldclassificatietaken. Van deze architecturen vermindert ResNet effectief het probleem van het verdwijnende gradiënt bij het trainen van diepe netwerken, waardoor de opbouw van diepere en complexere netwerkstructuren wordt vergemakkelijkt.
In objectdetectietaken wordt CNN meestal gebruikt als functie-extractor (backbone). Bijvoorbeeld, Darknet, cross-stage partial Darknet (CSPDarknet), enzovoort, in de YOLO-serie algoritmen zijn allemaal gebaseerd op CNN25. Om de functie-extractiecapaciteiten te verbeteren, hebben onderzoekers tal van verbeterde CNN-structuren voorgesteld. Bijvoorbeeld, het Inception-module extraheert kenmerken parallel via convolutiekernels van meerdere schalen. DenseNet verbetert het hergebruik van kenmerken met behulp van dichte verbindingen. Het Squeeze-and-Excitation-netwerk past adaptief het belang van kenmerkkanalen aan via aandachtsmechanismen26.
In dit onderzoek ontwierpen we een verbeterde CNN-module om de mogelijkheden van YOLOv11 voor functie-extractie te verbeteren. Deze module combineert fusie van multischaalfuncties met een aandachtsmechanisme om op efficiëntere wijze cruciale veiligheidsinformatie in productielijnsituaties te detecteren.
Toepassingsstatus van deep learning in industriële veiligheidsmonitoring
Deep learning heeft aanzienlijke voet aan de grond gekregen in de industriële veiligheidsmonitoring. Op CNN-gebaseerde algoritmen worden ingezet om te bepalen of werknemers veiligheidshelmen op de juiste manier dragen, ongeoorloofde doordringing van gevaarlijke zones detecteren en de toestand van defecte apparatuur monitoren27.
Op het gebied van gedragsherkenning worden 3D-CNN's en recurrente neurale netwerken gebruikt om het operationele gedrag van werknemers te analyseren en potentieel onveilige handelingen te identificeren. Door bijvoorbeeld de houdingsequenties van werknemers te analyseren, kan worden vastgesteld of zij veiligheidsprocedures overtreden28.
YOLO en Faster R-CNN worden veel gebruikt voor detectie van personeel en apparatuur in realtime bewakingsvideo's. Zo is in de literatuur een systeem voorgesteld voor realtime detectie van helmen op basis van YOLOv5, wat de intelligentie van veiligheidsbeheer op bouwplaatsen doeltreffend verbetert29.
Hoewel er enige vooruitgang is geboekt in bestaand onderzoek, blijven verschillende uitdagingen bestaan. Ten eerste bevatten industriële omgevingen doorgaans complexe verlichting, verduistering en achtergrondinterferentie, wat strenge eisen stelt aan de robuustheid van het algoritme. Ten tweede is realtimeprestatie een belangrijke vereiste, en het algoritme moet hoge snelheid in de inferentie behalen terwijl de nauwkeurigheid behouden blijft. Tot slot richt bestaand onderzoek zich voornamelijk op detectie van een enkele taak en ontbeert het onderzoek naar fusie van multisource-informatie en uitgebreide analyse30.
In dit onderzoek beoogt het voorgestelde YOLOv11- en CNN-fusiemodel de hierboven genoemde uitdagingen aan te pakken en een uitgebreide, realtime bewaking van veiligheidsrisico’s op de productielijn te realiseren door de mogelijkheden op het gebied van functie-extractie en -fusie te verbeteren.