In der modernen industriellen Produktion ist Sicherheit die Grundlage, um die Produktionseffizienz und das Wohlergehen des Personals sicherzustellen. Die Produktionsumgebung umfasst typischerweise hochgeschwindigkeitsmechanische Ausrüstung, komplexe technologische Prozesse und kollaborative Operationen mit mehreren Aufgaben. Jede kleine potenzielle Sicherheitsgefahr kann zu schwerwiegenden Produktionsunfällen führen, die erhebliche wirtschaftliche Verluste und sogar Todesfälle verursachen. Daher ist es entscheidend, ein effizientes, intelligentes und echtzeitfähiges Überwachungssystem für die Sicherheit einzurichten, um die Sicherheit in der industriellen Produktion zu erhöhen1,2.
Herkömmliche Methoden zur Sicherheitsüberwachung stützen sich hauptsächlich auf manuelle Videoüberwachung und verschiedene Sensoren (wie Infrarot-, Rauch- und Vibrationssensoren)3. Die manuelle Überwachung ist nicht nur ineffizient, sondern auch anfällig für nicht erkannte Vorfälle aufgrund von Ermüdung des Überwachungspersonals und kann keine durchgängige sowie umfassende Abdeckung gewährleisten. Obwohl Sensoren eine gewisse Frühwarnfunktion bieten können, ist ihr Erfassungsbereich begrenzt, und sie reagieren empfindlich auf Umwelteinflüsse, was zu ausgeprägten Problemen mit Fehlalarmen führt4. Intelligente Überwachungssysteme rücken zunehmend in den Fokus der Forschung. Die Echtzeitanalyse eines Videostreams mithilfe eines Deep-Learning-Algorithmus kann automatisch abnormale Ereignisse, unsicheres Verhalten und potenzielle Gefahren erkennen und dadurch die Intelligenz des Überwachungssystems erheblich verbessern4,5.
Die Objekterkennung ist eine Kerntechnologie in der intelligenten Überwachung. Als Vertreter von einstufigen Objekterkennern weisen die Algorithmen der You Only Look Once (YOLO)-Serie erhebliche Vorteile auf. Von YOLOv1 bis YOLOv8 hat sich diese Algorithmenfamilie kontinuierlich weiterentwickelt, wobei Verbesserungen an der Netzwerkarchitektur, der Verlustfunktion und der Trainingsmethodik sowie weiteren Aspekten vorgenommen wurden6,7. YOLOv11 hat insbesondere eine höhere Erkennungsgenauigkeit erreicht, während gleichzeitig eine hohe Bildrate beibehalten wird, besonders bei komplexen Hintergründen und dicht gepackten Objekten8.
Trotz seiner hervorragenden Leistung bei allgemeinen Objekterkennungsaufgaben sieht sich YOLOv11 jedoch in bestimmten Szenarien der Sicherheitsüberwachung an Produktionslinien weiterhin vor Herausforderungen9. Beispielsweise kann die Erkennungsgenauigkeit von YOLOv11 abnehmen, wenn Arbeiter teilweise durch Ausrüstung verdeckt sind oder wenn Sicherheitszeichen klein sind und stark der Hintergrundfarbe ähneln. Dies erfordert stärkere Fähigkeiten des Modells in der Merkmalsextraktion und semantischen Verständnis10.
Faltungsneuronale Netze (CNNs) verfügen über leistungsstarke Fähigkeiten bei der Extraktion von Bildmerkmalen11. Durch die Entwicklung tieferer und komplexerer Netzwerkarchitekturen können CNNs umfassendere und abstraktere Bildmerkmale lernen. Die Kombination eines CNNs mit YOLOv11 nutzt die schnellen Erkennungsfähigkeiten von YOLOv11 und die tiefe Merkmalsextraktion des CNNs, wodurch ein robusteres und intelligenteres Sicherheitsüberwachungssystem entsteht.
Basierend darauf schlägt dieses Papier ein Produktionslinien-Sicherheitsüberwachungssystem unter Verwendung von YOLOv11 und einem CNN vor. Die innovativen Aspekte dieser Studie umfassen: (1) die Vorschlag einer tiefen Fusionsarchitektur aus YOLOv11 und einem verbesserten CNN; (2) die Einführung einer mehrskaligen Merkmalsfusion und eines zusammengesetzten Aufmerksamkeitsmechanismus zur Verbesserung der Erkennung wesentlicher Sicherheitsmerkmale; und (3) die Überprüfung der Leistungsvorteile des Modells an einem selbst erstellten Datensatz komplexer Szenen.
Entwicklung der YOLO-Reihe-Algorithmen
Seit ihrer ersten Vorstellung durch Redmon et al. im Jahr 201512 hat der Algorithmus „You Only Look Once“ (YOLO) großes Interesse geweckt. Im Gegensatz zu Zweistufen-Detektoren, die auf Regionsvorschlägen basieren, behandelt YOLO die Objekterkennung als Regressionsaufgabe. Durch die direkte Vorhersage der Klassen und Positionen von Objekten in einem Bild erhöht YOLO die Erkennungsgeschwindigkeit deutlich und eignet sich somit für den Echtzeiteinsatz13.
Als bahnbrechende Arbeit in dieser Serie ermöglicht YOLOv1 erstmals eine End-to-End-Zieldetektion14. Bei YOLOv1 wird das Eingabebild in eine Gitterstruktur unterteilt, wobei jede Gitterzelle, typischerweise in einem S × S-Format angeordnet, dafür verantwortlich ist, Objekte innerhalb ihrer Grenzen zu erkennen.
Speziell ist die Ausgabe von YOLOv1 ein Tensor. Unter den S × S × (B × 5 + C) enthält die Vorhersage jeder Begrenzungsbox fünf Elemente: Koordinate des Mittelpunkts (x,y), Breite w, Höhe h und Konfidenz c. Der Berechnungsprozess ist in Gleichung (1) dargestellt:
(1)
Dabei steht Pr(Object) für die Wahrscheinlichkeit, dass sich ein Ziel in der Zelle befindet, und IOU steht für das Verhältnis aus Schnittmenge zu Vereinigungsmenge zwischen der vorhergesagten Begrenzungsbox und der tatsächlichen Box. Jede Zelle prognostiziert außerdem eine Reihe von Klassenwahrscheinlichkeiten, wobei Pr die Wahrscheinlichkeit dafür angibt, dass das Ziel der i-ten Klasse angehört, sofern ein Ziel vorhanden ist. Die Verlustfunktion von YOLOv1 setzt sich aus drei Hauptkomponenten zusammen: dem Verlust für die Koordinatenvorhersage, dem Verlust für die Konfidenzschätzung und dem Verlust für die Kategorievorhersage15.
YOLOv2 führt die Batch-Normalisierung, einen Hochauflösungsklassifikator und eine mehrskalige Trainingsstrategie ein, die Stabilität und Genauigkeit verbessern16. YOLOv3 verwendet Darknet-53 als Backbonenetzwerk und greift auf das Konzept des Feature Pyramid Network (FPN) zurück, um die Objekterkennung zu verbessern17.
YOLOv4 hat im Vergleich zu YOLOv3 zahlreiche Optimierungen vorgenommen und Technologien wie das Cross Stage Partial Network (CSPNet)18, das Path Aggregation Network (PANet)19 und die Mosaic-Datenaugmentierung eingeführt, um die Leistung des Modells weiter zu verbessern. YOLOv5 hat bedeutende Beiträge im Bereich Engineering geleistet und bietet eine benutzerfreundlichere und effizientere Implementierung20.
In den letzten Jahren hat sich die YOLO-Serie kontinuierlich weiterentwickelt, wobei nacheinander Versionen wie YOLOv6, YOLOv7 und YOLOv8 veröffentlicht wurden. Durch die Einführung der erweiterten effizienten Layer-Aggregationsnetzwerkstruktur (E-ELAN) und von Modell-Re-Parametrisierungstechniken erzielt YOLOv7 neue Durchbrüche hinsichtlich Geschwindigkeit und Genauigkeit. Diese Verbesserungen steigern nicht nur die Effizienz des Merkmalslernens, sondern optimieren auch die Inferenzleistung des Netzwerks, wodurch YOLOv7 frühere Versionen sowie zahlreiche gängige Detektoren bei verschiedenen Echtzeit-Objekterkennungsaufgaben übertrifft. YOLOv8 optimiert die Netzwerkstruktur weiter, verwendet ein ankerfreies Design, vereinfacht das Modell und verbessert dessen Verallgemeinerungsfähigkeit21.
Aufbauend auf den Vorteilen früherer Versionen wurde YOLOv11, das in dieser Studie verwendet wurde, für komplexe industrielle Szenarien optimiert. Zu seinen zentralen Verbesserungen gehören ein Netzwerk zur Merkmalsextraktion, ein effizienteres Modul zur Merkmalsfusion und ein robusteres Design der Verlustfunktion. Diese Verbesserungen ermöglichen es YOLOv11, bei der Verarbeitung von Verdeckungen, kleinen Objekten und komplexen Hintergründen in Produktionsumgebungen bessere Leistungen zu erbringen. YOLOv11 ist eine Version der YOLO-Serie, die von Ultralytics veröffentlicht wurde. Im Vergleich zu YOLOv8 verbessert es das C3K2-Modul und den Pfad der Merkmalsfusion und führt eine adaptive Ankerbox-Strategie ein, wodurch eine stärkere Detektionsrobustheit in industriellen Szenarien erreicht wird.
Grundlagen und Fortschritte des Faltungs-Neuronalen Netzwerks (CNN)
Das faltungsneuronale Netzwerk (CNN) ist ein zentrales Modell, das den Erfolg des Deep Learnings in der Computer Vision maßgeblich beeinflusst hat. Es funktioniert, indem es lokale Bildmerkmale durch Faltungsoperationen extrahiert und anschließend die Dimensionalität der Merkmale durch Pooling-Operationen reduziert, wodurch eine hierarchische Bildabstraktion erreicht wird22.
Ein typisches FNN besteht aus mehreren Faltungsschichten, Pooling-Schichten und vollständig verknüpften Schichten. Die Faltungsschicht durchsucht das Eingabebild mit einem Faltungskern, berechnet Skalarprodukte über lokale Bereiche und erzeugt eine Merkmalskarte. Der Berechnungsprozess ist in Gleichung (2) dargestellt:
(2)
Dabei ist x das Eingabebild, wk und bk sind die Gewichtung und der Bias des Faltungskerns, bzw., und
sind die Werte der Ausgabe-Feature-Karte an der Position (i,j). Die Pooling-Schicht verwendet üblicherweise Max-Pooling oder Average-Pooling. Die vollverknüpfte Schicht ist dafür zuständig, Merkmale zu extrahieren und Klassifizierungswahrscheinlichkeiten vorherzusagen.
Basierend darauf entwirft diese Arbeit ein CNN-Feature-Verbesserungsmodul für YOLOv11, das aus zwei parallelen Zweigen besteht: einem Multiskalen-Faltungszweig, der 3 × 3- und 5 × 5-Faltungskerne verwendet, um Merkmale auf mehreren Skalen zu extrahieren, und einem Aufmerksamkeitszweig, der nacheinander das Kanal-Aufmerksamkeitsmodul (Squeeze-and-Excitation) und das räumliche Aufmerksamkeitsmodul verbindet, um die diskriminativen Merkmale der Schlüsselziele zu verstärken. Die Ausgaben der beiden Zweige werden durch elementweise Addition fusioniert, und die entsprechende Verlustfunktion für die Feature-Verbesserung ist in Formel (3) dargestellt:
(3)
Lcoord ist der Verlust durch die Regressionsabweichung der Begrenzungsbox-Koordinaten; Lconf ist der Verlust durch die Zielzuversicht (Konfidenz); Lcls ist der Verlust durch die Kategorieklassifizierung; Lfeat ist der Verlust durch die Merkmalsverbesserung, der dazu dient, die diskriminativen Merkmale kleiner und verdeckter Ziele einzuschränken, die vom CNN-Verbesserungsmodul extrahiert werden; λcoord, λconf, λcls, λfeat sind die Gewichtungskoeffizienten der entsprechenden Verlustterme. Für diese Aufgabe wird λfeat = 0,05 festgelegt, und die übrigen Gewichte werden gemäß den Anforderungen der Erkennungsaufgabe ausgeglichen.
Klassische CNN-Architekturen wie VGGNet23 und ResNet24 haben bei Bildklassifizierungsaufgaben große Erfolge erzielt. Unter diesen Architekturen mildert ResNet das Problem des verschwindenden Gradienten beim Training tiefer Netzwerke wirksam ab, wodurch der Aufbau tieferer und komplexerer Netzwerkstrukturen erleichtert wird.
Bei Objekterkennungsaufgaben wird CNN gewöhnlich als Merkmalsextraktor (Backbone) verwendet. Beispielsweise basieren Darknet, cross-stage partial Darknet (CSPDarknet) und andere in der YOLO-Reihe von Algorithmen auf CNN25. Um die Fähigkeiten zur Merkmalsextraktion zu verbessern, haben Forscher zahlreiche verbesserte CNN-Strukturen vorgeschlagen. Beispielsweise extrahiert das Inception-Modul Merkmale parallel durch Faltungskerne verschiedener Skalen. DenseNet verbessert die Wiederverwendung von Merkmalen durch dichte Verbindungen. Das Squeeze-and-Excitation-Netzwerk passt die Wichtigkeit von Merkmalskanälen durch Aufmerksamkeitsmechanismen adaptiv an26.
In dieser Studie haben wir ein verbessertes CNN-Modul entwickelt, um die Fähigkeiten zur Merkmalsextraktion von YOLOv11 zu verbessern. Dieses Modul kombiniert die Fusion mehrskaliger Merkmale mit einem Aufmerksamkeitsmechanismus, um Schlüsselsicherheitsinformationen in Produktionsumgebungen effektiver zu erfassen.
Anwendungsstand des maschinellen Lernens im industriellen Sicherheitsmonitoring
Das maschinelle Lernen hat im Bereich des industriellen Sicherheitsmonitorings erhebliche Bedeutung erlangt. Auf CNN-basierten Algorithmen basierende Verfahren werden eingesetzt, um zu überprüfen, ob Arbeiter Sicherheitshelme ordnungsgemäß tragen, um unbefugte Eindringlinge in Gefahrenzonen zu erkennen und um den Zustand fehlerhafter Geräte zu überwachen27.
Bei der Verhaltenserkennung werden 3D-CNNs und rekurrente neuronale Netze eingesetzt, um das Betriebsverhalten von Arbeitnehmern zu analysieren und potenziell unsichere Handlungen zu identifizieren. Beispielsweise kann durch die Analyse von Körperhaltungsabfolgen der Arbeitnehmer ermittelt werden, ob sie gegen Sicherheitsvorschriften verstoßen28.
YOLO und Faster R-CNN werden häufig für die Erkennung von Personal und Ausrüstung in Echtzeit-Überwachungsvideos verwendet. Beispielsweise wurde in der Literatur ein Echtzeit-Helmerkennungssystem auf Basis von YOLOv5 vorgeschlagen, das die Intelligenz des Sicherheitsmanagements auf Baustellen effektiv verbessert29.
Obwohl in der bestehenden Forschung einige Fortschritte erzielt wurden, bleiben mehrere Herausforderungen bestehen. Erstens weisen industrielle Szenen typischerweise komplexe Beleuchtung, Verdeckungen und Hintergrundstörungen auf, was strenge Anforderungen an die Robustheit des Algorithmus stellt. Zweitens ist Echtzeitleistung eine zentrale Voraussetzung, und der Algorithmus muss eine Hochgeschwindigkeits-Inferenz erreichen, während er gleichzeitig die Genauigkeit beibehält. Schließlich konzentriert sich die bestehende Forschung hauptsächlich auf die Einzelaufgaben-Erkennung und untersucht kaum die Fusion von Mehrquelleninformationen und umfassende Analysen30.
In dieser Studie zielt das vorgeschlagene YOLOv11- und CNN-Fusionsmodell darauf ab, die oben genannten Herausforderungen zu bewältigen und durch verbesserte Fähigkeiten zur Merkmalsextraktion und -fusion eine umfassende, echtzeitfähige Überwachung von Sicherheitsrisiken in der Produktionslinie zu erreichen.