W nowoczesnej produkcji przemysłowej bezpieczeństwo jest fundamentem zapewnienia wydajności produkcji oraz dobrostanu personelu. Środowisko linii produkcyjnej zazwyczaj obejmuje szybkie urządzenia mechaniczne, złożone procesy technologiczne oraz operacje kooperacyjne angażujące wiele zadań. Każde niewielkie potencjalne zagrożenie bezpieczeństwa może doprowadzić do poważnych wypadków produkcyjnych, skutkujących znacznymi stratami ekonomicznymi, a nawetThough ofiatarami. Dlatego kluczowe jest ustanowienie wydajnego, inteligentnego i działającego w czasie rzeczywistym systemu monitorowania bezpieczeństwa, aby zwiększyć poziom bezpieczeństwa w produkcji przemysłowej1,2.
Tradycyjne metody monitorowania bezpieczeństwa opierają się głównie na ręcznym nadzorze wideo oraz różnych czujnikach (takich jak czujniki podczerwieni, dymu i wibracji)3. Monitorowanie ręczne jest nie tylko nieefektywne, ale również podatne na pominięcia w detekcji z powodu zmęczenia personelu nadzorującego i nie zapewnia ciągłego oraz kompleksowego pokrycia obszarem. Choć czujniki mogą pełnić określoną funkcję wczesnego ostrzegania, ich zasięg detekcji jest ograniczony i są one wrażliwe na zakłócenia środowiskowe, co prowadzi do istotnych problemów z fałszywymi alarmami4. Inteligentne systemy monitorowania stają się coraz ważniejszym obszarem badań. Analiza strumienia wideo w czasie rzeczywistym z wykorzystaniem algorytmu głębokiego uczenia pozwala na automatyczną identyfikację nieprawidłowych zdarzeń, niebezpiecznych zachowań i potencjalnych zagrożeń, co znacznie zwiększa inteligentność systemu monitorowania4,5.
Detekcja obiektów jest kluczową technologią w inteligentnym monitoringu. Algorytmy z serii You Only Look Once (YOLO), będące reprezentantami jednowarstwowych detektorów obiektów, wykazują znaczące zalety. Od YOLOv1 do YOLOv8 zbiór tych algorytmów podlegał ciągłemu rozwojowi, obejmującemu między innymi ulepszenia w architekturze sieci, funkcji straty oraz metodologii treningu6,7. W szczególności YOLOv11 osiągnął wyższą dokładność detekcji przy zachowaniu wysokiej liczby klatek na sekundę, zwłaszcza w przypadku złożonego tła i gęsto rozmieszczonych celów8.
Jednakże, pomimo doskonałych wyników w ogólnych zadaniach detekcji obiektów, YOLOv11 wciąż napotyka trudności w specyficznych scenariuszach monitorowania bezpieczeństwa na liniach produkcyjnych9. Na przykład dokładność detekcji YOLOv11 może spaść, gdy pracownicy są częściowo zasłonięci przez urządzenia lub gdy znaki bezpieczeństwa są małe i ściśle przypominają kolor tła. Wymaga to od modelu silniejszych możliwości ekstrakcji cech oraz zrozumienia semantycznego10.
Splotowe sieci neuronowe (CNN) posiadają potężne możliwości w zakresie ekstrakcji cech obrazu11. Dzięki projektowaniu głębszych i bardziej złożonych architektur sieci, CNN mogą uczyć się bogatszych i bardziej abstrakcyjnych cech obrazu. Połączenie CNN z YOLOv11 pozwala wykorzystać szybkie możliwości detekcji YOLOv11 oraz głęboką ekstrakcję cech CNN, co umożliwia budowę bardziej wytrzymałego i inteligentnego systemu monitorowania bezpieczeństwa.
W związku z powyższym, niniejsza praca proponuje system monitorowania bezpieczeństwa linii produkcyjnej z wykorzystaniem YOLOv11 oraz sieci CNN. Innowacyjne aspekty niniejszego badania obejmują: (1) zaproponowanie architektury głębokiej fuzji YOLOv11 i ulepszonej sieci CNN; (2) wprowadzenie wieloskalowej fuzji cech oraz złożonego mechanizmu uwagi w celu usprawnienia rozpoznawania kluczowych cech bezpieczeństwa; oraz (3) weryfikację przewagi wydajności modelu na bazie własnego zbioru danych z kompleksowych scen.
Rozwój algorytmów z serii YOLO
Od momentu ich pierwszego wprowadzenia przez Redmona i współpracowników w 2015 roku12, algorytm You Only Look Once (YOLO) wzbudził znaczne zainteresowanie. W przeciwieństwie do detektorów dwuetapowych, które opierają się na propozycjach regionów, YOLO traktuje detekcję obiektów jako zadanie regresji. Poprzez bezpośrednie przewidywanie klas i pozycji obiektów na obrazie, YOLO znacząco zwiększa prędkość detekcji, co czyni go odpowiednim do zastosowań w czasie rzeczywistym13.
Jako pionierska praca w tej serii, YOLOv1 po raz pierwszy umożliwia detekcję obiektów w systemie end-to-end14. YOLOv1 polega na podziale obrazu wejściowego na strukturę siatki, w której każda komórka siatki, zazwyczaj ułożona w formacie S × S, odpowiada za wykrywanie obiektów znajdujących się w jej granicach.
Konkretnie, wynikiem YOLOv1 jest tensor. W ramach S × S × (B × 5 + C), predykcja każdego pola ograniczającego (bounding box) zawiera 5 elementów: współrzędne punktu centralnego (x,y), szerokość w, wysokość h oraz pewność c. Proces obliczeniowy zilustrowano w równaniu (1):
(1)
Wśród nich, Pr(Object) reprezentuje prawdopodobieństwo występowania celu w siatce, a IOU oznacza stosunek części wspólnej do sumy obszarów (intersection over union) między przewidzianym prostokątem ograniczającym a prostokątem rzeczywistym (ground-truth). Każda komórka siatki przewiduje również zestaw prawdopodobieństw klas, Pr reprezentujących prawdopodobieństwo, że cel należy do i-tej klasy w przypadku obecności celu. Funkcja straty YOLOv1 składa się z trzech głównych komponentów: straty dla predykcji współrzędnych, straty dla szacowania pewności oraz straty dla predykcji kategorii15.
YOLOv2 wprowadza normalizację wsadową (Batch Normalization), klasyfikator o wysokiej rozdzielczości oraz strategię trenowania wieloskalowego, co poprawia stabilność i dokładność16. YOLOv3 wykorzystuje sieć Darknet-53 jako sieć szkieletową (backbone) i czerpie inspirację z koncepcji sieci piramidalnej cech (Feature Pyramid Network, FPN), aby usprawnić detekcję obiektów17.
YOLOv4 wprowadził liczne optymalizacje w stosunku do YOLOv3, implementując takie technologie jak Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 oraz wzbogacanie danych metodą Mosaic, aby dodatkowo poprawić wydajność modelu. YOLOv5 wniósł istotny wkład w obszarze inżynieryjnym, oferując łatwiejszą w obsłudze i bardziej efektywną implementację20.
W ostatnich latach seria YOLO stale ewoluuje, a kolejne wersje, takie jak YOLOv6, YOLOv7 i YOLOv8, są wydawane jedna po drugiej. Dzięki wprowadzeniu struktury Extended Efficient Layer Aggregation Network (E-ELAN) oraz technik reparametryzacji modelu, YOLOv7 osiąga nowe przełomy zarówno w zakresie szybkości, jak i dokładności. Udoskonalenia te nie tylko poprawiają efektywność uczenia cech, ale także optymalizują wydajność wnioskowania sieci, co pozwala YOLOv7 przewyższyć poprzednie wersje oraz wiele głównych detektorów w różnych zadaniach detekcji obiektów w czasie rzeczywistym. YOLOv8 dodatkowo optymalizuje strukturę sieci, przyjmuje konstrukcję anchor-free, upraszcza model i poprawia jego zdolność do generalizacji21.
Opierając się na zaletach poprzednich wersji, YOLOv11, wykorzystane w niniejszym badaniu, zostało zoptymalizowane pod kątem złożonych scenariuszy przemysłowych. Główne ulepszenia obejmują sieć ekstrakcji cech, bardziej wydajny moduł fuzji cech oraz bardziej odporną konstrukcję funkcji straty. Udoskonalenia te pozwalają YOLOv11 na lepsze radzenie sobie z przesłonami, małymi celami i złożonym tłem w środowiskach produkcyjnych. YOLOv11 to wersja z serii YOLO wydana przez Ultralytics. W porównaniu z YOLOv8 udoskonalono moduł C3K2 oraz ścieżkę fuzji cech, a także wprowadzono strategię adaptacyjnych ramek zakotwiczenia (anchor boxes), co zapewnia większą odporność detekcji w scenariuszach przemysłowych.
Podstawy i rozwój splotowych sieci neuronowych (CNN)
Splotowa sieć neuronowa (CNN) to kluczowy model, który w znacznym stopniu wpłynął na sukces głębokiego uczenia w dziedzinie komputerowego rozpoznawania obrazów. Działa ona poprzez wyodrębnianie lokalnych cech obrazu za pomocą operacji splotu, a następnie redukcję wymiarowości cech poprzez operacje poolingu, osiągając w ten sposób hierarchiczną abstrakcję obrazu22.
Typowa sieć CNN składa się z wielu warstw splotowych, warstw poolingowych oraz warstw w pełni połączonych. Warstwa splotowa skanuje obraz wejściowy za pomocą jądra splotu, oblicza iloczyny skalarne w obszarach lokalnych i generuje mapę cech. Proces obliczeniowy przedstawiono w równaniu (2):
(2)
Gdzie x to obraz wejściowy, wk i bk to odpowiednio waga i obciążenie (bias) jądra splotu, a
to wartości wyjściowej mapy cech w pozycji (i,j). W warstwie poolingu zazwyczaj stosuje się Max Pooling lub Average Pooling. Warstwa w pełni połączona odpowiada za ekstrakcję cech i przewidywanie prawdopodobieństw klasyfikacji.
Na tej podstawie w niniejszej pracy zaprojektowano moduł wzmacniania cech CNN dla modelu YOLOv11, który składa się z dwóch równoległych gałęzi: gałęzi konwolucji wieloskalowej, wykorzystującej jądra splotu 3 × 3 oraz 5 × 5 do ekstrakcji cech w różnych skalach, oraz gałęzi uwagi, która sekwencyjnie łączy moduły uwagi kanałowej (Squeeze-and-Excitation) i uwagi przestrzennej w celu wzmocnienia cech dyskryminacyjnych kluczowych obiektów. Wyniki obu gałęzi są łączone poprzez dodawanie elementowe, a odpowiadająca im funkcja straty wzmocnienia cech przedstawiona jest w formule (3):
(3)
Lwspółrzędne jest to strata regresji współrzędnych ramki ograniczającej; Lkonfiguracja celową stratą pewności; Lcls jest to strata klasyfikacji kategorii; Lcecha jest to strata wzmocnienia cech, stosowana w celu ograniczenia cech dyskryminacyjnych małych i przysłoniętych celów wyekstrahowanych przez moduł wzmocnienia CNN; λwspółrzędne, λkonfiguracja, λwyczyść ekran, λcecha są współczynnikami wagowymi odpowiadających im składników funkcji straty. Dla tego zadania λcecha ustawiono wartość 0,05, a pozostałe wagi zrównoważono zgodnie z wymaganiami zadania detekcji.
Klasyczne struktury CNN, takie jak VGGNet23 i ResNet24, odniosły wielki sukces w zadaniach klasyfikacji obrazów. Wśród tych architektur ResNet skutecznie łagodzi problem zanikającego gradientu podczas trenowania głębokich sieci, co ułatwia konstruowanie głębszych i bardziej złożonych struktur sieciowych.
W zadaniach detekcji obiektów sieci CNN są zazwyczaj wykorzystywane jako ekstraktory cech (backbone). Na przykład Darknet, cross-stage partial Darknet (CSPDarknet) i inne w serii algorytmów YOLO są oparte na sieciach CNN25. Aby zwiększyć możliwości ekstrakcji cech, badacze zaproponowali liczne ulepszone struktury CNN. Przykładowo, moduł Inception ekstrahuje cechy równolegle za pomocą wieloskalowych jąder splotowych. DenseNet zwiększa ponowne wykorzystanie cech dzięki gęstym połączeniom. Sieć Squeeze-and-Excitation adaptacyjnie dostosowuje istotność kanałów cech za pomocą mechanizmów uwagi26.
W niniejszym badaniu zaprojektowano ulepszony moduł CNN w celu zwiększenia możliwości ekstrakcji cech modelu YOLOv11. Moduł ten łączy wieloskalową fuzję cech z mechanizmem uwagi, aby skuteczniej wychwytywać kluczowe informacje dotyczące bezpieczeństwa w scenariuszach linii produkcyjnych.
Zastosowanie głębokiego uczenia w monitorowaniu bezpieczeństwa przemysłowego
Głębokie uczenie zyskało znaczną popularność w monitorowaniu bezpieczeństwa przemysłowego. Algorytmy oparte na sieciach CNN są wykorzystywane do określania, czy pracownicy prawidłowo noszą kaski ochronne, wykrywania nieautoryzowanych wtargnięć do stref niebezpiecznych oraz monitorowania stanu urządzeń ulegających awarii27.
W zakresie rozpoznawania zachowań stosuje się trójwymiarowe konwolucyjne sieci neuronowe (3D CNN) oraz rekurencyjne sieci neuronowe do analizy zachowań operacyjnych pracowników i identyfikacji potencjalnie niebezpiecznych działań. Na przykład poprzez analizę sekwencji postaw pracowników można ustalić, czy naruszają oni procedury bezpiecznej eksploatacji28.
YOLO i Faster R-CNN są szeroko stosowane do wykrywania personelu i sprzętu w materiałach wideo z nadzoru w czasie rzeczywistym. Na przykład w literaturze zaproponowano system wykrywania kasków w czasie rzeczywistym oparty na YOLOv5, który skutecznie zwiększa poziom inteligentnego zarządzania bezpieczeństwem na placach budowy29.
Mimo postępów poczynionych w dotychczasowych badaniach, nadal pozostaje kilka wyzwań. Po pierwsze, sceny przemysłowe zazwyczaj charakteryzują się złożonym oświetleniem, przesłonięciami oraz zakłóceniami tła, co stawia rygorystyczne wymagania w zakresie odporności algorytmu. Po drugie, kluczowym wymogiem jest wydajność w czasie rzeczywistym, a algorytm musi zapewniać szybką inferencję przy jednoczesnym zachowaniu dokładności. Wreszcie, istniejące badania koncentrują się głównie na detekcji jednozadaniowej i brakuje w nich eksploracji fuzji informacji z wielu źródeł oraz analizy kompleksowej30.
W niniejszym badaniu zaproponowany model fuzji YOLOv11 i CNN ma na celu rozwiązanie powyższych problemów oraz zapewnienie kompleksowego monitorowania ryzyk związanych z bezpieczeństwem linii produkcyjnej w czasie rzeczywistym poprzez usprawnienie możliwości ekstrakcji i fuzji cech.