Artykuł badawczy

Model detekcji obiektów w czasie rzeczywistym dla identyfikacji marki papierosów oparty na ulepszonej architekturze regresji jednostopniowej

DOI:

10.3791/69657

9 stycznia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby sprostać wyzwaniom takim jak zasłony i zmiany oświetlenia w zautomatyzowanych magazynach, niniejszy artykuł wprowadza ulepszoną architekturę regresji jednostopniowej do wykrywania marek pudełek po papierosach. Integrując adaptacyjne próbkowanie w czasie, odwrócony, efektywny, wieloskalowy mechanizm uwagi, oraz dynamiczną głowicę detekcyjną, proponowany model zapewnia dokładne, inteligentne inwentaryzowanie w czasie rzeczywistym.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rozpoznawanie wizualne dla automatycznego magazynu papierosów napotyka poważne przeszkody, w tym zmiany oświetlenia, różnorodne wymiary pudełek oraz częściowe zasłonięcie funkcji, co utrudnia weryfikację marki i wykrywanie błędnego opakowania. W artykule ten proponuje ulepszony model detekcji w czasie rzeczywistym, który poradzi sobie z problemami rozpoznawania obrazów i poprawi dokładność. Po pierwsze, wdrażany jest moduł adaptacyjnego downsamplowania, który zastępuje moduł downsampling konwolucyjny zarówno w sieciach szkieletowej, jak i gryfowej serii YOLO jako detektor bazowy lub oryginalny, co skutecznie zachowuje więcej szczegółów cech i realizuje lekkość modelu. Po drugie, wprowadzony jest odwrócony, wydajny, wieloskalowy moduł uwagi, który rejestruje informacje kontekstowe przestrzenne różnych skal i generuje dokładniejszą mapę uwagi przestrzennej, co poprawia dokładność predykcji modelu bazowego dla złożonych cech i celów okluzji. Wreszcie, moduł dynamicznej głowicy detekcyjnej zastępuje oryginalną głowicę detekcyjną modelu bazowego i wykonuje wieloskalowe wykrywanie obiektów na mapie cech wyodrębnionej z sieci szkieletowej i szyjnej, aby osiągnąć dokładne pozycjonowanie i podział kategorii przewidywanego celu. Aby ocenić wydajność ulepszonego modelu w terenie, sporządziliśmy wizualny zbiór danych marki pudełka papierosowego. Zbiór danych został rozszerzony za pomocą specyficznych dla regionu technik kopiowania-wklejania oraz tradycyjnych technik augmentacji, a uzyskany zbiór danych zawiera złożone tło, zasłonę i nakładanie się, małe cele oraz inne czynniki. Eksperyment pokazuje, że ulepszony model przedstawiony w tym artykule skutecznie spełnia wymagania wykrywania w czasie rzeczywistym w terenie. Proponowany model osiąga mAP na poziomie 97,9%, przy parametrach i FLOP odpowiednio 1 849 679 i 5,1 G. W porównaniu z modelem bazowym, proponowany model poprawia mAP o 0,9%, jednocześnie redukując parametry o 28,78% i operacje zmiennoprzecinkowe o 1,4 G. Dodatkowo model osiąga prędkość wnioskowania 38,5 FPS, spełniając wymagania dotyczące przemysłowej detekcji w czasie rzeczywistym.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nowoczesna produkcja i logistyka w dużej mierze opierają się na zautomatyzowanych systemach magazynowania i odzysku (AS/RS)1, aby osiągnąć gęste przechowywanie, efektywną obsługę materiałów oraz dokładne zarządzanie zapasami. AS/RS stał się kluczowym narzędziem pomagającym przedsiębiorstwom poprawić efektywność magazynów i obniżyć koszty, dzięki swojej wysokiej efektywności i inteligentnym właściwościom. Opierając się na wielowarstwowych półkach oraz różnorodnym wyposażeniu do załadunku i rozładunku, AS/RS jest komputerowo sterowanym systemem mechatroniki, który integruje wiele technologii, w tym mechanikę, elektronikę, informatykę, komunikację, sieci, czujniki oraz automatyczną kontrolę 2,3. AS/RS realizuje efektywne, precyzyjne i bezpieczne przechowywanie oraz obsługę towarów poprzez integrację i optymalizację półek, dźwigów stackerów, linii transportowych, systemów sterowania i innych urządzeń, co znacznie zwiększa efektywność przechowywania. Integracja widzenia komputerowego z AS/RS, kluczowy element Przemysłu 4.0, umożliwia bezprecedensowy poziom automatyzacji i inteligencji, pozwalając systemom widzieć i podejmować decyzje na podstawie danych wizualnych4.

W związku z powszechnym zastosowaniem AS/RS w fabrykach tytoniowych5, zaproponowano nowy wymóg inwentaryzacji dla marek pudełek papierosowych. Tradycyjne metody ręcznego inwentaryzacji cierpią na nieefektywność, wysokie wskaźniki fałszywego wykrywania oraz zagrożenia bezpieczeństwa, które nie spełniają potrzeb AS/RS. Wraz z ciągłym rozwojem technologii widzenia komputerowego, rozwiązania widzenia maszynowego są coraz częściej stosowane w obszarach inspekcji przemysłowych 6,7,8. Ponieważ na każdym pudełku papierosów drukowane są informacje o marce z unikalnymi wzorami i tekstem, technologia rozpoznawania obrazu oparta na widzeniu maszynowym umożliwia identyfikację i prowadzenie zapasów w opakowaniach papierosów.

Od 2012 roku algorytmy detekcji obiektów oparte na głębokim uczeniu przyniosły znaczące przełomy w rozpoznawaniu obrazów 9,10,11. Od wczesnych dwustopniowych modeli detekcji obiektów, takich jak R-CNN12, po współczesne modele jednostopniowego wykrywania obiektów, zdominowane przez modele serii YOLO, takie jak detektorybazowe lub oryginalne 13,14,15, te podejścia wniosły istotny wkład w rozwój algorytmów wykrywania obiektów. Inteligentne zadania inwentaryzacyjne coraz częściej wykorzystują modele wykrywania obiektów, aby precyzyjnie identyfikować i lokalizować wiele celów na obrazach lub filmach. Li i in.16 zaproponowali inteligentną metodę inwentaryzacji integrującą czujniki wagi i technologię rozpoznawania obrazów w celu poprawy efektywności i dokładności pomiarów. Wang i in.17 użyli maski R-CNN do segmentowania numeru półki i pozycji tytułu na podstawie obrazu grzbietu książki. Sun i in.18 zaprojektowali zintegrowany system rozpoznawania wizualnego, który wykorzystywał OpenCV do rozpoznawania dwuwymiarowych kodów na materiałach i półkach w trybie wielofunkcyjnym. Zoptymalizowali oryginalny detektor (v5), wprowadzając mechanizm uwagi C3CBAM oraz przypisywanie etykiet SimOTA, aby zwiększyć funkcje strat i dokładne wykrywanie wielu materiałów.

W dziedzinie detekcji obiektów, choć modele dwuetapowe — reprezentowane przez Faster R-CNN — posiadają tradycyjne przewagi w zakresie precyzji wykrywania, ich złożone mechanizmy generowania propozycji regionów skutkują stosunkowo wolnymi prędkościami wnioskowania. W konsekwencji mają trudności z spełnieniem rygorystycznych wymagań dotyczących wydajności w czasie rzeczywistym w scenariuszach przemysłowych19,20. Natomiast architektura oparta na regresji traktuje wykrywanie obiektów jako pojedynczy problem regresji, bezpośrednio przewidując lokalizacje celów i prawdopodobieństwa kategorii na podstawie obrazów wejściowych. Taki projekt architektoniczny pozwala modelom znacząco przewyższać większość modeli dwuetapowych pod względem efektywności wnioskowania, lekkiego ważenia i elastyczności wdrożenia, przy zachowaniu konkurencyjnej dokładności. W ten sposób ta architektura stała się preferowanym rozwiązaniem dla detekcji przemysłowej w czasie rzeczywistym21.

Oryginalny ekosystem modeli nadal szybko się rozwija, a najnowsze warianty odpowiadają na konkretne wyzwania. Na przykład oryginalny detektor(v12)22 koncentruje się na dalszym ulepszaniu optymalizacji czasu treningu oraz udoskonalaniu architektury dla lepszych kompromisów między dokładnością a efektywnością. Tymczasem oryginalny detektor (World)23 wprowadza możliwości wykrywania otwartego słownictwa, umożliwiając wnioskowanie w czasie rzeczywistym ogromnej gamy obiektów poza kategoriami zbioru treningowego poprzez wykorzystanie modelowania języka wizji. Chociaż te postępy przesuwają granice ogólnego wykrywania obiektów, prace te koncentrują się na specjalistycznym zastosowaniu przemysłowym, gdzie odporność na konkretne wyzwania, takie jak częściowa okluzja czy wariancja oświetlenia, jest kluczowa, a przestrzeń kategorii jest stała i znana a priori. Jako najgorętsza wersja tej rodziny modeli, modelbazowy 24 dziedziczy zalety oryginalnego detektora (v8)25,26; Nie tylko zmniejsza liczbę parametrów modelu, ale także uwzględnia równowagę między efektywnością wykrywania a dokładnością. W porównaniu z innymi modelami detekcji obiektów wyróżnia się w zadaniach rozpoznawania wzrokowego.

Wyzwanie wykrywania małych lub częściowo zasłoniętych pudełek papierosów jest przejawem szerszego problemu w widzeniu komputerowym. Wykrywanie małych obiektów jest aktywnie badane, obejmując podejścia od udoskonaleń sieci piramidy cech (FPN)27 po mechanizmy uwagi uwzględniające kontekst, które inspirują integrację wieloskalowego przetwarzania cech. Ponadto dążenie do efektywności operacyjnej w środowisku przemysłowym wymaga lekkiego projektu modelu. Zainspirowane koncepcjami efektywnej architektury eksplorowanymi w MobileNetV328 i GhostNet29, te koncepcje wykorzystują głęboką konwolucję i transformację liniową, aby zmniejszyć złożoność obliczeniową przy zachowaniu możliwości prezentacji, dlatego wybieramy lekkie moduły, aby ulepszyć model. Dlatego, aby poradzić sobie z inwentaryzacją marek pudełek papierosowych oraz czynnikami wpływającymi na inwentaryzację, takimi jak zmiany oświetlenia, różnice rozmiarów cech różnych marek oraz częściowe zasłonięcie między pudełkami papierosowymi, proponujemy w tym artykule ulepszony model detekcji obiektów z architekturą regresji jednoetapowej.

Główne innowacje proponowanego modelu są trzystronne. Po pierwsze, moduł Adaptive Downsampling (ADown)30jest wdrażany, aby zastąpić standardowe splotowe downsampling zarówno w sieciach szkieletowych, jak i neck. Ten nowatorski projekt ogranicza utratę informacji podczas kompresji cech, co jest kluczowe dla zachowania małych logo i tekstów marek. Po drugie, wprowadzono odwrócony mechanizm Efficient Multi-scale Attention (iEMA), który umożliwia modelu dynamiczną, wieloskalową percepcję kontekstową, znacząco poprawiając jego wydajność na małych i częściowo zasłoniętych pudełkach papierosowych. Po trzecie, oryginalna głowica detekcyjna została zastąpiona modułem DynamicHead31 , który łączy uwagę, przestrzenną i świadomość zadań, umożliwiając precyzyjniejszą lokalizację i klasyfikację celów o bardzo różnych rozmiarach. Te modyfikacje architektoniczne są spójnie zaprojektowane, aby rozwiązać specyficzne problemy związane z identyfikacją marki papierosów w warunkach przemysłowych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zbiór danych użyty w tym artykule został pozyskany z działu AS/RS w Dziale Logistyki firmy Longyan Tobacco Industry Co., Ltd. Badanie to nie obejmowało uczestników ani zwierząt. Nie wymagała się etycznego zatwierdzenia.

Pozyskiwanie i konfiguracja zbioru danych
Konfiguracja sprzętowa: Zamontowanie przemysłowego aparatu (np. MV-CA013-A0GM) wyposażonego w obiektyw o ogniskowej 8 mm (np. MVL-HF0828M-6MPE) na platformie ładunkowej dźwigu stackera. Podłącz aparat do komputera sterującego za pomocą kabla GigE i bezprzewodowego AP (np. BH-ANT5158S-14HV, BH-MS-AC1600HWH). Umieść wokół kamery paskowe światło LED (np. MV-LLDS-1002-38-W), aby zapewnić równomierne oświetlenie.

Ustawienie parametrów aparatu: Konfiguruj kamerę za pomocą oprogramowania producenta (np. MVS). Ustaw rozdzielczość akwizycji na 1280 x 1024 pikseli. Ustaw tryb spustu na Hardware Trigger i zsynchronizuj go z systemem pozycjonowania dźwigu stackera. Ustaw czas naświetlania na 100 ms i wzmocnienie na 5 dB, aby zminimalizować rozmycie ruchu i szumy. Odległość robocze między aparatem a pudełkami papierosów wynosi około 550 mm.

Zbieranie zdjęć: Przemysłowa kamera z wyzwalaczem automatycznie rejestruje obraz za każdym razem, gdy taca jest ustawiana podczas przechowywania i wybierania pudełek po papierosach. Zebrać łącznie 4 835 zdjęć RAW; typowe obrazy pokazano na Rysunku 1.

Adnotacje do obrazów: Użyj otwartoźródłowego narzędzia LabelImg. Dla każdego zdjęcia narysuj ramki ograniczające każdą widoczną cechę marki papierosów. Przypisz właściwą nazwę marki (np. Hongzhuang, Gutian) jako etykietę klasy dla każdego ramki ograniczającej. Zapisz adnotacje w standardowym formacie detekcji jednostopniowej, z jednym plikiem txt na obraz.

Kontrola jakości: Drugi adnotator przegląda losowo wybrane 20% obrazów z adnotacjami. Wszelkie rozbieżności są omawiane i rozwiązywane, co zapewnia spójność etykietowania.

Strategia augmentacji danych
Ta sekcja opisuje zarówno tradycyjne, jak i zaawansowane techniki augmentacji stosowane do zbiorów danych. Dane początkowe i rozszerzone są łączone w nowy zbiór danych, który następnie dzieli się na zestaw treningowy, zbiór walidacyjny oraz zbiór testowy, aby zapewnić sprawiedliwość w ocenie.

Tradycyjne uzupełnianie danych32: Transformacje te są stosowane w czasie rzeczywistym przez potok treningowy (np. z wykorzystaniem bibliotek Albumentations lub PyTorch Transforms) z określonym prawdopodobieństwem dla każdej partii.

Transformacje geometryczne: Rotacja: Losowe obracanie obrazów o kąt od -45° do +45°. Skalowanie: Losowo skaluj obrazy o czynnik od 0,8 do 1,2. Flip poziomy: Losowe przewracanie obrazów poziomo z 100% prawdopodobieństwem. Losowe przycinanie: Losowo przycinaj fragment od 80% do 100% oryginalnego obszaru obrazu.

Transformacje fotometryczne: Jasność i kontrast: Dostosuj jasność i kontrast o czynnik losowo wybrany z [0.6, 1.4]. Szum Gaussa: Dodaj szum Gaussa o odchyleniu standardowym losowo wybranym od [0, 0,01 * 255] do 10% obrazów. Rozmycie Gaussa: Stosuj rozmycie Gaussa o rozmiarze jądra 3x3 do 10% obrazów.

Symulacja zasłony: Losowo umieść 1 do 3 prostokątnych łatek okluzji (pokrywających do 5% powierzchni obrazu każdy) na obrazach. Łatki wypełnione są losowym szumem lub średnimi wartościami pikseli obrazu.

Zaawansowane rozszerzanie danych: specyficzne dla regionu kopiuj i wklej
Motywacja i wpływ: Główną motywacją tej ukierunkowanej augmentacji było rozwiązanie kluczowego problemu danych: kilka marek papierosów miało bardzo mało przypadków (nawet jedno zdjęcie). Standardowy podział testów walidacji losowych trainów mógłby potencjalnie przydzielić wszystkie instancje rzadkiej marki do jednego zestawu (np. wszystkie do zestawu testowego), co skutkowałoby brakiem możliwości poznania lub weryfikacji tej marki. Ta metoda sztucznie zwiększała wielkość próby dla tych niedostatecznie reprezentowanych marek, zapewniając, że każda marka ma wystarczającą liczbę instancji rozproszonych w zbiorach szkoleniowych, walidacyjnych i testowych. Ten fundamentalny krok zapobiega katastrofalnym awariom w rzadkich kategoriach i jest warunkiem koniecznym dla jakiejkolwiek znaczącej wydajności modelu oraz uogólnienia na pełen zestaw marek.

Ten krok wymaga wstępnie wytrenowanego segmentalnego modelu bazowego na początkowym zbiorze danych oraz modelu Segment Anything (SAM)33.

Segmentuj obiekty źródłowe: Dla obrazów pudełek papierosowych z niedostatecznie reprezentowanych marek użyj modelu SAM do precyzyjnego generowania masek segmentacyjnych. Użyj trybu point prompt, klikając na Funkcję Marki pudełka papierosowego , aby rozpocząć segmentację. Ręcznie waliduj i doprecyzuj wygenerowane maski, aby zapewnić dokładność. Zapisz fragmentowane zdjęcia pudełek papierosów z przezroczystym tłem jako pliki PNG. Tworzy to bibliotekę izolowanych instancji obiektów.

Generuj maski tła: Użyj wstępnie wytrenowanego segmentalnego modelu bazowego do segmentacji instancji na zestawie obrazów tła (obrazy z dużą ilością wolnej przestrzeni lub proste tła). Model generuje maski binarne wskazujące obszary już zajmowane przez obiekty.

Maski procesowe i wklejanie obiektów: Dla każdej maski tła użyj biblioteki OpenCV (funkcja 'cv2.approxPolyDP' z współczynnikiem epsilon 0,02 * obwodu konturowego) do dopasowywania krzywych i linearyzacji krawędzi maski, uzyskując uproszczoną reprezentację wielokątową wolnej przestrzeni. Zidentyfikuj największy ciągły obszar wielokąta w masce tła jako docelowy obszar pasty. Losowo wybierz segmentowany obiekt źródłowy z biblioteki. Zmień rozmiar (zachowując proporcje obrazu) i zastosuj transformację afiniczną (niewielki obrót między -5° a +5° oraz niewielkie ścinanie), aby naturalnie dopasował się do docelowego obszaru pasty, zapewniając, że nie nakłada się na granice istniejących obiektów. Użyj alfa blendingu, aby płynnie wkleić przekształcony obiekt na obraz tła w obliczonej lokalizacji. Ogólne ramy technologii augmentacji danych opartej na technice kopiowania-wklejania w określonych obszarach przedstawiono na Rysunku 2. Programowo wygeneruj odpowiadający mu nowy plik adnotacji txt dla wklejonego obiektu, aktualizując współrzędne ramki ograniczającej i etykietę klasy.

Ostateczny zbiór danych rozszerzonych: Ten proces offline generuje 600 nowych syntetycznych obrazów. Połącz je z oryginalnymi 4 835 obrazami oraz dodatkowymi 1 167 obrazami powstałymi dzięki zastosowaniu tradycyjnych technik augmentacji opisanych powyżej, aby uzyskać ostateczny zbiór danych liczący 6 602 obrazy. Podziel ostateczny zbiór danych na zestawy treningowe (70%, 4 621 obrazów), walidacyjne (20%, 1 320 obrazów) oraz testowe (10%, 661 obrazów), zapewniając, że obrazy z tej samej oryginalnej sekwencji są przechowywane w tym samym podziale, aby zapobiec wyciekom danych.

Modyfikacja modelu do budowy proponowanego ulepszonego detektora
Zoptymalizowane algorytmy wykrywania obiektów34 osiągnęły znaczący postęp w inspekcji przemysłowej w ostatnich latach. Ta sekcja zawiera szczegółową, krok po kroku procedurę modyfikacji architektury modelu bazowego w celu stworzenia proponowanego modelu. Modyfikacje są realizowane poprzez edycję pliku konfiguracyjnego modelu (np. config.yaml) oraz zapewnienie uwzględnienia odpowiednich niestandardowych definicji modułów w bazie kodu. Uzasadnienie każdej modyfikacji przedstawiono w celu wyjaśnienia jej roli w rozwiązywaniu konkretnych wyzwań wykrywania. Struktura proponowanego modelu przedstawiona jest na Rysunku 3.

Zastąpienie modułów downsampling modułem ADown: Standardowy moduł Convolution-BatchNorm-SiLU (CBS) używany do downsampling wykorzystuje pojedynczą splot o przekroczeniu, który może działać jako wąskie gardłoinformacyjne 35, potencjalnie eliminując drobnoziarniste cechy kluczowe do rozpoznawania małych pudełek papierosowych i szczegółowych logotypów marek. Moduł ADown został zaprojektowany, aby to złagodzić poprzez implementację struktury z dwoma gałęziami, która przechwytuje i zachowuje bogatszy zestaw cech podczas redukcji rozdzielczości przestrzennej. Jedna gałąź priorytetowo traktuje zachowanie lokalnych szczegółów o wysokiej częstotliwości, podczas gdy druga obejmuje szerszy, kontekstowy przegląd. Fuzja tych komplementarnych cech skutkuje bardziej solidną i informacyjną reprezentacją dla kolejnych warstw.

Kroki działania i wdrożenia
Definicja modułu: Upewnij się, że niestandardowy moduł PyTorch o nazwie ADown jest zdefiniowany w plikach definicji modelu projektu. Ten moduł musi zawierać dwie równoległe gałęzie. Pierwsza gałąź powinna składać się z dwuwymiarowej warstwy splotu z jądrem 3x3 i krokiem 2. Druga gałąź powinna kolejno składać się z warstwy maksymalnej puli 2x2 (ze stride 2), po której następuje warstwa splotowa 1x1. Wyjścia tych dwóch gałęzi mają być łączone wzdłuż wymiaru kanału, a powstała mapa cech jest następnie przekazywana przez końcową warstwę splotową 1x1, aby zintegrować kanały i uzyskać wyjście. Struktura modułu ADown przedstawiona jest na rysunku 4.

Edycja pliku konfiguracyjnego: Otwórz plik konfiguracyjny modelu bazowego (config.yaml). Systematycznie zidentyfikuj każdą instancję modułu CBS skonfigurowaną do downsampling (czyli gdzie parametr kroku jest ustawiony na 2). Zamień każdy z tych wpisów modułów CBS nowym modułem ADown.

Motywacja projektowa: Projektowanie ADown wynika z potrzeby ograniczenia utraty informacji w standardowych splotach o przestrętnych przekroczach, co może być szkodliwe dla małych obiektów. Jego struktura dwugałęziowa inspirowana jest ideą przetwarzania równoległego do rejestrowania zarówno szczegółów przestrzennych o wysokiej częstotliwości (za pomocą splotu), jak i niskoczęstotliwościowych informacji kontekstowych (poprzez pooling), zapewniając tym samym bogatszą, wieloskalową reprezentację cech dla kolejnych warstw.

Integracja modułu iEMA
Uzasadnienie i zasada projektowania: Aby zwiększyć zdolność modelu do wykrywania małych celów oraz tych częściowo zasłoniętych, niezbędne jest wprowadzenie mechanizmu, który skutecznie modeluje wieloskalowy kontekst przestrzenny. Moduł iEMA osiąga to, osadzając komponent Efficient Multi-scale Attention (EMA)36 w strukturze odwróconego bloku rezydualnego (iRMB)37 . iRMB zapewnia wydajną bazę obliczeniową dzięki głęboko rozdzielalnym splotom, podczas gdy komponent EMA jawnie rejestruje interakcje przestrzenne na skali pomiędzy skalą poprzez równoległy projekt wielogałęziowy. Ta integracja pozwala modelu dynamicznie kalibrować wagi cech, koncentrując uwagę na najbardziej dyskryminacyjnych regionach przestrzennych w różnych skalach, co poprawia rozpoznawanie pod okluzją i dla małych obiektów.

Kroki działania i wdrażania
Definicja modułu: Upewnij się, że zdefiniowany jest niestandardowy moduł PyTorch o nazwie iEMA. Ten moduł powinien najpierw zaimplementować odwrócony blok resztowy. Ten blok zazwyczaj zaczyna się od splotu punktowego dla rozszerzenia kanału, następnie następuje splot głębokości (np. 3x3) do wyodrębniania cech przestrzennych, a na końcu splot punktowy dla rzutowania kanału. Bezpośrednio po tym bloku należy wdrożyć mechanizm uwagi EMA. Mechanizm EMA zazwyczaj wykorzystuje grupowane sploty i interakcje międzywymiarowe, aby efektywnie generować wieloskalową mapę uwagi przestrzennej bez nadmiernego narzutu obliczeniowego. Struktura modułu iEMA przedstawiona jest na Rysunku 5.

Edycja pliku konfiguracyjnego: W pliku konfiguracyjnym config.yaml znajdź sekcje definiujące sieć neck, a konkretnie warstwy bezpośrednio po modułach C2f. W tych strategicznych miejscach wstaw nową warstwę, która wywołuje moduł iEMA.

Motywacja projektowa: Moduł iEMA opiera się na zasadzie zwiększania rozróżnialności cech poprzez integrację lokalnej ekstrakcji cech (poprzez głęboką konwolucję) z lekkim, ale skutecznym mechanizmem globalnego modelowania kontekstu (EMA). To hybrydowe podejście pozwala modelu adaptacyjnie koncentrować się na informacyjnych regionach w różnych skalach, co jest kluczowe dla rozpoznawania częściowo widocznych logotyp i tekstów marek.

Zastąpienie głowicy detekcyjnej modułem DynamicHead
Uzasadnienie i zasada projektowania: Oryginalna głowica detekcyjna może nie być optymalnie do obsługi znacznej różnicy skali pudełek papierosowych oraz złożonej interakcji między lokalizacją a zadaniami klasyfikacji. Moduł DynamicHead rozwiązuje ten problem, łącząc trzy formy uwagi w spójną strukturę: świadomą skali, przestrzenną oraz świadomą zadania. Komponent świadomy skali dynamicznie łączy cechy z różnych poziomów piramidy cech, zapewniając efektywną reprezentację obiektów o wszelkich rozmiarach. Komponent świadomy przestrzennie wykorzystuje strategię rzadkiego próbkowania, aby skoncentrować zasoby obliczeniowe na najbardziej informacyjnych regionach w mapach cech. Komponent świadomości zadań dostosowuje reprezentację cech specjalnie do określonych celów, takich jak regresja ramek ograniczających i klasyfikacja kategorii. To jednolite podejście prowadzi do dokładniejszych i bardziej solidnych prognoz.

Kroki działania i wdrażania
Definicja modułu: Jest to złożony moduł obejmujący trzy mechanizmy uwagi opisane przez równania (1) do (4). Jego wewnętrzna struktura będzie obejmować warstwy do obliczania wag skalowych, wykonywania deformowalnej uwagi przestrzennej oraz stosowania transformacji cech specyficznych dla zadania.

Równanie 1   (1)

Równanie 2   (2)

Równanie 3     (3)

Równanie 4     (4)

Gdzie WL(F) oznacza końcową mapę cech udoskonalonych przez uwagę, uzyskaną przez kolejne zastosowanie mechanizmów πL(F), π przestrzennie S(F) oraz mechanizmów uwagi zadaniowej πC(F) do cechy wejściowej F. Konkretnie, w równaniu (2), πL(F) oblicza wagę uwagi skalowaną, najpierw uśredniając ją przez wymiary przestrzenne (S) i kanałowe (C), przekazując ją przez funkcję liniową f(⋅) oraz aktywację twardą sigmoidalną σ(⋅). W równaniu (3) πS(F) wykonuje rzadką uwagę przestrzenną, agregując cechy z K wybranych punktów kluczowych pk, z których każdy ma uczone przesunięcie Δpk, aby skupić się na regionach dyskryminacyjnych i skalarnej ważności Δmk. W równaniu (4) πC(F) implementuje uwagę świadomą zadania, stosując transformację liniową (zarządzaną przez wyuczone parametry (α1, β1, α,2 β2)) do każdego kanału i wybierając maksymalną odpowiedź, co pozwala szefowi specjalizować się w zadaniach klasyfikacyjnych i regresji. Struktura modułu DynamicHead pokazana jest na Rysunku 6.

Edycja pliku konfiguracyjnego: W pliku config.yaml znajdź sekcję definiującą głowę modelu, która pierwotnie zawiera moduł Detect. Zastąp go nowym wpisem, który wywołuje moduł DynamicHead.

Motywacja projektowa: Moduł DynamicHead opiera się na obserwacji, że głowice wykrywające obiekty powinny być adaptacyjne do skali, położenia przestrzennego i zadania. Jego jednolity system uwagi, sformalizowany w równaniach. (1-4) pozwala modelu dynamicznie rekalibrować odpowiedzi cech na podstawie tych trzech wymiarów, co prowadzi do bardziej solidnych prognoz wobec zmienności skali i tła zakłóceń.

Trening modelu
Upewnij się, że PyTorch 2.1.0, CUDA 12.1 oraz wszystkie zależności są zainstalowane.

Dowództwo szkoleniowe
Przed ponownym trenowaniem przygotuj podzielone dane obrazowe i dane adnotacji w standardowym formacie detekcji jednostopniowej. Stwórz plik .yaml zawierający ścieżkę obrazu i kategorię danych. Zgodnie z ulepszeniem modelu oryginalny plik detektora .yaml został zastąpiony proponowanym modelowym plikiem .yaml. Zapisz plik train.py, zaimportuj pakiet detektora jednostopniowego, załaduj model treningowy i ścieżkę danych oraz ustaw parametry treningowe, w tym imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 itd.

Hiperparametry: Kluczowe parametry to: rozmiar obrazu wejściowego (640 x 640), rozmiar partii (4), początkowa szybkość uczenia (0,01) z harmonogramem wyżarzania kosinusowego, optymalizator SGD z pędem (0,937) oraz spadek wagi (0,0005). Mozaika jest domyślnie włączona.

Monitorowanie szkoleń: Proces szkoleniowy generuje metryki dla każdej epoki. Monitoruj krzywe pod kątem utraty treningowej/walidacyjnej oraz mAP na poziomie 0,5, aby zapewnić zbieżność i uniknąć nadmiernego dopasowania. Szkolenie przez 100 epok zazwyczaj wystarcza.

Ocena i wdrożenie modelu
Ocena: Po treningu najlepszy model zapisuje się jako runs/train/exp/weights/best.pt. Oceniaj to na zestawie wartości używając: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Skrypt wygeneruje Precision, Recall, mAP na 0,5 itd. Potwierdź, że mAP spełnia wymagany próg (np. 97,9%).

Wnioskowanie w celu weryfikacji: Wykonaj wnioskowanie na przykładowych obrazach, aby wizualnie zweryfikować wyniki wykrywania: bash python detect.py --wagi runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Poprzez weryfikację rozumowania można uzyskać wyniki detekcji każdego obrazu oraz szybkość detekcji modelu.

Wdrożenie: Aby wdrożyć w czasie rzeczywistym system dźwigu stackera, konwertuj model PyTorch (best.pt, ~4,7 MB) do formatu takiego jak TensorRT lub ONNX, aby zoptymalizować szybkość wnioskowania. Ostatecznym efektem są ramki ograniczone etykietami klas (nazwami marek) i ocenami pewności.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Środowisko eksperymentalne i ustawianie parametrów
Eksperymenty mające na celu weryfikację wydajności proponowanego modelu przeprowadzono na ramach głębokiego uczenia PyTorch, a szczegóły środowiska eksperymentalnego przedstawiono w Tabeli 1. Tutaj użyliśmy specjalnego zbioru danych zawierającego 6 602 obrazy, który został losowo podzielony na zestawy treningowe, walidacyjne i testowe w stosunku 7:2:1. Wszystkie eksperymenty wykorzystywały obrazy wejściowe o rozdzielczości 640 x 640 z...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kompromis między celnością a efektywnością
Kluczowym osiągnięciem tego modelu jest jego doskonała równowaga między dokładnością a efektywnością obliczeniową. Jak pokazano w Tabeli 2, przedstawiony model osiąga najwyższą mAP, jednocześnie zachowując najmniejszą liczbę parametrów i drugi najniższy FLOP spośród porównywanych modeli detektorów jednostopniowych. Przekłada się to bezpośrednio na praktyczne korzyści: mniejszy model jest szybszy w wdrożeniu, wymaga mniej pamięci i ma niższe...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak bezpośrednich konkurujących interesów finansowych. Badania te zostały przeprowadzone we współpracy z Longyan Tobacco Industrial Co., Ltd., gdzie zatrudniani są autorzy Hongli Deng i Wencan Li, oraz z fabryką papierosów Baoji, gdzie zatrudniony jest autor Baobin Luo. Te afiliacje dostarczyły scenariusza aplikacyjnego oraz dane terenowe do badania. Autorzy naukowi (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) nie deklarują żadnych finansowych ani niefinansowych konfliktów interesów dotyczących publikacji tego dzieła.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prace te zostały finansowo wsparte przez Metodę Pomiaru Temperatury odlewania Billet opartą na Przedzórnym Reflektorze i Wielofalowym (nr LZY24E050002), finansowaną przez Wspólne Fundusze Prowincji Nauk Przyrodniczych Zhejiang w Chinach, oraz Metodą Pomiaru Temperatury Pola Temperatury Niezamkniętej i Nieizotermicznej Komory Łyżwy (nr 2023K231) finansowaną przez Projekt Planowania Nauki i Technologii w Quzhou.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Czytnik koduHikvisionID5050Sprzęt Hikvision: Używany do odczytu kodów kreskowych na paletach, potrzeba podłączenia zasilania 24V
Kamera przemysłowaHikvisionMV-CA013-A0GM, MV-CS016-10GMPotrzeba podłączenia zasilacza 24V
Światło LEDHIKROBOTMV-LLDS-1002-38-WJedno metrowe źródło światła zapewnia odpowiednie warunki oświetleniowe dla aparatu
obiektywHikvisionMVL-HF0828M-6MPEOgniskowa: 8 mm, zakres przysłony: F2.8~F16, piksel: 6 milionów
MVSHikvisionV4.5.1Oprogramowanie Hikvision: Używane do debugowania kamer, ustawiania parametrów kamer i zbierania danych
PycharmJetBrains2020.1.3 x64Wykorzystywane do trenowania modeli głębokiego uczenia i tworzenia systemów detekcji
Kilka metalowych wspornikówLongyan Tobacco Industrial Co., Ltd.Stop aluminium 7075-T6Używany do naprawy kamer i czytników kodu
Kilka kabli sieciowychLongyan Tobacco Industrial Co., Ltd.RJ45 Crystal HeadPodłącz stację bazową między komputerem przemysłowym a punktem dostępowym bezprzewodowym, podłącz kamerę i przełącznik itd
SwicthTP-LinkTL-SH1005Istnieje 8 interfejsów kabli Ethernet wymagających zasilania 220V
Vision MasterHikvisionV4.3.0Oprogramowanie Hikvision: Używane do dopasowywania szablonów i wykrywania wyników obrazów
Bezprzewodowe urządzenie APShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHZe względu na dużą skalę ruchu wymaganego przez dźwig stosowy, kabel sieciowy nie może połączyć kamery z komputerem przemysłowym, dlatego potrzebne jest bezprzewodowe urządzenie AP, aby zapewnić płynne działanie sieci kamer

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Film wkrótce dostępny

Powiązane artykuły