Artykuł badawczy

Ocena w czasie rzeczywistym porządku wyrównania tytoniu z wykorzystaniem ulepszonego modelu regresji jednoetapowej

DOI:

10.3791/71669

29 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Opracowano ulepszony model regresji jednoetapowej do wykrywania w czasie rzeczywistym porządku wyrównania tytoniu. Podejście integruje trzy optymalizacje strukturalne oraz niestandardową metodę predykcji orientacji, aby zwiększyć dokładność wykrywania przy jednoczesnym ograniczeniu parametrów modelu i złożoności obliczeniowej, umożliwiając efektywną ocenę wyrównania ciętego tytoniu w środowiskach produkcji przemysłowej.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Uporządkowanie tytoniu ciętego, definiowane jako spójność wyrównania tytoniu wzdłuż osi papierosów, jest kluczowym czynnikiem w optymalizacji jakości produkcji. Dokładna i zautomatyzowana ocena tej właściwości pozostaje trudna ze względu na złożone struktury nici i zmienne warunki obrazowania. Opracowano ulepszony model regresji jednoetapowej, aby umożliwić niezawodne wykrywanie porządku przy wyrównywaniu tytoniu. Podejście to obejmuje trzy modyfikacje architektoniczne: interaktywną metodę downsampling wieloczęstotliwościowej do zachowania informacji o cechach, potrójną strategię fuzji uzupełniającej dla poprawy wieloskalowej reprezentacji cech oraz dynamiczną głowicę detekcyjną poprawiającą lokalizację w różnych skalach. Dodatkowo zaimplementowano niestandardową metodę przewidywania orientacji, która pozwala kwantyfikować uporządkowanie wyrównania. Model jest oceniany na zbiorze danych obrazów przemysłowych, osiągając średnią dokładność 89,9%, precyzję 90,6% oraz odwołanie 88,7%. W porównaniu z modelem bazowym, proponowane podejście redukuje parametry modelu o 30,8% (z 2,6M do 1,8M) oraz złożoność obliczeniową o 21,5% (z 6,5G do 5,1G), jednocześnie poprawiając wydajność. Ogólnie rzecz biorąc, metoda ta umożliwia efektywną i dokładną ocenę porządku wyrównania wyrównanego tytoniu oraz wykazuje przydatność do zastosowań przemysłowych w czasie rzeczywistym.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Uporządkowanie tytoniu odnoszą się do stopnia osiowego wyrównania tytoniu w obrębie papierosa. Zrozumienie czynników wpływających na tę właściwość, takich jak morfologia tytoniu i parametry pneumatycznego transportu, jest niezbędne dla optymalizacji procesów cięcia i montażu. W konsekwencji badanie tych czynników wpływających stało się kluczową strategią dla przedsiębiorstw tytoniowych, które dążą do obniżenia kosztów i poprawy efektywności produkcji. Tradycyjna ocena porządku w ciętym tytoniu opiera się na metodach ręcznych, które są nieefektywne i często pozbawione spójności oraz dokładności. Dlatego w branży istnieje pilna potrzeba zautomatyzowanego, precyzyjnego i w czasie rzeczywistym systemu wykrywania, który pozwoli zoptymalizować procesy produkcyjne. Dzięki szybkiemu rozwojowi głębokiego uczenia stała się możliwa zautomatyzowana ocena porządku po ciętym tytoniu oparta na wykrywaniu obiektów. Jednak wdrożenie takich systemów oceny na liniach produkcyjnych pozostaje w dużej mierze niezbadanym tematem badawczym. Niemniej jednak technologia widzenia maszynowego została z powodzeniem zastosowana w zadaniach inspekcyjnych w innych dziedzinach,co stanowi cenne odniesienia dla tego badania. W tym kontekście detektory oparte na splotowych sieciach neuronowych (CNN) stały się dominującym paradygmatem i zazwyczaj dzielą się je na podejścia dwuetapowe, takie jak Faster R-CNN2, oraz jednoetapowe ramy, takie jak seria 3,4 You Only Look Once (YOLO).

W ostatnich latach algorytmy detekcji obiektów oparte na głębokim uczeniu, szczególnie ramy Faster R-CNN, wykazały znaczący potencjał w różnych dziedzinach. Jednak ich bezpośrednie zastosowanie w konkretnych scenariuszach przemysłowych i zawodowych często jest ograniczone przez złożone środowiska operacyjne i unikalne wymagania zadaniowe. W związku z tym zaproponowano liczne dostosowane ulepszenia, aby sprostać tym wyzwaniom. W analizie obrazów medycznych, na przykład, Su i in.5 skupili się na optymalizacji parametrów i udoskonalaniu architektur sieci, aby zwiększyć dokładność wykrywania małych, kluczowych celów w wykrywaniu guzków płucnych. W przemysłowym wykrywaniu wad Chen i in.6 zajęli się interferencją tekstur podczas inspekcji tkanin, integrując filtry Gabora — zoptymalizowane za pomocą algorytmów genetycznych — z szkieletem Faster R-CNN, skutecznie tłumiąc złożone tła. Aby pokonać wyzwania związane z niedoborem danych i złożonością środowiskową w wykrywaniu celów podwodnych, Zeng i in.7 wprowadzili sieć okluzji adwersarnej. Sieć ta konkuruje z detektorem podczas treningu, zmuszając model do nauki bardziej odpornych funkcji i tym samym eliminując nadmierne dopasowanie. Ponadto, dla zadań wyszukiwania o drobnym ziarnie, takich jak identyfikacja konkretnych instancji, Li i in.8 ulepszyli Faster R-CNN poprzez konkatenację warstw cech oraz strategie precyzyjnego dostrojenia, znacząco poprawiając jego wydajność na obrazach o niskiej rozdzielczości. Wang i in.9 niedawno zaproponowali wielostronny ramowy system Faster R-CNN, chroniący prywatność, który umożliwia bezpieczne obliczenia na zaszyfrowanych obrazach i parametrach modeli poprzez nowatorskie protokoły bezpiecznego dzielenia, potęgowania i logarytmu. Sun i in.10 wykazali skuteczność ulepszonego Faster R-CNN w rozpoznawaniu wielu typów wad na piastach kół, osiągając wyższą średnią precyzję (mAP) niż R-CNN i YOLOv3. Razem te działania podkreślają dalszą ewolucję Faster R-CNN w kierunku większej adaptacji, odporności i zastosowania w różnorodnych realnych scenariuszach. Równolegle z postępem w detektorach dwustopniowych, również jednostopniowe ramy takie jak seria YOLO przeszły znaczący rozwój.

Jako znacząca alternatywa dla detektorów dwustopniowych, seria YOLO zyskała znaczące uznanie zarówno w środowisku przemysłowym, jak i badawczym dzięki swojej wydajnej architekturze i doskonałym osiągom detekcji w czasie rzeczywistym. Od wprowadzenia modelu pierwszej generacji przez Redmon i in.11w 2016 roku, kolejne iteracje stopniowo rozwiązywały różne ograniczenia techniczne, co skłoniło naukowców do opracowywania specjalistycznych adaptacji dla zastosowań specyficznych dla danej dziedziny. W systemach monitorowania ruchu drogowego, na przykład, Jamtsho i in.12 zaimplementowali YOLOv2 połączony z algorytmem śledzenia centroidów, aby precyzyjnie identyfikować tablice rejestracyjne motocyklistów bez kasku w strumieniach wideo, skutecznie zmniejszając liczbę fałszywych alarmów przy jednoczesnym zachowaniu wysokiego wskaźnika wykrywalności na poziomie 98,52%. Dla wymagających środowisk podwodnych Neelamegam i in.13 opracowali hybrydowy model YOLO-Transformer, który integruje zdolność wykrywania w czasie rzeczywistym YOLO z mechanizmami uwagi opartymi na transformatorach, co poprawia zrozumienie kontekstu. Dzięki uwzględnieniu danych z czujników IoT w czasie rzeczywistym dotyczących czynników środowiskowych, takich jak mętność i poziom światła, model dynamicznie dostosowuje się do zmieniających się warunków, osiągając dokładność wykrywania na poziomie 97,5% i przewyższając konwencjonalne modele w hałaśliwych, słabo widocznych scenariuszach. Podobnie Zhang i in.14 zaproponowali ulepszony model YOLO dla zastosowań teledetekcji. Aby rozwiązać problemy związane z niewystarczającą reprezentacją cech i zamieszaniem w tle, wprowadzili specjalistyczne moduły do ulepszania cech, fuzji wieloskalowej oraz globalnej świadomości kontekstu, co znacząco poprawia dokładność wykrywania małych obiektów. Łącznie badania te pokazują ciągły rozwój serii YOLO w kierunku większej adaptacyjności, odporności i skuteczności w różnorodnych scenariuszach rzeczywistych.

Pomimo tych postępów, najnowsze wersje rodziny YOLO, takie jak YOLOv113, nie są z natury zoptymalizowane pod kątem specyficznych złożoności teksturalnych i strukturalnych ciętego tytoniu w warunkach przemysłowych. Standardowe operacje downsampling mogą prowadzić do utraty drobnoziarnistych cech, które są kluczowe dla odróżnienia wyrównanego od nieuporządkowanego tytoniu ciętego. Ponadto ich głowice wykrywające w skali stałej mają trudności z efektywnym radzeniem sobie z wieloskalowym charakterem obiektów tytoniowych w różnych warunkach obrazowania.

Aby sprostać tym wyzwaniom, artykuł ten proponuje ulepszony model regresji jednoetapowej oparty na YOLOv11n, połączony z niestandardową metodą predykcji orientacji, umożliwiający solidne wykrywanie porządku po tytoniu w internecie. Główne osiągnięcia tego artykułu są trzystronne. (1) Proponowana jest metoda interaktywnego downsampling (MFID) z wieloma częstotliwościami. Standardowe operacje splotu z przekrojkiem lub pulowania odrzucają drobnoziarniste informacje, podczas gdy MFID jawnie rozkłada cechy na składowe o niskiej i wysokiej częstotliwości za pomocą falki Haara. Takie podejście zachowuje więcej oryginalnych informacji i ogranicza ich utratę podczas próbkowania w dół. (2) Metoda potrójnej komplementarnej fuzji (TCF) została zaprojektowana w celu poprawy jakości cech poprzez łączenie informacji semantycznych płytkich, środkowych i głębokich. Chociaż proste operacje konkatenacji lub dodawania są powszechnie stosowane do fuzji cech, TCF wprowadza warstwę średnią sterowaną, ważoną fuzję z odwrotnymi gałęziami wagowymi, osiągając tym samym komplementarność między informacjami semantycznymi a szczegółowymi. (3) Wprowadzono dynamiczną głowicę detekcyjną (DynamicHead), która zastępuje oryginalną głowicę detekcyjną. Oryginalna głowica detekcyjna opiera się na operacjach splotu o stałej skali; natomiast DynamicHead integruje mechanizmy uwagi uwzględniającej skalę, przestrzennie oraz zadania. Umożliwia to dynamiczną regulację znaczenia cech oraz bardziej elastyczne i skuteczne wieloskalowe fuzję cech, co poprawia zdolność modelu do precyzyjnej lokalizacji i klasyfikacji cech związanych z uporządkowaniem.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie nie obejmowało ludzkich podmiotów, zwierząt kręgowych ani tkanek regulowanych; dlatego nie była wymagana zgoda etyczna ani zgoda komitetu nadzoru instytucjonalnego. Zestaw danych wykorzystany w tym badaniu został uzyskany od firmy Longyan Tobacco Industry Co., Ltd. Obrazy zostały zebrane z pięciu niezależnych partii produkcyjnych w ciągu trzymiesięcznego okresu. Próbki były pobieranie losowo o różnych porach dnia (rano, po południu i wieczorem), aby uchwycić naturalne zmiany w warunkach produkcji. Zestaw danych obejmuje próbki pokrywające zakres wilgotności tytoniu od 12% do 18%, prędkości cięcia 1,5, 2,0 i 2,5 m/s oraz ciśnienia przesyłu pneumatycznego 0,4, 0,5 i 0,6 MPa, zapewniając pokrycie typowym warunkom produkcji.

Nabycie i konfiguracja zestawu danych
Konfiguracja sprzętu
System akwizycji obrazów został skonfigurowany, aby spełnić wymagania dotyczące wykrywania porządku ciętych tytoni w papierosach heat-not-burn. Składał się głównie z kamery przemysłowej, obiektywu przemysłowego, źródła światła wizyjnego i jednostki sterującej przemysłowej. System zastosował przemysłową kamerę MV-CH120-10GC sparowaną z przemysłowym obiektywem MV-KF0818M-12MP, aby uchwycić wysokiej jakości obrazy regionu ciętych tyton na powierzchni przekrojonych trzonków papierosów. Kamera została umieszczona w odległości roboczej 150 mm od powierzchni trzonka papierosa. Źródło światła LED zostało zamontowane współosiowo z kamerą w odległości 80 mm od celu, z kątem padania 45°. Obrazowanie odbywało się wewnątrz matowo-czarnej obudowy, aby wyeliminować zakłócenia światła otoczenia. Obudowa jest malowana matowo-czarnym aluminium o wymiarach wewnętrznych 400 mm (szerokość) × 350 mm (głębokość) × 300 mm (wysokość), a powierzchnie wewnętrzne pokryte są matowo-czarnymi farbami (odbicie < 5% przy 550 nm) aby zminimalizować wewnętrzne odbicia i zapewnić jednolite warunki oświetlenia. Aby zapewnić jakość obrazu i konsystencję, zastosowano źródło światła MV-LRDS-H-95-30-W, aby stworzyć stabilne środowisko oświetleniowe, minimalizując wpływ zmian światła otoczenia na ekstrakcję konturów pasków tytoniu i rozpoznawanie orientacji. Nabyte obrazy były odbierane, przetwarzane i przechowywane przez komputer przemysłowy PC1010-AX360, który również wykonywał kolejne algorytmy rozpoznawania, obliczenia wyników i wyjście interfejsowe. Nie wykonano żadnej eksplicitnej kalibracji kamery ani korekcji zniekształceń, ponieważ kombinacja przemysłowej kamery i obiektywu wykazywała zaniedbywalne zniekształcenia radialne (mniej niż 0,5% na krawędziach obrazu) w obrębie pola widzenia 896 × 1600 pikseli. Kamera i źródło światła były sztywno zamontowane na stałym ramieniu, aby zapewnić stabilność pozycyjną podczas akwizycji obrazu. Intensywność światła była utrzymywana na stałym poziomie przez cały czas akwizycji obrazu. Pole widzenia zostało skonfigurowane tak, aby w całości obejmować wystawiony region ciętych tyton w obrębie stalowej struktury wsporczej.

Ustawienia parametrów kamery
Akwizycja obrazów była wyzwalana, a obrazy były zapisywane w formacie JPG po pozycjonowaniu i przekrojeniu próbki papierosa. Aby zapewnić spójność nabytych obrazów, parametry akwizycji były ustawiane ręcznie. Konkretnie, rozdzielczość obrazu została ustalona na 896 × 1600. Czas ekspozycji został początkowo ustawiony na 4000 μs i mógł być dostosowywany w zakresie 3000 do 6000 μs w zależności od jasności w miejscu realizacji. Wszystkie dostosowania parametrów były wykonywane z próbką umieszczoną wewnątrz matowo-czarnej obudowy opisanej powyżej, w pełni kontrolowanych warunkach oświetleniowych. Podczas dostosowywania nie było żadnego zewnętrznego światła otoczenia, ponieważ system obrazu działał w całkowicie zamkniętym środowisku z wyłączonymi światłami pokojowymi. Zysk został początkowo ustawiony na 2 dB i kontrolowany w zakresie 0 do 6 dB w zależności od poziomów hałasu. Wartość gamma została ustalona na 0,8, a ustawienie balansu bieli skonfigurowano z ustalonymi parametrami. Ostateczne parametry akwizycji zostały ustawione następująco: czas ekspozycji = 4000 μs, zysk = 2 dB, gamma = 0,8, tryb balansu bieli = ustalony, rozdzielczość obrazu = 896 × 1600 pikseli, a format obrazu = JPG. Dla balansu bieli zastosowano tryb z ustalonymi parametrami. Kalibracja została przeprowadzona za pomocą standardowej karty referencyjnej bieli (X-Rite ColorChecker) umieszczonej w pozycji próbki. Zysk kanałów czerwonego i niebieskiego został dostosowany, aż wartości RGB karty białej zostały zrównane w granicach ±2% odchyłki. Po kalibrację parametry balansu bieli zostały ustalone następująco: zysk czerwony = 1,2, zysk zielony = 1,0 (ustalony), a zysk niebieski = 1,5. Kalibracja była wykonywana raz po każdym uruchomieniu systemu lub zawsze wtedy, gdy źródło światła wykazywa

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Środowisko eksperymentalne
Wszystkie eksperymenty przeprowadzono w ramach głębokiego uczenia PyTorch, a szczegółowe konfiguracje sprzętowe i programowe podsumowano w Tabeli 1. Łącznie 634 obrazy zostały losowo podzielone na zestawy treningowe, walidacyjne i testowe w stosunku 7:2:1. Podczas treningu obrazy wejściowe były jednolicie zmniejszane do 896 × 1600 pikseli, a początkowa szybkość uczenia była ustawiona na 0,01. Stosowano stochastyczny optymalizator gradientu opadania, o wspó...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kluczową zaletą proponowanego modelu wykrywania porządku w wycinaniu tytoniu jest równowaga między dokładnością wykrywania a efektywnością obliczeniową. Zadanie to wymaga przetwarzania w czasie rzeczywistym licznych drobnoziarnistych ciętych tytoniów na obrazach o wysokiej rozdzielczości, co nakłada surowe wymagania dotyczące precyzji i szybkości modelu. Jak pokazano w Tabeli 2, proponowany model osiąga najwyższe mAP@0,5 (89,9%) w wykrywaniu ciętych podpór tytoniowych i stalowych spośród porównywanych de...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak bezpośrednich konkurujących interesów finansowych. Badania te zostały przeprowadzone w Longyan Tobacco Industrial Co., Ltd., która dostarczyła scenariusza zastosowania oraz dane terenowe do badania. Autorzy naukowi nie deklarują żadnych finansowych ani niefinansowych konfliktów interesów dotyczących publikacji tej pracy.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badania te zostały sfinansowane z projektu dotyczącego technologii pomiaru produkcji dla produktów papierosowych z metodą "heat-un-burn" oraz kontroli temperatury i wilgotności środowiska (Grant nr FJZYKJJH2022YB014).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Czytnik koduHikvisionID5050Używany do odczytu kodów kreskowych na paletach; Wymaga zasilania 24 V
Zbiór danych (obrazy ciętego tytoniu)Longyan Tobacco Industrial Co., Ltd.Nie maNiestandardowy zestaw danych obrazów ciętego tytoniu wykorzystywany do trenowania, walidacji i testowania modeli
Framework do głębokiego uczenia (PyTorch 2.1.0)Fundacja PyTorchOprogramowanie open-sourceWykorzystywane do tworzenia i treningu modeli głębokiego uczenia
Kamera przemysłowaHikvisionMV-CH120-10GCWykorzystywane do akwizycji obrazu; Wymaga zasilania 24 V
Komputer przemysłowyTechnologia YanzhiPC1010-AX360Wykorzystywane do przetwarzania obrazów, wnioskowania modeli oraz przechowywania danych
Źródło światła LEDHikrobotMV-LRDS-H-95-30-WŹródło światła paskowego zapewnia stabilne oświetlenie do obrazowania
SoczewkaHikvisionMVL-KF0818M-12MPOgniskowa: 8 mm; zakres przysłony: F1.8– F16; Rozdzielczość 12 MP
Metalowe uchwytyLongyan Tobacco Industrial Co., Ltd.Stop aluminium 7075-T6Wykorzystywane do montażu i stabilizacji elementów sprzętowych
Kable siecioweLongyan Tobacco Industrial Co., Ltd.RJ45 Crystal HeadWykorzystywane do łączenia komputerów przemysłowych, aparatów i urządzeń sieciowych
Python (wersja 3.9)Python Software FoundationOprogramowanie open-sourceŚrodowisko programistyczne do implementacji
ZmianaTP-LinkTL-SH10058 portów Ethernet; wymaga zasilania 220 V
Bezprzewodowy punkt dostępu (moduł komunikacji przemysłowej)Shandong Huachuang XunlianBH-ANT5158S-14HV; BH-MS-AC1600HWHUmożliwia bezprzewodową komunikację między kamerą a komputerem przemysłowym
Oprogramowanie sterujące kamerą (MVS)HikvisionV4.5.1Wykorzystywane do debugowania kamery, konfiguracji parametrów oraz akwizycji danych
Oprogramowanie do przetwarzania obrazu (Vision Master)HikvisionV4.3.0Wykorzystywane do dopasowywania szablonów i wykrywania wyników obrazów
Zintegrowane środowisko programistyczne (PyCharm)JetBrains2020.1.3 x64Wykorzystywane do tworzenia modeli i wdrażania systemów
CUDA Toolkit (wersja 12.1)NVIDIAZestaw narzędzi programowych (brak numeru katalogowego)Umożliwia przyspieszenie GPU do trenowania i wnioskowania

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Ocena uporz dkowaniadetekcja w czasie rzeczywistymdownsampling cechwieloskalowa fuzja cechdynamiczna g owica detekcjipredykcja orientacjiprzemys owy zbi r obraz woptymalizacja jako ci produkcji

Powiązane artykuły