Araştırma makalesi

Geliştirilmiş tek aşamalı regresyon mimarisine dayalı gerçek zamanlı nesne tespit modeli

DOI:

10.3791/69657

9 Ocak 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Otomatik depolarda tıkanma ve aydınlatma değişiklikleri gibi zorlukları ele almak için, bu makale sigara kutusu markası tespiti için geliştirilmiş Tek Aşamalı Regresyon Mimarisi sunmaktadır. Uyarlanabilir aşağı sampling, ters verilmiş çok ölçekli dikkat mekanizması ve dinamik bir tespit başlığı entegre edilerek, önerilen model doğru, gerçek zamanlı akıllı stoklama gerçekleştirir.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Otomatik sigara envanterinin görsel tanıması, aydınlatma değişiklikleri, farklı kutu boyutları ve kısmi özellik kapatılması gibi önemli engellerle karşı karşıyadır; bu da marka doğrulamasını ve yanlış yerleştirilmiş kutu tespitini zorlaştırır. Bu makale, görüntü tanıma sorunlarıyla başa çıkmak ve doğruluğu artırmak için geliştirilmiş bir gerçek zamanlı algılama modeli önermektedir. İlk olarak, YOLO serisinin hem omurga hem de boyun ağlarında aşağı sampling konvolüsyon modülünün yerine baz veya orijinal dedektör olarak adaptif bir downsampling modülü yerleştirilir; bu modül, daha fazla özellik detayını korur ve modelin hafifliğini fark eder. İkinci olarak, farklı ölçeklerin mekansal bağlam bilgisini yakalamak ve daha doğru bir uzamsal dikkat haritası oluşturmak için ters verilmiş çok ölçekli bir dikkat modülü tanıtılır; bu da karmaşık özellikler ve tıkanma hedefleri için temel modelin tahmin doğruluğunu artırır. Son olarak, dinamik bir algılama kafa modülü, temel modelin orijinal tespit başlığını değiştirir ve omurga ve boyun ağlarından çıkarılan özellik haritasında çok ölçekli nesne tespiti yapar; böylece tahmin edilen hedefin doğru konumlandırılması ve kategori bölünmesi sağlanır. Geliştirilmiş modelin sahadaki performansını değerlendirmek için, sigara kutusu markasının görsel bir veri setini oluşturduk. Veri seti, bölgeye özgü kopyala-yapıştır ve geleneksel artırma teknikleriyle genişletilmiş ve elde edilen veri seti karmaşık arka plan, tıkanma ve örtüşme, küçük hedef ve diğer faktörleri içerir. Deney, bu makalede sunulan geliştirilmiş modelin sahada gerçek zamanlı tespit gereksinimlerini etkili bir şekilde karşıladığını göstermektedir. Önerilen model, parametre ve FLOP'lar sırasıyla 1.849.679 ve 5.1 G ile %97,9 mAP elde etmektedir. Temel modele kıyasla önerilen model, mAP'yi %0,9 artırırken parametreleri %28,78 ve kayan nokta işlemlerini 1,4 G azaltmaktadır. Ayrıca, model 38,5 FPS çıkarım hızına ulaşarak gerçek zamanlı endüstriyel tespit gereksinimlerini karşılar.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modern üretim ve lojistik, yüksek yoğunluklu depolama, verimli malzeme taşıma ve doğru envanter yönetimi sağlamak için Otomatik Depolama ve Geri Alma Sistemlerine (AS/RS)1 büyük ölçüde dayanır. AS/RS, yüksek verimliliği ve akıllı özellikleri sayesinde işletmelerin depo verimliliğini artırmasına ve maliyetleri düşürmesine yardımcı olabilecek kritik bir araç haline gelmiştir. Çok katmanlı raflar, çeşitli yükleme ve boşaltma ekipmanlarından oluşan AS/RS, bilgisayar kontrollü bir mekatronik sistemdir ve mekanik, elektronik, bilgisayar bilimi, iletişim, ağ, sensörler ve otomatik kontrol 2,3 dahil olmak üzere birden fazla teknolojiyi entegre eder. AS/RS, rafların, istem vinçlerinin, konveyör hatlarının, kontrol sistemlerinin ve diğer ekipmanların entegrasyonu ve optimizasyonu yoluyla ürünlerin verimli, doğru ve güvenli depolanması ve taşınmasını sağlar; bu da depolama verimliliğini büyük ölçüde artırır. Endüstri 4.0'ın temel bir yönü olan bilgisayar görme teknolojisinin AS/RS'ye entegrasyonu, sistemlerin görsel verilere dayanarak görme ve karar vermesini sağlayarak eşi benzeri görülmemiş otomasyon ve zeka seviyelerini sağlar4.

AS/RS'nin tütünfabrikalarında yaygın uygulanmasıyla birlikte, sigara kutusu markaları için yeni bir stok gereksinimi önerildi. Geleneksel manuel stok değerlendirme yöntemleri verimsizlik, yüksek yanlış tespit oranları ve AS/RS ihtiyaçlarını karşılamayan güvenlik risklerinden muzdariptir. Bilgisayar görme teknolojisinin sürekli ilerlemesiyle birlikte, makine görüşü çözümleri endüstriyel denetimalanlarında giderek daha fazla uygulanmaktadır 6,7,8. Marka bilgileri her sigara kutusunda benzersiz desenler ve metinlerle basıldığı için, makine görüşüne dayalı görüntü tanıma teknolojisi, sigara kutusu markasının tanımlanması ve stoklama yapılmasını mümkün kılar.

2012'den bu yana, derin öğrenme tabanlı nesne algılama algoritmaları görüntütanıma 9,10,11'de önemli atılımlar getirdi. R-CNN12 gibi erken iki aşamalı nesne algılama modellerinden, temel veya orijinal dedektör 13,14,15 olarak YOLO serisi modellerinin hakim olduğu çağdaş tek aşamalı nesne algılama modellerine kadar, bu yaklaşımlar nesne algılama algoritmalarının gelişimine önemli katkılar sağlamıştır. Akıllı stok yapma görevleri, görüntü veya videolarda birden fazla hedefi doğru şekilde tanımlamak ve konumlandırmak için nesne tespit modellerini giderek daha fazla kullanır. Li ve ark.16, stok verimliliğini ve doğruluğunu artırmak için tartı sensörleri ve görüntü tanıma teknolojisini entegre eden akıllı bir stok değerlendirme yöntemi önermiştir. Wang ve ark.17, kitaplık numarası ve başlık konumunu kitap sırt görüntüsünden ayırmak için maske R-CNN kullandı. Sun ve ark.18, OpenCV kullanarak materyaller ve raflar üzerindeki iki boyutlu kodları çoklu modda tanıyan entegre bir görsel tanıma sistemi tasarladı. Orijinal dedektörü (v5s) C3CBAM dikkat mekanizması ve SimOTA etiket atamasını ekleyerek kayıp fonksiyonlarını artırarak doğru çoklu materyal tespiti için optimize ettiler.

Nesne tespiti alanında, Faster R-CNN ile temsil edilen iki aşamalı modeller tespit hassasiyetinde geleneksel avantajlara sahip olsa da, karmaşık bölge öneri oluşturma mekanizmaları nispeten yavaş çıkarım hızlarına yol açar. Sonuç olarak, endüstriyel senaryolarda gerçek zamanlı performans için katı gereksinimleri karşılamaktazorlanırlar 19,20. Buna karşılık, regresyon tabanlı mimari, nesne algılamayı tek bir regresyon problemi olarak ele alır ve giriş görüntülerinden hedef konumları ve kategori olasılıklarını doğrudan tahmin eder. Bu mimari tasarım, modellerin çıkarım verimliliği, hafiflik ve dağıtım esnekliği açısından çoğu iki aşamalı modeli önemli ölçüde geride bırakmasını sağlarken, rekabetçi doğruluğu korur. Böylece, bu mimari gerçek zamanlı endüstriyel tespit için tercih edilençözüm haline gelmiştir 21.

Orijinal model ekosistemi hızla evrilmeye devam ediyor ve son varyantlar belirli zorlukları ele alıyor. Örneğin, orijinal dedektör(v12)22, daha iyi doğruluk-verimlilik takasları için eğitim süresi optimizasyonunu ve mimari iyileştirmeyi daha da geliştirmeye odaklanır. Bu arada, orijinal dedektör (Dünya)23, vizyon-dil modellemesinden faydalanarak eğitim seti kategorilerinin ötesinde çok çeşitli nesnelerin gerçek zamanlı çıkarımını mümkün kılan açık kelime algılama yetenekleri sunar. Bu gelişmeler genel amaçlı nesne algısının sınırlarını zorlasa da, bu çalışma, kısmi kapanma ve aydınlatma varyansı gibi belirli zorluklara dayanıklılığın ön planda olduğu ve kategori alanının önceden sabit ve bilindiği özel endüstriyel uygulamalara odaklanmaktadır. Bu model ailesinin en sıcak versiyonu olarak, temel model24, orijinal dedektör(v8)25,26'dan avantajlar alır; Sadece model parametrelerinin sayısını azaltmakla kalmaz, aynı zamanda tespit verimliliği ile doğruluk arasında bir denge de göz önünde bulundurur. Diğer nesne algılama modelleriyle karşılaştırıldığında, görsel tanıma görevlerinde öne çıkar.

Küçük veya kısmen tıkanmış sigara kutularını tespit etme zorluğu, bilgisayar görüşündeki daha geniş bir sorunun bir tezahürüdür. Küçük nesne algılama, özellik piramit ağı (FPN) iyileştirmelerinden çok ölçekli özellik işlemenin entegrasyonuna ilham veren bağlama duyarlı dikkat mekanizmalarına kadar uzanan yaklaşımlarla aktif olarak araştırılmıştır. Ayrıca, endüstriyel ortamda operasyonel verimlilik arayışı, hafif bir model tasarımı gerektirir. MobileNetV328 ve GhostNet29'da incelenen verimli mimari kavramlarından ilham alan bu kavramlar, sunum yeteneğini korurken hesaplama karmaşıklığını azaltmak için derin konvolüsyon ve doğrusal dönüşüm kullanır; bu nedenle modeli geliştirmek için bazı hafif modüller seçiyoruz. Bu nedenle, sigara kutusu markalarının stok sayısını ve aydınlatma değişiklikleri, çeşitli markaların özellik boyutu farklılıkları ve sigara kutuları arasındaki kısmi kapanma gibi stoklama faktörlerini ele almak için, bu makalede geliştirilmiş tek aşamalı regresyon mimarisi nesne algılama modeli öneriyoruz.

Önerilen modelin başlıca yenilikleri üç unsurdan oluşur. İlk olarak, Adaptif Downsampling (ADown)30modülü, hem omurga hem de boyun ağlarında standart konvolüsyon downsampling yönteminin yerini almak üzere kullanılmıştır. Bu yenilikçi tasarım, küçük marka logoları ve metinlerinin korunması için kritik olan özellik sıkıştırma sırasında bilgi kaybını azaltır. İkinci olarak, modeli dinamik, çok ölçekli bağlamsal algı ile güçlendirmek için ters ters Verimli Çok Ölçekli Dikkat (iEMA) mekanizması tanıtılır ve böylece küçük ve kısmen kapalı sigara kutularında performansını önemli ölçüde artırır. Üçüncü olarak, orijinal tespit başlığı, ölçek, mekansal ve görev farkında dikkatleri birleştiren DynamicHead31 modülü ile değiştirilmiştir; bu modül, çok farklı boyuttaki hedefler arasında daha hassas yerelleştirme ve sınıflandırma sağlar. Bu mimari değişiklikler, endüstriyel ortamlarda sigara markası tanımlamasının özel sorun noktalarını gidermek için bütünlükle tasarlanmıştır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu makalede kullanılan veri seti, Longyan Tütün Endüstrisi Şirketi, Ltd.'nin Lojistik Departmanı'nın AS/RS alanından alınmıştır. Bu çalışma insan katılımcıları veya hayvanları içermedi. Etik onay gerekmiyordu.

Veri seti edinimi ve kurulumu
Donanım konfigürasyonu: 8 mm odak mesafeli lensle (örneğin MVL-HF0828M-6MPE) donatılmış endüstriyel bir kamera (örneğin, MV-CA013-A0GM) stacker vincinin yük platformuna monte edilir. Kamerayı bir kontrol PC'ye GigE kablosu ve kablosuz bir AP cihazı (örneğin, BH-ANT5158S-14HV, BH-MS-AC1600HWH) ile bağlayın. Kameranın etrafına bir şerit LED ışığı (örneğin, MV-LLDS-1002-38-W) yerleştirerek eşit aydınlatma sağlanır.

Kamera parametre ayarı: Üreticinin yazılımı (örneğin, MVS) kullanılarak kamerayı yapılandırın. Alım çözünürlüğünü 1280 x 1024 piksel olarak ayarlayın. Tetik modunu Donanım Tetik olarak ayarlayın ve stacker vincinin konumlandırma sistemiyle senkronize edin. Pozlama süresini 100 ms'e, gain seviyesini ise 5 dB'ye ayarlayarak hareket bulanıklığını ve gürültüyü en aza indirin. Kamera ile sigara kutuları arasındaki çalışma mesafesi yaklaşık 550 mm'dir.

Görsel koleksiyonu: Tetikli endüstriyel bir kamera, sigara kutularının saklanması ve alınması sırasında bir tepsi yerleştirildiğinde otomatik olarak bir görüntü yakalar. Toplamda 4.835 ham görüntü toplayın; tipik görüntüler Şekil 1'de gösterilmiştir.

Görsel açıklama: Açık kaynak aracı LabelImg'yi kullanın. Her resim için, görünür her sigara markası özelliğinin etrafına sınırlı kutular çizin. Her sınırlayıcı kutu için sınıf etiketi olarak doğru marka adını (örneğin, Hongzhuang, Gutian) atayın. Açıklamaları standart tek aşamalı algılama formatında kaydedin; her görüntü için bir txt dosyası bulunuyor.

Kalite kontrolü: İkinci bir anlatıcı, annotlu görsellerin rastgele seçilmiş %20'sini inceler. Herhangi bir tutarsızlık tartışılıp çözülür, böylece etiketleme tutarlılığı sağlanır.

Veri artırma stratejisi
Bu bölüm, veri setlerine uygulanan geleneksel ve gelişmiş artırma tekniklerini detaylandırır. Başlangıç veri ve artırılmış veriler yeni bir veri setinde birleştirilir; bu veri seti, değerlendirmede adaleti sağlamak için eğitim seti, doğrulama seti ve test seti olarak ayrılır.

Geleneksel veri artırma32: Bu dönüşümler, eğitim boru hattı tarafından gerçek zamanlı olarak uygulanır (örneğin, Albumentations veya PyTorch Transforms kütüphaneleri kullanılarak) ve her parti için tanımlanmış bir olasılıkla.

Geometrik dönüşümler: Dönme: Görüntüleri -45° ile +45° arasında rastgele döndürür. Ölçeklendirme: Resimleri rastgele 0.8 ile 1.2 arasında bir kat ölçeklendir. Yatay çevirme: Görüntüleri %100 olasılıkla rastgele yatay çevir. Rastgele kırpma: Orijinal görüntü alanının %80 ile %100'ü arasında bir bölümü rastgele kırpın.

Fotometrik dönüşümler: Parlaklık ve Kontrast: [0.6, 1.4]'ten rastgele seçilen bir faktörle parlaklık ve kontrastı ayarlayın. Gauss gürültüsü: Standart sapma ile [0, 0.01 * 255] arasında rastgele seçilen Gauss gürültüsünü %10'una ekleyin. Gauss bulanıklığı: Görüntülerin %10'una 3x3 çekirdek boyutuna sahip bir Gauss bulanıklığı uygulayın.

Oklüzyon simülasyonu: Görüntülere rastgele 1 ila 3 dikdörtgen tıkanma yaması (her biri görüntü alanının %5'ine kadar) yerleştirin. Yamalar rastgele gürültü veya ortalama görüntü piksel değerleriyle doldurulur.

Gelişmiş veri artırma: bölgeye özgü kopyala-yapıştır
Motivasyon ve etki: Bu hedefli artırmanın temel motivasyonu, kritik bir veri sorununu ele almaktı: birkaç sigara markasında çok az örnek (tek bir görüntü kadar) bulundu. Standart rastgele bir tren doğrulama testi bölünmesi, nadir bir markanın tüm örneklerini tek bir kümeye (örneğin, hepsi test setine) tahsis edebilir ve bu da modelin o markayı öğrenme veya doğrulama fırsatı olmamasına neden olabilir. Bu yöntem, az temsil edilen markalar için numune büyüklüğünü yapay olarak artırdı ve her markanın eğitim, doğrulama ve test setleri arasında yeterli sayıda örnek olmasını sağladı. Bu temel adım, nadir kategorilerde felaket arızalarını önler ve tüm marka setinde anlamlı bir model performansı ve genelleme için ön koşuldur.

Bu adım, başlangıç veri seti ve Segment Anything Model (SAM)33 üzerinde önceden eğitilmiş segmental temel model gerektirir.

Segment kaynak nesneleri: Az temsil edilen markalardan gelen sigara kutusu görüntüleri için, SAM modelini kullanarak hassas segmentasyon maskeleri oluşturun. Segmentasyonu başlatmak için Sigara Kutusunun Marka Özelliği'ne tıklayarak puan istemi modunu kullanın. Oluşturulan maskeleri elle doğrulayın ve doğruluk için geliştirin. Şeffaf arka planlı segmentlenmiş sigara kutusu görüntülerini PNG dosyaları olarak kaydet. Bu, izole nesne örneklerinden oluşan bir kütüphane oluşturur.

Arka plan maskeleri oluşturun: Önceden eğitilmiş segmental temel modeli kullanarak bir dizi arka plan görüntüsünde (bol boş alan veya basit arka planlara sahip resimler) örnek segmentasyonu gerçekleştirin. Model, nesnelerin zaten işgal ettiği bölgeleri gösteren ikili maskeler üretecektir.

Maskeleri ve nesneleri yapıştırma işlemi: Her arka plan maskesi için, OpenCV kütüphanesini ('cv2.approxPolyDP' fonksiyonu, epsilon faktörü 0.02 * kontur çevresi) kullanarak eğri uyumunu gerçekleştirin ve maske kenarlarını doğrusal hale getirerek boş alanın basitleştirilmiş bir çokgen temsili elde edin. Arka plan maskesi içindeki en büyük bitişik çokgen alanını hedef yapıştırma bölgesi olarak belirleyin. Kütüphaneden rastgele segmentlenmiş bir kaynak nesne seçin. Boyutunu değiştirin (en-boy oranını koruyun) ve hedef yapıştırma bölgesine doğal olarak uyacak şekilde affine dönüşüm uygulayın (-5° ile +5° arasında küçük bir dönüş ve hafif kayma), böylece mevcut nesnelerin sınırlarıyla örtüşmemesini sağlar. Dönüştürülmüş nesneyi hesaplanan konumdaki arka plan görüntüsüne sorunsuz yapıştırmak için alfa karıştırma kullanın. Belirli alanlarda kopyala-yapıştır tekniğine dayanan veri artırma teknolojisinin genel çerçevesi Şekil 2'de gösterilmiştir. Yapıştırılan nesne için programatik olarak uygun yeni bir txt annotasyon dosyası oluşturulur, sınırlayıcı kutu koordinatları ve sınıf etiketi güncellenir.

Son artırılmış veri seti: Bu çevrimdışı süreç 600 yeni sentetik görüntü üretir. Bunları, yukarıda açıklanan geleneksel artırma teknikleri uygulanarak oluşturulan orijinal 4.835 görüntü ve ek 1.167 görüntüyle birleştirerek nihai 6.602 görüntü veri setini oluşturur. Son veri setini eğitim (%70, %4.621 görüntü), doğrulama (%20, 1.320 görüntü) ve test (%10, 661 görüntü) setlerine ayırın; böylece aynı orijinal diziminden görüntülerin aynı bölünme içinde tutulmasını sağlayarak veri sızıntısını önleyin.

Önerilen geliştirilmiş dedektör için model değişikliği
Nesnealgılama algoritmaları 34 için optimize edilmiş algoritmalar, son yıllarda endüstriyel denetimde kayda değer ilerlemeler kaydetmiştir. Bu bölüm, önerilen modeli oluşturmak için temel model mimarisini değiştirmek için ayrıntılı ve adım adım bir prosedür sunar. Değişiklikler, modelin yapılandırma dosyasının (örneğin, config.yaml) düzenlenmesiyle ve ilgili özel modül tanımlarının kod tabanına dahil edilmesinden sağlanarak gerçekleştirilir. Her değişikliğin gerekçesi, belirli tespit zorluklarını ele almadaki rolünü açıklamak için sunulur. Önerilen modelin yapısı Şekil 3'te gösterilmiştir.

Downsampling modüllerinin ADown modülü ile değiştirilmesi: Aşağı samplama için kullanılan standart Convolution-BatchNorm-SiLU (CBS) modülü, tek bir kademeli konvolüsyon kullanır; bu modül, bilgidarboğazı 35 olarak görev yapabilir ve küçük sigara kutularını ve ayrıntılı marka logolarını tanımak için kritik olan ince taneli özellikleri potansiyel olarak ortadan kaldırabilir. ADown modülü, mekansal çözünürlük azaltma sırasında daha zengin bir özellik setini yakalayan ve koruyan çift dallı bir yapı uygulayarak bu durumu hafifletmek üzere tasarlanmıştır. Bir dal yüksek frekanslı yerel detayların tutulmasını önceliklendirirken, diğeri daha geniş ve bağlam açısından zengin bir genel bakış sunuyor. Bu tamamlayıcı özelliklerin birleşimi, sonraki katmanlar için daha sağlam ve bilgilendirici bir temsil ortaya çıkarır.

Eylem-uygulama adımları
Modül tanımı: Projenin model tanım dosyalarında ADown adlı özel bir PyTorch modülünün tanımlandığından emin olun. Bu modül iki paralel dal içermelidir. İlk dal, 3x3 çekirdekli ve 2 adımlı iki boyutlu bir konvolüsyon katmandan oluşmalıdır. İkinci dal, ardışık olarak 2x2 maksimum havuzlama katmanı (adım 2 ile) ve ardından 1x1 konvolüsyon katmanından oluşmalıdır. Bu iki dalın çıktıları kanal boyutu boyunca birleştirilecek ve ortaya çıkan özellik haritası, kanalları entegre etmek ve çıktıyı üretmek için son 1x1 konvolüsyon katmanından geçirilecektir. ADown modülünün yapısı Şekil 4'te gösterilmiştir.

Yapılandırma dosyası düzenleme: Temel model yapılandırma dosyasını (config.yaml) açın. Aşağı örnekleme için yapılandırılmış her CBS modül örneğini sistematik olarak tanımlayın (yani adım parametresi 2'ye ayarlanmış). Bu CBS modül girişlerinin her birini yeni ADown modülü ile değiştirin.

Tasarım motivasyonu: ADown tasarımı, standart çizgili konvolüsiyalarda bilgi kaybını azaltma ihtiyacından kaynaklanır; bu da küçük nesneler için zararlı olabilir. Çift dal yapısı, hem yüksek frekanslı uzamsal detayları (konvolüsyon aracılığıyla) hem de düşük frekanslı bağlamsal bilgileri (havuzlama yoluyla) yakalamak için paralel işleme fikrinden ilham alarak sonraki katmanlar için daha zengin çok ölçekli özellik temsili sağlar.

iEMA modülünün entegrasyonu
Gerekçe ve tasarım ilkesi: Modelin küçük hedefleri ve kısmen gizlenmiş hedefleri tespit etme yeteneğini artırmak için, çok ölçekli mekânsal bağlamı etkili şekilde modelleyebilen bir mekanizmanın dahil edilmesi şarttır. iEMA modülü, bunu bir ters çevrilmiş kalıntı blok (iRMB)37 yapısına Verimli Çok Ölçekli Dikkat (EMA)36 bileşeni gömmekle başarır. iRMB, derinlik açısından ayrılabilir konvolüsyonlar kullanarak hesaplama açısından verimli bir temel sağlarken, EMA bileşeni paralel çok dal tasarımı aracılığıyla çapraz ölçekli mekansal etkileşimleri açıkça yakalar. Bu entegrasyon, modelin özellik ağırlıklarını dinamik olarak yeniden kalibre etmesini sağlar; farklı ölçeklerde en ayırt edici mekansal bölgelere odaklanır, böylece kapatma altında ve küçük nesneler için tanıma daha iyi olur.

Eylem-Uygulama Adımları
Modül tanımı: iEMA adlı özel bir PyTorch modülünün tanımlandığından emin olun. Bu modül önce ters çevrilmiş bir kalıntı bloğu uygulamalıdır. Bu blok genellikle kanal genişlemesi için noktasal bir konvolüsyonla başlar, ardından mekânsal özellik çıkarımı için derinlik konvolüsyonu (örneğin, 3x3) ve son olarak kanal projeksiyonu için nokta dönüşümü yapılır. Bu bloklamadan hemen sonra EMA dikkat mekanizması uygulanmalıdır. EMA mekanizması genellikle gruplanmış konvolüsyonlar ve boyutlar arası etkileşimler kullanarak aşırı hesaplama yükü olmadan çok ölçekli bir uzamsal dikkat haritası verimli şekilde üretir. iEMA modülünün yapısı Şekil 5'te gösterilmiştir.

Yapılandırma dosyası düzenleme: config.yaml yapılandırma dosyasında, boyun ağını tanımlayan bölümleri, özellikle C2f modüllerinin hemen ardından gelen katmanları bulun. Bu stratejik konumlarda, iEMA modülünü çağıran yeni bir katman ekleyin.

Tasarım motivasyonu: iEMA modülü, yerel özellik çıkarımı (derinlik yoluyla konvolüsyon) hafif ama etkili bir küresel bağlam modelleme mekanizması (EMA) ile entegre ederek özellik ayırt edilebilirliğini artırma ilkesine dayanır. Bu hibrit yaklaşım, modelin farklı ölçeklerdeki bilgilendirici bölgelere uyarlanabilir şekilde odaklanmasını sağlar; bu, kısmen görünür marka logoları ve metinlerini tanımak için çok önemlidir.

Algılama başlığının DynamicHead modülü ile değiştirilmesi
Gerekçe ve tasarım prensibi: Orijinal tespit başlığı, sigara kutularının önemli ölçek değişimlerini ve yerelleştirme ile sınıflandırma görevleri arasındaki karmaşık etkileşimi optimal şekilde yönetemeyebilir. DynamicHead modülü, üç dikkat biçimini tutarlı bir yapıda birleştirerek bunu ele alır: ölçek farkında, mekânsal farkında ve görev farkında dikkat. Ölçek farkında bileşen, özellik piramidinin farklı seviyelerindeki özellikleri dinamik olarak birleştirerek her boyuttaki nesnelerin etkili şekilde temsil edilmesini sağlar. Mekansal farkındalık bileşeni, hesaplama kaynaklarını özellik haritalarındaki en bilgilendirici bölgelere odaklamak için seyrek bir örnekleme stratejisi kullanır. Göreve duyarlı bileşen, özellik temsilini özellikle sınırlayıcı kutu regresyonu ve kategori sınıflandırması gibi farklı amaçlar için uyarlar. Bu birleşik yaklaşım, daha doğru ve sağlam tahminlere yol açar.

Eylem-Uygulama Adımları
Modül tanımı: Bu, (1)'den (4'e) kadar denklemlerle tanımlanan üç dikkat mekanizmasını kapsayan karmaşık bir modüldür. İç yapısı, ölçekli ağırlıkların hesaplanması, deforme edilebilir mekânsal dikkat uygulanması ve göreve özgü özellik dönüşümlerinin uygulanması için katmanları içerecektir.

Denklem 1(1)

Denklem 2(2)

Denklem 3(3)

Denklem 4(4)

BuradaW L(F), giriş özelliği F'ye ölçek farkında πL(F), mekânsal π farkındaS(F) ve göreve duyarlı πC(F) dikkat mekanizmalarının ardışık uygulanmasıyla elde edilen nihai dikkat ile rafine edilmiş özellik haritasını gösterir. Özellikle, Eq. (2)'deL(F π) önce mekânsal (S) ve kanal (C) boyutları arasında ortalama alarak ölçek bazında bir dikkat ağırlığını hesaplar; bunu doğrusal bir fonksiyon f(⋅) ve sert sigmoid aktivasyon σ(⋅) üzerinden geçirir. Eq. (3)'te πS(F), K örneklenmiş anahtar nokta p k'dan özellikleri toplayarak seyrek mekânsal dikkat gerçekleştirir; her biri öğrenilebilir bir ofset Δp k ile ayırt edici bölgelere ve önem skaler Δmk üzerine odaklanır. Eq. (4)'te πC(F), her kanala doğrusal bir dönüşüm (α1, β1,α 2,β 2)) uygulayarak görev farkında bir dikkat uygular ve maksimum yanıtı seçer, böylece başlık sınıflandırma ve regresyon görevlerinde uzmanlaşabilir. DynamicHead modülünün yapısı Şekil 6'da gösterilmiştir.

Yapılandırma dosyası düzenleme: config.yaml dosyasında, modelin başını tanımlayan bölümü bulun; bu bölüm aslında Detect modülünü içerir. DinamikHead modülünü çağıran yeni bir giriş ile değiştirin.

Tasarım motivasyonu: DynamicHead modülü, nesne algılama başlıklarının ölçek, mekansal konum ve göreve uyarlanabilir olması gerektiği gözlemine dayanır. Birleşik dikkat çerçevesi, Eqs ile resmileştirilmiş (1-4), modelin bu üç boyuta dayalı özellik yanıtlarını dinamik olarak yeniden kalibre etmesini sağlar ve ölçek varyasyonu ile arka plan karmaşasına karşı daha sağlam tahminler sağlar.

Model eğitimi
PyTorch 2.1.0, CUDA 12.1 ve tüm bağımlılıkların kurulduğundan emin olun.

Eğitim komutanlığı
Yeniden eğitimden önce, bölünmüş görüntü verisi ve annotasyon verilerini standart tek aşamalı tespit formatında hazırlayın. Görüntü yolu ve veri kategorisini içeren bir .yaml dosyası oluşturun. Model iyileştirmesine göre, orijinal dedektör .yaml dosyası önerilen model .yaml dosyasıyla değiştirilmiştir. train.py dosyasını yazın, tek aşamalı dedektör paketini içe aktarın, eğitim modelini ve veri yolunu yükleyin ve imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 vb. gibi bazı eğitim parametrelerini belirleyin.

Hiperparametreler: Ana parametreler şunlardır: giriş görüntü boyutu (640 x 640), parti boyutu (4), kosinüs tavlama zamanlayıcı ile başlangıç öğrenme oranı (0.01), momentumlu SGD optimizatoru (0.937) ve ağırlık azalması (0.0005). Mozaik artırma varsayılan olarak etkinleştirilmiştir.

Eğitim izleme: Eğitim süreci, her dönem için metrikler üretecektir. Eğimleri/doğrulama kaybı ve mAP 0.5'te izleyerek yakınsamayı ve aşırı uyumu önleyin. 100 dönem için eğitim genellikle yeterlidir.

Model değerlendirmesi ve dağıtımı
Değerlendirme: Eğitimden sonra en iyi model runs/train/exp/weights/best.pt olarak kaydedilir. Val setinde şu şekilde değerlendirin: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Script, 0.5'te Precision, Recall, mAP vb. çıkarır. mAP'nin gerekli eşiği karşıladığını (örneğin, %97,9) doğrulayın.

Doğrulama için çıkarım: Tespit sonuçlarını görsel olarak doğrulamak için örnek görüntülerde çıkarım yapın: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Gerekçe doğrulanarak, her görüntünün tespit sonuçları ve modelin tespit hızı elde edilebilir.

Dağıtım: Stacker vincinin sisteminde gerçek zamanlı dağıtım için, PyTorch modelini (best.pt, ~4.7 MB) optimize edilmiş çıkarım hızı için TensorRT veya ONNX gibi bir formata dönüştürebilirsiniz. Son çıktı, sınıf etiketleri (marka adları) ve güven puanlarıyla sınırlanmış kutulardır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deneysel ortam ve parametre ayarı
Önerilen modelin performansını doğrulamak için yapılan deneyler, derin öğrenme çerçevesi PyTorch üzerinde yapıldı ve deneysel ortamın detayları Tablo 1'de listelenmiştir. Burada, 7:2:1 oranında rastgele eğitim, doğrulama ve test setlerine ayrılan 6.602 görüntü içeren özel bir veri seti kullandık. Tüm deneyler, 640 x 640 çözünürlükte giriş görüntüleri kullandı ve başlangıçta öğrenme oranı 0.01 oldu; bu oran, aşırı uyumu önlemek için 0.937 momentumlu st...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Doğruluk-verimlilik takası
Bu modelin temel başarılarından biri, doğruluk ile hesaplama verimliliği arasındaki üstün dengedir. Tablo 2'de gösterildiği üzere, sunulan model en yüksek mAP'yi sağlarken, aynı anda en düşük parametre sayısına ve karşılaştırılan tek aşamalı dedektör modelleri arasında ikinci en düşük FLOP'a sahiptir. Bu doğrudan pratik faydalara dönüşür: daha küçük bir model daha hızlı dağıtılır, daha az bellek gerektirir ve hem GPU hem de ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar doğrudan rekabet eden finansal çıkarlar belirtmemektedir. Bu araştırma, yazarlar Hongli Deng ve Wencan Li'nin çalıştığı Longyan Tütün Endüstri Co., Ltd. ile yazar Baobin Luo'nun çalıştığı Baoji Sigara Fabrikası ile iş birliği içinde gerçekleştirilmiştir. Bu bağlantılar, çalışma için uygulama senaryosu ve saha verilerini sağladı. Akademik yazarlar (Jun Liu, Jianguang Yi, Feng Yang, Xiaobo Zhao) bu çalışmanın yayımlanmasıyla ilgili finansal veya finansal olmayan çıkar çatışmaları belirtmemektedir.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Çin Zhejiang Eyalet Doğa Bilimleri Vakfı'nın Ortak Fonları tarafından finanse edilen Öncelikli Reflektör ve Çok Dalga Boylu Döküm Döküm Sıcaklık Ölçme Yöntemi (No.LZY24E050002) ve Quzhou Bilim ve Teknoloji Planlama Projesi tarafından finanse edilen Çevrimiçi Sıcaklık Alanı Ölçme Yöntemi (No. 2023K231) ile desteklenmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Kod OkuyucuHikvisionID5050Hikvision ekipmanı: Paletlerde barkod okumak için kullanılır, 24V güç kaynağı bağlanması gerekir
endüstriyel kameraHikvisionMV-CA013-A0GM, MV-CS016-10GM24V güç kaynağı bağlamam gerekiyor
LED ışığıHIKROBOTMV-LLDS-1002-38-WBir metrelik şerit ışık kaynağı, kamera için yeterli aydınlatma koşulları sağlar
LensHikvisionMVL-HF0828M-6MPEodak uzaklığı:8mm, diyafram aralığı:F2.8~F16, piksel:6 milyon
MVSHikvisionV4.5.1Hikvision yazılımı: Kameraların hata ayıklaması, kamera parametrelerinin ayarlanması ve veri toplama için kullanılır
PycharmJetBrains2020.1.3 x64Derin öğrenme modellerinin eğitimi ve tespit sistemleri geliştirmek için kullanılır
Birkaç metal braketLongyan Tütün Sanayi Şirketi, Ltd.7075-T6 Alüminyum AlaşımıKameraları ve kod okuyucuları tamir etmek için kullanılır
Birkaç ağ kablosuLongyan Tütün Sanayi Şirketi, Ltd.RJ45 Kristal KafaBaz istasyonunu endüstriyel bilgisayar ile kablosuz AP arasına bağlayın, kamera ve anahtarı bağlayın vb
SwicthTP-LinkTL-SH1005220V güç kaynağı gerektiren 8 Ethernet kablo arayüzü vardır
Vizyon UstasıHikvisionV4.3.0Hikvision yazılımı: Şablon eşleştirme ve görüntü sonuçlarını tespit etmek için kullanılır
Kablosuz AP cihazıShandong HuachuangxunlianBH-ANT5158S-14HV, BH-MS-AC1600HWHStacker vincinin gerektirdiği büyük ölçekli hareket nedeniyle, ağ kablosu kamerayı endüstriyel bilgisayara bağlayamaz ve kamera ağının sorunsuz çalışması için kablosuz bir AP cihazı gereklidir

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Video yakında

İlgili makaleler