$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma insan denekleri, omurgalı hayvanları veya düzenlenmiş dokuları kapsamamıştır; bu nedenle, etik onay veya kurumsal inceleme kurulu onayı gerekmiyordu. Bu çalışmada kullanılan veri seti Longyan Tobacco Industry Co., Ltd.'den alındı. Üç aylık bir dönemde beş bağımsız üretim partisinden görüntüler toplandı. Örnekleme, günün farklı saatlerinde (sabah, öğleden sonra ve gece) rastgele olarak yapılarak üretim koşullarındaki doğal değişimleri yakaladı. Veri seti, %12–18 arasında tütün nem aralığını, 1,5, 2,0 ve 2,5 m/s kesme hızlarını ve 0,4, 0,5 ve 0,6 MPa pnömatik taşıma basınçlarını kapsayan örnekleri içeriyor; böylece tipik üretim koşullarının kapsanmasını sağlıyor.
Veri Seti Edinimi ve Kurulumu
Donanım yapılandırması
Görüntü alma sistemi, ısıya dayanıklı sigaralarda kesilen tütünün düzenliliğini tespit etme gereksinimlerini karşılayacak şekilde yapılandırıldı. Esas olarak bir endüstriyel kamera, bir endüstriyel lens, bir görüş ışığı kaynağı ve bir endüstriyel kontrol ünitesinden oluşuyordu. Sistem, kesilmiş tütün bölgesinin kesilmiş sigara çubuklarının yüzeyinde yüksek çözünürlüklü görüntülerini yakalamak için MV-CH120-10GC endüstriyel kamera ve MVL-KF0818M-12MP endüstriyel lens ile eşleştirilmiş bir endüstriyel kamera kullanıldı. Kamera, sigara çubuğu yüzeyinden 150 mm çalışma mesafesinde konumlandırılmıştı. Şerit LED ışık kaynağı, kamerayla birlikte hedeften 80 mm mesafede, 45° giriş açısıyla birlikte monte edilmişti. Görüntüleme, ortam ışığı parazitini ortadan kaldırmak için mat siyah bir kafes içinde yapıldı. Gövde, iç boyutları 400 mm (genişlik) × 350 mm (derinlik) × 300 mm (yükseklik) ölçülerine sahip, iç yüzeyleri mat siyah boya ile kaplanmış (yansıtma < 550 nm) iç yansımaları en aza indirmek ve tutarlı aydınlatma koşullarını sağlamak için kaplıdır. Görüntüleme kalitesi ve tutarlılığını sağlamak için, ortam ışığı değişikliklerinin tütün ipliği kontur çıkarımı ve yön tanıma üzerindeki etkisini en aza indirerek stabil bir aydınlatma ortamı oluşturmak amacıyla MV-LRDS-H-95-30-W ışık kaynağı kullanıldı. Alınan görüntüler, PC1010-AX360 endüstriyel bilgisayar tarafından alındı, işlenir ve depolanırdı; bilgisayar ayrıca sonraki tanıma algoritmalarını, sonuç hesaplamasını ve arayüz çıktısını gerçekleştirirdi. Endüstriyel kamera ve lens kombinasyonu, 896 × 1600 piksel görüş alanında görüntü kenarlarında %0,5'ten az radyal bozulma gösterdiği için açık bir kamera kalibrasyonu veya bozulma düzeltmesi yapılmadı. Kamera ve ışık kaynağı, görüntü alınırken konum kararlılığını sağlamak için sabit bir çerçeveye sertçe monte edilmişti. Görüntü alımı boyunca ışık kaynağı yoğunluğu sabit bir seviyede tutuldu. Görüş alanı, çelik destek yapısında açık kesilmiş tütün bölgesini tamamen kapsayacak şekilde yapılandırıldı.
Kamera parametre ayarı
Görüntü edinimi tetiklendi ve örnekler sigara yerleştirilip bölümlere ayrıldıktan sonra görüntüler JPG formatında kaydedildi. Alınan görüntülerin tutarlılığını sağlamak için elde etme parametreleri manuel olarak ayarlandı. Özellikle, görüntü çözünürlüğü 896 × 1600 olarak ayarlanmıştı. Pozlama süresi başlangıçta 4000 μs olarak ayarlanmıştı ve yerdeki parlaklığa göre 3000 ila 6000 μs aralığında ince ayarlanabiliyordu. Tüm parametre ayarlamaları, örnek yukarıda açıklanan mat siyah muhafaza içine, tam kontrollü aydınlatma koşullarında yerleştirilerek gerçekleştirilmiştir. Ayar sırasında dış ortam ışığı yoktu; görüntüleme sistemi tamamen kapalı bir ortamda oda ışıkları kapalı ve kapalı bir ortamda çalışıyordu. Kazanç başlangıçta 2 dB olarak ayarlandı ve gürültü seviyelerine göre 0 ila 6 dB aralığında kontrol edildi. Gamma değeri 0.8'e ayarlandı ve beyaz dengesi sabit parametrelerle yapılandırıldı. Son alım parametreleri şu şekilde ayarlandı: pozlama süresi = 4000 μs, kazanç = 2 dB, gamma = 0.8, beyaz denge modu = sabit, görüntü çözünürlüğü = 896 × 1600 piksel ve görüntü formatı = JPG. Beyaz dengesi için sabit parametreli mod kullanıldı. Kalibrasyon, örnek pozisyonuna yerleştirilen standart beyaz referans kartı (X-Rite ColorChecker) kullanılarak gerçekleştirildi. Kırmızı ve mavi kanal kazançları, beyaz kartın RGB değerleri %±2 sapma içinde eşitlenene kadar ayarlandı. Kalibrasyondan sonra beyaz denge parametreleri şu şekilde sabitlendi: kırmızı kazanç = 1.2, yeşil kazanç = 1.0 (sabit) ve mavi kazanç = 1.5. Kalibrasyon, her sistem başlatıldıktan sonra veya ışık kaynağında renk sıcaklığı kaymasına yol açabilecek yaşlanma belirtileri gösterdiğinde bir kez gerçekleştirildi. Bu ayarlar, kesilen tütünün net sınırlarını ve stabil parlaklık dağılımını sağlamaya yardımcı olurken, sonraki tütün zinciri segmentasyonu, yönelim hesaplaması ve düzenlilik analizi için işlem gereksinimlerini karşılamaya yardımcı olmuştur.
Görsel koleksiyonu
Görüntü alımı, kesimden sonra ısıya dayanıklı sigara çubuklarının yüzeyinde ortaya çıkan kesilmiş tütün alanını hedefledi. Tespit sırasında, sigara örneği önce inceleme istasyonuna teslim edilir, burada duruşu ve konumu örnek konumlandırma mekanizmasıyla ayarlanır ve sabitlenir. Konumlandırma mekanizması, V şeklinde hizalama kılavuzlarına sahip pnömatik bir kelepçeden oluşur. Sistem, lazer yer değiştirme sensörü ölçümleriyle doğrulandığı üzere 1000 ardışık döngüde ±0,5 mm konumsal tekrarlanabilirlik sağlar. Daha sonra, dış sargı malzemesi kesme mekanizması tarafından sağlam bir şekilde kesilmiş ve yüzeyde kesilen tütünü görüş sisteminin görüş alanında tamamen açığa çıkarmıştır. Yuvarlak döner bir bıçak (çapı 50 mm, kalınlığı 0,3 mm, malzemesi yüksek hızlı çelik) kullanıldı. Kesme derinliği 1,5 mm olarak ayarlanmış, dönme hızı ise 300 rpm'dir. Kesim tutarlılığı, lineer kodlayıcı geri bildirimiyle izlendi ve kalınlık değişimi ±0,05 mm içinde korundu. Örnek konumu stabil hale geldikten ve görüntüleme bölgesi net bir şekilde tanımlandıktan sonra, görüntü kaydı endüstriyel kamera kullanılarak ışık kaynağı tarafından sağlanan stabil aydınlatma altında gerçekleştirildi. Toplamda 634 görüntü toplandı; tipik görüntüler Şekil 1'de gösterilmiştir. Veri seti üç tütün yoğunluk seviyesini (düşük, orta, yüksek; yaklaşık 180, 220 ve 260 mg/cm 3), −180° ile 180° arasında uzanan iplik yönleri ve normal aydınlatmadan düşük ışık kenar koşullarına kadar değişen aydınlatma koşullarını içerir. Aydınlanma, sensörün örnek yüzey konumuna yerleştirildiği kalibre edilmiş dijital lux metre (TA8133, doğruluk ±%3) kullanılarak ölçüldü. Ölçülen normal aydınlatma aralığı 200–800 lüks arasındadır; kapalı kapalı kaputun içindeki şerit LED ışık kaynağı sayesinde sağlanır ve ortam ışığı sızıntısı yoktur. Düşük uç değeri (yaklaşık 200 luks), model dayanıklılığını değerlendirmek için ışık kaynağının karartılması sonucu oluşturulan bir kenar durumu temsil eder. Ayrıca, yaklaşık %30'unda tütün ipliklerinin kısmi tıkanması (%10 ila %50 arasında değişen) görülür. Bu varyasyonlar, gerçek üretim hattı çeşitliliğini yansıtır.

Şekil 1. Görüş sistemi tarafından alınan kesilen tütünün temsil eden ham görüntüleri. (a–h) Endüstriyel alan koşullarında görüntü alma sistemi kullanılarak yakalanan ham tütünün ham görüntülerinin temsilci örnekleri. Görüntüler, kontrollü aydınlatma altında 896 × 1600 piksel çözünürlükte, eşit parlaklık sağlamak ve çevresel paraziti en aza indirmek için şerit ışık kaynağı kullanılarak elde edildi. Bu görüntüler, model işlemeden önce tütün ipliği dağılımı, yoğunluğu ve yönelimindeki farklılıkları göstermektedir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Görsel açıklaması
Açık kaynak aracı LabelImg kullanılarak, görünür kesilmiş tütün ve çelik destek özelliklerinin etrafında sınırlı kutular çizildi. Her sınırlayıcı kutu için doğru açı etiket olarak atandı. Yatay eksen (0°), görüntünün alt kenarına paralel sağa doğru yön olarak tanımlanmıştır. Her tütün ipliği için, açıklama aracının açı ölçüm fonksiyonu, ipliğin ana ekseni boyunca bir çizgi çizmek için kullanıldı. Açı, bu eksen ile yatay referans arasındaki açı olarak kaydedildi (aralık: −180° ile 180°). Açıklamalar, standart tek aşamalı algılama formatında kaydedildi ve her görüntüye karşılık gelen bir TXT dosyası vardı. Her .txt dosyada şu şekilde biçimlendirilmiş satırlar bulunur: class_id x_center y_center genişlik yüksekliği. Koordinatlar, görüntü boyutlarına göre [0,1] olarak normalleştirilir. Sınıf 0 = tütün sapı, sınıf 1 = çelik destek. Açı etiketi, beş standart YOLO alanından sonra eklenen .txt açıklama dosyasında altıncı sütun olarak saklanır. Satır başına tam format şudur: class_id x_center y_center genişlik, yükseklik açısı. Açı değeri, −180.0 ile 180.0 arasında değişen bir kayan nokta sayısı olarak dereceler cinsinden, iki ondalık basamakla (örneğin 45.75) saklanır. Örnek satır: 0 0.5230 0.4170 0.0850 0.0620 38.25.
Kalite kontrolü
İkinci bir anlatıcı, annotlu görsellerin rastgele seçilmiş %20'sini inceledi. Rastgele seçim, Python rastgele kütüphanesinden random.sample() fonksiyonu kullanılarak 2024 sabitlenmiş rastgele tohum ile gerçekleştirildi. Tüm resim dosya adlarının bir listesi oluşturuldu ve görüntülerin %20'si bu tohumlanmış rastgele sayı üreteci kullanılarak değiştirilmeden örneklendi, böylece tekrarlanan kalite kontrol prosedürlerinde tekrarlanabilir seçim sağlandı. Herhangi bir tutarsızlık tartışılıp çözüldü, böylece etiketleme tutarlılığı sağlandı. Annotatörler arası anlaşma açısal sapma kullanılarak değerlendirildi: iki annotörün açı etiketleri arasındaki ortalama mutlak fark 2,8° idi (standart sapma = 1,5°). >5° sapmalı açıklamalar incelenip uzlaştırıldı.
Kesilmiş Tütün Düzenliliği Tespiti İçin Tek Aşamalı Regresyon Modeli
Kesilmiş tütün hizalanmasının tespit edilmesi, hem üretim sürecini hem de sigara üretiminde nihai ürün kalitesini artırmak için kritik öneme sahiptir. Ancak bu denetim görevi, kesilmiş tütünlerin örtüşmesi, küçük hedef boyutları ve dengesiz aydınlatma gibi çeşitli zorluklarla karşı karşıyadır; bunların tümü tespit doğruluğunu ve dayanıklılığını zayıflatmaktadır. YOLOv11n tabanlı geliştirilmiş tek aşamalı regresyon modeli, kesilen tütün düzeninin çevrimiçi tespiti için kullanılır. Önerilen çerçeve, sigara çubuğu oluşumu sırasında kesilen tütünün morfolojik özelliklerini doğru şekilde tanımlayarak hizalama düzeninin güvenilir tespitini sağlarken, doğruluk, dayanıklılık ve gerçek zamanlı işleme yeteneğini artırır. Önerilen tek aşamalı regresyon çerçevesinin genel konfigürasyonu Şekil 2'de gösterilmiştir.

Şekil 2. Önerilen tek aşamalı regresyon modelinin genel mimarisi. Diyagram , omurga, boyun ve tespit başlığı dahil olmak üzere tüm ağ yapısını göstermektedir. Omurga, özellik bilgilerini korumak için çok frekanslı etkileşimli aşağı sampling (MFID) modüllerini içeren çok ölçekli özellikler çıkarır. Boyun, çok seviyeli temsil için üçlü tamamlayıcı füzyon (TCF) stratejisini kullanarak özellikleri entegre eder. Tespit kafası, yerelleştirme ve sınıflandırma performansını artırmak için ölçek farkında (πL), mekânsal farkında (πS) ve görev farkında (πC) dikkat mekanizmalarını entegre eden DynamicHead modülünü benimser. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Çok Frekanslı Bilgi Aşağı Örnekleme Modülü (MFID)
YOLOv11'in omurga ağında, 2 adımlı konvolüsyonel işlem, pikselleri atlayarak aşağı örnekleme gerçekleştirir. Bu süreç, uzamsal bilginin doğrudan yarısını atar ve yüksek frekanslı detayların (örneğin küçük nesnelerin kenarları ve dokuları) kaybına ve küçük hedefler için önemli bilgi kaybına yol açar. Ayrıca, omurgadaki maksimum havuzlama ve ortalama havuzlama işlemleri, nesne bölgelerindeki detaylı bilgileri atıyor, özellikleri pürüzsüzleştirir ve gürültü getiriyor; bunların hepsi özellik öğrenimini olumsuz etkiler.
Bu sorunları ele almak için, dalgalet hiyerarşik ayrıştırma15,16 kavramından ilham alan bir MFID modülü tanıtılmıştır. Bu modül, önce özellikleri Haar dalga geçimi dönüşümü kullanarak iki tamamlayıcı bölüme ayırır: düşük frekanslı arka plan bilgisi, bu da sınıflandırmayı artırır, yüksek frekanslı ayrıntılar ise kenarlar ve dokular açısından zengin ve küçük hedef algılamalarını artırır. Küçük hedeflerin algısını daha da güçlendirmek için MFID modülü iki ek dal içerir: küçük hedeflerin ince taneli özelliklerini korumak için çeviri değişmezliğini kullanan maksimum havuzlu dal ve daha güçlü temsil kapasitesi ve zengin bilgi bileşimi elde etmek için öğrenilebilir parametreleri kullanan bir kademeli dönüşümlü dal. Bu çok dal yapısı sayesinde, MFID modülü aşağı samplama sırasında daha eksik mekansal ve frekans bilgisini korur. MFID modülünün mimarisi Şekil 3'te gösterilmiştir.

Şekil 3. MFID modülünün yapısı. MFID modülü, giriş özelliklerini düşük frekanslı ve yüksek frekanslı bileşenlere ayırarak kritik yapısal bilgileri korumak için Haar dalgasit dönüşümü kullanır. HLL düşük frekanslı yaklaştırma bileşenini gösterirken, HLH,H HL ve HHH sırasıyla yatay, dikey ve çapraz yönlerde yüksek frekanslı detay bileşenlerini temsil eder. 2↓ sembolü iki kat aşağı örnekleme anlamına gelir. Birden fazla daldan gelen özellik haritaları, özellik temsilini artırmak için birleştirme ve kapı mekanizmalarıyla birleştirilir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Aşağı örnekleme sırasında, görüntü Haar dalgasit dönüşümü kullanılarak parçalanır; bu dönüşüm, düşük ve yüksek frekanslı özellikleri ayrıştırmada basitliği ve verimliliği nedeniyle gerçek zamanlı tespit görevleri için uygun hale gelir. HL ve H H, sırasıyla düşük geçirim ve yüksek geçirecek ayrıştırma filtrelerini gösterir ve görüntüden düşük frekans ve yüksek frekanslı bilgi almak için kullanılır. Tek seviyeli, tek boyutlu bir Haar dönüşümü için dalgasit baz fonksiyonu ve ölçekleme fonksiyonu, Denklem 1 kullanılarak aşağıdaki şekilde tanımlanır:
(1)
Haar baz fonksiyonu, Denklem 2 kullanılarak şu şekilde tanımlanır:
(2)
Burada, j ve k parametreleri, sırasıyla Haar baz fonksiyonunun ölçekleme katsayısı ve dönüşüm miktarını gösterir. Özellikle, sıfır dereceli Haar temel fonksiyonu, Denklem 3 kullanılarak aşağıdaki şekilde tanımlanır:
(3)
Şekil 3'te 2↓ sembolü iki kat aşağı örneklemeyi gösterir. İki seviyeli bir Haar dalgasit ayrıştırması dört bileşen elde eder: düşük frekanslı yaklaştırma (HLL) ve yatay (HLH), dikey (HHL) ve çapraz (HHH) yönlerdeki yüksek frekanslı detay bileşenleri. HLL bileşeni kontur, arka plan ve küresel bilgi taşırken, yüksek frekanslı bileşenler (HLH,H HL ve HHH) kenar, doku ve ince taneli özellikleri yakalar.
İki kat aşağı örneklemeden elde edilen yüksek frekanslı bileşenler HLH,H HL ve HHH, Concat işlemi ile birleştirilir ve böylece çok yönlü detaylı bilgi, Denklem 4'te gösterildiği gibi entegre yüksek frekanslı detay bilgisi
üretmek için entegre edilir.
(4)
Daha sonra, maksimum havuzlama kolunda ikincil bilgi birleştirme yapılır; böylece detaylı özellikler küresel özelliklerle entegre edilir ve böylece yeniden oluşturulmuş bilgi
üretilir; bu da daha geniş bir belirgin özellik seti içeren ve gelişmiş özellik temsili için yüksek frekanslı detaylı bilgileri yeniden kullanan Denklem 5'te gösterilmiştir.
(5)
Daha sonra, bilgi akışını dinamik olarak düzenlemek için bir kapı mekanizması kullanılır ve
bu mekanizma, faydalı özellikleri korurken gereksiz gürültü parazitini bastırır. Kapı mekanizması şu şekilde tanımlanır: gating(x) = Linear_2(ReLU(Linear_1(x))), burada Linear_1 kanal boyutunu 4 azalma faktörü azaltır ve Linear_2 onu orijinal kanal boyutuna geri döndürür. Kapı mekanizmasının çıktısı, Sigmoid aktivasyonu ile geçirilerek modülasyon ağırlıkları [0,1] aralığında üretilir. Öğrenilebilir parametreler arasında, her iki Lineer katmanın ağırlık matrisleri ve yanlışlık terimleri bulunur; bunlar tekdüz başlangıllaştırma ile başlatılır. Bu, ayrıntılı ve kritik özellik bilgilerinin doğru şekilde dengelenmesini ve kullanılmasını sağlar ve Denklem 6'da sunulan nihai detaylı özelliği
ortaya çıkarır.
(6)
Son olarak, adım-konvolüsyon aşağı örnekleme bilgisi, düşük frekanslı vektör ve nihai detay özelliği Concat ile birleştirilerek özellik aşağı örnekleme etkileşimini birden fazla boyut ve frekans bantında genişletilir; bu durum Denklem 7'de gösterilmiştir.
(7)
Eylem-uygulama adımları
Modül tanımı
Projenin model tanım dosyalarında MFID adlı özel bir PyTorch modülü tanımlanmalıdır. Bu modülün uygulanması dört paralel yoldan oluşur: (1) Dalgalet dönüşümü: giriş özellik haritasına önceden tanımlanmış Haar dalga bağı filtreleri kullanılarak iki seviyeli bir ayrıştırma uygulanır; yatay, dikey ve çapraz yönlerde düşük frekanslı bir yaklaşım bileşeni ve yüksek frekanslı detay bileşenleri oluşturulur; ardından üç yüksek frekanslı bileşen birleştirilir; (2) Max-pooling: girdiye en belirgin özellikleri korumak için maksimum havuzlama uygulanır; (3) Çizgili konvolüsyon: standart aşağı samplama, 2 adımlı bir konvolüsyon katmandan yapılır; (4) Özellik yeniden yapılandırma ve füzyon: önce, wavelet dönüşümünden elde edilen yüksek frekanslı bilgi, maksimum havuzlama dalının özellikleriyle birleştirilir; sonrasında, ince taneli özellikleri filtrelemek için düşük frekanslı bilgiyle yönlendirilen bir kapı mekanizması kullanılır; Son olarak, işlenmiş ince taneli özellikler, düşük frekanslı bileşenler ve çizgili konvolüsyon çıktısı birleştirilerek nihai aşağı örneklenmiş özellik haritası elde edilir.
Yapılandırma dosyası düzenleme
Temel model yapılandırma dosyası (config.yaml) açılmalıdır. Hem omurga hem de boyun ağlarındaki tüm standart downsampling modülleri sistematik olarak tanımlanmalıdır. Tanımlanan her aşağı örnekleme modülü girişi MFID modülü ile değiştirilmelidir.
Tasarım motivasyonu
MFID modülü, standart aşağı sampling işlemlerinde bilgi kaybını azaltmak için tasarlanmıştır; bu da özellikle küçük nesne tespiti için zararlıdır. Temel konsepti, dalga hiyerarşik ayrıştırmadan esinlenmiştir. Düşük frekanslı küresel bilgiyi görüntüdeki yüksek frekanslı detay bilgisinden açıkça ayırarak ve bunları buna göre işleyerek modül, aşağı sampling sırasında kritik doku ve kenar özelliklerinin korunmasını sağlar. Maksimum havuzlama ve kademeli konvolüsyon dallarının dahil edilmesi, özellikleri tamamlayıcı perspektiflerden daha da yakalar ve tamamlar—özellikle çeviri değişmezliği ile öğrenilebilir temsil arasında. Çok dal birleşmesi sayesinde, modül sonraki ağ katmanlarına daha bilgilendirici ve sağlam bir çok frekanslı özellik temsili sunar. Tüm belirtilmemiş mimari parametreler ve katman yapılandırmaları, PyTorch içindeki YOLOv11n çerçevesinin varsayılan uygulama ayarlarını takip eder.
Üçlü Çapraz Özellikli Füzyon Modülü (TCF)
YOLOv11 ağ mimarisinin boyun özellik birleşimi aşamasında, aynı ölçekli özellik haritalarını birleştirmek için genellikle basit bir birleştirme işlemi kullanılır. Ancak bu doğrudan yaklaşımın açık sınırlamaları vardır: birincisi, farklı seviyelerdeki özellikler arasındaki anlamsal farklılıkları tam olarak hesaba katmıyor; İkinci olarak, kanallar arası korelasyonların açık modellemesinin olmaması, küçük hedef özelliklerini füzyon sırasında seyrelmeye veya kaybetmeye yatkın hale getirir ve bu da tespit performansını olumsuz etkiler. Bu sorunları ele almak için, TCF modülü olarak adlandırılan daha etkileşimli bir füzyonyöntemi sunulmaktadır 17. Bu yöntem, katmanlar arası iletim yoluyla bilgi akışını küçük hedef algılamaya yönlendiren çok seviyeli ilerleyici bir füzyon stratejisi kullanır. Ayrıca, ölçekler arasında derin seviyeli bilgiyi keşfetmek için ek doğrusal olmayan işlemler de içerir ve böylece çok ölçekli özelliklerin birleşimini artırır. Basit toplama veya ortalama füzyona dayanan geleneksel modüllerin aksine, TCF ağırlıklı bir füzyon yaklaşımını benimser. Bu, her seviyede ayrıntılı bilgileri adapte ederek öğrenmesini, bilgi çıkarma yollarını dinamik olarak optimize etmesini ve en ayırt edici özelliklere odaklanmasını sağlayarak nihayetinde tespit doğruluğunu artırır. TCF modülünün mimarisi Şekil 4'te gösterilmiştir.

Şekil 4. TCF modülünün yapısı. TCF modülü, küçük hedeflerin temsilini artırmak için sığ, orta ve derin katmanlar arasında çok seviyeli özelliklerin birleşmesini gerçekleştirir. P, farklı seviyelerdeki giriş özellik haritalarını temsil eder. Conv konvolüsyon işlemlerini, Upsample özellik yükseltmesini gösterir ve AdaptiveAvgPool uyarlanabilir ortalama havuzlamayı temsil eder. Modül, dengeli füzyon ve katmanlar arası etkileşim yoluyla kalibre edilmiş özellikleri entegre ederek anlamsal ve mekansal özelliklerin tamamlayıcılığını artırır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Nesne algılama görevinde, derin katman özelliği Pi+1 ile sığ katman özelliği P i-1'deki bilgiler önemli ölçüde farklılık gösterir. Katmanlar arası bilginin birleşmesini artırmak için, farklı seviyelerdeki özellik bilgisi arasındaki farkları dengelemek için orta katman P i son özellik birleşimi katmanı olarak tanıtılır.
İlk olarak, sığ, orta ve derin katmanların giriş bilgisi, Sigmoid aktivasyon fonksiyonu kullanılarak işlenir; bu
özellikler ağırlıklı özellikler ,
, ve
, oluşturulur; bu özellikler ana özellikleri güçlendirir ve gereksiz olanları zayıflatmaya hizmet eder; bu, Denklem 8'de gösterilmiştir.
(8)
İkinci olarak, sığ, orta ve derin katmanların giriş bilgisi, eşlenmiş ağırlıklı özelliklerle eleman bazında çarpılır ve Denklem 9'da gösterildiği gibi kalibre edilmiş
özellikler,
, ve
, üretilir. Özelliklerin önemi, ağırlık dikkat mekanizması aracılığıyla dinamik olarak ayarlanır, böylece uyarlanabilir özellik seçimi ve yeniden kalibrasyon sağlanır.
(9)
Orta katman özellik füzyon aşamasında, iki ters ağırlık dalı kalibre edilmiş sığ katman ve derin katman özellikleriyle birleşerek sırasıyla sığ katman özelliklerindeki gürültü nedeniyle oluşan yanlış detaylı bilgileri ve derin katman özelliklerindeki önyargılı anlamsal bilgileri filtreler. Daha sonra, çoklu dal bilgisi entegre edilir ve bu katmanın orijinal özellikleri, kalibre edilmiş özellikleri ve etkileşimli özellikleri ile kalibre edilmiş sığ katman ve derin katman özellikleri birleştirilir. Bu, çok ölçekli özellik bilgisinin korunmasını ve tamamlanmasını sağlar, küçük hedef bilgi kaybı ve yanlış değerlendirme sorunlarını azaltır ve nihayetinde Denklem 10 kullanılarak formüle edilen orta katman birleşmiş özellikler
sağlar:
(10)
Sığ tabaka, derin tabaka ve orta katman arasındaki ilişkiler, Denklemler 11 ve 12'de gösterildiği gibi ayrı olarak belirlenmiştir.
(11)
(12)
Son olarak, üç özellik birleşme yolunun çıktıları, her bir yolun bağımsızlığını korumak için Concat işlemiyle birleştirilir. Her yoldan anahtar bilgiler, α, β ve γ ağırlıklarına göre dinamik olarak öğrenilir; bunlar, 1.0'a başlatılmış ve eğitim sırasında geri yayılma yoluyla optimize edilmiş öğrenilebilir skaler parametreler olarak tanımlanır; bu da sığ, orta ve derin özellik yollarından gelen katkıların dinamik dengesini sağlar. Ayrıca, bağlamsal bilgileri toplamak, katmanlar arası birleştirmeden kaynaklanan tutarsız özellik sınır yanıtlarını ortadan kaldırmak ve küçük hedef detaylı bilgilerin elde edilmesini ve geliştirilmiş temsilini optimize etmek için konvolüsyon işlemler kullanılır. Süreç, Denklem 13 kullanılarak şu şekilde formüle edilmiştir:
(13)
Eylem-uygulama adımları
Modül tanımı
TCF adlı özel bir PyTorch modülü projenin model tanım dosyaları içinde tanımlanmalıdır. Bu modül, omurga ağının farklı aşamalarından çıkarılan sığ katman, orta katman ve derin katman özellik haritalarını girdi olarak alır. İçsel işlem akışı üç ana adımdan oluşur: (1) Özellik kalibrasyonu: Sigmoid fonksiyonu, üç giriş özellik katmanının her birine uygulanarak ağırlık haritaları oluşturulur; bu haritalar orijinal özellik haritalarıyla eleman bazında çarpılır ve temel özellikleri güçlendirirken, gereksiz olanlar bastırılır; (2) Etkileşimli füzyon: orta katman özellik füzyon aşamasında, kalibre edilmiş sığ katman ve derin katman özellikleriyle birleşmek için iki ters ağırlık dalı eklenir; böylece sığ katman özelliklerindeki gürültü nedeniyle oluşan yanlış detay bilgileri ve derin katman özelliklerindeki önyargılı anlamsal bilgiler filtrelenir; (3) Çok yollu toplama: orijinal özellikler, kalibre edilmiş özellikler, etkileşimli özellikler ve sığ ve derin bilgilerle birleşen özellikler entegre edilir; ardından katmanlar arası birleştirmeden kaynaklanan tutarsız özellik sınır yanıtları ortadan kaldırmak için konvolüsyon işlemler uygulanır ve nihayetinde çok ölçekli bilgilerle zengin birleşmiş özellikler ortaya çıkar.
Yapılandırma dosyası düzenleme
Model yapılandırma dosyası (config.yaml) açılmalıdır. Boyun ağındaki özellik füzyon bölümleri—özellikle omurga ağının farklı aşamalarından özelliklerin birleştirildiği katmanlar—konumlandırılmalıdır. Bu pozisyonlarda, orijinal basit birleştirme işlem katmanları, modül girişlerinin ilgili sığ, orta ve derin özelliklere doğru şekilde bağlandığından emin olmak üzere TCF modülüne çağrı ile değiştirilmelidir.
Tasarım motivasyonu
TCF modülünün tasarımı, özellik birleşmesi sırasında bilgi eşitsizliği ve bilgi kaybı gibi zorluklarla motive edilmiştir. Sığ özellikler detay açısından zengindir ancak önemli gürültü içerirken, derin özellikler güçlü anlam gösterir ancak düşük çözünürlük gösterir. Bunu çözmek için, TCF modülü orta katman özelliğini bilgi dengeleyicisi olarak tanıtır ve katmanlar arası özelliklerin tamamlayıcı avantajlarını en üst düzeye çıkarmak için özenle tasarlanmış kalibrasyon, etkileşim ve toplama yollarını içermektedir. Temel motivasyon, her seviyedeki özelliklerin önemini dinamik olarak değerlendirebilen ve bilgiyi seçici olarak entegre edebilen daha etkili bir füzyon mekanizması kurmaktır. Sonuç olarak, sonraki tespit başlığı için hem detay hem de anlamsal bilgiler açısından zengin yüksek kaliteli bir özellik temsili oluşturur ve bu da onu küçük nesne tanıma için özellikle uygun kılar.
DynamicHead Modülü
Tespit başı bileşeni, omurga ve özellik birleşimi ağları tarafından üretilen özellik temsillerinde çok ölçekli nesne tanıma temel amacını yerine getirir. Bu süreç, tespit edilen nesnelerin doğru mekansal yerelleştirilmesini, kategorik atamasını ve sınırlayıcı kutu tahminlerinin güvenilirliğini sağlar. Görsel verilerdeki hedef özelliklerdeki önemli ölçek varyasyonları ve belirli çerçevelerdeki sınırlayıcı kutu önerilerinin yoğun yoğunluğu göz önüne alındığında, kesin kesim tütün tanımlaması çok ölçekli desenlerin analizini gerektirir. Bunu çözmek için, yöntem YOLOv11n'deki yerel algılama kafasının yerine DynamicHeadmimarisi 18'i benimseyerek, ölçek farkında, mekânsal farkında ve görev farkında mekanizmaları entegre eden bir öz-dikkat çerçevesi oluşturarak hem algılama yeteneğini hem de operasyonel verimliliği artırır. DynamicHead bileşeninin yapısal konfigürasyonu Şekil 5'te gösterilmiştir.

Şekil 5. DynamicHead algılama modülünün yapısı. DynamicHead modülü üç ardışık dikkat mekanizması içerir: ölçek farkında (πL), mekânsal farkında (πS) ve görev farkında (πC). Bu bileşenler, ölçekler, mekansal bölgeler ve tespit görevleri arasında özellik önemini dinamik olarak ayarlar. Bu tasarım, tespit başlığı içinde uyarlanabilir özellik iyileştirmesini sağlayarak hem yerelleştirme doğruluğunu hem de sınıflandırma performansını artırır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Bu mimari, ölçek farkında (πL), mekânsal farkında (πS) ve görev farkında (πC) bileşenlerinden oluşur. Ölçek farkında dikkat mekanizması (πL) önce giriş özellik haritasını mekânsal ve kanal boyutları arasında ortalamayı yapar. Sonuç, doğrusal bir projeksiyon katmanından geçirilir ve ardından sert sigmoid aktivasyonu uygulanarak ölçek ağırlıkları oluşturulur ve bu ağırlıklar orijinal özellik haritası ile eleman bazında çarpılır. Mekansal farkında dikkat mekanizması (πS), K = 9 seyrek seçilmiş örnekleme noktası ile deforme edilebilir konvolüsyon kullanır. Her örnekleme noktası için Δpk ofset vektörleri ve modülasyon skalerleri Δmk tahmin eder, ardından örneklenen özellikleri toplayarak mekânsal dikkat ağırlıkları oluşturur. Görev farkında dikkat mekanizması (πC), her kanala iki parametre seti (α1, β1 ve α2, β 2) kullanılarak bağımsız olarak öğrenilebilir bir doğrusaldönüşüm uygular. İki dönüştürülmüş temsil arasındaki maksimum yanıtı seçerek özellikleri sınıflandırma ve regresyon görevleri için dinamik olarak uyarlar. Son olarak, bu üç dikkat mekanizması giriş özellik haritasına sıralı olarak uygulanır: F_out = πC(πS(πL(F) · F) · F) · F. Ölçek farkında mekanizma, çapraz ölçekli özellik ağırlıklarını kullanarak çoklu çözünürlüklü temsilleri uyarlayıcı şekilde birleştirir ve böylece boyutsal varyasyonlara karşı model hassasiyetini iyileştirir. Mekansal farkındalık bileşeni, özellik eşlemelerinde bölgesel vurgu ağırlıklarını uygular; hesaplama odağını ön plan varlıklarına yönlendirir ve alakasız arka plan girişimini bastırır. Bu arada, göreve duyarlı modül, belirli hedefler için çıktı temsillerini dinamik olarak modüle eder, hem sınıflandırma hem de regresyon sonuçlarını geliştirerek model hassasiyetini ve operasyonel dayanıklılığı güçlendirir. Hesaplama prosedürü, Denklemler 14–17'de resmileştirilmiştir.
(14)
(15)
(16)
(17)
Burada, WL(F) dikkat zenginleştirilmiş özellik temsilini, πL(F), πS(F) ve πC(F) ise sırasıyla ölçekli, mekansal ve görev odaklı dikkat işlemlerine karşılık gelir. f dönüşümü doğrusal bir projeksiyon katmanını temsil eder, σ(x) sert sigmoid aktivasyon işlemesini gösterir, K seyrek seçilmiş uzamsal noktaların miktarını gösterir, pk+Δpk ayırt edici alanları vurgulamak için konumsal ayarlamalar getirir, Δmk uzamsal nokta pk için öğretilebilir bir anlamlılık ölçüsünü oluşturur ve α(F) ile β(F) aktivasyon eşiklerini yöneten öğrenilebilir parametrik fonksiyonlardır. Bunlar arasında, K tüm deneylerde 9'a ayarlanmıştır, çünkü bu değer yeterli mekansal kapsama sağlarken hesaplama verimliliğini korur.
Eylem-uygulama adımları
Modül tanımı
DynamicHead adlı özel bir PyTorch modülü projenin model tanım dosyalarında tanımlanmalıdır. Bu modülün uygulanması, ardışık olarak uygulanan üç dikkat biriminden oluşur: (1) Ölçek farkında dikkat: farklı ölçeklerdeki özellik katmanları öğrenilebilir parametrelerle dinamik olarak ağırlıklandırılır; (2) Mekansal farkında dikkat: Deforme edilebilir konvolüsyon kavramına dayanan bu birim, özellik haritalarındaki seyrek ama ayırt edici mekânsal konumlara odaklanır; (3) Görev farkında dikkat: aktivasyon eşikleri, sırasıyla sınıflandırma ve regresyon görevleri için özellik temsillerini optimize etmek amacıyla dinamik olarak öğrenilir. Bu üç dikkat mekanizması girdi özellik piramidine sıralı olarak uygulanır ve nihayetinde tahmin için özellikler üretir. Tüm modüller, yukarıda açıklandığı gibi konvolüsyon katmanlar, doğrusal katmanlar, aktivasyon fonksiyonları ve dikkat mekanizmaları dahil olmak üzere standart PyTorch işlemleriyle uygulanmıştır.
Yapılandırma dosyası düzenleme
Model yapılandırma dosyası (config.yaml) açılmalıdır. Tespit başlığını tanımlayan bölüm bulunmalıdır. Orijinal algılama başlığı konfigürasyonu, genellikle sınıflandırma ve regresyon için bir dizi konvolüsyon katmandan oluşur ve DynamicHead modülüne çağrı ile değiştirilmelidir; böylece girdisi, boyun ağı tarafından özellik piramidi çıktısına bağlanır.
Tasarım motivasyonu
Geleneksel algılama başlıkları genellikle tüm özellik katmanlarına, mekansal konumlara ve görevlere aynı konvolüsyon parametreler setini uygular; göreve özgü uyum sağlama özelliği yoktur. DynamicHead modülünün tanıtılması, tespit görevlerinin karmaşıklığından kaynaklanmakta olup, bu zorlukları birleşik dikkat odaklı mimariyle çözmeyi ve ele almayı amaçlamaktadır. Tasarım motivasyonu üç unsurdur: (1) ölçek farkında modül aracılığıyla farklı boyutlardaki hedeflere karşılık gelen özellik katmanlarına uyarlanabilir odaklanmak; (2) hesaplama kaynaklarını arka plan yerine ön plan hedef bölgelerine yoğunlaştırmak; ve (3) göreve duyarlı modül aracılığıyla sınıflandırma ve regresyonun farklı amaçları için özellik temsillerini dinamik olarak optimize etmek. Bu ayrıştırma ve dinamik optimizasyonun birleşimi, kesilmiş tütün gibi yoğun düzenlenmiş, çok ölçekli hedefler için modelin yerelleştirme doğruluğunu ve sınıflandırma güvenilirliğini artırır.
Tütün Düzenliliği için Özel Değerlendirme Yöntemi
Modül tanımı ve tasarım ilkesi: Kesilmiş tütün hizalanmasının düzenliliğinin nicel değerlendirmesi, üretim sürecinin kararlılığını değerlendirmek ve sigara üretiminde nihai ürün kalitesini tahmin etmek için gereklidir. Geleneksel değerlendirme yöntemleri, öznel, zaman alıcı ve tutarlı nicel ölçümler sağlayamayan manuel görsel incelemeye dayanır. Bu sınırlamaları gidermek için, geliştirilmiş tek aşamalı regresyon dedektörle entegre edilmiş özel açı tahmin yöntemi kullanılır. Bu yöntemin temel ilkesi, sigara çubuğunun içindeki çelik destek yapısını geometrik bir kıyaslama olarak kullanarak mekânsal referans çerçevesi oluşturmaktır. Çelik destek üretim sırasında sabit bir yön tuttuğu için, bireysel kesim tütününün göreli yönelimini hesaplamak için ideal bir referans hattı olarak hizmet eder. Tespit edilen kesilmiş tütünün mutlak açılarını ve çelik desteğinin yatay referans çizgisine göre ölçülüp bunların göreli açısal farklarını hesaplayarak yöntem, hizalama düzeninin nicel bir değerlendirmesini sağlar. Sıfır göreli açı, bir iplik ile destek arasında mükemmel paralellik gösterirken, artan açısal sapma daha kötü hizalanmayı gösterir. Yatay referans ekseni, görüntünün alt kenarına paralel olan ve soldan sağa doğru yönelmiş bir çizgi olarak tanımlanır. Bu eksen 0°'ye karşılık gelir; pozitif açılar saat yönünün tersine, negatif açılar ise bu eksenden saat yönünde ölçülür. Nihai düzenlilik metriği, bir görüntüdeki tüm tespit edilen ipliklerin göreli açılarının ortalaması alınarak elde edilir; böylece tutarlı ve objektif kalite derecelendirmesi sağlanır.
Eylem-uygulama adımları
Açı hesaplama modülü tanımı
Geliştirilmiş tek aşamalı regresyon modelinden algılama çıktılarını işleyen bir sonradan işleme modülü uygulayın. Tespit edilen her nesne için (kesilmiş tütün ve çelik destek) sınırlayıcı kutu koordinatlarını çıkarın. Tespit edilen her nesne için merkez nokta koordinatlarını Denklem 18 kullanarak hesaplayın. Görüntü boyutlarına göre görüntü merkez noktası koordinatlarını Denklem 19 kullanarak hesaplayın.

(18)

(19)
burada x₁, x₂, y₁, y₂ tütün ipliği veya çelik destek için tespit edilen sınır kutusunun dört köşesinin koordinatlarını gösterir; c, x ve cy, tespit bölgesindeki ilgili merkez noktalarının koordinatlarını temsil eder; w ve h, sigara görselinin genişliğini ve yüksekliğini gösterir; dx ve dy, görüntü merkez noktasının koordinatlarını tanımlar.
Mutlak açı hesaplaması
Tespit edilen her tütün ipliği ve çelik destek için, görüntü merkezinden nesne merkezine vektörü hesaplayın. Denklem 20'de formüle edilmiş arktanjant fonksiyonu kullanarak yatay referans çizgisine mutlak açıyı hesaplayın. Açı, atan2(d_y, d_x kullanılarak hesaplanır; burada atan2, Python matematik kütüphanesinde bulunan dört dörtlüklü ters teğet fonksiyonudur. Bu fonksiyon, (−π, π] radyan aralığında değerler döndürür, bu değerler daha sonra dereceye dönüştürülür ve (−180°, 180°) aralığında çıkış açıları elde edilir. Kadrant yönetimi otomatik olarak atan2 ile d_y ve d_x işaretlerine dayanır. Bu, çelik destek için Bir çelik ve her tütün ipliği için Birkesim elde eder.
(20)
Göreli açı hesaplaması
Tespit edilen her tütün zinciri için, çelik destekin mutlak açısını ipliğin mutlak açısından çıkararak göreceli açıyı hesaplayın; bu, Denklem 21'de gösterilmiştir. Mutlak değer, pozitif açısal sapma ölçümlerini sağlar.
(21)
Düzenlilik metrik üretimi
Tespit edilen tüm ipliklerin göreli açılarını tek bir görüntü içinde toplayın. Ortalama göreli açıyı To toplayarak ve Denklem 22'de formüle edildiği gibi tespit edilen toplam zincir sayısına bölerek hesaplayın. Bu ortalama değer, o görüntü için hizalama düzeninin nicel ölçütü olarak hizmet eder.
(22)
Kalite derecelendirme uygulaması
Hesaplanan değeri, Denklem 23'te tanımlandığı şekilde önceden tanımlanmış eşiklere dayalı niteliksel derecelere eşleyen bir sınıflandırma fonksiyonu uygulayın. Derecelendirme eşikleri (0°–30° = Mükemmel, 30°–60° = İyi, >60° = Kötü) Longyan Tütün Endüstrisi Şirketi, Ltd.'den üç kalite kontrol uzmanıyla yapılan istişare üzerine belirlendi. Bu uzmanlar, 200 örnek görüntüyü bağımsız olarak değerlendirdi ve hesaplanan ortalama göreli açıları algılanan hizalama kalitesiyle üç kategorili bir ölçek (Mükemmel, İyi ve Kötü) karşılaştırdı. 30° ve 60° sınırları, uzmanlar arası anlaşmanın %90'ı aştığı durumlarda uzlaşı sınırları olarak seçildi. Bu derecelendirme, kalite kontrol personeli için nicel sonuçların sezgisel yorumlanmasını sağlar.
(23)
Yapılandırma dosyası düzenleme
Model yapılandırma dosyası (config.yaml veya model.yaml) açılmalıdır. Yapılandırmanın post-processing bölümü veya çıkarım ayarları bölümü bulunmalıdır. Özel açı hesaplama modülü doğru şekilde referans verilmeli ve etkinleştirilmelidir. Çıkış ayrıştırma ayarları, hem kesilen tütün hem de çelik destek için sınırlayıcı kutu koordinatlarını doğru çıkaracak şekilde doğrulanmalıdır. Bu değerlendirme yöntemi için ek katman eklemeye gerek yoktur, çünkü algılama başlığı çıktısından sonra bir işlem sonrası modül olarak çalışır.
Tasarım motivasyonu
Bu özel değerlendirme yönteminin tasarımı, öznel görsel incelemeyi nesnel, tekrarlanabilir nicel ölçümlere dönüştürme ihtiyacından kaynaklanmaktadır. Geleneksel manuel denetim, gözlemciler arası değişkenlikten zarar görür ve süreç optimizasyonu için sürekli sayısal veri sağlayamıyor. Sigara çubuğunda çelik desteği doğal geometrik referans olarak kullanarak, bu yöntem harici kalibrasyon işaretleyicilerine olan ihtiyacı ortadan kaldırır ve farklı görseller ile üretim partilerinde ölçüm tutarlılığını sağlar. Merkez noktası vektörleri ve ark tanjant hesaplamalarının kullanımı, açı tahmini için matematiksel olarak sağlam ve hesaplama açısından verimli bir yaklaşım sunar ve gerçek zamanlı dağıtım için uygun hale getirir. Görüntü merkezinden nesne merkezine bu vektör tabanlı hesaplama, kamera görüş alanı ve sigara çubuğunun görüntü içindeki konumuna değişmeden olacak şekilde tasarlanmıştır; böylece farklı yakalama koşullarında sağlamlık sağlanır. Birden fazla tespit edilen iplik arasında ortalamalama stratejisi, iplik yönelimindeki doğal değişimleri hesaba katır ve istatistiksel olarak güvenilir bir genel düzenlilik metriği sunar. Üç kademeli bir derecelendirme sistemi, sürekli sayısal ölçümleri uygulanabilir kalite kategorilerine dönüştürerek üretim hattı kalite kontrolünde hızlı karar alınmasını kolaylaştırır. Genel olarak, bu entegre yaklaşım, geliştirilmiş tek aşamalı regresyon modelinin tespit yeteneklerini hassas geometrik hesaplamalarla birleştirerek, kesilmiş tütün hizalanma düzeninin kapsamlı ve otomatik değerlendirilmesini mümkün kılar.
Kesilmiş Tütün Düzen Tespiti Modeli Eğitimi
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1 ve tüm bağımlılıklar doğru şekilde kurulmalıdır. Uygulama, standart PyTorch YOLO boru hatlarını takip eder ve sağlanan ayrıntılı modül açıklamaları ile yapılandırma adımlarına dayanarak yeniden üretilebilir.
Eğitim komutanlığı
Yeniden eğitimden önce, standart tek aşamalı tespit formatında (örneğin, her görüntü için bir .txt dosya içeren YOLO formatında bölümlenmiş görüntü veri seti ve annotasyon dosyaları hazırlanmalıdır. Görüntü yolları, sınıf sayısı (kesilmiş tütün ve çelik destek) ve sınıf adlarını belirten bir veri seti yapılandırması .yaml dosyası oluşturulmalıdır. Daha önce açıklanan model iyileştirmelerine dayanarak, orijinal dedektör .yaml yapılandırma dosyası, MFID, TCF ve DynamicHead modüllerini içeren önerilen model .yaml dosyası ile değiştirilmelidir. train.py beti, tek aşamalı dedektör paketini içe aktarmak, eğitim modelini ve veri seti yapılandırmasını yüklemek ve aşağıdaki eğitim parametrelerini ayarlamak için yazılmış veya değiştirilmelidir: imgsz=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 vb. Rastgele tohum 42 olarak sabitlendi ve model ağırlıkları derin öğrenme çerçevesi tarafından sağlanan varsayılan başlatma stratejisi kullanılarak başlatıldı. Tekrarlanabilirlik, torch.backends.cudnn.deterministic = Doğru ve torch.backends.cudnn.benchmark = Yanlış olarak ayarlanarak sağlandı.
Hiperparametreler
Eğitim için yapılandırılan ana hiperparametreler şunlardır: 896 × 1600 piksel giriş görüntü çözünürlüğü; parti boyutu 4, GPU belleği tarafından sınırlandırılmıştır; kademeli bozunma için kosinüs tavlama zamanlayıcı ile başlangıç öğrenme oranı 0.01; 0.912 momentumlu stokastik gradyan iniş (SGD) optimizatoru ile yakınsamayı hızlandırır; ve düzenli olarak 0.0004 ağırlık düşüşü ile karşılaştırılır. Görüntüler ortalama [0.485, 0.456, 0.406] ve standart sapma [0.229, 0.224, 0.225] kullanılarak normalleştirildi. Artırma aşamasında rastgele yatay çevirme (%50), rastgele parlaklık ayarı (%±%20) ve rastgele dönüş (±15°) yer almıştır. Mozaik artırma, erken eğitim dönemlerinde varsayılan olarak etkinleştirilir ve model dayanıklılığını farklı nesne ölçekleri ve tıkanmalara karşı artırır. Son 10 dönemde (close_mosaic = 10) tespit doğruluğunu artırmak için devre dışı bırakılır.
Eğitim izleme
Eğitim sırasında, çerçeve her dönemde kapsamlı metrikler üretir. Kayıp fonksiyonu, üç bileşenin ağırlıklı toplamıdır: sınıflandırma kaybı (logitlerle ikili çapraz entropi [BCE], lokalizasyon kaybı (birleşim [IoU] kaybı üzerinde tam kesişim) ve nesnelik kaybı (BCE). Toplam kayıp ağırlıkları λ_cls = 0.5, λ_box = 0.05 ve λ_obj = 1.0 olarak belirlendi. Eğitim ve doğrulama kayıp eğrileri, istikrarlı yakınsamayı sağlamak ve aşırı uyum belirtilerini tespit etmek için izlenmelidir. Doğrulama setinde 0,5 (mAP@0,5) IoU eşiğindeki mAP, kesilmiş tütün ipliği tespiti için birincil performans göstergesi olarak kullanılır. Veri seti büyüklüğü ve model karmaşıklığı göz önüne alındığında, 100 dönem için eğitim genellikle yakınsamaya yeterlidir. En iyi performans gösteren model kontrol noktası, doğrulama mAP'ye göre otomatik olarak kaydedilir.
Model Değerlendirmesi ve Dağıtımı
Değerlendirme
Eğitim tamamlandıktan sonra, optimal model ağırlıkları runs/train/exp/weights/best.pt olarak kaydedilir. Eğitilen model, özel doğrulama setinde şu komutla değerlendirilmelidir: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Değerlendirme beni, her iki tespit sınıfı (kesilmiş tütün ve çelik desteği) için hassasiyet, geri çağırma ve mAP@0.5 gibi temel performans metriklerini üretir. mAP, endüstriyel dağıtım için gerekli eşik değerini karşılayacak şekilde doğrulanmalıdır (örneğin, iplik tespiti için %>95). Dağıtım eşiği (mAP >strand tespiti için %95), hedef endüstriyel ortam için iç bir performans gereksinimini temsil eder. Bildirilen sonuç, zorlu uç vakaları içeren çeşitli test setlerindeki performansı yansıtıyor. Modelin rutin üretim koşulları için mAP, ideal aydınlatma ve minimum tıkanma için filtrelenmiş bir alt küme üzerinde değerlendirildiğinde %96'yı aşmaktadır. Rutin üretim alt kümesi şu kriterlerle tanımlandı: 500–800 luks aralığında aydınlatma (optimal aydınlatma), oklüzyon oranı %10'dan az (minimum örtüşme) ve görünür speküler yansımalar yok. Bu alt küme, test setinin yaklaşık %67'sini temsil eden 427 görüntü içerir. Bu alt küme, normal aydınlatma ve iyi yönlendirilmiş ip düzeni altında standart gündüz üretim koşullarına karşılık gelir.
Çıkarım doğrulaması
Modelin görünmez görüntülerdeki algılama performansını görsel olarak doğrulamak için, aşağıdaki komutla örnek test görüntülerinde çıkarım yapılır: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Bu komut, tespit edilen kesilmiş tütün ve çelik desteklerin etrafında sınırlanmış kutularla açıklamalı görüntüler üretir. Çıkarım hızı, NVIDIA GeForce RTX 3080 Ti GPU (12 GB VRAM) üzerinde CUDA 12.1 ve PyTorch 2.1.0 kullanılarak ölçüldü. Raporlanan saniyede kare (FPS), 50 ısınma iterasyonundan sonra ortalama 100'den fazla ardışık ileri pas olarak hesaplandı. Ayrıca, çıkarım hızı (saniyede kare cinsinden) rapor edilir ve bu hızın dağıtım ortamına gerçek zamanlı uygunluğunu doğrular.
Model dağıtımı
Endüstriyel kontrol sisteminde gerçek zamanlı dağıtımı mümkün kılmak için, eğitilmiş PyTorch modeli (best.pt, yaklaşık 7–9 MB) TensorRT veya Open Neural Network Exchange (ONNX) gibi optimize edilmiş bir çıkarım formatına aktarılmalıdır. Bu dönüşüm, tespit doğruluğunu korurken çıkarım hızını artırır. ONNX dışa aktarma için şu kupley: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"]). TensorRT dönüşümü için şu kunu kullanın: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. FP16 hassas modu, çıkarım hızını optimize etmek için kullanıldı. Son olarak kullanılan model, sınırlayıcı kutu koordinatları, sınıf etiketleri (kesik tütün ipliği veya çelik destek) ve tespit edilen her nesne için güven puanları çıkarır; bunlar, kesim tütününün düzenliliğini nicelendirmek için kullanılan özel açı değerlendirme yöntemine giriş olarak kullanılır.