Önerilen YOLOv11 ve CNN füzyon modelinin üretim hattı güvenlik izlemedeki etkinliğini doğrulamak için çeşitli güvenlik tehlikesi senaryolarını kapsayan bir veri seti oluşturulmuştur. Bu veri seti, 42 sabit rastgele tohum (seed) kullanılarak 7:1,5:1,5 oranında eğitim, doğrulama ve test setlerine ayrılmış 12.000 üretim hattı sahne görüntüsü içermektedir. Veri seti; standart aydınlatma, düşük ışık, kısmi kapanma, yoğun kapanma, hareket bulanıklığı ve karmaşık arka planlar dahil olmak üzere çeşitli çalışma koşullarını kapsamaktadır. Çıkarım için güven eşiği 0,5 ve maksimumu olmayan baskılama (NMS) eşiği 0,45 olarak belirlenmiştir. Tüm deneyler üç kez tekrarlanmış ve sonuçlar ortalama ± standart sapma olarak rapor edilmiştir. Etiketleme kategorileri, PASCAL Visual Object Classes (VOC) formatı kullanılarak işçiler, güvenlik kaskları, robotik kollar, tehlikeli alanlar, araçlar ve taşıtlar olarak belirlenmiştir. Birleşme üzerinden birleşim (IoU) eşiği 0,5 olarak ayarlanmış ve etiketleme tutarlılığı iki kişiyle çapraz doğrulama yoluyla onaylanmıştır. Giriş görüntüleri tekdüze olarak 640 × 640 boyutuna ölçeklendirilmiş ve Mosaic veri artırımıyla genişletilmiştir. Eğitim, 0,01 başlangıç öğrenme hızı, 0,9 momentum, 0,0005 ağırlık azalması ve 32 toplu işlem boyutu (batch size) ile SGD optimizasyonu kullanılarak gerçekleştirilmiştir. Eğitim 200 epok boyunca sürdürülmüş ve öğrenme hızını ayarlamak için kosinüs tavlaması (cosine annealing) kullanılmıştır.
Modelin etkinliğini kapsamlı bir şekilde değerlendirmek için çeşitli değerlendirme metrikleri kullanılmıştır: ortalama ortalama hassasiyet (mAP), görüntü karesi işleme hızını ölçmek için saniye başına kare sayısı (FPS), pozitif tahminlerin doğruluğunu değerlendirmek için hassasiyet (precision), modelin gerçek pozitifleri tespit etme yeteneğini ölçmek için duyarlılık (recall) ve modelin genel sınıflandırma kapasitesini yansıtan, alıcı işletim karakteristiği (ROC) eğrisi altındaki alanı belirten eğri altındaki alan (AUC). Hesaplama formülleri Denklem (4), (5), (6), (7), (8), (9), (10), (11)'de gösterilmiştir:
(4)
(5)
(6)
Duyarlılık
(7)
(8)
(9)
(10)
(11)
Burada, mAP@0,5, 0,5'lik bir IoU eşiğindeki ortalama ortalama hassasiyeti (mean average precision) ifade eder; N kategori sayısıdır; APi ... ortalama hassasiyeti nedir? i-ıncı kategori; ve mAP@[0.5:0.95], 0,5 ile 0,95 arasındaki IoU eşikleri üzerinden hesaplanan ortalama mAP'dir. TP, FP, FNve TN sırasıyla doğru pozitif, yanlış pozitif, yanlış negatif ve doğru negatif sayılarını temsil eder. F işlenen toplam kare sayısıdır, T toplam işlem süresidir, TPR gerçek pozitif oranıdır ve Yalancı Pozitif Oranı yalancı pozitif oranınıdır.
YOLOv11 tespit bileşeni için kayıp fonksiyonu Denklem (12)'de gösterilmiştir:
(12)
Burada Lcoord tahmin edilen kare ile gerçek kare arasındaki sapmayı, Lconf tahmin edilen karenin güven hata payını, Lclass kategori tahmin hatasını ölçer; λcoord, λconf ve λclass ise ilgili kayıpları dengelemek için kullanılan ağırlık katsayılarıdır.
Tablo 1'deki verilerin analizi, önerilen yöntemin 0,91'lik bir mAP@0.5 ve 0,82'lik bir mAP@0.5:0.95 değerine ulaştığını göstermektedir; bu değerler YOLOv5 ile karşılaştırıldığında sırasıyla 0,04 ve 0,04'lük iyileşmeleri temsil etmektedir. F1-skoru 0,935'tir ve bu değer karşılaştırma modellerinin değerlerinden de daha yüksektir. Algılama hızı 120 FPS olup, Faster R-CNN'in dört katı, ancak YOLOv10 ve YOLOv11'den biraz daha düşüktür. Parametre sayısı 6,7M'dir; bu değer YOLOv11'den sadece 1,5M daha fazladır ve mAP@0.5'te 0,03'lük bir iyileşme sağlamıştır. Benzer hesaplama maliyetine sahip olan EfficientDet ile karşılaştırıldığında, doğruluk 0,06 daha yüksekken parametre sayısı %56 daha düşüktür. Veriler, tanıtılan çok ölçekli füzyon ve dikkat mekanizmasının küçük hedef algılama doğruluğunu etkili bir şekilde artırdığını, hız ve doğruluk arasında iyi bir denge kurduğunu kanıtlamaktadır. Özetle, önerilen yöntemimiz algılama doğruluğu ve hızı arasında bir denge sağlamaktadır. mAP@0.5 değeri, en iyi ikinci modelden 0,02 daha yüksektir, F1-skoru 0,935'e ulaşmıştır ve 6,7M parametre pratik uygulama için yeterlidir. Çok ölçekli füzyon ve dikkat mekanizması, karmaşık sahnelerdeki küçük ve tıkanmış hedeflerin tanınmasını geliştirmektedir. Model, doğruluk ve verimliliği dengeleyerek onu endüstriyel güvenlik izleme gibi gerçek zamanlı senaryolar için uygun hale getirmektedir. Özellikle, tüm karşılaştırma modelleri; 640 × 640 standart giriş çözünürlüğü, 0,45 NMS eşiği ve 0,5 güven eşiği ile resmi önceden eğitilmiş ağırlıkları kullanmıştır.
| Yöntem | mAP@0.5 | mAP@0.5:0.95 | F1-skoru | FPS | Parametreler (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| BİZİMKİ | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
Tablo 1: Model performansının kapsamlı karşılaştırma tablosu. Verilerin analizi, önerilen yöntemin 0,91 mAP@0.5 ve 0,82 mAP@0.5:0.95 değerlerine ulaştığını, bunun da YOLOv5'e kıyasla sırasıyla 0,04 ve 0,04'lük iyileşmeler olduğunu göstermektedir. F1-skoru 0,935'tir ve bu değer karşılaştırma modellerinkinden daha yüksektir. Algılama hızı, Faster R-CNN'in dört katı olan 120 FPS'dir, ancak YOLOv10 ve YOLOv11'den biraz daha düşüktür. Parametre sayısı 6,7M'dir; bu değer YOLOv11'den sadece 1,5M daha fazladır ve mAP@0.5 değerinde 0,03'lük bir iyileşme sağlamaktadır. Benzer hesaplama maliyetine sahip EfficientDet ile karşılaştırıldığında, doğruluk 0,06 daha yüksekken parametre sayısı %56 daha düşüktür. Veriler, tanıtılan çok ölçekli füzyon ve dikkat mekanizmasının küçük hedef algılama doğruluğunu etkili bir şekilde artırdığını ve hız ile doğruluk arasında iyi bir denge sağladığını kanıtlamaktadır. Özetle, önerilen yöntemimiz algılama doğruluğu ve hızı arasında bir denge kurmaktadır. mAP@0.5 değeri, ikinci en iyi modelden 0,02 daha yüksektir, F1-skoru 0,935'e ulaşmıştır ve 6,7M parametre pratik dağıtım için yeterlidir. Çok ölçekli füzyon ve dikkat mekanizması, karmaşık sahnelerdeki küçük ve engellenmiş hedeflerin tanınmasını geliştirmektedir. Model, doğruluk ve verimliliği dengeleyerek endüstriyel güvenlik izleme gibi gerçek zamanlı senaryolar için uygun hale gelmektedir. Şunu belirtmek gerekir ki, tüm karşılaştırma modelleri resmi önceden eğitilmiş ağırlıkları, 640 × 640 şeklinde tek tip giriş çözünürlüğünü, 0,45 şeklinde tek tip NMS eşiğini ve 0,5 şeklinde tek tip güven eşiğini kullanmaktadır.
Şekil 2, modelin hatalı tespit türlerinin derinlemesine bir analizini sunmaktadır. YOLOv11 + CNN, en düşük arka plan hatalı tespit oranına (10.000 karede 85 kez) sahip olup, hatalı tespitlerin çoğu benzer nesnelerde (62 kez) ve kısmen gizlenmiş sahnelerde (48 kez) meydana gelmiştir. ROC eğrisi analizi, modelin TPR değerinin 0,1 FPR'de 0,9'a ulaştığını (AUC = 0,98) göstermektedir ve eğriler arasındaki en dar boşluk, tespit güvenilirliğinin yüksekliğini desteklemektedir. Bu analiz sonuçları yalnızca modelin performansını desteklemekle kalmaz, aynı zamanda özellikle benzer nesneleri ayırt etme yeteneğinin güçlendirilmesi yoluyla, sonraki hatalı tespit optimizasyonları için net bir teknik yol haritası sağlar.

Şekil 2. Hata analizi. Modelin hatalı tespit türlerinin analizi. YOLOv11 + CNN, en düşük arka plan hatalı tespit oranına (10.000 karede 85 kez) sahiptir ve hatalı tespitlerin çoğunluğu benzer nesnelerde (62 kez) ve kısmen engellenmiş sahnelerde (48 kez) yoğunlaşmıştır. ROC eğrisi analizi, modelin TPR değerinin 0.1'lik bir FPR'de 0.9'a ulaştığını (AUC = 0.98) göstermektedir ve eğriler arasındaki en dar boşluk, tespit güvenilirliğini desteklemektedir. Bu analiz sonuçları sadece modelin performansını desteklemekle kalmayıp, aynı zamanda özellikle benzer nesneleri ayırt etme yeteneğinin güçlendirilmesi yoluyla, sonraki hatalı tespit optimizasyonları için net bir teknik yol haritası sunmaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Şekil 3, modelin çeşitli donanım platformlarındaki performansını karşılaştırmaktadır. YOLOv11 + CNN, Edge tensor işlem birimi (TPU) üzerinde sadece ±2 ms'lik bir dalgalanma ile 18 ms'lik ultra düşük bir gecikme süresine ulaşırken, güç tüketimi 15 W seviyesinde kontrol edilmektedir. Verim testleri, modelin Jetson Xavier uç bilişim cihazlarında 70 FPS'lik bir işlem hızına ulaştığını ve 99. yüzdelik dilim gecikmesinin 50 ms dahilinde kontrol edildiğini göstermektedir. Bu dağıtım performans göstergeleri, modelin endüstriyel alanlardaki çeşitli bilişim platformlarının dağıtım ihtiyaçlarına uyum sağlamasına olanak tanır. Hata analizi, modelin kaynak kısıtlı ortamlarda istikrarlı performansı koruyabildiğini göstererek mühendislik uygulanabilirliğini kanıtlamaktadır.

Şekil 3. Dağıtım performansı. Modelin çeşitli donanım platformlarındaki performansının karşılaştırılması. YOLOv11 + CNN, Edge TPU'da 18 ms'lik ultra düşük bir gecikme (yalnızca ±2 ms dalgalanma ile) elde eder ve güç tüketimi 15 W seviyesinde kontrol edilir. Throughput testleri, modelin Jetson Xavier uç bilişim cihazlarında 70 FPS'lik bir işlem hızına ulaştığını ve 99. persentil gecikmenin 50 ms içerisinde kontrol edildiğini göstermektedir. Bu dağıtım performans göstergeleri, modelin endüstriyel alanlardaki çeşitli bilişim platformlarının dağıtım ihtiyaçlarına uyum sağlayabileceğini göstermektedir. Hata analizi, modelin kaynak kısıtlı ortamlarda kararlı performans sergileyebildiğini göstererek mühendislik uygulanabilirliğini kanıtlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Şekil 4, altı hedef kategori genelinde her bir modelin tespit performansı farklılıklarını karşılaştırmaktadır. YOLOv11 + CNN, güvenlik kaskı tanıma görevinde 0,96'lık bir doğruluk elde ederek kıyaslama modelini 4 yüzde puan farkla geçmiştir. Kesikli çizgi grafiği, modelin kategoriler arasında minimum performans dalgalanmaları (±0,05) sergilediğini göstermekte ve bu durum modelin genelleme yeteneklerini yansıtmaktadır. Isı haritası olarak sunulan hata matrisi, tehlikeli alan ile robotik kol arasında %15'lik bir karşılıklı yanlış tespit olduğunu ortaya koymaktadır. Bu bulgu, sonraki model optimizasyonu için net bir yön sağlamaktadır.

Şekil 4. Kategori tespit analizi. Altı hedef kategori genelinde her bir modelin tespit performans farklarının karşılaştırılması. YOLOv11 + CNN, güvenlik kaskı tanıma görevinde %0,96 doğruluk elde ederek referans modeli 4 yüzde puanı ile geçmiştir. Noktalı grafik, modelin kategoriler arasında minimal performans dalgalanmaları (±0,05) sergilediğini göstererek genelleme yeteneklerini yansıtmaktadır. Isı haritası olarak sunulan karışıklık matrisi, tehlikeli alan ile robot kol arasında %15 oranında karşılıklı yanlış tespit olduğunu ortaya koymaktadır. Bu bulgu, sonraki model optimizasyonu için net bir yön sağlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Şekil 5, her bir model için eğitim sürecinin kapsamlı bir kaydını sunmaktadır. YOLOv11 + CNN, kaybın 30 epoch içerisinde 0,1'e düşmesiyle en hızlı yakınsama hızını sergilemektedir ve doğrulama seti mAP eğrisi ile eğitim seti arasındaki fark tutarlı bir şekilde %1'den azdır. Hata bandı grafiği analizi, modelin nihai doğrulama mAP@0.5 değerinin 0,94 ± 0,01'de sabit olduğunu ve performans dalgalanma aralığının RetinaNet'inkinin yalnızca üçte biri olduğunu göstermektedir. Bu sonuçlar, ortak eğitim protokolünün etkinliğini desteklemektedir. Model, eğitimin erken aşamalarında performans avantajları göstermekte olup, bu durum mimari tasarımının özellikleri hızlıca öğrenmesini sağladığını belirtmektedir.

Şekil 5. Eğitim sürecinin analizi. Her bir model için eğitim sürecinin kaydı. YOLOv11 + CNN en hızlı yakınsama hızını sergilemekte (kayıp 30 epoch içinde 0.1'e düşmektedir) ve doğrulama seti mAP eğrisi ile eğitim seti arasındaki fark her zaman %1'den azdır. Hata bandı grafiği analizi, modelin nihai doğrulama mAP@0.5 değerinin 0.94 ± 0.01 seviyesinde stabil olduğunu ve performans dalgalanma aralığının RetinaNet'inkinin yalnızca üçte biri olduğunu göstermektedir. Bu sonuçlar, ortak eğitim protokolünün etkinliğini desteklemektedir. Model, eğitimin erken aşamalarında performans avantajları göstermekte olup, bu durum mimari tasarımının özellikleri hızlı bir şekilde öğrenmesini sağladığını belirtmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Tablo 2, karmaşık ortamlardaki farklı tespit modelleri için nicel performans sonuçlarını sunmaktadır. Standart aydınlatma koşulları ve çeşitli uç senaryolar genelindeki test verileri, YOLOv11 + CNN'nin tüm koşullar altında optimal performansı koruduğunu göstermektedir. Standart aydınlatma koşulları altında, bu modelin mAP@0.5 değeri 0,91'e ulaşarak YOLOv5 (0,87) ve Faster R-CNN'den (0,84) önemli ölçüde daha iyi sonuç vermiştir. Çevresel koşulların kötüleşmesiyle birlikte, her modelin performansı farklı derecelerde azalmaktadır ancak YOLOv11 + CNN en güçlü çevresel dayanıklılığı sergilemektedir: düşük ışık koşullarında (< 50 lux), performans yalnızca %3 oranında azalırken (0,88'e), bu durum karşılaştırma modelindeki %5'lik düşüşten daha iyidir; yoğun örtüşmeli senaryolarda (> 50%), mAP değeri hala 0,78 seviyesinde tutulabilmekte ve performans kaybı (%13), YOLOv5 (%15) ve Faster R-CNN'den (%16) önemli ölçüde daha düşük kalmaktadır. Bu sonuçlar, YOLOv11 + CNN'nin, geliştirilmiş özellik füzyonu ve dikkat mekanizmaları aracılığıyla modelin aydınlatma değişiklikleri ve örtüşmeler gibi karmaşık faktörlere adaptasyonunu artırdığını, böylece endüstriyel senaryolardaki pratik uygulamaları desteklediğini kanıtlamaktadır.
| Test Koşulu | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | Performans Dalgalanması |
| Standart Aydınlatma | 0.91 | 0.87 | 0.84 | 0.01 |
| Düşük Işık (< 50 lüks) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| Kısmi Tıkanıklık (%30–50) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| Ağır Oklüzyon (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| Hareket Bulanıklığı | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
Tablo 2: Çevresel uyumluluğun nicel analiz tablosu. Karmaşık ortamlarda farklı tespit modellerinin nicel analiz yoluyla performansı. Standart aydınlatma koşullarından çeşitli ekstrem senaryolara kadar olan test verileri, YOLOv11 + CNN'in tüm test koşulları altında en yüksek performansı koruduğunu göstermektedir. Standart aydınlatma koşulları altında, bu modelin mAP@0.5 değeri 0,91'e ulaşmış olup YOLOv5 (0,87) ve Faster R-CNN'den (0,84) önemli ölçüde daha iyi sonuç vermiştir. Çevresel koşulların kötüleşmesiyle birlikte, her bir modelin performansı farklı derecelerde azalmaktadır, ancak YOLOv11 + CNN değerlendirilen modeller arasında en güçlü çevresel dayanıklılığı göstermektedir: düşük ışık koşullarında (< 50 lux), performans yalnızca %3 oranında azalmış (0,88'e düşmüş) olup bu durum karşılaştırma modelinin %5'lik azalmasından daha iyidir; yüksek derecede örtülü senaryolarda (> 50%), mAP değeri hala 0,78'de tutulabilmekte ve performans kaybı (%13), YOLOv5 (%15) ve Faster R-CNN'in (%16) kaybından anlamlı derecede daha düşük seyretmektedir. Bu sonuçlar, YOLOv11 + CNN'in geliştirilmiş bir özellik füzyon mekanizması ve dikkat tasarımı aracılığıyla, aydınlatma değişiklikleri ve örtülme girişimi gibi karmaşık faktörlere karşı modelin uyumluluğunu artırdığını kanıtlamakta ve endüstriyel senaryolardaki pratik uygulamaları desteklemektedir.
Tablo 3, yakınsamayı hızlandırmak ve salınımları bastırmak için 0,9 momentum ile SGD optimizasyonunun bu deneyde kullanıldığını göstermektedir. Optimizasyonu hassaslaştırmak amacıyla, eğitim sırasında kademeli olarak azalan kosinüs tavlaması (cosine annealing) ile 0,01'lik bir başlangıç öğrenme hızı kullanılmıştır. L2 regülarizasyonu uygulamak ve aşırı öğrenmeyi (overfitting) azaltmak için 0,0005'lik bir ağırlık azalması (weight decay) eklenmiştir. 32'lik bir grup boyutu (batch size), hesaplama verimliliği ile gradyan kestirim stabilitesi arasında denge sağlamıştır. 200 eğitim epoku yeterli yakınsamanın gerçekleşmesini sağlamıştır. Parametreler, eğitim hızı ve doğruluğu dengeleyerek tek aşamalı tespit görevine uyarlanmıştır.
| Parametre | Değer |
| Optimize Edici | Stokastik Gradyan İnişi |
| Başlangıç öğrenme oranı | 0.01 |
| Momentum | 0.9 |
| Ağırlık azalımı | 0.0005 |
| Grup boyutu | 32 |
| Eğitim epokları | 200 |
| Öğrenme oranı planlaması | Kosinüs tavlaması |
Tablo 3: Eğitim hiperparametre tablosu. Bu deneyde, yakınsamayı hızlandırmak ve salınımları bastırmak için 0,9 momentumlu SGD optimizatörü kullanılmıştır. Optimizasyonu hassaslaştırmak için eğitim sırasında kademeli olarak azalan kosinüs tavlamasıyla birlikte 0,01 başlangıç öğrenme hızı kullanılmıştır. L2 düzenlilemesi uygulamak ve aşırı öğrenmeyi azaltmak için 0,0005 ağırlık azalması eklenmiştir. 32'lik bir grup boyutu (batch size), hesaplama verimliliği ile gradyan kestirim stabilitesini dengelemiştir. 200 eğitim epoku yeterli yakınsamanın sağlanmasını garanti etmiştir. Parametreler, eğitim hızı ve doğruluğu dengeleyecek şekilde tek aşamalı tespit görevine uyarlanmıştır.
Tablo 4, baz hattı olarak YOLOv11 kullanıldığında mAP@0.5 değerinin 0.89 olduğunu göstermektedir. Yalnızca çok ölçekli füzyonun eklenmesi, doğruluğu 0.88'e düşürmektedir. Kanal dikkati ve uzamsal dikkatin sırasıyla ardışık olarak eklenmesi, doğruluğu sırasıyla 0.90 ve 0.89'a çıkarmaktadır. Tüm modüllerin birleşik doğruluğu, baz hattına kıyasla 0.02'lik bir artışla 0.91'e ulaşmaktadır. Veriler, kanal dikkatinin doğruluğu doğrudan artırdığını ve çok ölçekli yapı ile dikkatin birleşik performansının optimal olduğunu göstermektedir.
| Yapılandırma | mAP@0.5 |
| YOLOv11 (temel model) | 0.89 |
| + Çok ölçekli füzyon | 0.88 |
| + Çok ölçekli + kanal dikkati | 0.9 |
| + Çok ölçekli + uzamsal dikkat | 0.89 |
| Tam modül (YOLOv11 + CNN) | 0.91 |
Tablo 4: Ablasyon testi tablosu. YOLOv11 temel olarak kullanıldığında mAP@0.5 değeri 0,89'dur. Yalnızca çok ölçekli füzyonun eklenmesi doğruluğu 0,88'e düşürmektedir. Çok ölçekli füzyondan sonra kanal dikkati veya uzamsal dikkatin eklenmesi, doğruluğu sırasıyla 0,90 ve 0,89'a çıkarmaktadır. Tüm modüllerin birleşik doğruluğu, temel modele göre 0,02'lik bir artışla 0,91'e ulaşmaktadır. Veriler, bu kurulumda kanal dikkatinin uzamsal dikkate göre daha fazla kazanç sağladığını ve çok ölçekli füzyon ile dikkatin birleşik performansının optimal olduğunu göstermektedir.
Şekil 6, modelin ekstrem ortamlardaki performansını sistematik olarak değerlendirmektedir. YOLOv11 + CNN'in mAP değeri düşük ışık koşullarında yalnızca %6 oranında düşerek 0,88'e gerilemiş ve yoğun örtüşmeli sahnelerde 0,78'lik bir mAP değerini (referans değerin %8 önünde) korumuştur. Bu sonuçlar, modelin çevresel adaptasyon yeteneği sergilediğini, endüstriyel üretimdeki yaygın aydınlatma değişikliklerini ve yerel örtüşme sorunlarını etkili bir şekilde giderdiğini, böylece tespit sisteminin stabil çalışmasını desteklediğini göstermektedir.

Şekil 6. Çevresel adaptasyon. Modelin ekstrem ortamlardaki performansının sistematik bir değerlendirmesi. YOLOv11 + CNN'in mAP değeri düşük ışık koşullarında yalnızca %6 oranında düşmüş (0.88'e inmiş) ve yoğun oklüzyon içeren sahnelerde hala 0.78 mAP (referans değerin %8 önünde) değerini korumuştur. Bu sonuçlar, modelin çevresel adaptasyon sergilediğini, endüstriyel üretimdeki yaygın aydınlatma değişikliklerini ve yerel oklüzyon sorunlarını etkili bir şekilde çözerek tespit sisteminin stabil çalışmasını desteklediğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Şekil 7, t-SNE boyut indirgeme aracılığıyla altı tip endüstriyel hedef üzerindeki YOLOv11 ve YOLOv11 + CNN arasındaki öznitelik dağılım farklarını karşılaştırmaktadır. Soldaki şekil, temel YOLOv11 modelinin özniteliklerinin, özellikle "Danger Zone" (kırmızı) ve "Vehicle" (mor) kategorilerinde önemli ölçüde örtüştüğü belirgin bir sınıf içi dağılım (sınıf içi mesafe 2.34 ± 0.15) sergilediğini göstermektedir; bu durum, 3. deney grubundaki %15'lik hatalı tespit oranıyla tutarlıdır. Sağdaki şekil ise, geliştirilmiş YOLOv11 + CNN'in öznitelik geliştirme modülü aracılığıyla sınıf içi kompaktlığı önemli ölçüde artırdığını ve her kategori içindeki küme merkezleri arasındaki ortalama mesafeyi 1,8 kat artırdığını göstermektedir.

Şekil 7. t-SNE Öznitelik Dağılım Karşılaştırması. t-SNE boyut indirgeme aracılığıyla altı tip endüstriyel hedef üzerinde YOLOv11 ve YOLOv11 + CNN arasındaki öznitelik dağılım farklarının karşılaştırılması. Soldaki şekil, temel model olan YOLOv11'in özniteliklerinin, özellikle önemli ölçüde örtüşmenin olduğu "Tehlike Bölgesi" (kırmızı) ve "Araç" (mor) kategorilerinde belirgin bir sınıf içi dağılım (sınıf içi mesafe 2,34 ± 0,15) sergilediğini göstermektedir; bu durum deney grubu 3'teki %15'lik yanlış tespit oranıyla uyumludur. Sağdaki şekil, geliştirilmiş YOLOv11 + CNN modelinin öznitelik geliştirme modülü aracılığıyla sınıf içi kompaktlığı önemli ölçüde artırdığını ve her kategorideki küme merkezleri arasındaki ortalama mesafenin 1,8 kat arttığını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Şekil 8, sistematik ablasyon deneyleri aracılığıyla her bir modülün katkısını doğrulamaktadır. Ablasyon sonuçları, çok ölçekli füzyondan sonra kanal dikkatinin eklenmesinin mAP@0.5 değerini 0.90'a çıkardığını, uzaysal dikkatin eklenmesinin ise mAP@0.5 değerini 0.89'a çıkardığını göstermektedir. Tam modül, 0.91 ile en yüksek mAP@0.5 değerine ulaşmaktadır. Isı haritası görselleştirmesi, bileşik dikkat mekanizmasının hem tehlikeli bölgenin merkezine (aktivasyon değeri: +0.15) hem de kenardaki küçük hedeflere (+0.08) olan tespit yanıtını eş zamanlı olarak artırabildiğini göstermektedir. Deneysel veriler, çok ölçekli özellik füzyonunun ve dikkat mekanizmalarının kümülatif bir etkiye sahip olduğunu ve modelin farklı ölçeklerdeki hedef tespit gereksinimlerini karşılamasını sağladığını kanıtlamaktadır.

Şekil 8Modüler ablasyon deneyi. Sistematik ablasyon deneyleri aracılığıyla her bir modülün katkısının doğrulanması. Ablasyon sonuçları, çok ölçekli füzyondan sonra kanal dikkat mekanizmasının eklenmesinin mAP@0.5 değerini 0,90'a çıkardığını, uzamsal dikkat mekanizmasının eklenmesinin ise mAP@0.5 değerini 0,89'a çıkardığını göstermektedir. Tam modül, 0,91 ile en yüksek mAP@0.5 değerine ulaşmaktadır. Isı haritası görselleştirmesi, bileşik dikkat mekanizmasının hem tehlikeli alanın merkezine olan tespit yanıtını (aktivasyon değeri: +0,15) hem de kenarlardaki küçük hedeflere olan yanıtı (+0,08) eş zamanlı olarak artırabildiğini göstermektedir. Deneysel veriler, çok ölçekli özellik füzyonunun ve dikkat mekanizmalarının kümülatif bir etkiye sahip olduğunu ve modelin farklı ölçeklerdeki hedef tespit gereksinimlerini karşılamasını sağladığını kanıtlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
VERİ KULLANILABİLİRLİĞİ:
Ham üretim hattı görüntülerinin ve video akışlarının tamamı endüstriyel gizlilik kısıtlamalarına tabidir ve kamuya açık olarak yayınlanmamıştır. Ek Veri Seti Açıklaması (Ek Dosya 1), veri seti edinme ayrıntılarını, kategori ve senaryo dağılımlarını, açıklama (annotation) özelliklerini, kalite kontrol prosedürlerini, veri bölümlerini, ön işleme ve artırma prosedürlerini sunmaktadır. Bir Sözde Kod ve Yeniden Üretilebilirlik Çerçevesi (Ek Dosya 2), sözde kod düzeyinde bir iş akışı, yapılandırma açıklamaları ve yeniden üretim için kılavuz sağlamaktadır. Kurumsal ve gizlilik kısıtlamalarına tabi olmak kaydıyla, ticari olmayan akademik araştırmalar için sorumlu yazardan anonimleştirilmiş bir alt küme ve ek destekleyici materyaller talep edilebilir.
Ek Dosya 1. Tamamlayıcı veri kümesi açıklaması. Bu dosya; veri kümesi edinme protokolünü, senaryo kapsamını, sınıf dağılımını, açıklama spesifikasyonlarını, kalite kontrol prosedürlerini, eğitim/doğrulama/test bölümlendirmesini, ön işlemeyi ve veri artırma prosedürlerini açıklamaktadır. Lütfen bu dosyayı indirmek için buraya tıklayınız.
Ek Dosya 2. Sözde kod ve tekrarlanabilirlik çerçevesi. Bu dosya; ön işleme, eğitim, değerlendirme ve dağıtım için sözde kod düzeyinde iş akışı ve yapılandırma ayrıntılarını sağlamakta, ayrıca ham endüstriyel görüntüler üzerindeki kısıtlamaları ve destekleyici materyallere erişimi açıklamaktadır. Bu dosyayı indirmek için lütfen buraya tıklayın.