Yöntem makalesi

Derin Öğrenme Tabanlı Nesne Algılama ve Özellik İyileştirme Kullanarak Üretim Hattı Güvenliğinin Gerçek Zamanlı İzlenmesi

29 görüntülenme

DOI:

10.3791/70968

21 Ağustos 2026

Bu makalede

Özet

Bu çalışma, You Only Look Once versiyon 11 (YOLOv11)'i evrişimli sinir ağları ile entegre eden bir üretim hattı güvenlik izleme yöntemi önermektedir. Değerlendirilen temel modellerden daha yüksek performans gösteren bu yöntem, bir grafik işlem birimi üzerinde 0,5 birlik kesişim-birleşim eşiğinde ortalama ortalama hassasiyet (mAP@0.5) 0,91, mAP@0.5:0.95 ise 0,82 ve saniyede 120 kare hıza ulaşmıştır.

Özet

Endüstri 4.0'ın derinleşmesiyle birlikte, üretim hatlarının otomasyon ve zeka seviyeleri önemli ölçüde artmış, bu durum izlemenin gerçek zamanlı performansı, doğruluğu ve güvenliğine yönelik talepleri yükseltmiştir. Manuel denetimlere veya basit eşik tabanlı kararlara dayanan geleneksel izleme sistemleri, genellikle yavaş tepki süreleri, yüksek yanlış alarm oranları ve sınırlı zeka sorunlarından muzdariptir. Bu nedenle, bu çalışma You Only Look Once versiyon 11 (YOLOv11) ile bir evrişimli sinir ağını (CNN) entegre eden bir üretim hattı güvenlik izleme sistemi önermektedir. İlk olarak, elde edilen görüntüler ön işlemeden geçirilmiştir. Ardından, işçileri, ekipmanları ve potansiyel tehlikeleri gerçek zamanlı olarak tanımlamak için YOLOv11 kullanılmıştır. Sonrasında, küçük ve engellenmiş hedefler için özellik çıkarma yeteneklerini artırmak amacıyla, çok ölçekli özellik füzyonu ve dikkat mekanizmalarıyla geliştirilmiş bir CNN ağı tanıtılmıştır. Son olarak, güvenlik durumunu değerlendirmek için tespit sonuçları, CNN ile geliştirilmiş özelliklerle birleştirilmiştir. Deneyler, momentumu 0.9, başlangıç öğrenme oranı 0.01, ağırlık azalması (weight decay) 0.0005, kosinüs tavlamalı (cosine-annealed) öğrenme oranı ayarı, 32'lik bir grup boyutu (batch size) ve 200 epok boyunca eğitimle, stokastik gradyan inişi (SGD) optimizasyonu kullanılarak özgün bir üretim hattı güvenlik veri seti üzerinde gerçekleştirilmiştir. Değerlendirilen temel algoritmalarla karşılaştırma yapmak için değerlendirme metrikleri olarak mAP@0.5 ve saniyedeki kare sayısı (FPS) cinsinden tespit hızı kullanılmıştır. Sonuçlar, önerilen sistemin 0.91'lik bir mAP@0.5 ve 120 FPS'lik bir tespit hızına ulaştığını göstermektedir. Sistem ayrıca gölgelenme ve değişken aydınlatma gibi karmaşık koşullar altında güçlü bir performans sergileyerek, üretim hattı güvenlik izlemedeki etkinliğini ve pratik uygulama potansiyelini kanıtlamıştır.

Giriş

Modern endüstriyel üretimde güvenlik, üretim verimliliğinin ve personel refahının sağlanmasının temel taşıdır. Üretim hattı ortamı genellikle yüksek hızlı mekanik ekipmanlar, karmaşık teknolojik süreçler ve birden fazla görevi içeren ortaklaşa operasyonlar içerir. Potansiyel olan her küçük güvenlik tehlikesi, ciddi üretim kazalarına yol açarak önemli ekonomik kayıplara ve hatta can kayıplarına neden olabilir. Bu nedenle, endüstriyel üretimde güvenliği artırmak için verimli, akıllı ve gerçek zamanlı bir güvenlik izleme sisteminin kurulması büyük önem taşımaktadır1,2.

Geleneksel güvenlik izleme yöntemleri temel olarak manuel video gözetimine ve çeşitli sensörlere (kızılötesi, duman ve titreşim sensörleri gibi)3 dayanmaktadır. Manuel izleme sadece verimsiz olmakla kalmayıp, aynı zamanda izleme personelinin yorgunluğu nedeniyle gözden kaçan tespitlere yatkındır ve sürekli ve kapsamlı bir kapsama alanı sağlayamaz. Sensörler belirli bir erken uyarı işlevi görebilse de tespit menzilleri sınırlıdır ve çevresel girişimlere karşı hassastırlar; bu durum, belirgin yanlış alarm problemlerine yol açar4. Akıllı izleme sistemleri, giderek artan bir araştırma odağı haline gelmiştir. Bir derin öğrenme algoritması kullanılarak bir video akışının gerçek zamanlı analizi; anormal olayları, güvensiz davranışları ve potansiyel tehlikeleri otomatik olarak tanımlayabilir ve böylece izleme sisteminin zekasını büyük ölçüde artırabilir4,5.

Nesne tespiti, akıllı izleme sistemlerinde temel bir teknolojidir. Tek aşamalı nesne dedektörlerinin temsilcileri olan You Only Look Once (YOLO) serisi algoritmalar, önemli avantajlar sergilemektedir. YOLOv1'den YOLOv8'e kadar olan bu algoritma koleksiyonu; ağ mimarisi, kayıp fonksiyonu ve eğitim metodolojisi gibi çeşitli yönlerde iyileştirmelerle sürekli bir gelişim süreci geçirmiştir6,7. Özellikle YOLOv11, özellikle karmaşık arka planlar ve yoğun şekilde yerleşmiş hedeflerle karşılaşıldığında, yüksek kare hızını korurken daha yüksek tespit doğruluğu elde etmiştir8.

Bununla birlikte, genel nesne tespit görevlerindeki mükemmel performansına rağmen, YOLOv11 belirli üretim hattı güvenlik izleme senaryolarında hâlâ zorluklarla karşılaşmaktadır9. Örneğin, işçiler ekipmanlar tarafından kısmen engellendiğinde veya güvenlik işaretleri küçük olup arka plan rengine çok benzediğinde YOLOv11 tespit doğruluğu azalabilir. Bu durum, modelin daha güçlü özellik çıkarma ve anlamsal anlama yeteneklerine sahip olmasını gerektirmektedir10.

Konvolüsyonel sinir ağları (CNN'ler), görüntü öznitelik çıkarımında güçlü yeteneklere sahiptir11. Daha derin ve daha karmaşık ağ mimarileri tasarlanarak, CNN'ler daha zengin ve daha soyut görüntü öznitelikleri öğrenebilir. Bir CNN'in YOLOv11 ilele birleştirilmesi, YOLOv11'in hızlı tespit yeteneklerinden ve CNN'in derin öznitelik çıkarımından yararlanarak daha sağlam ve akıllı bir güvenlik izleme sistemi oluşturur.

Buna dayanarak, bu makale YOLOv11 ve bir CNN kullanan bir üretim hattı güvenlik izleme sistemi önermektedir. Bu çalışmanın yenilikçi yönleri şunlardır: (1) YOLOv11 ve geliştirilmiş bir CNN'den oluşan derin bir füzyon mimarisinin önerilmesi; (2) temel güvenlik özelliklerinin tanınmasını artırmak için çok ölçekli özellik füzyonunun ve kompozit bir dikkat mekanizmasının tanıtılması; ve (3) modelin performans avantajlarının, özel olarak oluşturulmuş karmaşık bir sahne veri seti üzerinde doğrulanması.

YOLO serisi algoritmalarının geliştirilmesi
2015 yılında Redmon ve arkadaşları tarafından ilk kez tanıtılmasından beri12, You Only Look Once (YOLO) algoritması büyük ilgi görmüştür. Bölge önerilerine dayanan iki aşamalı dedektörlerin aksine YOLO, nesne tespitini bir regresyon görevi olarak ele alır. Bir görüntüdeki nesnelerin sınıflarını ve konumlarını doğrudan tahmin ederek YOLO, tespit hızını belirgin şekilde artırır ve bu da onu gerçek zamanlı kullanım için uygun hale getirir13.

Bu serideki öncü çalışma olan YOLOv1, uçtan uca hedef tespitini ilk kez gerçekleştirmiştir14. YOLOv1, giriş görüntüsünün bir ızgara yapısına bölünmesini içerir; burada genellikle S × S formatında düzenlenen her bir ızgara hücresi, kendi sınırları içine düşen nesneleri tespit etmekle görevlidir.

Özellikle, YOLOv1'in çıktısı bir tensördür. S × S × (B × 5 + C) içinde, her bir sınırlayıcı kutu tahmini 5 öge içerir: merkez nokta koordinatı (x,y), genişlik w, yükseklik h ve güven skoru c. Hesaplama süreci Denklem (1)'de gösterilmiştir:
Nesne tespit analizi için Olasılık ve Kesişim üzerinden Birleşim (IoU) formülü.   (1)

Bunlar arasında Pr(Object), ızgarada bir hedef bulunma olasılığını; IOU ise tahmin edilen sınırlayıcı kutu ile gerçek (ground-truth) kutu arasındaki kesişimin birleşime oranını temsil eder. Her ızgara ayrıca, bir hedefin varlığı durumunda hedefle ilgili sınıf olasılıkları kümesini, yani hedefin i. sınıfa ait olma olasılığını temsil eden Pr değerlerini tahmin eder. YOLOv1'in kayıp fonksiyonu üç ana bileşenden oluşur: koordinat tahmini kaybı, güven tahmini kaybı ve kategori tahmini kaybı15.

YOLOv2; kararlılığı ve doğruluğu artıran Batch Normalization, yüksek çözünürlüklü bir sınıflandırıcı ve çok ölçekli bir eğitim stratejisi sunar16. YOLOv3, omurga ağ olarak Darknet-53'ü kullanır ve hedef tespitini geliştirmek için Feature Pyramid Network (FPN) kavramından esinlenir17.

YOLOv4, YOLOv3 üzerine çok sayıda optimizasyon yaparak modelin performansını daha da artırmak için Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 ve Mosaic veri geliştirme gibi teknolojiler sunmuştur. YOLOv5 ise mühendislik açısından önemli katkılar sağlayarak daha kolay kullanılabilen ve daha verimli bir uygulama sunmuştur20.

Son yıllarda YOLO serisi, YOLOv6, YOLOv7 ve YOLOv8 gibi sürümlerin birbiri ardına yayınlanmasıyla gelişmeye devam etmiştir. Genişletilmiş Verimli Katman Birleştirme Ağı (E-ELAN) yapısını ve model yeniden parametrelendirme tekniklerini tanıtan YOLOv7, hem hız hem de doğruluk açısından yeni kırılmalar gerçekleştirmiştir. Bu geliştirmeler, yalnızca özellik öğreniminin verimliliğini artırmakla kalmaz, aynı zamanda ağın çıkarım performansını da optimize ederek YOLOv7'nin önceki sürümleri ve birçok ana akım detektörü çeşitli gerçek zamanlı nesne tespit görevlerinde geride bırakmasını sağlar. YOLOv8 ise ağ yapısını daha da optimize eder, anchor-free (çapa içermeyen) bir tasarım benimser, modeli sadeleştirir ve genelleme yeteneğini artırır21.

Önceki versiyonların avantajları üzerine inşa edilen ve bu çalışmada kullanılan YOLOv11, karmaşık endüstriyel senaryolar için optimize edilmiştir. Temel geliştirmeleri arasında bir özellik çıkarım ağı, daha verimli bir özellik füzyon modülü ve daha sağlam bir kayıp fonksiyonu tasarımı yer almaktadır. Bu iyileştirmeler, YOLOv11'in üretim ortamlarındaki oklüzyonlar, küçük hedefler ve karmaşık arka planlarla başa çıkarken daha iyi performans göstermesini sağlar. YOLOv11, Ultralytics tarafından yayınlanan YOLO serisinin bir versiyonudur. YOLOv8 ile karşılaştırıldığında, C3K2 modülünü ve özellik füzyon yolunu iyileştirmiş ve adaptif bir çapa kutusu stratejisi getirerek endüstriyel senaryolarda daha güçlü bir tespit sağlamlığı sunmuştur.

Evrişimli Sinir Ağları (CNN) temelleri ve gelişimi
Evrişimli sinir ağı (CNN), bilgisayarlı görü alanında derin öğrenmenin başarısını derinden etkileyen temel bir modeldir. Bu model, evrişim işlemleri aracılığıyla yerel görüntü özelliklerini çıkararak ve ardından havuzlama işlemleriyle özellik boyutluluğunu azaltarak hiyerarşik görüntü soyutlaması gerçekleştirir22.

Tipik bir CNN; birden fazla konvolüsyonel, havuzlama ve tam bağlantılı katmandan oluşur. Konvolüsyonel katman, giriş görüntüsünü bir konvolüsyon çekirdeği ile tarar, yerel bölgeler üzerinden nokta çarpımları hesaplar ve bir özellik haritası oluşturur. Hesaplama işlemi Denklem (2)'de gösterilmiştir:

Konvolüsyon işlemi formül diyagramı; makine öğrenimi modelleri için matematiksel notasyon.   (2)

Burada x giriş görüntüsünü, wk ve bk sırasıyla konvolüsyon çekirdeğinin ağırlığını ve sapmasını, Algoritmalarda kullanılan matris veya tensör operasyonlarıyla potansiyel olarak ilişkili y_ij^k matematiksel ifadesi. ise çıkış özellik haritasının (i,j) konumundaki değerlerini temsil eder. Havuzlama katmanı genellikle Maksimum Havuzlama (Max Pooling) veya Ortalama Havuzlama (Average Pooling) kullanır. Tam bağlantılı katman ise özellikleri çıkarmaktan ve sınıflandırma olasılıklarını tahmin etmekten sorumludur.

Buna dayanarak, bu çalışma YOLOv11 için iki paralel koldan oluşan bir CNN özellik geliştirme modülü tasarlamaktadır: Çok ölçekli özellikleri çıkarmak için 3 × 3 ve 5 × 5 konvolüsyon çekirdeklerini kullanan çok ölçekli bir konvolüsyon kolu ve ana hedeflerin ayırt edici özelliklerini geliştirmek için kanal dikkat (Squeeze-and-Excitation) ve uzamsal dikkat modüllerini ardışık olarak bağlayan bir dikkat kolu. İki kolun çıktıları eleman bazlı toplama ile birleştirilir ve ilgili özellik geliştirme kayıp fonksiyonu formül (3)'te gösterilmiştir:

 alt="Kayıp fonksiyonu koordinasyonu için matematiksel formül L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat" (3)

Lcoord sınırlayıcı kutu koordinat regresyon kaybıdır; Lconf hedef güven kaybıdır; Lcls kategori sınıflandırma kaybıdır; Lfeat ise CNN iyileştirme modülü tarafından çıkarılan küçük hedeflerin ve engellenmiş hedeflerin ayırt edici özelliklerini kısıtlamak için kullanılan özellik iyileştirme kaybıdır; λcoord, λconf, λcls, λfeat ilgili kayıp terimlerinin ağırlık katsayılarıdır. Bu görev için λfeat = 0.05 olarak ayarlanmış ve kalan ağırlıklar tespit görevi gereksinimlerine göre dengelenmiştir.

VGGNet23 ve ResNet24 gibi klasik CNN yapıları, görüntü sınıflandırma görevlerinde büyük başarılar elde etmiştir. Bu mimariler arasında ResNet, derin ağ eğitimindeki kaybolan gradyan problemini etkili bir şekilde hafifleterek daha derin ve daha karmaşık ağ yapılarının oluşturulmasını kolaylaştırır.

Nesne tespit görevlerinde, CNN genellikle bir özellik çıkarıcı (backbone) olarak kullanılır. Örneğin, YOLO algoritma serisindeki Darknet, cross-stage partial Darknet (CSPDarknet) vb. yapıların tümü CNN üzerine kurulmuştur25. Özellik çıkarma yeteneklerini artırmak için araştırmacılar çok sayıda geliştirilmiş CNN yapısı önermişlerdir. Örneğin, Inception modülü, çok ölçekli konvolüsyon çekirdekleri aracılığıyla özellikleri paralel olarak çıkarır. DenseNet, yoğun bağlantılarla özelliklerin yeniden kullanımını artırır. Squeeze-and-Excitation Network ise dikkat mekanizmaları aracılığıyla özellik kanallarının önemini adaptif olarak ayarlar26.

Bu çalışmada, YOLOv11'in özellik çıkarma yeteneklerini geliştirmek için geliştirilmiş bir CNN modülü tasarladık. Bu modül, üretim hattı senaryolarındaki temel güvenlik bilgilerini daha etkili bir şekilde yakalamak için çok ölçekli özellik füzyonunu bir dikkat mekanizması ile birleştirir.

Derin öğrenmenin endüstriyel güvenlik izlemedeki uygulama durumu
Derin öğrenme, endüstriyel güvenlik izleme alanında önemli bir ilgi görmüştür. İşçilerin güvenlik kasklarını uygun şekilde takıp takmadıklarını belirlemek, tehlikeli bölgelere yetkisiz girişleri tespit etmek ve arızalı ekipmanların durumunu izlemek için CNN tabanlı algoritmalar kullanılmaktadır27.

Davranış tanıma açısından, çalışanların operasyonel davranışlarını analiz etmek ve potansiyel olarak güvensiz eylemleri belirlemek için 3D CNN'ler ve tekrarlayan sinir ağları kullanılır. Örneğin, çalışanların duruş dizileri analiz edilerek, güvenlik işletim prosedürlerini ihlal edip etmedikleri belirlenebilir28.

YOLO ve Faster R-CNN, gerçek zamanlı gözetleme videolarında personel ve ekipman tespiti için yaygın olarak kullanılmaktadır. Örneğin, literatürde YOLOv5 tabanlı gerçek zamanlı bir kask tespit sistemi önerilmiş ve bu sistem şantiye güvenlik yönetiminin zekasını etkili bir şekilde artırmıştır29.

Mevcut araştırmalarda bazı ilerlemeler kaydedilmiş olsa da, çeşitli zorluklar devam etmektedir. İlk olarak, endüstriyel sahneler tipik olarak karmaşık aydınlatma, oklüzyon ve arka plan girişimleri içerir ki bunlar algoritmanın dayanıklılığına yönelik katı gereksinimler getirir. İkinci olarak, gerçek zamanlı performans temel bir gerekliliktir ve algoritma, doğruluğunu korurken yüksek hızlı çıkarım gerçekleştirmelidir. Son olarak, mevcut araştırmalar öncelikle tek görevli saptamaya odaklanmaktadır ve çok kaynaklı bilgi füzyonu ile kapsamlı analizlerin keşfi konusunda yetersiz kalmaktadır30.

Bu çalışmada, önerilen YOLOv11 ve CNN füzyon modeli, öznitelik çıkarma ve füzyon yeteneklerini geliştirerek yukarıdaki zorlukların üstesinden gelmeyi ve üretim hattı güvenlik risklerinin kapsamlı, gerçek zamanlı izlemesini gerçekleştirmeyi amaçlamaktadır.

Protokol

YOLOv11 ve CNN algoritması

Genel sistem mimarisi
Bu çalışmada önerilen üretim hattı güvenlik izleme sistemi, yüksek hassasiyetli ve yüksek hızlı gerçek zamanlı güvenlik izlemesi gerçekleştirmek için YOLOv11 ile geliştirilmiş bir CNN'yi birleştiren hibrit bir mimari benimsemektedir. Şekil 1'de gösterildiği gibi sistem temel olarak bir giriş ön işleme modülü, bir YOLOv11 nesne tespit modülü, bir CNN öznitelik geliştirme modülü ve bir füzyon karar modülünden oluşmaktadır. Giriş görüntüsü, modelin genelleme yeteneğini artırmak için öncelikle ön işleme modülü tarafından normalize edilir ve zenginleştirilir. Ardından, CSPDarknet omurgası ile öznitelikler çıkarılır ve spatial pyramid pooling-fast (SPPF) modülü ile alıcı alan genişletilir. Örnekleme sonrası çok ölçekli öznitelikler birleştirilir; ardından, ana hedeflerin ayırt edici temsilini daha da geliştirmek için birleştirilmiş özniteliklere sırasıyla kanal dikkati ve uzamsal dikkat uygulanır. CNN öznitelik geliştirme modülü, YOLOv11 omurga ağının C3, C4 ve C5 katmanlarının çıkışlarından sonrasına yerleştirilerek sırasıyla 80 × 80 × 256, 40 × 40 × 512 ve 20 × 20 × 1,024 boyutlarındaki çok ölçekli öznitelik haritalarını alır. CNN öznitelik geliştirme modülü, küçük ve kısmen kapanmış hedefler için öznitelik çıkarımını daha da geliştirir. Son olarak, füzyon karar modülü, YOLOv11'in tespit sonuçlarını CNN ile geliştirilmiş özniteliklerle birleştirir ve hedefin kesin konumunu, kategorisini ve güven puanını çıktı olarak vermek için bunları tasarlanmış bir kayıp fonksiyonu aracılığıyla ortaklaşa optimize eder.

YOLOv11 tespit çerçevesi
YOLOv11, YOLO serisinin tek aşamalı tespit çerçevesinin güçlü yönlerinden yararlanan birkaç kritik geliştirme sunmuştur. Mimarisi üç ana bileşene ayrılmıştır: bir omurga (backbone) ağ, bir özellik füzyon ağı ve bir tespit başlığı. Omurga ağ, geliştirilmiş bir CSPDarknet yapısı kullanır. Özellik füzyon ağı, çok ölçekli özellikleri etkili bir şekilde birleştirmek için özellik piramit ağları ve yol toplama ağlarından esinlenerek, aşamalar arası yerel bağlantıları ve derinlemesine ayrılabilir konvolüsyonları bünyesinde barındırır.

Özellik geliştirme modülü
Özellik geliştirme modülü, modelin temel güvenlik özelliklerine olan duyarlılığını artırmayı amaçlamaktadır. YOLOv11 ana ağının (backbone network) her katmanı tarafından üretilen özellik haritalarını işleyerek, üst örnekleme (upsampling) ve alt örnekleme (downsampling) işlemleri aracılığıyla farklı ölçekler arasındaki bilgileri birleştirir. Spesifik olarak, çok ölçekli dal spatial ölçek çeşitliliğini yakalarken, dikkat (attention) dalı temel kanalları ve konumsal yanıtları dinamik olarak geliştirir. Bu iki dal bağımsız olarak çalışmaz; aksine, artık bağlantılar (residual connections) ve özellik yeniden kalibrasyonu yoluyla birbirlerini tamamlar ve birleştirilirler. Her ölçekte geliştirme modülü tarafından işlenen özellik haritası, 1 × 1 konvolüsyon ile orijinal özellik haritasının kanal sayısına uygun hale getirilir ve ardından eleman bazlı toplama yoluyla orijinal YOLOv11 özellik haritası ile birleştirilir. Birleştirilen özellik haritası, çok ölçekli füzyon için sonraki Özellik Piramidi Ağına (FPN) aktarılarak hiyerarşik bir güvenlik özelliği temsili oluşturur. Modüller arasında sorunsuz bir entegrasyon sağlamak için, kayıp fonksiyonu YOLOv11 tespit kaybı ve CNN modülü özellik geliştirme kaybından oluşan, uçtan uca ortak bir eğitim stratejisi benimsenmiştir.

Evrişimli sinir ağı diyagramı; görüntü tespit süreci için Conv, ELAN, SPPF modüllerini içerir.
Şekil 1. YOLOv11-CNN algoritması. Özellik geliştirme modülü, modelin kritik güvenlik özelliklerine olan duyarlılığını artırmayı amaçlar. YOLOv11 omurgasının çeşitli katmanlarından gelen özellik haritalarını işleyerek, üst örnekleme (upsampling) ve alt örnekleme (downsampling) işlemleri aracılığıyla farklı ölçeklerdeki özellikleri birleştirir. Ek olarak, kanal ve uzamsal dikkat mekanizmaları içerir. YOLOv11 ve CNN modülleri arasında sorunsuz bir entegrasyon sağlamak için ortak bir eğitim stratejisi uygulanır. Eğitim sırasında, her iki modülün parametreleri uçtan uca optimize edilir. Kayıp fonksiyonu, YOLOv11'in tespit kaybı ile CNN modülünün özellik geliştirme kaybını birleştirir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Sonuçlar

Önerilen YOLOv11 ve CNN füzyon modelinin üretim hattı güvenlik izlemedeki etkinliğini doğrulamak için çeşitli güvenlik tehlikesi senaryolarını kapsayan bir veri seti oluşturulmuştur. Bu veri seti, 42 sabit rastgele tohum (seed) kullanılarak 7:1,5:1,5 oranında eğitim, doğrulama ve test setlerine ayrılmış 12.000 üretim hattı sahne görüntüsü içermektedir. Veri seti; standart aydınlatma, düşük ışık, kısmi kapanma, yoğun kapanma, hareket bulanıklığı ve karmaşık arka planlar dahil olmak üzere çeşitli çalışma koşullarını kapsamaktadır. Çıkarım için güven eşiği 0,5 ve maksimumu olmayan baskılama (NMS) eşiği 0,45 olarak belirlenmiştir. Tüm deneyler üç kez tekrarlanmış ve sonuçlar ortalama ± standart sapma olarak rapor edilmiştir. Etiketleme kategorileri, PASCAL Visual Object Classes (VOC) formatı kullanılarak işçiler, güvenlik kaskları, robotik kollar, tehlikeli alanlar, araçlar ve taşıtlar olarak belirlenmiştir. Birleşme üzerinden birleşim (IoU) eşiği 0,5 olarak ayarlanmış ve etiketleme tutarlılığı iki kişiyle çapraz doğrulama yoluyla onaylanmıştır. Giriş görüntüleri tekdüze olarak 640 × 640 boyutuna ölçeklendirilmiş ve Mosaic veri artırımıyla genişletilmiştir. Eğitim, 0,01 başlangıç öğrenme hızı, 0,9 momentum, 0,0005 ağırlık azalması ve 32 toplu işlem boyutu (batch size) ile SGD optimizasyonu kullanılarak gerçekleştirilmiştir. Eğitim 200 epok boyunca sürdürülmüş ve öğrenme hızını ayarlamak için kosinüs tavlaması (cosine annealing) kullanılmıştır.

Modelin etkinliğini kapsamlı bir şekilde değerlendirmek için çeşitli değerlendirme metrikleri kullanılmıştır: ortalama ortalama hassasiyet (mAP), görüntü karesi işleme hızını ölçmek için saniye başına kare sayısı (FPS), pozitif tahminlerin doğruluğunu değerlendirmek için hassasiyet (precision), modelin gerçek pozitifleri tespit etme yeteneğini ölçmek için duyarlılık (recall) ve modelin genel sınıflandırma kapasitesini yansıtan, alıcı işletim karakteristiği (ROC) eğrisi altındaki alanı belirten eğri altındaki alan (AUC). Hesaplama formülleri Denklem (4), (5), (6), (7), (8), (9), (10), (11)'de gösterilmiştir:

mAP hesaplama formülü, mAP@0.5=1/NΣ(Ni=1)APi, metrik, hassasiyet, veri analizi.  (4)
ortalama Ortalama Hassasiyet (mAP) hesaplama formülü; veri değerlendirme analizi için Σ denklemi.  (5)
Hassasiyet formülü, TP/(TP+FP), makine öğrenimi sonuç analizi denklemi, kısa metrik.  (6)
Duyarlılık Hassasiyet formülü, TP/(TP+FN), denklem, istatistiksel analiz, makine öğrenimi değerlendirmesi. (7)
fizikte zaman başına kuvvet hesaplamasını gösteren statik denge denklemi FPS=F/T.  (8)
Doğru pozitif oran formülü, TPR=TP/(TP+FN), istatistiksel analiz denklemi.  (9)
Yanlış pozitif oran formülü, FPR=FP/(FP+TN), istatistiksel analiz, eğitim amaçlı kullanım.  (10)
AUC formülü AUC=∫₀¹TPR(x)dx; veri analizi yorumlaması için matematiksel diyagram.  (11)

Hassasiyet-duyarlılık metrikleri; mAP@0.5, mAP@[0.5:0.95], TP, FP, FN, hassasiyet, duyarlılık; veri analizi.  Burada, mAP@0,5, 0,5'lik bir IoU eşiğindeki ortalama ortalama hassasiyeti (mean average precision) ifade eder; N kategori sayısıdır; APi ... ortalama hassasiyeti nedir? i-ıncı kategori; ve mAP@[0.5:0.95], 0,5 ile 0,95 arasındaki IoU eşikleri üzerinden hesaplanan ortalama mAP'dir. TP, FP, FNve TN sırasıyla doğru pozitif, yanlış pozitif, yanlış negatif ve doğru negatif sayılarını temsil eder. F işlenen toplam kare sayısıdır, T toplam işlem süresidir, TPR gerçek pozitif oranıdır ve Yalancı Pozitif Oranı yalancı pozitif oranınıdır.
YOLOv11 tespit bileşeni için kayıp fonksiyonu Denklem (12)'de gösterilmiştir:

Kayıp fonksiyonu formülü: \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

Statik denge denklem diyagramı: L_coord, L_conf, L_class; λ_coord, λ_conf, λ_class.  Burada Lcoord tahmin edilen kare ile gerçek kare arasındaki sapmayı, Lconf tahmin edilen karenin güven hata payını, Lclass kategori tahmin hatasını ölçer; λcoord, λconf ve λclass ise ilgili kayıpları dengelemek için kullanılan ağırlık katsayılarıdır.

Tablo 1'deki verilerin analizi, önerilen yöntemin 0,91'lik bir mAP@0.5 ve 0,82'lik bir mAP@0.5:0.95 değerine ulaştığını göstermektedir; bu değerler YOLOv5 ile karşılaştırıldığında sırasıyla 0,04 ve 0,04'lük iyileşmeleri temsil etmektedir. F1-skoru 0,935'tir ve bu değer karşılaştırma modellerinin değerlerinden de daha yüksektir. Algılama hızı 120 FPS olup, Faster R-CNN'in dört katı, ancak YOLOv10 ve YOLOv11'den biraz daha düşüktür. Parametre sayısı 6,7M'dir; bu değer YOLOv11'den sadece 1,5M daha fazladır ve mAP@0.5'te 0,03'lük bir iyileşme sağlamıştır. Benzer hesaplama maliyetine sahip olan EfficientDet ile karşılaştırıldığında, doğruluk 0,06 daha yüksekken parametre sayısı %56 daha düşüktür. Veriler, tanıtılan çok ölçekli füzyon ve dikkat mekanizmasının küçük hedef algılama doğruluğunu etkili bir şekilde artırdığını, hız ve doğruluk arasında iyi bir denge kurduğunu kanıtlamaktadır. Özetle, önerilen yöntemimiz algılama doğruluğu ve hızı arasında bir denge sağlamaktadır. mAP@0.5 değeri, en iyi ikinci modelden 0,02 daha yüksektir, F1-skoru 0,935'e ulaşmıştır ve 6,7M parametre pratik uygulama için yeterlidir. Çok ölçekli füzyon ve dikkat mekanizması, karmaşık sahnelerdeki küçük ve tıkanmış hedeflerin tanınmasını geliştirmektedir. Model, doğruluk ve verimliliği dengeleyerek onu endüstriyel güvenlik izleme gibi gerçek zamanlı senaryolar için uygun hale getirmektedir. Özellikle, tüm karşılaştırma modelleri; 640 × 640 standart giriş çözünürlüğü, 0,45 NMS eşiği ve 0,5 güven eşiği ile resmi önceden eğitilmiş ağırlıkları kullanmıştır.

YöntemmAP@0.5mAP@0.5:0.95F1-skoruFPSParametreler (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
BİZİMKİ0.910.820.9351206.7

Tablo 1: Model performansının kapsamlı karşılaştırma tablosu. Verilerin analizi, önerilen yöntemin 0,91 mAP@0.5 ve 0,82 mAP@0.5:0.95 değerlerine ulaştığını, bunun da YOLOv5'e kıyasla sırasıyla 0,04 ve 0,04'lük iyileşmeler olduğunu göstermektedir. F1-skoru 0,935'tir ve bu değer karşılaştırma modellerinkinden daha yüksektir. Algılama hızı, Faster R-CNN'in dört katı olan 120 FPS'dir, ancak YOLOv10 ve YOLOv11'den biraz daha düşüktür. Parametre sayısı 6,7M'dir; bu değer YOLOv11'den sadece 1,5M daha fazladır ve mAP@0.5 değerinde 0,03'lük bir iyileşme sağlamaktadır. Benzer hesaplama maliyetine sahip EfficientDet ile karşılaştırıldığında, doğruluk 0,06 daha yüksekken parametre sayısı %56 daha düşüktür. Veriler, tanıtılan çok ölçekli füzyon ve dikkat mekanizmasının küçük hedef algılama doğruluğunu etkili bir şekilde artırdığını ve hız ile doğruluk arasında iyi bir denge sağladığını kanıtlamaktadır. Özetle, önerilen yöntemimiz algılama doğruluğu ve hızı arasında bir denge kurmaktadır. mAP@0.5 değeri, ikinci en iyi modelden 0,02 daha yüksektir, F1-skoru 0,935'e ulaşmıştır ve 6,7M parametre pratik dağıtım için yeterlidir. Çok ölçekli füzyon ve dikkat mekanizması, karmaşık sahnelerdeki küçük ve engellenmiş hedeflerin tanınmasını geliştirmektedir. Model, doğruluk ve verimliliği dengeleyerek endüstriyel güvenlik izleme gibi gerçek zamanlı senaryolar için uygun hale gelmektedir. Şunu belirtmek gerekir ki, tüm karşılaştırma modelleri resmi önceden eğitilmiş ağırlıkları, 640 × 640 şeklinde tek tip giriş çözünürlüğünü, 0,45 şeklinde tek tip NMS eşiğini ve 0,5 şeklinde tek tip güven eşiğini kullanmaktadır.

Şekil 2, modelin hatalı tespit türlerinin derinlemesine bir analizini sunmaktadır. YOLOv11 + CNN, en düşük arka plan hatalı tespit oranına (10.000 karede 85 kez) sahip olup, hatalı tespitlerin çoğu benzer nesnelerde (62 kez) ve kısmen gizlenmiş sahnelerde (48 kez) meydana gelmiştir. ROC eğrisi analizi, modelin TPR değerinin 0,1 FPR'de 0,9'a ulaştığını (AUC = 0,98) göstermektedir ve eğriler arasındaki en dar boşluk, tespit güvenilirliğinin yüksekliğini desteklemektedir. Bu analiz sonuçları yalnızca modelin performansını desteklemekle kalmaz, aynı zamanda özellikle benzer nesneleri ayırt etme yeteneğinin güçlendirilmesi yoluyla, sonraki hatalı tespit optimizasyonları için net bir teknik yol haritası sağlar.

Nesne tespit modellerini karşılaştıran ROC eğrisi ve sütun grafiği: AUC, türe göre yanlış alarm analizi.
Şekil 2. Hata analizi. Modelin hatalı tespit türlerinin analizi. YOLOv11 + CNN, en düşük arka plan hatalı tespit oranına (10.000 karede 85 kez) sahiptir ve hatalı tespitlerin çoğunluğu benzer nesnelerde (62 kez) ve kısmen engellenmiş sahnelerde (48 kez) yoğunlaşmıştır. ROC eğrisi analizi, modelin TPR değerinin 0.1'lik bir FPR'de 0.9'a ulaştığını (AUC = 0.98) göstermektedir ve eğriler arasındaki en dar boşluk, tespit güvenilirliğini desteklemektedir. Bu analiz sonuçları sadece modelin performansını desteklemekle kalmayıp, aynı zamanda özellikle benzer nesneleri ayırt etme yeteneğinin güçlendirilmesi yoluyla, sonraki hatalı tespit optimizasyonları için net bir teknik yol haritası sunmaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 3, modelin çeşitli donanım platformlarındaki performansını karşılaştırmaktadır. YOLOv11 + CNN, Edge tensor işlem birimi (TPU) üzerinde sadece ±2 ms'lik bir dalgalanma ile 18 ms'lik ultra düşük bir gecikme süresine ulaşırken, güç tüketimi 15 W seviyesinde kontrol edilmektedir. Verim testleri, modelin Jetson Xavier uç bilişim cihazlarında 70 FPS'lik bir işlem hızına ulaştığını ve 99. yüzdelik dilim gecikmesinin 50 ms dahilinde kontrol edildiğini göstermektedir. Bu dağıtım performans göstergeleri, modelin endüstriyel alanlardaki çeşitli bilişim platformlarının dağıtım ihtiyaçlarına uyum sağlamasına olanak tanır. Hata analizi, modelin kaynak kısıtlı ortamlarda istikrarlı performansı koruyabildiğini göstererek mühendislik uygulanabilirliğini kanıtlamaktadır.

Cihazlar genelinde YOLO modelleri için throughput ve gecikme karşılaştırma grafikleri; cihaz performans analizi.
Şekil 3. Dağıtım performansı. Modelin çeşitli donanım platformlarındaki performansının karşılaştırılması. YOLOv11 + CNN, Edge TPU'da 18 ms'lik ultra düşük bir gecikme (yalnızca ±2 ms dalgalanma ile) elde eder ve güç tüketimi 15 W seviyesinde kontrol edilir. Throughput testleri, modelin Jetson Xavier uç bilişim cihazlarında 70 FPS'lik bir işlem hızına ulaştığını ve 99. persentil gecikmenin 50 ms içerisinde kontrol edildiğini göstermektedir. Bu dağıtım performans göstergeleri, modelin endüstriyel alanlardaki çeşitli bilişim platformlarının dağıtım ihtiyaçlarına uyum sağlayabileceğini göstermektedir. Hata analizi, modelin kaynak kısıtlı ortamlarda kararlı performans sergileyebildiğini göstererek mühendislik uygulanabilirliğini kanıtlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 4, altı hedef kategori genelinde her bir modelin tespit performansı farklılıklarını karşılaştırmaktadır. YOLOv11 + CNN, güvenlik kaskı tanıma görevinde 0,96'lık bir doğruluk elde ederek kıyaslama modelini 4 yüzde puan farkla geçmiştir. Kesikli çizgi grafiği, modelin kategoriler arasında minimum performans dalgalanmaları (±0,05) sergilediğini göstermekte ve bu durum modelin genelleme yeteneklerini yansıtmaktadır. Isı haritası olarak sunulan hata matrisi, tehlikeli alan ile robotik kol arasında %15'lik bir karşılıklı yanlış tespit olduğunu ortaya koymaktadır. Bu bulgu, sonraki model optimizasyonu için net bir yön sağlamaktadır.

Karışıklık matrisi ve kategori performans grafiği; kesinlik, geri çağırma, F1-skoru analizi, güvenlik modeli.
Şekil 4. Kategori tespit analizi. Altı hedef kategori genelinde her bir modelin tespit performans farklarının karşılaştırılması. YOLOv11 + CNN, güvenlik kaskı tanıma görevinde %0,96 doğruluk elde ederek referans modeli 4 yüzde puanı ile geçmiştir. Noktalı grafik, modelin kategoriler arasında minimal performans dalgalanmaları (±0,05) sergilediğini göstererek genelleme yeteneklerini yansıtmaktadır. Isı haritası olarak sunulan karışıklık matrisi, tehlikeli alan ile robot kol arasında %15 oranında karşılıklı yanlış tespit olduğunu ortaya koymaktadır. Bu bulgu, sonraki model optimizasyonu için net bir yön sağlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 5, her bir model için eğitim sürecinin kapsamlı bir kaydını sunmaktadır. YOLOv11 + CNN, kaybın 30 epoch içerisinde 0,1'e düşmesiyle en hızlı yakınsama hızını sergilemektedir ve doğrulama seti mAP eğrisi ile eğitim seti arasındaki fark tutarlı bir şekilde %1'den azdır. Hata bandı grafiği analizi, modelin nihai doğrulama mAP@0.5 değerinin 0,94 ± 0,01'de sabit olduğunu ve performans dalgalanma aralığının RetinaNet'inkinin yalnızca üçte biri olduğunu göstermektedir. Bu sonuçlar, ortak eğitim protokolünün etkinliğini desteklemektedir. Model, eğitimin erken aşamalarında performans avantajları göstermekte olup, bu durum mimari tasarımının özellikleri hızlıca öğrenmesini sağladığını belirtmektedir.

Makine öğrenimi modellerinin doğrulama mAP ve eğitim kaybını karşılaştıran kutu grafiği ve keman grafiği.
Şekil 5. Eğitim sürecinin analizi. Her bir model için eğitim sürecinin kaydı. YOLOv11 + CNN en hızlı yakınsama hızını sergilemekte (kayıp 30 epoch içinde 0.1'e düşmektedir) ve doğrulama seti mAP eğrisi ile eğitim seti arasındaki fark her zaman %1'den azdır. Hata bandı grafiği analizi, modelin nihai doğrulama mAP@0.5 değerinin 0.94 ± 0.01 seviyesinde stabil olduğunu ve performans dalgalanma aralığının RetinaNet'inkinin yalnızca üçte biri olduğunu göstermektedir. Bu sonuçlar, ortak eğitim protokolünün etkinliğini desteklemektedir. Model, eğitimin erken aşamalarında performans avantajları göstermekte olup, bu durum mimari tasarımının özellikleri hızlı bir şekilde öğrenmesini sağladığını belirtmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Tablo 2, karmaşık ortamlardaki farklı tespit modelleri için nicel performans sonuçlarını sunmaktadır. Standart aydınlatma koşulları ve çeşitli uç senaryolar genelindeki test verileri, YOLOv11 + CNN'nin tüm koşullar altında optimal performansı koruduğunu göstermektedir. Standart aydınlatma koşulları altında, bu modelin mAP@0.5 değeri 0,91'e ulaşarak YOLOv5 (0,87) ve Faster R-CNN'den (0,84) önemli ölçüde daha iyi sonuç vermiştir. Çevresel koşulların kötüleşmesiyle birlikte, her modelin performansı farklı derecelerde azalmaktadır ancak YOLOv11 + CNN en güçlü çevresel dayanıklılığı sergilemektedir: düşük ışık koşullarında (< 50 lux), performans yalnızca %3 oranında azalırken (0,88'e), bu durum karşılaştırma modelindeki %5'lik düşüşten daha iyidir; yoğun örtüşmeli senaryolarda (> 50%), mAP değeri hala 0,78 seviyesinde tutulabilmekte ve performans kaybı (%13), YOLOv5 (%15) ve Faster R-CNN'den (%16) önemli ölçüde daha düşük kalmaktadır. Bu sonuçlar, YOLOv11 + CNN'nin, geliştirilmiş özellik füzyonu ve dikkat mekanizmaları aracılığıyla modelin aydınlatma değişiklikleri ve örtüşmeler gibi karmaşık faktörlere adaptasyonunu artırdığını, böylece endüstriyel senaryolardaki pratik uygulamaları desteklediğini kanıtlamaktadır.

Test KoşuluYOLOv11 + CNNYOLOv5Faster R-CNNPerformans Dalgalanması
Standart Aydınlatma0.910.870.840.01
Düşük Işık (< 50 lüks)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
Kısmi Tıkanıklık (%30–50)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
Ağır Oklüzyon (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
Hareket Bulanıklığı0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

Tablo 2: Çevresel uyumluluğun nicel analiz tablosu. Karmaşık ortamlarda farklı tespit modellerinin nicel analiz yoluyla performansı. Standart aydınlatma koşullarından çeşitli ekstrem senaryolara kadar olan test verileri, YOLOv11 + CNN'in tüm test koşulları altında en yüksek performansı koruduğunu göstermektedir. Standart aydınlatma koşulları altında, bu modelin mAP@0.5 değeri 0,91'e ulaşmış olup YOLOv5 (0,87) ve Faster R-CNN'den (0,84) önemli ölçüde daha iyi sonuç vermiştir. Çevresel koşulların kötüleşmesiyle birlikte, her bir modelin performansı farklı derecelerde azalmaktadır, ancak YOLOv11 + CNN değerlendirilen modeller arasında en güçlü çevresel dayanıklılığı göstermektedir: düşük ışık koşullarında (< 50 lux), performans yalnızca %3 oranında azalmış (0,88'e düşmüş) olup bu durum karşılaştırma modelinin %5'lik azalmasından daha iyidir; yüksek derecede örtülü senaryolarda (> 50%), mAP değeri hala 0,78'de tutulabilmekte ve performans kaybı (%13), YOLOv5 (%15) ve Faster R-CNN'in (%16) kaybından anlamlı derecede daha düşük seyretmektedir. Bu sonuçlar, YOLOv11 + CNN'in geliştirilmiş bir özellik füzyon mekanizması ve dikkat tasarımı aracılığıyla, aydınlatma değişiklikleri ve örtülme girişimi gibi karmaşık faktörlere karşı modelin uyumluluğunu artırdığını kanıtlamakta ve endüstriyel senaryolardaki pratik uygulamaları desteklemektedir.

Tablo 3, yakınsamayı hızlandırmak ve salınımları bastırmak için 0,9 momentum ile SGD optimizasyonunun bu deneyde kullanıldığını göstermektedir. Optimizasyonu hassaslaştırmak amacıyla, eğitim sırasında kademeli olarak azalan kosinüs tavlaması (cosine annealing) ile 0,01'lik bir başlangıç öğrenme hızı kullanılmıştır. L2 regülarizasyonu uygulamak ve aşırı öğrenmeyi (overfitting) azaltmak için 0,0005'lik bir ağırlık azalması (weight decay) eklenmiştir. 32'lik bir grup boyutu (batch size), hesaplama verimliliği ile gradyan kestirim stabilitesi arasında denge sağlamıştır. 200 eğitim epoku yeterli yakınsamanın gerçekleşmesini sağlamıştır. Parametreler, eğitim hızı ve doğruluğu dengeleyerek tek aşamalı tespit görevine uyarlanmıştır.

ParametreDeğer
Optimize EdiciStokastik Gradyan İnişi
Başlangıç öğrenme oranı0.01
Momentum0.9
Ağırlık azalımı0.0005
Grup boyutu32
Eğitim epokları200
Öğrenme oranı planlamasıKosinüs tavlaması

Tablo 3: Eğitim hiperparametre tablosu. Bu deneyde, yakınsamayı hızlandırmak ve salınımları bastırmak için 0,9 momentumlu SGD optimizatörü kullanılmıştır. Optimizasyonu hassaslaştırmak için eğitim sırasında kademeli olarak azalan kosinüs tavlamasıyla birlikte 0,01 başlangıç öğrenme hızı kullanılmıştır. L2 düzenlilemesi uygulamak ve aşırı öğrenmeyi azaltmak için 0,0005 ağırlık azalması eklenmiştir. 32'lik bir grup boyutu (batch size), hesaplama verimliliği ile gradyan kestirim stabilitesini dengelemiştir. 200 eğitim epoku yeterli yakınsamanın sağlanmasını garanti etmiştir. Parametreler, eğitim hızı ve doğruluğu dengeleyecek şekilde tek aşamalı tespit görevine uyarlanmıştır.

Tablo 4, baz hattı olarak YOLOv11 kullanıldığında mAP@0.5 değerinin 0.89 olduğunu göstermektedir. Yalnızca çok ölçekli füzyonun eklenmesi, doğruluğu 0.88'e düşürmektedir. Kanal dikkati ve uzamsal dikkatin sırasıyla ardışık olarak eklenmesi, doğruluğu sırasıyla 0.90 ve 0.89'a çıkarmaktadır. Tüm modüllerin birleşik doğruluğu, baz hattına kıyasla 0.02'lik bir artışla 0.91'e ulaşmaktadır. Veriler, kanal dikkatinin doğruluğu doğrudan artırdığını ve çok ölçekli yapı ile dikkatin birleşik performansının optimal olduğunu göstermektedir.

YapılandırmamAP@0.5
YOLOv11 (temel model)0.89
+ Çok ölçekli füzyon0.88
+ Çok ölçekli + kanal dikkati0.9
+ Çok ölçekli + uzamsal dikkat0.89
Tam modül (YOLOv11 + CNN)0.91

Tablo 4: Ablasyon testi tablosu. YOLOv11 temel olarak kullanıldığında mAP@0.5 değeri 0,89'dur. Yalnızca çok ölçekli füzyonun eklenmesi doğruluğu 0,88'e düşürmektedir. Çok ölçekli füzyondan sonra kanal dikkati veya uzamsal dikkatin eklenmesi, doğruluğu sırasıyla 0,90 ve 0,89'a çıkarmaktadır. Tüm modüllerin birleşik doğruluğu, temel modele göre 0,02'lik bir artışla 0,91'e ulaşmaktadır. Veriler, bu kurulumda kanal dikkatinin uzamsal dikkate göre daha fazla kazanç sağladığını ve çok ölçekli füzyon ile dikkatin birleşik performansının optimal olduğunu göstermektedir.

Şekil 6, modelin ekstrem ortamlardaki performansını sistematik olarak değerlendirmektedir. YOLOv11 + CNN'in mAP değeri düşük ışık koşullarında yalnızca %6 oranında düşerek 0,88'e gerilemiş ve yoğun örtüşmeli sahnelerde 0,78'lik bir mAP değerini (referans değerin %8 önünde) korumuştur. Bu sonuçlar, modelin çevresel adaptasyon yeteneği sergilediğini, endüstriyel üretimdeki yaygın aydınlatma değişikliklerini ve yerel örtüşme sorunlarını etkili bir şekilde giderdiğini, böylece tespit sisteminin stabil çalışmasını desteklediğini göstermektedir.

Nesne tespit modeli performans grafikleri; aydınlatma ve oklüzyon etkisi analiz edildi; mAP@0.5 metrikleri.
Şekil 6. Çevresel adaptasyon. Modelin ekstrem ortamlardaki performansının sistematik bir değerlendirmesi. YOLOv11 + CNN'in mAP değeri düşük ışık koşullarında yalnızca %6 oranında düşmüş (0.88'e inmiş) ve yoğun oklüzyon içeren sahnelerde hala 0.78 mAP (referans değerin %8 önünde) değerini korumuştur. Bu sonuçlar, modelin çevresel adaptasyon sergilediğini, endüstriyel üretimdeki yaygın aydınlatma değişikliklerini ve yerel oklüzyon sorunlarını etkili bir şekilde çözerek tespit sisteminin stabil çalışmasını desteklediğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 7, t-SNE boyut indirgeme aracılığıyla altı tip endüstriyel hedef üzerindeki YOLOv11 ve YOLOv11 + CNN arasındaki öznitelik dağılım farklarını karşılaştırmaktadır. Soldaki şekil, temel YOLOv11 modelinin özniteliklerinin, özellikle "Danger Zone" (kırmızı) ve "Vehicle" (mor) kategorilerinde önemli ölçüde örtüştüğü belirgin bir sınıf içi dağılım (sınıf içi mesafe 2.34 ± 0.15) sergilediğini göstermektedir; bu durum, 3. deney grubundaki %15'lik hatalı tespit oranıyla tutarlıdır. Sağdaki şekil ise, geliştirilmiş YOLOv11 + CNN'in öznitelik geliştirme modülü aracılığıyla sınıf içi kompaktlığı önemli ölçüde artırdığını ve her kategori içindeki küme merkezleri arasındaki ortalama mesafeyi 1,8 kat artırdığını göstermektedir.

YOLOv11 ile YOLOv11+CNN öznitelik kümeleme grafiği, sınıf içi mesafe analizi, veri görselleştirme.
Şekil 7. t-SNE Öznitelik Dağılım Karşılaştırması. t-SNE boyut indirgeme aracılığıyla altı tip endüstriyel hedef üzerinde YOLOv11 ve YOLOv11 + CNN arasındaki öznitelik dağılım farklarının karşılaştırılması. Soldaki şekil, temel model olan YOLOv11'in özniteliklerinin, özellikle önemli ölçüde örtüşmenin olduğu "Tehlike Bölgesi" (kırmızı) ve "Araç" (mor) kategorilerinde belirgin bir sınıf içi dağılım (sınıf içi mesafe 2,34 ± 0,15) sergilediğini göstermektedir; bu durum deney grubu 3'teki %15'lik yanlış tespit oranıyla uyumludur. Sağdaki şekil, geliştirilmiş YOLOv11 + CNN modelinin öznitelik geliştirme modülü aracılığıyla sınıf içi kompaktlığı önemli ölçüde artırdığını ve her kategorideki küme merkezleri arasındaki ortalama mesafenin 1,8 kat arttığını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 8, sistematik ablasyon deneyleri aracılığıyla her bir modülün katkısını doğrulamaktadır. Ablasyon sonuçları, çok ölçekli füzyondan sonra kanal dikkatinin eklenmesinin mAP@0.5 değerini 0.90'a çıkardığını, uzaysal dikkatin eklenmesinin ise mAP@0.5 değerini 0.89'a çıkardığını göstermektedir. Tam modül, 0.91 ile en yüksek mAP@0.5 değerine ulaşmaktadır. Isı haritası görselleştirmesi, bileşik dikkat mekanizmasının hem tehlikeli bölgenin merkezine (aktivasyon değeri: +0.15) hem de kenardaki küçük hedeflere (+0.08) olan tespit yanıtını eş zamanlı olarak artırabildiğini göstermektedir. Deneysel veriler, çok ölçekli özellik füzyonunun ve dikkat mekanizmalarının kümülatif bir etkiye sahip olduğunu ve modelin farklı ölçeklerdeki hedef tespit gereksinimlerini karşılamasını sağladığını kanıtlamaktadır.

Dikkat haritaları ile YOLO çerçevelerinde özellik iyileştirmenin ablasyon çalışması grafiği; performans analizi.
Şekil 8Modüler ablasyon deneyi. Sistematik ablasyon deneyleri aracılığıyla her bir modülün katkısının doğrulanması. Ablasyon sonuçları, çok ölçekli füzyondan sonra kanal dikkat mekanizmasının eklenmesinin mAP@0.5 değerini 0,90'a çıkardığını, uzamsal dikkat mekanizmasının eklenmesinin ise mAP@0.5 değerini 0,89'a çıkardığını göstermektedir. Tam modül, 0,91 ile en yüksek mAP@0.5 değerine ulaşmaktadır. Isı haritası görselleştirmesi, bileşik dikkat mekanizmasının hem tehlikeli alanın merkezine olan tespit yanıtını (aktivasyon değeri: +0,15) hem de kenarlardaki küçük hedeflere olan yanıtı (+0,08) eş zamanlı olarak artırabildiğini göstermektedir. Deneysel veriler, çok ölçekli özellik füzyonunun ve dikkat mekanizmalarının kümülatif bir etkiye sahip olduğunu ve modelin farklı ölçeklerdeki hedef tespit gereksinimlerini karşılamasını sağladığını kanıtlamaktadır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

VERİ KULLANILABİLİRLİĞİ:
Ham üretim hattı görüntülerinin ve video akışlarının tamamı endüstriyel gizlilik kısıtlamalarına tabidir ve kamuya açık olarak yayınlanmamıştır. Ek Veri Seti Açıklaması (Ek Dosya 1), veri seti edinme ayrıntılarını, kategori ve senaryo dağılımlarını, açıklama (annotation) özelliklerini, kalite kontrol prosedürlerini, veri bölümlerini, ön işleme ve artırma prosedürlerini sunmaktadır. Bir Sözde Kod ve Yeniden Üretilebilirlik Çerçevesi (Ek Dosya 2), sözde kod düzeyinde bir iş akışı, yapılandırma açıklamaları ve yeniden üretim için kılavuz sağlamaktadır. Kurumsal ve gizlilik kısıtlamalarına tabi olmak kaydıyla, ticari olmayan akademik araştırmalar için sorumlu yazardan anonimleştirilmiş bir alt küme ve ek destekleyici materyaller talep edilebilir.

Ek Dosya 1. Tamamlayıcı veri kümesi açıklaması. Bu dosya; veri kümesi edinme protokolünü, senaryo kapsamını, sınıf dağılımını, açıklama spesifikasyonlarını, kalite kontrol prosedürlerini, eğitim/doğrulama/test bölümlendirmesini, ön işlemeyi ve veri artırma prosedürlerini açıklamaktadır. Lütfen bu dosyayı indirmek için buraya tıklayınız.

Ek Dosya 2. Sözde kod ve tekrarlanabilirlik çerçevesi. Bu dosya; ön işleme, eğitim, değerlendirme ve dağıtım için sözde kod düzeyinde iş akışı ve yapılandırma ayrıntılarını sağlamakta, ayrıca ham endüstriyel görüntüler üzerindeki kısıtlamaları ve destekleyici materyallere erişimi açıklamaktadır. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tartışma

Deneysel sonuçlar, önerilen YOLOv11–CNN füzyon modelinin üretim hattı güvenlik izleme için tespit doğruluğunu ve gerçek zamanlı performansı artırdığını göstermektedir. YOLOv11'in verimli tek aşamalı tespiti ve CNN modülünün özellik geliştirmesinden yararlanan sistem; karmaşık aydınlatma ve tıkanıklık (oklüzyon) koşulları altında işçileri, ekipmanları ve tehlikeli alanları tanımlamıştır. Çok ölçekli özellik füzyonu ve dikkat mekanizmaları, temel güvenlik unsurlarına odaklanma yeteneğini artırarak erken uyarı için yorumlanabilir görsel kanıtlar sağlamıştır.

Sistem; gerçek zamanlı izlemenin manuel denetime olan bağımlılığı azaltabildiği ve potansiyel güvenlik tehlikelerine verilen yanıt sürelerini kısalttığı otomobil üretimi ve elektronik montaj gibi ortamlardaki üretim hatları için pratik bir değere sahiptir. Vidalar ve aletler gibi küçük hedefler ile robotik kollar veya diğer ekipmanlar tarafından kısmen engellenmiş çalışan hedefleri için, çok ölçekli özellik füzyonu ve dikkat mekanizmaları, modelin güvenlikle ilgili özellikleri çıkarma ve vurgulama yeteneğini geliştirmektedir. Bu iyileştirmeler, hedeflerin boyut ve görünürlük açısından farklılık gösterdiği üretim ortamları için geçerlidir.

Bununla birlikte, bu çalışmanın hâlâ belirgin sınırlamaları bulunmaktadır. Şiddetli tıkanıklık veya çok düşük aydınlatma altında, hedef öznitelik bilgileri eksik hale geldiği ve mevcut evrişimli öznitelikler yetersiz kalabildiği için modelin performansı düşebilir. Yeni eklenen CNN öznitelik geliştirme modülü, düşük maliyetli uç cihazlar üzerindeki hesaplama yükünü artırabilecek ve kaynak kısıtlı ortamlarda konuşlandırmayı sınırlayabilecek 1,5M ek parametre getirmektedir. Bu çalışma, görünür ışık görüntü verilerini kullanmakta olup kızılötesi termal görüntüleme veya milimetre dalga radarı gibi çok modlu sensör bilgilerini entegre etmemektedir; bu nedenle, tam karanlık veya duman gibi ekstrem endüstriyel sahnelerde performans sınırlı kalabilir.

Gelecekteki araştırmalar şu yönlere odaklanacaktır: tespit performansını korurken parametre yükünü azaltmak için yapılandırılmış budama ve bilgi damıtma tabanlı model hafifletme; aşırı aydınlatma ve dumanlı ortamlarda tespit yeteneğini artırmak için görünür-kızılötesi çok modlu füzyon tespit çerçevesinin oluşturulması; konvolüsyonel katmanların bir kısmının yerini almak ve uzun mesafeli bağlamsal özellik çıkarımını geliştirmek için hafif bir Transformer modülünün eklenmesi ve hedef tespitinden davranış erken uyarısına kadar tüm iş akışını desteklemek için uçtan uca bir anormal davranış tanıma alt sisteminin geliştirilmesi.

Sonuç olarak, bu çalışma, karmaşık endüstriyel ortamlardaki potansiyel güvenlik tehlikelerinin gerçek zamanlı tespiti ve erken uyarılmasına olanak sağlamak için YOLOv11 ve CNN algoritmalarını birleştiren bir üretim hattı güvenlik izleme sistemine odaklanmaktadır. Deneysel doğrulama yoluyla, füzyon modeli nesne tespit doğruluğu ve çıkarım hızı açısından performans avantajları göstermiştir. Verimli tek aşamalı tespit mimarisi ve optimize edilmiş özellik çıkarımı ile YOLOv11; işçilerin, ekipmanların ve tehlikeli alanların hızla belirlenmesinde başarılı performans sergilemiş ve üretim hattı senaryolarındaki temel güvenlik unsurlarını doğru bir şekilde yakalamıştır. Aynı zamanda, geliştirilmiş CNN modülünün eklenmesi, özellik yakalama kapasitesini ve engellenmiş hedeflerin tespitini daha da artırmıştır. Üretim hattı güvenlik izlemede model, görsel analiz yoluyla görüntüdeki temel güvenlik alanlarına otomatik olarak odaklanarak güvenlik uyarıları için yorumlanabilir bir temel sağlamaktadır. Füzyon modeli; işleme, montaj ve depolama dahil olmak üzere çeşitli üretim hattı senaryolarında güçlü bir adaptasyon yeteneği ve kararlılık sergilemiştir. Bu çalışmanın temel katkıları şunlardır:

(1) Tespit hızı ve doğruluğu dengelemek için YOLOv11 ve CNN'den oluşan derin bir füzyon mimarisi tasarlanmıştır.
(2) Karmaşık senaryolardaki temel güvenlik unsurlarına odaklanma yeteneğini artırmak için çok ölçekli bir özellik füzyonu ve dikkat optimizasyon mekanizması oluşturulmuştur.
(3) Kendi oluşturulan üretim hattı güvenlik veri kümesi üzerinde yapılan deneyler, modelin 0,91 mAP@0.5 değerine ve 120 FPS tespit hızına ulaştığını göstermiştir. Senaryolar arası testlerde model, kararlı bir performans sergilemiştir.

Tipik vaka çalışmaları, standart aydınlatma koşulları altında, sadece %40'ı açıkta olan bir güvenlik kaskının çok ölçekli füzyon ve kanal dikkati ile doğru şekilde tespit edildiğini (güven düzeyi 0,93), temel modelin ise bunu arka plan olarak yanlış tanımladığını göstermiştir. Düşük ışıklı senaryolarda, bir işçi tehlikeli bir alana girdiğinde, uzamsal dikkat hedefi yönlendirici çizgilerle başarıyla sınırlandırmış, karşılaştırma yöntemi ise bunu tespit edememiştir. Hatalar arasında, şiddetli oklüzyon altında dokusunun arka planla benzerliği nedeniyle bir İngiliz anahtarının yanlışlıkla alet olarak tespit edilmesi ve düşük ışık koşulları altında uzaktaki düşük sinyal-gürültü oranı nedeniyle bir güvenlik kaskının gözden kaçırılması yer almaktadır; bu durum ekstrem koşullar altındaki öznitelik temsilindeki sınırlamaları ortaya koymaktadır. Bu sonuçlar, modelin normal ve orta derecede karmaşık senaryolarda dayanıklı olduğunu ancak ekstrem koşullarda hala iyileştirmeye ihtiyaç duyduğunu göstermektedir.

Açıklamalar

Yazarların beyan edeceği herhangi bir çıkar çatışması bulunmamaktadır.

Teşekkürler

Bu çalışma kısmen Taizhou Üniversitesi İleri Yetenekler için Bilimsel Araştırma Vakfı'nın "Akıllı imalat için hassas tespitin temel teknolojileri üzerine araştırma" (TZXY2020QDJJ006) kapsamında desteklenmiştir.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
COCO API   Y/AHedef tespit doğruluğu değerlendirmesi ve istatistiksel analiz için kullanılan değerlendirme aracı.
CUDA 11.4NVIDIAY/APyTorch 1.12 framework'ü ile birlikte kullanılan paralel hesaplama platformu.
Edge TPU   Y/AGecikme ve güç tüketimi testleri için kullanılan dağıtım platformu; bildirilen gecikme 18 ms ve güç tüketimi 15 W olarak kaydedilmiştir.
Jetson Xavier uç bilişim cihazıNVIDIA   İş çıkarma kapasitesi (throughput) testleri için kullanılan uç bilişim cihazı; bildirilen işlem hızı 70 FPS ve %99'luk dilim gecikmesi 50 ms'nin altındadır.
NVIDIA Tesla V100 GPUNVIDIA   Eğitim/değerlendirme sunucusunda kullanılan GPU.
PyTorch 1.12   Y/AModel eğitimi ve değerlendirmesi için kullanılan derin öğrenme framework'ü.
scikit-learn    Y/AModel değerlendirmesi için kullanılan değerlendirme/istatistiksel analiz aracı.
Kendi oluşturulan üretim hattı güvenlik veri setiY/AY/AVOC formatında, standart aydınlatma, düşük aydınlatma, kısmi oklüzyon, ağır oklüzyon, hareket bulanıklığı ve karmaşık arka planları kapsayan 12.000 üretim hattı sahne görüntüsünden oluşan veri seti; altı etiketleme kategorisi: işçiler, güvenlik kaskları, robotik kollar, tehlikeli alanlar, araçlar ve taşıtlar.
Eğitim sunucusu       NVIDIA Tesla V100 GPU ve Ubuntu 20.04 işletim sistemi ile donatılmış sunucu.
Ubuntu 20.04 işletim sistemi     Y/AEğitim/değerlendirme sunucusunda kullanılan işletim sistemi.
VOC etiketleme formatıY/AY/AKendi oluşturulan üretim hattı güvenlik veri seti için kullanılan etiketleme formatı.
YOLOv11 nesne tespit modeliUltralyticsY/Aİşçileri, ekipmanları ve potansiyel tehlikeleri gerçek zamanlı olarak tespit etmek için kullanılan nesne tespit modeli.

Kaynaklar

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Yeniden basım ve izinler

Etiketler

Ger ek Zamanl zlemeDerin renme TespitiYOLOv11Evri imli Sinir Aok l ekli znitelik F zyonuDikkat MekanizmasEnd striyel Otomasyon