Modern endüstriyel üretimde güvenlik, üretim verimliliğinin ve personel refahının sağlanmasının temel taşıdır. Üretim hattı ortamı genellikle yüksek hızlı mekanik ekipmanlar, karmaşık teknolojik süreçler ve birden fazla görevi içeren ortaklaşa operasyonlar içerir. Potansiyel olan her küçük güvenlik tehlikesi, ciddi üretim kazalarına yol açarak önemli ekonomik kayıplara ve hatta can kayıplarına neden olabilir. Bu nedenle, endüstriyel üretimde güvenliği artırmak için verimli, akıllı ve gerçek zamanlı bir güvenlik izleme sisteminin kurulması büyük önem taşımaktadır1,2.
Geleneksel güvenlik izleme yöntemleri temel olarak manuel video gözetimine ve çeşitli sensörlere (kızılötesi, duman ve titreşim sensörleri gibi)3 dayanmaktadır. Manuel izleme sadece verimsiz olmakla kalmayıp, aynı zamanda izleme personelinin yorgunluğu nedeniyle gözden kaçan tespitlere yatkındır ve sürekli ve kapsamlı bir kapsama alanı sağlayamaz. Sensörler belirli bir erken uyarı işlevi görebilse de tespit menzilleri sınırlıdır ve çevresel girişimlere karşı hassastırlar; bu durum, belirgin yanlış alarm problemlerine yol açar4. Akıllı izleme sistemleri, giderek artan bir araştırma odağı haline gelmiştir. Bir derin öğrenme algoritması kullanılarak bir video akışının gerçek zamanlı analizi; anormal olayları, güvensiz davranışları ve potansiyel tehlikeleri otomatik olarak tanımlayabilir ve böylece izleme sisteminin zekasını büyük ölçüde artırabilir4,5.
Nesne tespiti, akıllı izleme sistemlerinde temel bir teknolojidir. Tek aşamalı nesne dedektörlerinin temsilcileri olan You Only Look Once (YOLO) serisi algoritmalar, önemli avantajlar sergilemektedir. YOLOv1'den YOLOv8'e kadar olan bu algoritma koleksiyonu; ağ mimarisi, kayıp fonksiyonu ve eğitim metodolojisi gibi çeşitli yönlerde iyileştirmelerle sürekli bir gelişim süreci geçirmiştir6,7. Özellikle YOLOv11, özellikle karmaşık arka planlar ve yoğun şekilde yerleşmiş hedeflerle karşılaşıldığında, yüksek kare hızını korurken daha yüksek tespit doğruluğu elde etmiştir8.
Bununla birlikte, genel nesne tespit görevlerindeki mükemmel performansına rağmen, YOLOv11 belirli üretim hattı güvenlik izleme senaryolarında hâlâ zorluklarla karşılaşmaktadır9. Örneğin, işçiler ekipmanlar tarafından kısmen engellendiğinde veya güvenlik işaretleri küçük olup arka plan rengine çok benzediğinde YOLOv11 tespit doğruluğu azalabilir. Bu durum, modelin daha güçlü özellik çıkarma ve anlamsal anlama yeteneklerine sahip olmasını gerektirmektedir10.
Konvolüsyonel sinir ağları (CNN'ler), görüntü öznitelik çıkarımında güçlü yeteneklere sahiptir11. Daha derin ve daha karmaşık ağ mimarileri tasarlanarak, CNN'ler daha zengin ve daha soyut görüntü öznitelikleri öğrenebilir. Bir CNN'in YOLOv11 ilele birleştirilmesi, YOLOv11'in hızlı tespit yeteneklerinden ve CNN'in derin öznitelik çıkarımından yararlanarak daha sağlam ve akıllı bir güvenlik izleme sistemi oluşturur.
Buna dayanarak, bu makale YOLOv11 ve bir CNN kullanan bir üretim hattı güvenlik izleme sistemi önermektedir. Bu çalışmanın yenilikçi yönleri şunlardır: (1) YOLOv11 ve geliştirilmiş bir CNN'den oluşan derin bir füzyon mimarisinin önerilmesi; (2) temel güvenlik özelliklerinin tanınmasını artırmak için çok ölçekli özellik füzyonunun ve kompozit bir dikkat mekanizmasının tanıtılması; ve (3) modelin performans avantajlarının, özel olarak oluşturulmuş karmaşık bir sahne veri seti üzerinde doğrulanması.
YOLO serisi algoritmalarının geliştirilmesi
2015 yılında Redmon ve arkadaşları tarafından ilk kez tanıtılmasından beri12, You Only Look Once (YOLO) algoritması büyük ilgi görmüştür. Bölge önerilerine dayanan iki aşamalı dedektörlerin aksine YOLO, nesne tespitini bir regresyon görevi olarak ele alır. Bir görüntüdeki nesnelerin sınıflarını ve konumlarını doğrudan tahmin ederek YOLO, tespit hızını belirgin şekilde artırır ve bu da onu gerçek zamanlı kullanım için uygun hale getirir13.
Bu serideki öncü çalışma olan YOLOv1, uçtan uca hedef tespitini ilk kez gerçekleştirmiştir14. YOLOv1, giriş görüntüsünün bir ızgara yapısına bölünmesini içerir; burada genellikle S × S formatında düzenlenen her bir ızgara hücresi, kendi sınırları içine düşen nesneleri tespit etmekle görevlidir.
Özellikle, YOLOv1'in çıktısı bir tensördür. S × S × (B × 5 + C) içinde, her bir sınırlayıcı kutu tahmini 5 öge içerir: merkez nokta koordinatı (x,y), genişlik w, yükseklik h ve güven skoru c. Hesaplama süreci Denklem (1)'de gösterilmiştir:
(1)
Bunlar arasında Pr(Object), ızgarada bir hedef bulunma olasılığını; IOU ise tahmin edilen sınırlayıcı kutu ile gerçek (ground-truth) kutu arasındaki kesişimin birleşime oranını temsil eder. Her ızgara ayrıca, bir hedefin varlığı durumunda hedefle ilgili sınıf olasılıkları kümesini, yani hedefin i. sınıfa ait olma olasılığını temsil eden Pr değerlerini tahmin eder. YOLOv1'in kayıp fonksiyonu üç ana bileşenden oluşur: koordinat tahmini kaybı, güven tahmini kaybı ve kategori tahmini kaybı15.
YOLOv2; kararlılığı ve doğruluğu artıran Batch Normalization, yüksek çözünürlüklü bir sınıflandırıcı ve çok ölçekli bir eğitim stratejisi sunar16. YOLOv3, omurga ağ olarak Darknet-53'ü kullanır ve hedef tespitini geliştirmek için Feature Pyramid Network (FPN) kavramından esinlenir17.
YOLOv4, YOLOv3 üzerine çok sayıda optimizasyon yaparak modelin performansını daha da artırmak için Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 ve Mosaic veri geliştirme gibi teknolojiler sunmuştur. YOLOv5 ise mühendislik açısından önemli katkılar sağlayarak daha kolay kullanılabilen ve daha verimli bir uygulama sunmuştur20.
Son yıllarda YOLO serisi, YOLOv6, YOLOv7 ve YOLOv8 gibi sürümlerin birbiri ardına yayınlanmasıyla gelişmeye devam etmiştir. Genişletilmiş Verimli Katman Birleştirme Ağı (E-ELAN) yapısını ve model yeniden parametrelendirme tekniklerini tanıtan YOLOv7, hem hız hem de doğruluk açısından yeni kırılmalar gerçekleştirmiştir. Bu geliştirmeler, yalnızca özellik öğreniminin verimliliğini artırmakla kalmaz, aynı zamanda ağın çıkarım performansını da optimize ederek YOLOv7'nin önceki sürümleri ve birçok ana akım detektörü çeşitli gerçek zamanlı nesne tespit görevlerinde geride bırakmasını sağlar. YOLOv8 ise ağ yapısını daha da optimize eder, anchor-free (çapa içermeyen) bir tasarım benimser, modeli sadeleştirir ve genelleme yeteneğini artırır21.
Önceki versiyonların avantajları üzerine inşa edilen ve bu çalışmada kullanılan YOLOv11, karmaşık endüstriyel senaryolar için optimize edilmiştir. Temel geliştirmeleri arasında bir özellik çıkarım ağı, daha verimli bir özellik füzyon modülü ve daha sağlam bir kayıp fonksiyonu tasarımı yer almaktadır. Bu iyileştirmeler, YOLOv11'in üretim ortamlarındaki oklüzyonlar, küçük hedefler ve karmaşık arka planlarla başa çıkarken daha iyi performans göstermesini sağlar. YOLOv11, Ultralytics tarafından yayınlanan YOLO serisinin bir versiyonudur. YOLOv8 ile karşılaştırıldığında, C3K2 modülünü ve özellik füzyon yolunu iyileştirmiş ve adaptif bir çapa kutusu stratejisi getirerek endüstriyel senaryolarda daha güçlü bir tespit sağlamlığı sunmuştur.
Evrişimli Sinir Ağları (CNN) temelleri ve gelişimi
Evrişimli sinir ağı (CNN), bilgisayarlı görü alanında derin öğrenmenin başarısını derinden etkileyen temel bir modeldir. Bu model, evrişim işlemleri aracılığıyla yerel görüntü özelliklerini çıkararak ve ardından havuzlama işlemleriyle özellik boyutluluğunu azaltarak hiyerarşik görüntü soyutlaması gerçekleştirir22.
Tipik bir CNN; birden fazla konvolüsyonel, havuzlama ve tam bağlantılı katmandan oluşur. Konvolüsyonel katman, giriş görüntüsünü bir konvolüsyon çekirdeği ile tarar, yerel bölgeler üzerinden nokta çarpımları hesaplar ve bir özellik haritası oluşturur. Hesaplama işlemi Denklem (2)'de gösterilmiştir:
(2)
Burada x giriş görüntüsünü, wk ve bk sırasıyla konvolüsyon çekirdeğinin ağırlığını ve sapmasını,
ise çıkış özellik haritasının (i,j) konumundaki değerlerini temsil eder. Havuzlama katmanı genellikle Maksimum Havuzlama (Max Pooling) veya Ortalama Havuzlama (Average Pooling) kullanır. Tam bağlantılı katman ise özellikleri çıkarmaktan ve sınıflandırma olasılıklarını tahmin etmekten sorumludur.
Buna dayanarak, bu çalışma YOLOv11 için iki paralel koldan oluşan bir CNN özellik geliştirme modülü tasarlamaktadır: Çok ölçekli özellikleri çıkarmak için 3 × 3 ve 5 × 5 konvolüsyon çekirdeklerini kullanan çok ölçekli bir konvolüsyon kolu ve ana hedeflerin ayırt edici özelliklerini geliştirmek için kanal dikkat (Squeeze-and-Excitation) ve uzamsal dikkat modüllerini ardışık olarak bağlayan bir dikkat kolu. İki kolun çıktıları eleman bazlı toplama ile birleştirilir ve ilgili özellik geliştirme kayıp fonksiyonu formül (3)'te gösterilmiştir:
(3)
Lcoord sınırlayıcı kutu koordinat regresyon kaybıdır; Lconf hedef güven kaybıdır; Lcls kategori sınıflandırma kaybıdır; Lfeat ise CNN iyileştirme modülü tarafından çıkarılan küçük hedeflerin ve engellenmiş hedeflerin ayırt edici özelliklerini kısıtlamak için kullanılan özellik iyileştirme kaybıdır; λcoord, λconf, λcls, λfeat ilgili kayıp terimlerinin ağırlık katsayılarıdır. Bu görev için λfeat = 0.05 olarak ayarlanmış ve kalan ağırlıklar tespit görevi gereksinimlerine göre dengelenmiştir.
VGGNet23 ve ResNet24 gibi klasik CNN yapıları, görüntü sınıflandırma görevlerinde büyük başarılar elde etmiştir. Bu mimariler arasında ResNet, derin ağ eğitimindeki kaybolan gradyan problemini etkili bir şekilde hafifleterek daha derin ve daha karmaşık ağ yapılarının oluşturulmasını kolaylaştırır.
Nesne tespit görevlerinde, CNN genellikle bir özellik çıkarıcı (backbone) olarak kullanılır. Örneğin, YOLO algoritma serisindeki Darknet, cross-stage partial Darknet (CSPDarknet) vb. yapıların tümü CNN üzerine kurulmuştur25. Özellik çıkarma yeteneklerini artırmak için araştırmacılar çok sayıda geliştirilmiş CNN yapısı önermişlerdir. Örneğin, Inception modülü, çok ölçekli konvolüsyon çekirdekleri aracılığıyla özellikleri paralel olarak çıkarır. DenseNet, yoğun bağlantılarla özelliklerin yeniden kullanımını artırır. Squeeze-and-Excitation Network ise dikkat mekanizmaları aracılığıyla özellik kanallarının önemini adaptif olarak ayarlar26.
Bu çalışmada, YOLOv11'in özellik çıkarma yeteneklerini geliştirmek için geliştirilmiş bir CNN modülü tasarladık. Bu modül, üretim hattı senaryolarındaki temel güvenlik bilgilerini daha etkili bir şekilde yakalamak için çok ölçekli özellik füzyonunu bir dikkat mekanizması ile birleştirir.
Derin öğrenmenin endüstriyel güvenlik izlemedeki uygulama durumu
Derin öğrenme, endüstriyel güvenlik izleme alanında önemli bir ilgi görmüştür. İşçilerin güvenlik kasklarını uygun şekilde takıp takmadıklarını belirlemek, tehlikeli bölgelere yetkisiz girişleri tespit etmek ve arızalı ekipmanların durumunu izlemek için CNN tabanlı algoritmalar kullanılmaktadır27.
Davranış tanıma açısından, çalışanların operasyonel davranışlarını analiz etmek ve potansiyel olarak güvensiz eylemleri belirlemek için 3D CNN'ler ve tekrarlayan sinir ağları kullanılır. Örneğin, çalışanların duruş dizileri analiz edilerek, güvenlik işletim prosedürlerini ihlal edip etmedikleri belirlenebilir28.
YOLO ve Faster R-CNN, gerçek zamanlı gözetleme videolarında personel ve ekipman tespiti için yaygın olarak kullanılmaktadır. Örneğin, literatürde YOLOv5 tabanlı gerçek zamanlı bir kask tespit sistemi önerilmiş ve bu sistem şantiye güvenlik yönetiminin zekasını etkili bir şekilde artırmıştır29.
Mevcut araştırmalarda bazı ilerlemeler kaydedilmiş olsa da, çeşitli zorluklar devam etmektedir. İlk olarak, endüstriyel sahneler tipik olarak karmaşık aydınlatma, oklüzyon ve arka plan girişimleri içerir ki bunlar algoritmanın dayanıklılığına yönelik katı gereksinimler getirir. İkinci olarak, gerçek zamanlı performans temel bir gerekliliktir ve algoritma, doğruluğunu korurken yüksek hızlı çıkarım gerçekleştirmelidir. Son olarak, mevcut araştırmalar öncelikle tek görevli saptamaya odaklanmaktadır ve çok kaynaklı bilgi füzyonu ile kapsamlı analizlerin keşfi konusunda yetersiz kalmaktadır30.
Bu çalışmada, önerilen YOLOv11 ve CNN füzyon modeli, öznitelik çıkarma ve füzyon yeteneklerini geliştirerek yukarıdaki zorlukların üstesinden gelmeyi ve üretim hattı güvenlik risklerinin kapsamlı, gerçek zamanlı izlemesini gerçekleştirmeyi amaçlamaktadır.