Nella produzione industriale moderna, la sicurezza è il fondamento per garantire l'efficienza produttiva e il benessere del personale. L'ambiente della linea di produzione coinvolge tipicamente apparecchiature meccaniche ad alta velocità, processi tecnologici complessi e operazioni collaborative che richiedono più mansioni. Ogni piccolo rischio potenziale per la sicurezza può causare gravi incidenti industriali, con ingenti perdite economiche e persino decessi. È quindi fondamentale istituire un sistema di monitoraggio della sicurezza efficiente, intelligente e in tempo reale per migliorare la sicurezza nella produzione industriale1,2.
I metodi tradizionali di monitoraggio della sicurezza si basano principalmente sulla sorveglianza manuale tramite video e su vari sensori (ad esempio, infrarossi, fumo e vibrazioni)3. Il monitoraggio manuale non è solo inefficiente, ma è anche soggetto a mancati rilevamenti a causa della fatica del personale addetto alla sorveglianza, e non è in grado di garantire una copertura continua e completa. Sebbene i sensori possano offrire una certa funzione di preallarme, il loro raggio di rilevamento è limitato ed essi sono sensibili alle interferenze ambientali, con conseguenti problemi significativi di falsi allarmi4. I sistemi intelligenti di monitoraggio stanno diventando un settore di ricerca sempre più rilevante. L'analisi in tempo reale di un flusso video mediante un algoritmo di apprendimento profondo (deep learning) consente di identificare automaticamente eventi anomali, comportamenti non sicuri e potenziali rischi, migliorando così notevolmente l'intelligenza del sistema di sorveglianza4,5.
Il rilevamento di oggetti è una tecnologia fondamentale nel monitoraggio intelligente. Come rappresentanti dei rilevatori di oggetti monostadio, gli algoritmi della serie You Only Look Once (YOLO) mostrano vantaggi significativi. Dal YOLOv1 al YOLOv8, questa serie di algoritmi ha subito uno sviluppo continuo, con miglioramenti apportati all'architettura della rete, alla funzione di perdita e alle metodologie di addestramento, tra gli altri aspetti6,7. Il YOLOv11, in particolare, ha raggiunto una maggiore accuratezza nel rilevamento mantenendo al contempo un'elevata frequenza di fotogrammi, specialmente in presenza di sfondi complessi e oggetti densamente affollati8.
Tuttavia, nonostante le ottime prestazioni in compiti generali di rilevamento oggetti, YOLOv11 affronta ancora alcune sfide in specifici scenari di monitoraggio della sicurezza in linea di produzione9. Ad esempio, l'accuratezza di rilevamento di YOLOv11 può diminuire quando i lavoratori sono parzialmente oscurati da attrezzature o quando i segnali di sicurezza sono piccoli e presentano un colore molto simile a quello dello sfondo. Ciò richiede al modello capacità più elevate di estrazione delle caratteristiche e di comprensione semantica10.
Le reti neurali convoluzionali (CNN) possiedono notevoli capacità nell'estrazione delle caratteristiche delle immagini11. Progettando architetture di rete più profonde e complesse, le CNN possono apprendere caratteristiche d'immagine più ricche e astratte. Combinare una CNN con YOLOv11 sfrutta le capacità di rilevamento rapido di YOLOv11 e l'estrazione profonda delle caratteristiche della CNN, consentendo così di realizzare un sistema di monitoraggio della sicurezza più robusto e intelligente.
Sulla base di ciò, questo articolo propone un sistema di monitoraggio della sicurezza in linea di produzione che utilizza YOLOv11 e una CNN. Gli aspetti innovativi di questo studio includono: (1) la proposta di un'architettura di fusione profonda di YOLOv11 e una CNN migliorata; (2) l'introduzione della fusione di caratteristiche multiscala e di un meccanismo di attenzione composito per potenziare il riconoscimento delle caratteristiche chiave di sicurezza; e (3) la verifica dei vantaggi prestazionali del modello su un dataset autocostruito di scene complesse.
Sviluppo degli algoritmi della serie YOLO
Dalla sua prima introduzione da parte di Redmon et al. nel 201512, l'algoritmo You Only Look Once (YOLO) ha suscitato notevole interesse. A differenza dei rilevatori a due stadi che si basano su proposte di regione, YOLO tratta il rilevamento di oggetti come un compito di regressione. Prevedendo direttamente le classi e le posizioni degli oggetti in un'immagine, YOLO aumenta in modo significativo la velocità di rilevamento, rendendolo adatto all'uso in tempo reale13.
Come lavoro pionieristico di questa serie, YOLOv1 realizza per la prima volta una rilevazione end-to-end degli obiettivi14. YOLOv1 prevede la suddivisione dell'immagine in ingresso in una struttura a griglia, in cui ogni cella della griglia, solitamente organizzata in un formato S × S, ha il compito di rilevare gli oggetti che rientrano nei suoi limiti.
In particolare, l'output di YOLOv1 è un tensore. Tra gli S × S × (B × 5 + C), la previsione di ciascun riquadro delimitatore contiene 5 elementi: coordinate del punto centrale (x,y), larghezza w, altezza h e valore di confidenza c. Il processo di calcolo è illustrato nell'Equazione (1):
(1)
Tra questi, Pr(Object) rappresenta la probabilità che ci sia un bersaglio nella griglia, mentre IOU rappresenta il rapporto tra l'intersezione e l'unione tra il riquadro delimitatore predetto e il riquadro reale. Ogni griglia prevede anche un insieme di probabilità per le classi, Pr che indica la probabilità che il bersaglio appartenga alla i-esima classe qualora sia presente un bersaglio. La funzione di perdita di YOLOv1 è composta da tre componenti principali: la perdita per la predizione delle coordinate, la perdita per la stima della fiducia e la perdita per la predizione della categoria15.
YOLOv2 introduce la normalizzazione del batch, un classificatore ad alta risoluzione e una strategia di addestramento multi-scala, che migliorano stabilità e accuratezza16. YOLOv3 utilizza Darknet-53 come rete principale e si ispira al concetto di Feature Pyramid Network (FPN) per potenziare il rilevamento degli oggetti17.
YOLOv4 ha introdotto numerose ottimizzazioni rispetto a YOLOv3, adottando tecnologie come la Cross Stage Partial Network (CSPNet)18, la Path Aggregation Network (PANet)19 e il miglioramento dei dati tramite tecnica Mosaic, al fine di migliorare ulteriormente le prestazioni del modello. YOLOv5 ha apportato significativi contributi nell'ambito ingegneristico, offrendo un'implementazione più semplice da utilizzare e più efficiente20.
Negli ultimi anni, la serie YOLO ha continuato a evolversi, con il rilascio di versioni come YOLOv6, YOLOv7 e YOLOv8 una dopo l'altra. Introducendo la struttura Extended Efficient Layer Aggregation Network (E-ELAN) e tecniche di ri-parametrizzazione del modello, YOLOv7 raggiunge nuovi traguardi sia in termini di velocità che di accuratezza. Questi miglioramenti non solo aumentano l'efficienza dell'apprendimento delle caratteristiche, ma ottimizzano anche le prestazioni di inferenza della rete, consentendo a YOLOv7 di superare le versioni precedenti e molti detector mainstream in svariate attività di rilevamento oggetti in tempo reale. YOLOv8 ottimizza ulteriormente la struttura della rete, adotta un design privo di ancoraggi (anchor-free), semplifica il modello e ne migliora la capacità di generalizzazione21.
Basandosi sui vantaggi delle versioni precedenti, YOLOv11, utilizzato in questo studio, è stato ottimizzato per scenari industriali complessi. I suoi principali miglioramenti includono una rete di estrazione delle caratteristiche, un modulo di fusione delle caratteristiche più efficiente e una progettazione della funzione di perdita più robusta. Questi miglioramenti consentono a YOLOv11 di prestare meglio nel gestire occlusioni, piccoli bersagli e sfondi complessi negli ambienti produttivi. YOLOv11 è una versione della serie YOLO rilasciata da Ultralytics. Rispetto a YOLOv8, migliora il modulo C3K2 e il percorso di fusione delle caratteristiche, e introduce una strategia adattiva per le box di ancoraggio, fornendo così una maggiore robustezza nella rilevazione in scenari industriali.
Fondamenti e progressi della rete neurale convoluzionale (CNN)
La rete neurale convoluzionale (CNN) è un modello fondamentale che ha profondamente influenzato il successo dell'apprendimento profondo nel campo della visione artificiale. Opera estraendo caratteristiche locali dell'immagine attraverso operazioni di convoluzione e successivamente riducendo la dimensionalità delle caratteristiche tramite operazioni di pooling, realizzando così un'astrazione gerarchica dell'immagine22.
Un CNN tipico è composto da diversi strati convoluzionali, di pooling e completamente connessi. Lo strato convoluzionale analizza l'immagine in ingresso con un kernel di convoluzione, calcola prodotti scalari su regioni locali e produce una mappa delle caratteristiche. Il processo di calcolo è mostrato nell'Equazione (2):
(2)
Dove x è l'immagine in ingresso, wk e bk sono rispettivamente il peso e il bias del kernel di convoluzione, e
sono i valori della mappa delle caratteristiche in uscita nella posizione (i,j). Il livello di pooling utilizza comunemente il Max Pooling o l'Average Pooling. Il livello completamente connesso è responsabile dell'estrazione delle caratteristiche e della previsione delle probabilità di classificazione.
Sulla base di ciò, questo articolo propone un modulo di potenziamento delle caratteristiche CNN per YOLOv11, costituito da due rami paralleli: un ramo con convoluzioni multi-scala che utilizza kernel convoluzionali 3 × 3 e 5 × 5 per estrarre caratteristiche a diverse scale; e un ramo di attenzione che collega in sequenza i moduli di attenzione ai canali (Squeeze-and-Excitation) e di attenzione spaziale, al fine di potenziare le caratteristiche discriminanti degli obiettivi principali. Gli output dei due rami vengono fusi mediante somma puntuale, e la corrispondente funzione di perdita per il potenziamento delle caratteristiche è mostrata nella formula (3):
(3)
Lcoord è la perdita di regressione delle coordinate del riquadro delimitatore; Lconf è la perdita di confidenza del target; Lcls è la perdita di classificazione della categoria; Lfeat è la perdita di miglioramento delle caratteristiche, utilizzata per vincolare le caratteristiche discriminative dei target di piccole dimensioni e dei target parzialmente oscurati estratte dal modulo di potenziamento della CNN; λcoord, λconf, λcls, λfeat sono i coefficienti di peso dei rispettivi termini di perdita. Per questo compito, si imposta λfeat = 0,05, mentre i restanti pesi vengono bilanciati in base ai requisiti del compito di rilevamento.
Le strutture classiche di CNN, come VGGNet23 e ResNet24, hanno ottenuto un notevole successo nei compiti di classificazione delle immagini. Tra queste architetture, ResNet attenua efficacemente il problema del gradiente che scompare durante l'addestramento di reti profonde, facilitando così la costruzione di strutture di rete più profonde e complesse.
Nei compiti di rilevamento degli oggetti, la CNN è solitamente utilizzata come estrattore di caratteristiche (backbone). Ad esempio, Darknet, cross-stage partial Darknet (CSPDarknet), ecc., nella serie di algoritmi YOLO, sono tutti basati sulla CNN25. Per potenziare le capacità di estrazione delle caratteristiche, i ricercatori hanno proposto numerose strutture CNN migliorate. Ad esempio, il modulo Inception estrae caratteristiche in parallelo attraverso kernel di convoluzione multi-scala. DenseNet migliora il riutilizzo delle caratteristiche mediante connessioni dense. La Squeeze-and-Excitation Network regola in modo adattivo l'importanza dei canali delle caratteristiche attraverso meccanismi di attenzione26.
In questo studio, abbiamo progettato un modulo CNN migliorato per potenziare le capacità di estrazione delle caratteristiche di YOLOv11. Questo modulo combina la fusione di caratteristiche multiscala con un meccanismo di attenzione per catturare in modo più efficace le informazioni chiave relative alla sicurezza negli scenari di linea di produzione.
Stato di applicazione dell'apprendimento profondo nel monitoraggio della sicurezza industriale
L'apprendimento profondo ha ottenuto un notevole sviluppo nel monitoraggio della sicurezza industriale. Gli algoritmi basati su CNN vengono utilizzati per determinare se i lavoratori indossano correttamente i caschi di sicurezza, rilevare intrusioni non autorizzate in zone pericolose e monitorare lo stato di funzionamento di apparecchiature difettose27.
Per quanto riguarda il riconoscimento del comportamento, vengono utilizzati CNN 3D e reti neurali ricorrenti per analizzare il comportamento operativo dei lavoratori e identificare azioni potenzialmente pericolose. Ad esempio, analizzando le sequenze della postura dei lavoratori, è possibile determinare se stanno violando le procedure operative di sicurezza28.
YOLO e Faster R-CNN sono ampiamente utilizzati per il rilevamento di persone e attrezzature in video di sorveglianza in tempo reale. Ad esempio, è stato proposto in letteratura un sistema di rilevamento in tempo reale di caschi basato su YOLOv5, che migliora efficacemente l'intelligenza nella gestione della sicurezza nei cantieri29.
Sebbene siano stati compiuti alcuni progressi nella ricerca esistente, rimangono diverse sfide. In primo luogo, le scene industriali presentano tipicamente illuminazione complessa, occlusioni e interferenze di sfondo, che impongono requisiti rigorosi sulla robustezza dell'algoritmo. In secondo luogo, le prestazioni in tempo reale rappresentano un requisito fondamentale, e l'algoritmo deve raggiungere un'inferenza ad alta velocità mantenendo l'accuratezza. Infine, la ricerca esistente si concentra principalmente sul rilevamento di un singolo compito e manca di esplorare la fusione di informazioni provenienti da più fonti e un'analisi completa30.
In questo studio, il modello proposto di fusione tra YOLOv11 e CNN mira ad affrontare le sfide sopra menzionate e a realizzare un monitoraggio completo ed in tempo reale dei rischi per la sicurezza in linea di produzione, potenziando le capacità di estrazione e fusione delle caratteristiche.