Methodenartikel

Real-time veiligheidsmonitoring van productielijnen met behulp van deep learning-gebaseerde objectdetectie en kenmerkverbetering

36 weergaven

DOI:

10.3791/70968

21 augustus 2026

In dit artikel

Samenvatting

Dit artikel stelt een methode voor de veiligheidsbewaking van productielijnen voor die You Only Look Once versie 11 (YOLOv11) integreert met convolutionele neurale netwerken. Het behaalde een gemiddelde gemiddelde precisie bij een intersection-over-union-drempelwaarde van 0,5 (mAP@0.5) van 0,91, een mAP@0.5:0.95 van 0,82 en 120 frames per seconde op een graphics processing unit, waarmee het beter presteerde dan de geëvalueerde basismodellen.

Samenvatting

Met de verdieping van Industrie 4.0 zijn de automatiserings- en intelligentieniveaus van productielijnen aanzienlijk verbeterd, waardoor er hogere eisen worden gesteld aan de real-time prestaties, nauwkeurigheid en veiligheid van monitoring. Traditionele monitoringsystemen, die vertrouwen op handmatige inspecties of eenvoudige beslissingen op basis van drempelwaarden, kampen over het algemeen met trage responstijden, hoge percentages foutieve alarmen en beperkte intelligentie. Daarom stelt dit artikel een veiligheidsmonitoringsysteem voor voor productielijnen dat You Only Look Once versie 11 (YOLOv11) integreert met een convolutioneel neuraal netwerk (CNN). Eerst werden de verkregen beelden voorbewerkt. Vervolgens werd YOLOv11 gebruikt om werknemers, apparatuur en potentiële gevaren in real-time te identificeren. Daarna werd een verbeterd CNN-netwerk met multi-scale feature-fusie en aandachtmechanismen geïntroduceerd om de mogelijkheden voor feature-extractie voor kleine en occluderende doelen te verbeteren. Ten slotte werden de detectieresultaten gefuseerd met de CNN-verbeterde features om de veiligheidsstatus te beoordelen. Experimenten werden uitgevoerd met behulp van een zelfgebouwde dataset voor productielijnveiligheid, waarbij de stochastic gradient descent (SGD) optimizer werd gebruikt met een momentum van 0,9, een initiële leerstroom van 0,01, weight decay van 0,0005, cosine-annealed leerstroomaanpassing, een batchgrootte van 32 en training gedurende 200 epochs. mAP@0,5 en de detectiesnelheid in frames per seconde (FPS) werden gebruikt als evaluatiemetrieken voor vergelijking met de geëvalueerde baseline-algoritmen. De resultaten tonen aan dat het voorgestelde systeem een mAP@0,5 van 0,91 en een detectiesnelheid van 120 FPS bereikte. Het demonstreerde tevens robuuste prestaties onder complexe omstandigheden, zoals schaduwvorming en variërende verlichting, wat de effectiviteit en het praktische toepassingspotentieel bij de veiligheidsmonitoring van productielijnen ondersteunt.

Inleiding

In de moderne industriële productie is veiligheid de hoeksteen voor het waarborgen van productie-efficiëntie en het welzijn van personeel. De productieomgeving omvat doorgaans snelle mechanische apparatuur, complexe technologische processen en samenwerkende operaties met meerdere taken. Elk klein potentieel veiligheidsrisico kan leiden tot ernstige productie-ongelukken, met aanzienlijke economische verliezen en zelfs dodelijke slachtoffers tot gevolg. Daarom is het van cruciaal belang een efficiënt, intelligent en real-time veiligheidstoezichtsysteem op te zetten om de veiligheid in de industriële productie te verbeteren1,2.

Traditionele methoden voor veiligheidsbewaking zijn voornamelijk gebaseerd op handmatige videobewaking en diverse sensoren (zoals infrarood-, rook- en trillingssensoren)3. Handmatige bewaking is niet alleen inefficiënt, maar ook gevoelig voor gemiste detecties door vermoeidheid van het bewakingspersoneel, en kan geen continue en uitgebreide dekking bieden. Hoewel sensoren een bepaalde functie voor vroegtijdige waarschuwing kunnen bieden, is hun detectiebereik beperkt en zijn ze gevoelig voor omgevingsinterferentie, wat leidt tot opvallende problemen met valse alarmen4. Intelligente bewakingssystemen zijn steeds meer een onderzoeksfocus geworden. Echtijdanalyse van een videostream met behulp van een deep learning-algoritme kan automatisch abnormale gebeurtenissen, onveilige gedragingen en potentiële gevaren identificeren, waardoor de intelligentie van het bewakingssysteem sterk verbetert4,5.

Objectdetectie is een kerntechnologie binnen intelligente monitoring. Als vertegenwoordigers van single-stage objectdetectoren tonen de You Only Look Once (YOLO)-reeksalgoritmen aanzienlijke voordelen. Van YOLOv1 tot YOLOv8 heeft deze verzameling algoritmen een voortdurende ontwikkeling doorgemaakt, met verbeteringen aan de netwerkarchitectuur, verliesfunctie en trainingsmethodologie, onder andere6,7. YOLOv11 heeft met name een hogere detectieprecisie bereikt terwijl een hoog beeldsnelheid gehandhaafd blijft, vooral bij complexe achtergronden en dicht opeengepakte doelen8.

Toch ondervindt YOLOv11, ondanks zijn uitstekende prestaties bij algemene objectdetectietaken, nog steeds uitdagingen in specifieke veiligheidsbewakingscenario's op productielijnen9. Bijvoorbeeld kan de detectie-accuratesse van YOLOv11 afnemen wanneer werknemers gedeeltelijk worden verhuld door apparatuur of wanneer veiligheidstekens klein zijn en sterk op de achtergrondkleur lijken. Dit vereist dat het model over sterkere mogelijkheden beschikt met betrekking tot functie-extractie en semantisch begrip10.

Convolutionele neurale netwerken (CNN's) beschikken over krachtige mogelijkheden bij het extraheren van beeldkenmerken11. Door diepere en complexere netwerkarchitecturen te ontwerpen, kunnen CNN's rijkere en meer abstracte beeldkenmerken leren. Het combineren van een CNN met YOLOv11 maakt gebruik van de snelle detectiemogelijkheden van YOLOv11 en de diepe kenmerkenextractie van het CNN, waardoor een robuustere en intelligente veiligheidsmonitoring opgebouwd wordt.

Op basis hiervan stelt dit artikel een veiligheidsbewakingssysteem voor productielijnen voor, dat gebruikmaakt van YOLOv11 en een CNN. De innovatieve aspecten van dit onderzoek zijn: (1) het voorstellen van een diepe fusie-architectuur van YOLOv11 en een verbeterde CNN; (2) het introduceren van fusie van kenmerken op meerdere schalen en een samengesteld aandachtsmechanisme om de herkenning van belangrijke veiligheidskenmerken te verbeteren; en (3) het verifiëren van de prestatievoordelen van het model op een zelf opgebouwde dataset van complexe scènes.

Ontwikkeling van YOLO-serie algoritmen
Sinds de eerste introductie door Redmon et al. in 201512 heeft het You Only Look Once (YOLO)-algoritme aanzienlijke belangstelling gewekt. In tegenstelling tot tweestadige detectoren die afhankelijk zijn van regiovoorstellingen, beschouwt YOLO objectdetectie als een regressietaak. Door rechtstreeks de klassen en posities van objecten in een afbeelding te voorspellen, verhoogt YOLO aanzienlijk de detectiesnelheid, waardoor het geschikt is voor gebruik in real-time13.

Als baanbrekend werk in deze serie bereikt YOLOv1 voor het eerst end-to-end doeldetectie14. YOLOv1 houdt in dat de ingangsafbeelding wordt opgedeeld in een roosterstructuur, waarbij elke roostercel, doorgaans georganiseerd in een S × S-indeling, verantwoordelijk is voor het detecteren van objecten die binnen zijn grenzen vallen.

Specifiek is de uitvoer van YOLOv1 een tensor. Van de S × S × (B × 5 + C) bevat de voorspelling van elke begrenzende rechthoek 5 elementen: coördinaat van het middelpunt (x,y), breedte w, hoogte h en betrouwbaarheid c. Het berekeningsproces is weergegeven in Vergelijking (1):
Waarschijnlijkheid en Intersection over Union (IoU)-formule voor objectdetectie-analyse.   (1)

Daaronder stelt Pr(Object) de kans voor dat er zich een doelwit in het rooster bevindt, en IOU stelt de verhouding voor van de intersectie ten opzichte van de unie tussen de voorspelde begrenzende rechthoek en de werkelijke rechthoek. Elk rooster voorspelt ook een reeks klassenkansen, waarbij Pr de kans aangeeft dat het doelwit behoort tot de i-de klasse indien er een doelwit aanwezig is. De verliesfunctie van YOLOv1 bestaat uit drie hoofdcomponenten: het verlies voor coördinaatvoorspelling, het verlies voor betrouwbaarheidsschatting en het verlies voor categorievoorspelling15.

YOLOv2 introduceert Batch Normalisatie, een hoge-resolutie classificator en een multi-schaal trainingsstrategie, die de stabiliteit en nauwkeurigheid verbeteren16. YOLOv3 gebruikt Darknet-53 als basisnetwerk en put inspiratie uit het Feature Pyramid Network (FPN)-concept om doeldetectie te verbeteren17.

YOLOv4 heeft op basis van YOLOv3 talrijke optimalisaties doorgevoerd, waarbij technologieën zoals Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 en Mosaic-data-verbetering zijn geïntroduceerd om de prestaties van het model verder te verbeteren. YOLOv5 heeft belangrijke bijdragen geleverd aan de engineering, met een gebruiksvriendelijkere en efficiëntere implementatie20.

De afgelopen jaren is de YOLO-serie blijven evolueren, met versies zoals YOLOv6, YOLOv7 en YOLOv8 die achtereenvolgens zijn uitgebracht. Door de introductie van de Extended Efficient Layer Aggregation Network (E-ELAN)-structuur en model re-parameterisatie-technieken, bereikt YOLOv7 nieuwe doorbraken op het gebied van zowel snelheid als nauwkeurigheid. Deze verbeteringen verhogen niet alleen de efficiëntie van het leerproces van kenmerken, maar optimaliseren ook de inferentieprestaties van het netwerk, waardoor YOLOv7 betere resultaten levert dan eerdere versies en vele gangbare detectoren bij diverse real-time objectdetectietaken. YOLOv8 optimaliseert de netwerkstructuur verder, hanteert een ankerloze ontwerpmethode, vereenvoudigt het model en verbetert de generalisatiecapaciteit21.

Voortbouwend op de voordelen van eerdere versies, is YOLOv11, gebruikt in dit onderzoek, geoptimaliseerd voor complexe industriële scenario's. De kernverbeteringen omvatten een netwerk voor functie-extractie, een efficiëntere module voor functiefusie en een robuustere ontwerp van de verliesfunctie. Deze verbeteringen stellen YOLOv11 in staat beter te presteren bij het verwerken van verduisteringen, kleine doelen en complexe achtergronden in productieomgevingen. YOLOv11 is een versie uit de YOLO-serie die is uitgegeven door Ultralytics. In vergelijking met YOLOv8 verbetert het de C3K2-module en het pad voor functiefusie, en introduceert een adaptieve ankerboxstrategie, waardoor een sterkere detectierobuustheid in industriële scenario's wordt geboden.

Grondslag en vooruitgang van het convolutionele neurale netwerk (CNN)
Het convolutionele neurale netwerk (CNN) is een cruciaal model dat het succes van deep learning binnen computervisie diepgaand heeft beïnvloed. Het werkt door lokale beeldfuncties te extraheren via convolutionele operaties en vervolgens de dimensionaliteit van de functies te verlagen via poolingoperaties, waardoor een hiërarchische beeldabstractie wordt bereikt22.

Een typisch CNN bestaat uit meerdere convolutie-, pooling- en volledig verbonden lagen. De convolutielag scant het invoerbeeld met een convolutiekern, berekent inwendige producten over lokale gebieden en genereert een kenmerkkaart. Het berekingsproces wordt weergegeven in Vergelijking (2):

Diagram van de convolutie-operatie; wiskundige notatie voor machine learning-modellen.   (2)

Waarbij x de invoerafbeelding is, wk en bk respectievelijk het gewicht en de bias van de convolutiekern zijn, en Wiskundige uitdrukking y_ij^k, mogelijk gerelateerd aan matrix- of tensoroperaties die worden gebruikt in algoritmen. de waarden zijn van de uitvoerende functiekaart op positie (i,j). De poolinglaag gebruikt meestal Max Pooling of Average Pooling. De volledig verbonden laag is verantwoordelijk voor het extraheren van kenmerken en het voorspellen van classificatiekansen.

Op basis hiervan ontwerpt dit artikel een CNN-featureverbeteringsmodule voor YOLOv11, die bestaat uit twee parallelle takken: een multischaalconvolutietak die 3 × 3- en 5 × 5-convolutiekernels gebruikt om multischaalkenmerken te extraheren; en een aandachtstak die achtereenvolgens de kanaalaandacht (Squeeze-and-Excitation) en ruimtelijke aandachtsmodules verbindt om de discriminerende kenmerken van belangrijke doelen te versterken. De uitgangen van de twee takken worden samengevoegd door middel van elementsgewijze optelling, en de overeenkomstige verliesfunctie voor featureverbetering staat weergegeven in formule (3):

 Wiskundige formule voor verliesfunctiecoördinatie L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord is het regressieverlies van de coördinaten van de omkaderende rechthoek; Lconf is het verlies van de doelbetrouwbaarheid; Lcls is het verlies van de categorieclassificatie; Lfeat is het verlies van de functieverbetering, gebruikt om de discriminerende kenmerken van kleine doelen en verhulde doelen die zijn geëxtraheerd door de CNN-verbeteringsmodule te beperken; λcoord, λconf, λcls, λfeat zijn de gewichtscoëfficiënten van de overeenkomstige verliescomponenten. Voor deze taak is λfeat = 0,05 ingesteld, en de resterende gewichten worden gebalanceerd op basis van de vereisten van de detectietaak.

Klassieke CNN-structuren, zoals VGGNet23 en ResNet24, hebben groot succes behaald bij beeldclassificatietaken. Van deze architecturen vermindert ResNet effectief het probleem van het verdwijnende gradiënt bij het trainen van diepe netwerken, waardoor de opbouw van diepere en complexere netwerkstructuren wordt vergemakkelijkt.

In objectdetectietaken wordt CNN meestal gebruikt als functie-extractor (backbone). Bijvoorbeeld, Darknet, cross-stage partial Darknet (CSPDarknet), enzovoort, in de YOLO-serie algoritmen zijn allemaal gebaseerd op CNN25. Om de functie-extractiecapaciteiten te verbeteren, hebben onderzoekers tal van verbeterde CNN-structuren voorgesteld. Bijvoorbeeld, het Inception-module extraheert kenmerken parallel via convolutiekernels van meerdere schalen. DenseNet verbetert het hergebruik van kenmerken met behulp van dichte verbindingen. Het Squeeze-and-Excitation-netwerk past adaptief het belang van kenmerkkanalen aan via aandachtsmechanismen26.

In dit onderzoek ontwierpen we een verbeterde CNN-module om de mogelijkheden van YOLOv11 voor functie-extractie te verbeteren. Deze module combineert fusie van multischaalfuncties met een aandachtsmechanisme om op efficiëntere wijze cruciale veiligheidsinformatie in productielijnsituaties te detecteren.

Toepassingsstatus van deep learning in industriële veiligheidsmonitoring
Deep learning heeft aanzienlijke voet aan de grond gekregen in de industriële veiligheidsmonitoring. Op CNN-gebaseerde algoritmen worden ingezet om te bepalen of werknemers veiligheidshelmen op de juiste manier dragen, ongeoorloofde doordringing van gevaarlijke zones detecteren en de toestand van defecte apparatuur monitoren27.

Op het gebied van gedragsherkenning worden 3D-CNN's en recurrente neurale netwerken gebruikt om het operationele gedrag van werknemers te analyseren en potentieel onveilige handelingen te identificeren. Door bijvoorbeeld de houdingsequenties van werknemers te analyseren, kan worden vastgesteld of zij veiligheidsprocedures overtreden28.

YOLO en Faster R-CNN worden veel gebruikt voor detectie van personeel en apparatuur in realtime bewakingsvideo's. Zo is in de literatuur een systeem voorgesteld voor realtime detectie van helmen op basis van YOLOv5, wat de intelligentie van veiligheidsbeheer op bouwplaatsen doeltreffend verbetert29.

Hoewel er enige vooruitgang is geboekt in bestaand onderzoek, blijven verschillende uitdagingen bestaan. Ten eerste bevatten industriële omgevingen doorgaans complexe verlichting, verduistering en achtergrondinterferentie, wat strenge eisen stelt aan de robuustheid van het algoritme. Ten tweede is realtimeprestatie een belangrijke vereiste, en het algoritme moet hoge snelheid in de inferentie behalen terwijl de nauwkeurigheid behouden blijft. Tot slot richt bestaand onderzoek zich voornamelijk op detectie van een enkele taak en ontbeert het onderzoek naar fusie van multisource-informatie en uitgebreide analyse30.

In dit onderzoek beoogt het voorgestelde YOLOv11- en CNN-fusiemodel de hierboven genoemde uitdagingen aan te pakken en een uitgebreide, realtime bewaking van veiligheidsrisico’s op de productielijn te realiseren door de mogelijkheden op het gebied van functie-extractie en -fusie te verbeteren.

Protocol

YOLOv1- en CNN-algoritme

Algemene systeemarchitectuur
Het in dit artikel voorgestelde veiligheidsbewakingssysteem voor productielijnen maakt gebruik van een hybride architectuur die YOLOv1 combineert met een verbeterd CNN om real-time veiligheidsbewaking met hoge precisie en hoge snelheid te bereiken. Zoals weergegeven in Figuur 1, bestaat het systeem hoofdzakelijk uit een module voor input-voorbewerking, een YOLOv1-objectdetectiemodule, een CNN-kenmerkversterkingsmodule en een fusiebeslissingsmodule. Het inputbeeld wordt eerst genormaliseerd en uitgebreid door de voorbewerkingsmodule om het generalisatievermogen van het model te verbeteren. Vervolgens worden kenmerken geëxtraheerd door de CSPDarknet-backbone en wordt het receptieve veld uitgebreid door de spatial pyramid pooling-fast (SPPF)-module. Multi-schaal kenmerken worden na upsampling gefuseerd, waarna kanaal-aandacht (channel attention) en ruimtelijke aandacht (spatial attention) sequentieel op de gefuseerde kenmerken worden toegepast om de onderscheidende representatie van belangrijke doelwitten verder te verbeteren. De CNN-kenmerkversterkingsmodule is geplaatst na de outputs van de C3-, C4- en C5-lagen van het YOLOv1-backbone-netwerk en ontvangt multi-schaal feature maps met afmetingen van respectievelijk 80 × 80 × 256, 40 × 40 × 512 en 20 × 20 × 1.024. De CNN-kenmerkversterkingsmodule verbetert verder de kenmerkextractie voor kleine en occlusie-doelwitten. Ten slotte combineert de fusiebeslissingsmodule de detectieresultaten van YOLOv1 met de CNN-versterkte kenmerken en optimaliseert deze gezamenlijk via een ontworpen verliesfunctie om de nauwkeurige locatie, categorie en betrouwbaarheidsscore van het doelwit uit te voeren.

YOLOv1 detectie-framework
YOLOv1 heeft verschillende cruciale verbeteringen geïntroduceerd die profiteren van de sterktes van het single-stage detectie-framework van de YOLO-serie. De architectuur is verdeeld in drie hoofdcomponenten: een backbone-netwerk, een feature-fusienetwerk en een detectiekop. Het backbone-netwerk maakt gebruik van een verbeterde CSPDarknet-structuur. Het feature-fusienetwerk bevat cross-stage lokale verbindingen en depthwise separable convolutions, geïnspireerd door feature pyramid networks en path aggregation networks om multi-scale features effectief samen te voegen.

Module voor kenmerkverbetering
De module voor kenmerkverbetering is bedoeld om de gevoeligheid van het model voor cruciale veiligheidskenmerken te verbeteren. Deze verwerkt de kenmerkkaarten (feature maps) die door elke laag van het YOLOv1-backbonenetwerk worden geproduceerd, waarbij informatie over verschillende schalen wordt gefuseerd via upsampling- en downsampling-operaties. Specifiek legt de multi-scale branch de diversiteit in ruimtelijke schaal vast, terwijl de attention branch dynamisch belangrijke kanalen en positionele responsen versterkt. Deze twee branches werken niet onafhankelijk, maar zijn complementair en worden gefuseerd via residuele verbindingen en kenmerkrecalibratie. De kenmerkkaart die door de verbeteringsmodule op elke schaal wordt verwerkt, wordt via een 1 × 1 convolutie aangepast om overeen te komen met het aantal kanalen van de oorspronkelijke kenmerkkaart, en vervolgens via elementgewijze optelling gefuseerd met de oorspronkelijke YOLOv1-kenmerkkaart. De gefuseerde kenmerkkaart wordt vervolgens ingevoerd in het daaropvolgende Feature Pyramid Network (FPN) voor multi-scale fusie, waardoor een hiërarchische representatie van veiligheidskenmerken wordt gevormd. Om een naadloze integratie tussen de modules te waarborgen, wordt een end-to-end gezamenlijke trainingsstrategie gehanteerd, waarbij de verliesfunctie bestaat uit het YOLOv1-detectieverlies en het verlies voor kenmerkverbetering van de CNN-module.

Diagram van een convolutioneel neuraal netwerk; bevat Conv-, ELAN- en SPPF-modules voor het proces van beelddetectie.
Figuur 1YOLOv1-CNN-algoritme. De module voor kenmerkverbetering is erop gericht de gevoeligheid van het model voor kritieke veiligheidskenmerken te versterken. Deze verwerkt kenmerkkaarten (feature maps) uit diverse lagen van de YOLOv1-backbone en fuseert kenmerken van verschillende schalen via upsampling- en downsampling-operaties. Daarnaast bevat de module kanaal- en ruimtelijke aandachtmechanismen. Om een naadloze integratie tussen de YOLOv11- en CNN-modules te waarborgen, wordt een gezamenlijke trainingsstrategie toegepast. Tijdens de training worden de parameters van beide modules end-to-end geoptimaliseerd. De verliesfunctie combineert het detectieverlies van YOLOv11 met het verlies voor kenmerkverbetering van de CNN-module. Klik hier om een grotere versie van deze figuur te bekijken.

Resultaten

Om de effectiviteit van het voorgestelde YOLOv1- en CNN-fusiemodel bij de veiligheidsbewaking van productielijnen te verifiëren, is een dataset samengesteld die diverse scenario's van veiligheidsrisico's omvat. Deze dataset bevat 12.0 afbeeldingen van productielijnscènes, verdeeld over trainings-, validatie- en testsets in een verhouding van 7:1,5:1,5, met een vaste random seed van 42. Het beslaat diverse werkomstandigheden, waaronder standaardverlichting, zwakke verlichting, gedeeltelijke occlusie, sterke occlusie, bewegingsonscherpte en complexe achtergronden. De betrouwheidsdrempel voor inferentie werd ingesteld op 0,5 en de drempel voor non-maximum suppression (NMS) op 0,45. Alle experimenten werden driemaal herhaald en de resultaten worden gerapporteerd als gemiddelde ± standaarddeviatie. De annotatiecategorieën zijn werknemers, veiligheidshelmen, robotarmen, gevarenzones, gereedschappen en voertuigen, gebruikmakend van het PASCAL Visual Object Classes (VOC)-formaat. De intersection-over-union (IoU)-drempel is ingesteld op 0,5 en de consistentie van de annotaties is geverifieerd via kruisvalidatie door twee personen. Invoerafbeeldingen werden uniform geschaald naar 640 × 640 en uitgebreid met Mosaic-data. De training werd uitgevoerd met de SGD-optimizer met een initiële leeromslag van 0,01, momentum van 0,9, weight decay van 0,005 en een batchgrootte van 32. De training liep gedurende 20 epochs, waarbij cosine annealing werd gebruikt om de leeromslag aan te passen.

Om de effectiviteit van het model grondig te beoordelen, zijn verschillende evaluatiemetrieken gebruikt: mean average precision (mAP), frames per seconde (FPS) om de snelheid van de beeldframeverwerking te meten, precisie om de nauwkeurigheid van positieve voorspellingen te evalueren, recall om het vermogen van het model om true positives te detecteren te meten, en de area under the curve (AUC) om de oppervlakte onder de receiver operating characteristic (ROC)-curve aan te geven, wat het algemene classificatievermogen van het model weerspiegelt. De berekeningsformules worden weergegeven in Vergelijkingen (4), (5), (6), (7), (8), (9), (10), (1):

formule voor mAP-berekening, mAP@0,5=1/NΣ(Ni=1)APi, metriek, precisie, data-analyse.  (4)
berekeningsformule voor de gemiddelde gemiddelde precisie (mAP); Σ-vergelijking voor data-evaluatieanalyse.  (5)
Precisieformule, TP/(TP+FP), vergelijking voor analyse van resultaten van machine learning, beknopte metriek.  (6)
Recall Precisieformule, TP/(TP+FN), vergelijking, statistische analyse, evaluatie van machine learning. (7)
Statische evenwichtingsvergelijking FPS=F/T die de berekening van kracht per tijd in de natuurkunde weergeeft.  (8)
Formule voor de sensitiviteit (true positive rate), TPR=TP/(TP+FN), vergelijking voor statistische analyse.  (9)
Formule voor het fout-positieve percentage, FPR=FP/(FP+TN), statistische analyse, educatief gebruik.  (10)
AUC-formule AUC=∫₀¹TPR(x)dx; wiskundig diagram voor interpretatie van data-analyse.  (11)

Precision-recall-metrieken; mAP@0,5, mAP@[0,5:0,95], TP, FP, FN, precisie, recall; data-analyse.  Hier geeft mAP@0,5 de gemiddelde gemiddelde precisie aan bij een IoU-drempelwaarde van 0,5; N is het aantal categorieën; APi is de gemiddelde precisie van de i-de categorie; en mAP@[0,5:0,95] is de gemiddelde mAP berekend over IoU-drempelwaarden van 0,5 tot 0,95. TP, FP, FN, en TN vertegenwoordigen respectievelijk de aantallen terecht-positieven, fout-positieven, fout-negatieven en terecht-negatieven. F is het totale aantal verwerkte frames, T is de totale verwerkingstijd, TPR is de sensitiviteit, en FPR is de fout-positief ratio.
Voor de detectiecomponent van YOLOv11 wordt de verliesfunctie weergegeven in vergelijking (12):

Formule van de verliesfunctie: \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

Diagram van de vergelijking voor statisch evenwicht: L_coord, L_conf, L_class; λ_coord, λ_conf, λ_class.  Waar Lcoord geeft de afwijking tussen het voorspelde frame en het werkelijke frame aan, Lconf meet de betrouwbaarheidsfout van het voorspelde frame, Lclass meet de categorievoorspellingsfout, en λcoord, λconf en λclass zijn de wegingscoëfficiënten die worden gebruikt om de overeenkomstige verliesfuncties in evenwicht te brengen.

Analyse van de gegevens in Tabel 1 laat zien dat de voorgestelde methode een mAP@0.5 van 0,91 en een mAP@0,5:0,95 van 0,82 behaalt, wat respectievelijk verbeteringen van 0,04 en 0,04 vertegenwoordigt ten opzichte van YOLOv5. De F1-score is 0,935, wat even tevoren hoger is dan die van de vergelijkingsmodellen. De detectiesnelheid is 120 FPS, vier keer die van Faster R-CNN, maar iets lager dan YOLOv10 en YOLOv11. Het aantal parameters is 6,7M, slechts 1,5M meer dan YOLOv1, met een verbetering van 0,03 in mAP@0.5. Vergeleken met EfficientDet, dat een vergelijkbare rekenkost heeft, is de nauwkeurigheid 0,06 hoger, terwijl het aantal parameters 56% lager is. De gegevens tonen aan dat de geïntroduceerde multi-scale fusion en het attentiemeganisme de detectienauwkeurigheid van kleine doelen effectief verbeteren, waardoor een goede balans tussen snelheid en nauwkeurigheid wordt bereikt. Samenvattend behaalt onze voorgestelde methode een evenwicht tussen detectienauwkeurigheid en snelheid. De mAP@0.5 is 0,02 hoger dan die van het op één na beste model, de F1-score bereikt 0,935, en de 6,7M parameters zijn voldoende voor praktische implementatie. De multi-scale fusion en het attentiemeganisme verbeteren de herkenning van kleine en occludeerde doelen in complexe scènes. Het model balanceert nauwkeurigheid en efficiëntie, waardoor het geschikt is voor real-time scenario's zoals industriële veiligheidsmonitoring. Opvallend is dat alle vergelijkingsmodellen gebruikmaken van officiële pretrained weights, met een uniforme inputresolutie van 640 × 640, een NMS-drempelwaarde van 0,45 en een betrouwbaarheidsdrempelwaarde van 0,5.

MethodemAP@0.5mAP@0.5:0.95F1-scoreFPSParams (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.70.81355.3
YOLOv10.880.750.8951405.2
ONZE METHODE0.910.820.9351206.7

Tabel 1: Uitgebreide vergelijkingstabel van modelprestaties. Analyse van de gegevens toont aan dat de voorgestelde methode een mAP@0.5 van 0,91 en een mAP@0.5:0.95 van 0,82 behaalt, wat respectievelijk verbeteringen van 0,04 en 0,04 vertegenwoordigt ten opzichte van YOLOv5. De F1-score is 0,935, wat ook hoger is dan die van de vergelijkingsmodellen. De detectiesnelheid is 120 FPS, vier keer die van Faster R-CNN, maar iets lager dan YOLOv10 en YOLOv11. Het aantal parameters is 6,7M, slechts 1,5M meer dan YOLOv1, met een verbetering van 0,03 in mAP@0.5. Vergeleken met EfficientDet, dat een vergelijkbare computationele kostprijs heeft, is de nauwkeurigheid 0,06 hoger, terwijl het aantal parameters 56% lager is. De gegevens tonen aan dat de geïntroduceerde multi-scale fusie en het aandachtmechanisme de nauwkeurigheid van detectie van kleine doelwitten effectief verbeteren, waardoor een goede balans tussen snelheid en nauwkeurigheid wordt bereikt. Samenvattend bereikt onze voorgestelde methode een evenwicht tussen detectienauwkeurigheid en snelheid. De mAP@0.5 is 0,02 hoger dan die van het op één na beste model, de F1-score bereikt 0,935, en de 6,7M parameters zijn voldoende voor praktische implementatie. De multi-scale fusie en het aandachtmechanisme verbeteren de herkenning van kleine en occludeerde doelwitten in complexe scènes. Het model balanceert nauwkeurigheid en efficiëntie, waardoor het geschikt is voor real-time scenario's zoals industriële veiligheidsbewaking. Opmerkelijk is dat alle vergelijkingsmodellen officiële vooraf getrainde gewichten gebruiken, met een uniforme inputresolutie van 640 × 640, een uniforme NMS-drempelwaarde van 0,45 en een uniforme betrouwbaarheidsdrempelwaarde van 0,5.

Figuur 2 biedt een diepgaande analyse van de typen foutieve detecties van het model. YOLOv1 + CNN heeft de laagste foutieve detectieratio voor de achtergrond (85 keer/10.0 frames), waarbij de meeste foutieve detecties voorkomen bij vergelijkbare objecten (62 keer) en gedeeltelijk occludeerde scènes (48 keer). ROC-curve-analyse laat zien dat de TPR van het model 0,9 bereikte (AUC = 0,98) bij een FPR van 0,1, en de nauwe afstand tussen de curven bevestigt de hoge betrouwbaarheid van de detectie-confidentie. Deze analyseresultaten ondersteunen niet alleen de prestaties van het model, maar bieden ook een duidelijke technische roadmap voor daaropvolgende optimalisatie van foutieve detecties, in het bijzonder door het vermogen om vergelijkbare objecten te onderscheiden te versterken.

ROC-curve en staafdiagram voor de vergelijking van objectdetectiemodellen: AUC, analyse van valse alarmen per type.
Figuur 2Foutanalyse. Analyse van de typen foutieve detecties van het model. YOLOv1 + CNN vertoont de laagste foutieve detectiegraad van de achtergrond (85 keer/10.00 frames), waarbij de meerderheid van de foutieve detecties geconcentreerd is bij vergelijkbare objecten (62 keer) en gedeeltelijk occludeerde scènes (48 keer). ROC-curve-analyse geeft aan dat de TPR van het model 0,9 bereikte (AUC = 0,98) bij een FPR van 0,1, en de nauwste afstand tussen de curven bevestigt de betrouwbaarheid van de detectieconfidentie. Deze analyseresultaten ondersteunen niet alleen de prestaties van het model, maar bieden ook een duidelijke technische roadmap voor de daaropvolgende optimalisatie van foutieve detecties, in het bijzonder door het vermogen om vergelijkbare objecten te onderscheiden te versterken. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3 vergelijkt de prestaties van het model op verschillende hardwareplatforms. YOLOv11 + CNN behaalt een ultralage latentie van 18 ms op de Edge tensor processing unit (TPU), met een fluctuatie van slechts ±2 ms, waarbij het stroomverbruik wordt beheerst op 15 W. Doorvoertests tonen aan dat het model een verwerkingssnelheid van 70 FPS bereikt op Jetson Xavier edge computing-apparaten, waarbij de latentie van het 9ste percentiel binnen 50 ms blijft. Deze prestatie-indicatoren voor implementatie maken het mogelijk om aan de implementatiebehoeften van diverse rekenplatforms in industriële velden te voldoen. De foutanalyse laat verder zien dat het model stabiele prestaties kan handhaven in omgevingen met beperkte middelen, wat de technische toepasbaarheid ervan demonstreert.

Grafieken voor de vergelijking van doorvoer en latentie voor YOLO-modellen op verschillende apparaten; analyse van apparaatprestaties.
Figuur 3Prestaties bij implementatie. Vergelijking van de prestaties van het model op verschillende hardwareplatforms. YOLOv1 + CNN bereikt een ultralage latentie van 18 ms op de Edge TPU (met een fluctuatie van slechts ±2 ms), en het stroomverbruik wordt beheerst op 15 W. Doorvoersnelheidstests tonen aan dat het model een verwerkingssnelheid van 70 FPS behaalt op Jetson Xavier edge computing-apparaten, waarbij de latentie van het 9ste percentiel binnen 50 ms blijft. Deze implementatie-prestatieindicatoren geven aan dat het model kan worden aangepast aan de implementatiebehoeften van diverse computerplatforms in industriële sectoren. De foutanalyse laat verder zien dat het model stabiele prestaties kan handhaven in omgevingen met beperkte middelen, wat de technische toepasbaarheid ervan aantoont. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4 vergelijkt de verschillen in detectieprestaties van elk model over zes doelcategorieën. YOLOv1 + CNN behaalde een nauwkeurigheid van 0,96 bij de taak voor het herkennen van veiligheidshelmen, waarmee het benchmarkmodel met 4 procentpunten werd overtroffen. De stippelgrafiek laat zien dat het model minimale prestatieschommelingen vertoont over de categorieën (±0,05), wat wijst op de generalisatiecapaciteiten ervan. De confusiematrix, weergegeven als een heat map, onthult een wederzijdse foutieve detectie van 15% tussen het gevarengebied en de robotarm. Deze bevinding biedt een duidelijke richting voor nadere optimalisatie van het model.

Confusiematrix en grafiek van de prestaties per categorie; analyse van precisie, recall en F1-score, veiligheidsmodel.
Figuur 4Categorie-detectieanalyse. Vergelijking van de verschillen in detectieprestaties van elk model over zes doelcategorieën. YOLOv1 + CNN behaalde een nauwkeurigheid van 0,96 bij de herkenning van veiligheidshelmen, waarmee het benchmarkmodel met 4 procentpunten werd overtroffen. De stippelgrafiek geeft aan dat het model minimale prestatieschommelingen vertoont over de categorieën (±0,05), wat wijst op de generalisatiecapaciteiten ervan. De conjunctiematrix, weergegeven als een heatmap, onthult een wederzijdse foutieve detectie van 15% tussen het gevarengebied en de robotarm. Deze bevinding biedt een duidelijke richting voor een daaropvolgende optimalisatie van het model. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5 biedt een uitgebreid overzicht van het trainingsproces voor elk model. YOLOv1 + CNN vertoont de snelste convergentiesnelheid, waarbij het verlies binnen 30 epochs daalt naar 0,1, en het verschil tussen de mAP-curve van de validatieset en de trainingset consequent minder dan 1% bedraagt. De analyse van de foutbandplot laat zien dat de uiteindelijke validatie mAP@0.5 van het model stabiel is op 0,94 ± 0,01, en dat het bereik van de prestatieschommelingen slechts een derde is van dat van RetinaNet. Deze resultaten bevestigen de effectiviteit van het gezamenlijke trainingsprotocol. Het model vertoont prestatievoordelen in de vroege fasen van de training, wat aangeeft dat het architecturale ontwerp in staat is om kenmerken snel te leren.

Boxplot en vioolplot waarin de validatie-mAP en het trainingsverlies van machine learning-modellen worden vergeleken.
Figuur 5Analyse van het trainingsproces. Een verslag van het trainingsproces voor elk model. YOLOv1 + CNN vertoont de snelste convergentiesnelheid (het verlies daalt binnen 30 epochs tot 0,1), en het verschil tussen de mAP-curve van de validatieset en de trainingset is altijd kleiner dan 1%. De analyse van de foutbandplot laat zien dat de uiteindelijke validatie mAP@0,5 van het model stabiel is op 0,94 ± 0,01, en dat de fluctuatie van de prestaties slechts een derde is van die van RetinaNet. Deze resultaten ondersteunen de effectiviteit van het gezamenlijke trainingsprotocol. Het model vertoont prestatievoordelen in de vroege stadia van de training, wat aangeeft dat het architecturale ontwerp in staat is om kenmerken snel te leren. Klik hier om een grotere versie van deze figuur te bekijken.

Tabel 2 presenteert de kwantitatieve prestatieresultaten voor verschillende detectiemodellen in complexe omgevingen. Testgegevens onder standaard verlichtingsomstandigheden en diverse extreme scenario's laten zien dat YOLOv1 + CNN onder alle condities een optimale prestatie behoudt. Onder standaard verlichtingsomstandigheden bereikte de mAP@0.5 van dit model 0,91, wat aanzienlijk beter is dan YOLOv5 (0,87) en Faster R-CNN (0,84). Naarmate de omgevingscondities verslechteren, neemt de prestatie van elk model in wisselende mate af, maar YOLOv1 + CNN vertoont de sterkste omgevingsrobuustheid: onder omstandigheden met weinig licht (< 50 lux) neemt de prestatie slechts met 3% af (naar 0,8), wat beter is dan de reductie van 5% bij het vergelijkingsmodel; in scenario's met zware occlusies (> 50%) kan de mAP nog steeds worden gehandhaafd op 0,78, en de prestatiedegradatie (13%) is aanzienlijk kleiner dan die van YOLOv5 (15%) en Faster R-CNN (16%). Deze resultaten tonen aan dat YOLOv1 + CNN de aanpasbaarheid van het model aan complexe factoren, zoals veranderingen in verlichting en occlusies, verbetert door middel van verbeterde feature-fusie en aandachtmechanismen, waardoor praktische toepassingen in industriële scenario's worden ondersteund.

TestconditieYOLOv1 + CNNYOLOv5Faster R-CNNPrestatieschommeling
Standaardverlichting0.910.870.840.01
Lage lichtintensiteit (< 50 lux)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
Gedeeltelijke occlusie (30%–50%)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
Zware occlusie (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
Bewegingsonscherpte0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

Tabel 2: Kwantitatieve analysetabel van de omgevingsaanpassingsvermogen. Prestaties van verschillende detectiemodellen in complexe omgevingen via kwantitatieve analyse. Testgegevens van standaard verlichtingsomstandigheden tot diverse extreme scenario's tonen aan dat YOLOv1 + CNN de hoogste prestaties behoudt onder alle testcondities. Onder standaard verlichtingsomstandigheden bereikte de mAP@0.5 van dit model 0,91, wat significant beter is dan YOLOv5 (0,87) en Faster R-CNN (0,84). Naarmate de omgevingscondities verslechteren, nemen de prestaties van elk model in verschillende mate af, maar YOLOv1 + CNN vertoont de sterkste omgevingsrobuustheid van de geëvalueerde modellen: onder omstandigheden met weinig licht (< 50 lux) daalt de prestatie slechts met 3% (naar 0,8), wat beter is dan de afname van 5% bij het vergelijkingsmodel; in scenario's met zware occlusie (> 50%) kan de mAP nog steeds worden gehandhaafd op 0,78, en de prestatiedegradatie (13%) is significant kleiner dan die van YOLOv5 (15%) en Faster R-CNN (16%). Deze resultaten tonen aan dat YOLOv1 + CNN de aanpassingsvermogen van het model aan complexe factoren, zoals veranderingen in verlichting en occlusie-interferentie, verbetert door een geoptimaliseerd feature-fusie-mechanisme en attention-design, wat praktische toepassingen in industriële scenario's ondersteunt.

Tabel 3 laat zien dat de SGD-optimizer is gebruikt in dit experiment, met een momentum van 0,9 om de convergentie te versnellen en oscillaties te onderdrukken. Er werd een initiële leerfrequentie van 0,01 gebruikt met cosine annealing, die tijdens de training geleidelijk afnam om de optimalisatie te verfijnen. Een weight decay van 0,05 werd geïntroduceerd om L2-regularisatie toe te passen en overfitting te verminderen. Een batchgrootte van 32 zorgde voor een balans tussen computationele efficiëntie en de stabiliteit van de gradiëntschatting. De 20 trainingsepochs waarborgden voldoende convergentie. De parameters werden aangepast aan de detectietaak in één fase, waarbij een balans werd gezocht tussen trainingssnelheid en nauwkeurigheid.

ParameterWaarde
OptimizerSGD
Initiële leeromgeving0.01
Momentum0.9
Gewichtsverval0.005
Batchgrootte32
Trainings-epochs20
Planning van de leersnelheidCosine annealing

Tabel 3: Tabel met hyperparameters voor de training. De SGD-optimizer werd in dit experiment gebruikt, met een momentum van 0.9 om de convergentie te versnellen en oscillaties te onderdrukken. Er werd een initiële leerfrequentie van 0.01 gebruikt met cosine annealing, die geleidelijk afnam tijdens de training om de optimalisatie te verfijnen. Een weight decay van 0.05 werd geïntroduceerd om L2-regularisatie toe te passen en overfitting te verminderen. Een batchgrootte van 32 zorgde voor een balans tussen computationele efficiëntie en de stabiliteit van de gradientschatting. De 200 training-epochs zorgden voor voldoende convergentie. De parameters werden aangepast aan de single-stage detectietaak, waarbij een balans werd gezocht tussen trainingssnelheid en nauwkeurigheid.

Tabel 4 laat zien dat, met YOLOv1 als basislijn, de mAP@0.5 0,89 is. De introductie van enkel multi-scale fusion verlaagt de nauwkeurigheid naar 0,8. Het stapsgewijs toevoegen van channel attention en spatial attention verbetert de nauwkeurigheid vervolgens tot respectievelijk 0,90 en 0,89. De gecombineerde nauwkeurigheid van alle modules bereikt 0,91, een verbetering van 0,02 ten opzichte van de basislijn. De gegevens tonen aan dat channel attention de nauwkeurigheid direct verbetert en dat de gecombineerde prestatie van multi-scale en attention optimaal is.

ConfiguratiemAP@0.5
YOLOv1 (baseline)0.89
+ Multi-scale fusie0.8
+ Multi-scale + kanaal-attentie0.9
+ Multi-scale + ruimtelijke attentie0.89
Volledige module (YOLOv1 + CNN)0.91

Tabel 4: Ablatietesttabel. Met YOLOv1 als basislijn is de mAP@0.5 0,89. De introductie van enkel multi-scale fusie verlaagt de nauwkeurigheid naar 0,8. Het toevoegen van channel attention of spatial attention na multi-scale fusie verbetert de nauwkeurigheid respectievelijk naar 0,90 en 0,89. De gecombineerde nauwkeurigheid van alle modules bereikt 0,91, een verbetering van 0,02 ten opzichte van de basislijn. De gegevens tonen aan dat channel attention in deze setting grotere winst oplevert dan spatial attention, en dat de gecombineerde prestatie van multi-scale fusie en attention optimaal is.

Figuur 6 evalueert systematisch de prestaties van het model in extreme omgevingen. De mAP van YOLOv1 + CNN daalde met slechts 6% (naar 0,8) onder omstandigheden met weinig licht en behield nog steeds een mAP van 0,78 (8% hoger dan de benchmark) in sterk occluderende scenario's. Deze resultaten tonen aan dat het model een omgevingsadaptatie vertoont, waarbij veelvoorkomende veranderingen in verlichting en lokale occlusieproblemen in de industriële productie effectief worden aangepakt, wat daarmee de stabiele werking van het detectiesysteem ondersteunt.

Prestatiegrafieken van het model voor objectdetectie; analyse van de impact van verlichting en occlusie; mAP@0,5-metrieken.
Figuur 6Aanpassingsvermogen aan de omgeving. Een systematische evaluatie van de prestaties van het model in extreme omgevingen. De mAP van YOLOv1 + CNN daalde met slechts 6% (naar 0,8) onder omstandigheden met weinig licht, en behield nog steeds een mAP van 0,78 (8% boven de benchmark) in zwaar occludeerde scènes. Deze resultaten tonen aan dat het model omgevingsadaptiviteit vertoont en effectief omgaat met veelvoorkomende veranderingen in belichting en lokale occlusieproblemen in industriële productie, waardoor de stabiele werking van het detectiesysteem wordt ondersteund. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7 vergelijkt de verschillen in kenmerkdistributie tussen YOLOv1 en YOLOv1 + CNN voor zes typen industriële doelwitten via t-SNE dimensionaliteitsreductie. De linkerfiguur laat zien dat de kenmerken van het basismodel YOLOv1 een aanzienlijke intraclass-dispersie vertonen (intraclass-afstand 2.34 ± 0.15), met name bij de "Danger Zone" (rood) en "Vehicle" (paars), waar een aanzienlijke overlap is, wat consistent is met de foutieve detectiegraad van 15% in experimentele groep 3. De rechterfiguur laat zien dat het verbeterde YOLOv1 + CNN de intraclass-compactheid aanzienlijk verhoogt via de kenmerkverbeteringsmodule, waarbij de gemiddelde afstand tussen clustercentra binnen elke categorie met 1,8 keer is toegenomen.

Grafiek van feature-clustering YOLOv1 vs. YOLOv1+CNN, analyse van de intra-klasseafstand, datavisualisatie.
Figuur 7Vergelijking van de t-SNE feature-distributie. Een vergelijking van de verschillen in kenmerkdistributie tussen YOLOv1 en YOLOv1 + CNN voor zes typen industriële doelwitten via t-SNE-dimensiereductie. De linkerfiguur laat zien dat de kenmerken van het basismodel YOLOv1 een significante intraclasse-dispersie vertonen (intraclasse-afstand 2,34 ± 0,15), met name in de "Danger Zone" (rood) en "Vehicle" (paars) waar er sprake is van aanzienlijke overlap, wat consistent is met de foutdetectiegraad van 15% in experimentele groep 3. De figuur rechts laat zien dat het verbeterde YOLOv1 + CNN de intraclasse-compactheid significant verbetert door de kenmerkverbeteringsmodule, waarbij de gemiddelde afstand tussen de clustercentra in elke categorie met 1,8 keer is toegenomen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8 bevestigt de bijdrage van elke module via systematische ablatie-experimenten. De ablatieresultaten laten zien dat het toevoegen van channel-attention na multi-scale fusie de mAP@0.5 verhoogt tot 0,90, terwijl het toevoegen van spatial-attention de mAP@0.5 verhoogt tot 0,89. De volledige module behaalt de hoogste mAP@0.5 van 0,91. De visualisatie van de heat map laat zien dat het samengestelde attention-mechanisme gelijktijdig de detectierespons op het centrum van het gevarengebied (activatiewaarde: +0,15) en kleine targets aan de rand (+0,08) kan verbeteren. De experimentele gegevens tonen aan dat multi-scale feature-fusie en attention-mechanismen een cumulatief effect hebben, waardoor het model kan voldoen aan de eisen voor target-detectie op verschillende schalen.

Ablatiestudie-grafiek van kenmerkverbetering in YOLO-frameworks met attention-maps; prestatieanalyse.
Figuur 8Modulair ablatie-experiment. Verificatie van de bijdrage van elke module door middel van systematische ablatie-experimenten. De ablatieresultaten laten zien dat het toevoegen van kanaalattentie na multi-schaal fusie de mAP@0,5 verhoogt naar 0,90, terwijl het toevoegen van ruimtelijke attentie de mAP@0,5 verhoogt naar 0,89. De volledige module behaalt de hoogste mAP@0,5 van 0,91. De hittekaartvisualisatie laat zien dat het samengestelde attentiemechanisme gelijktijdig de detectierespons kan versterken voor het centrum van het gevarengebied (activatiewaarde: +0,15) en kleine targets aan de rand (+0,08). De experimentele gegevens tonen aan dat multi-schaal kenmerkfusie en attentiemechanismen een cumulatief effect hebben, waardoor het model aan de target-detectie-eisen over verschillende schalen kan voldoen. Klik hier om een grotere versie van deze figuur te bekijken.

DATAbeschikbaarheid:
Volledige ruwe beelden en videostromen uit de productielijn zijn onderworpen aan industriële vertrouwelijkheidsbeperkingen en worden niet openbaar gemaakt. Een aanvullende beschrijving van de dataset (Supplemental File 1) bevat details over de acquisitie van de dataset, de verdeling van categorieën en scenario's, annotatiespecificaties, kwaliteitscontroleprocedures, datasplitsingen, preprocessing en augmentatieprocedures. Een pseudocode- en reproduceerbaarheidsraamwerk (Supplemental File 2) biedt een workflow op pseudocodeniveau, configuratiebeschrijvingen en richtlijnen voor reproductie. Een geanonimiseerde subset en aanvullend ondersteunend materiaal kunnen worden opgevraagd bij de corresponderende auteur voor niet-commercieel academisch onderzoek, onder voorbehoud van institutionele en vertrouwelijkheidsbeperkingen.

Aanvullend bestand 1. Beschrijving van de aanvullende dataset. Dit bestand beschrijft het protocol voor de acquisitie van de dataset, de scenario-dekking, de klassendistributie, de annoteerspecificaties, de kwaliteitscontroleprocedures, de partitioning van training/validatie/test, de preprocessing en de augmentatieprocedures. Klik hier om dit bestand te downloaden.

Aanvullend bestand 2. Pseudocode en reproduceerbaarheidsraamwerk. Dit bestand bevat workflowdetails op pseudocodeniveau en configuratiedetails voorbewerking, training, evaluatie en implementatie, en beschrijft de beperkingen met betrekking tot ruwe industriële beelden en de toegang tot ondersteunende materialen. Klik hier om dit bestand te downloaden.

Discussie

Experimentele resultaten tonen aan dat het voorgestelde YOLOv11–CNN-fusiemodel de detectienauwkeurigheid en real-time prestaties voor de veiligheidsbewaking van productielijnen verbetert. Door gebruik te maken van de efficiënte single-stage detectie van YOLOv11 en de kenmerkverbetering van de CNN-module, identificeerde het systeem werknemers, apparatuur en gevaarlijke zones onder complexe verlichtings- en occlusieomstandigheden. Multi-scale kenmerkfusie en attention-mechanismen verbeterden het vermogen om zich op cruciale veiligheidselementen te concentreren, waardoor interpreteerbaar visueel bewijs voor vroegtijdige waarschuwing werd geleverd.

Het systeem heeft een praktische waarde voor productielijnen in omgevingen zoals automobielproductie en elektronica-assemblage, waar monitoring in realtime de afhankelijkheid van handmatige inspectie kan verminderen en de responstijden bij potentiële veiligheidsrisico's kan verkorten. Voor kleine doelen, zoals schroeven en gereedschappen, en voor werknemers die gedeeltelijk worden afgeschermd door robotarmen of andere apparatuur, verbeteren de multi-scale feature fusion en attention-mechanismen het vermogen van het model om veiligheidsgerelateerde kenmerken te extraheren en te benadrukken. Deze verbeteringen zijn relevant voor productieomgevingen waarin doelen variëren in grootte en zichtbaarheid.

Deze studie kent echter nog duidelijke beperkingen. Bij ernstige occlusie of zeer lage verlichting kan de prestatie van het model afnemen omdat de kenmerken van het doelobject onvolledig worden en bestaande convolutionele kenmerken mogelijk onvoldoende zijn. De nieuw toegevoegde CNN-module voor kenkening enhancement introduceert 1,5M extra parameters, wat de computationele belasting op goedkope edge-apparaten kan verhogen en de implementatie in omgevingen met beperkte middelen kan beperken. Deze studie maakt gebruik van beeldgegevens in het zichtbare lichtspectrum en integreert geen multimodale sensorinformatie, zoals infraroodthermische beelden of millimetergolfradar; daarom kan de prestatie beperkt zijn in extreme industriële scenario's, zoals volledige duisternis of rook.

Toekomstig onderzoek zal zich richten op de volgende richtingen: modelverlichtung op basis van gestructureerde pruning en kennisdestillatie om de parameterbelasting te verminderen terwijl de detectieprestaties behouden blijven; de constructie van een multimodaal fusiedetectiekader voor zichtbaar en infrarood licht om het detectievermogen onder extreme verlichtingsomstandigheden en in rookomgevingen te verbeteren; de introductie van een lichtgewicht Transformer-module om een deel van de convolutionele lagen te vervangen en de extractie van contextkenmerken over lange afstand te verbeteren; en de ontwikkeling van een end-to-end subsysteem voor het herkennen van abnormaal gedrag om de volledige workflow te ondersteunen, van doeldetectie tot vroege waarschuwing van gedrag.

Concluderend richt deze studie zich op een veiligheidsmonitoringsysteem voor productielijnen dat YOLOv11- en CNN-algoritmen fuseert om real-time detectie en vroegtijdige waarschuwing van potentiële veiligheidsrisico's in complexe industriële omgevingen mogelijk te maken. Door experimentele verificatie vertoonde het fusiemodel prestatievoordelen in de nauwkeurigheid van objectdetectie en de inferentiesnelheid. Dankzij de efficiënte single-stage detectiearchitectuur en geoptimaliseerde kenmerkextractie presteerde YOLOv11 goed bij het snel identificeren van werknemers, apparatuur en gevaarlijke zones, en legde het nauwkeurig cruciale veiligheidselementen vast in scenario's van productielijnen. Tegelijkertijd zorgde de introductie van de verbeterde CNN-module voor een verdere optimalisatie van de kenmerkextractie en de detectie van occlusies. Bij de veiligheidsmonitoring van de productielijn richt het model zich via visuele analyse automatisch op kritieke veiligheidszones in het beeld, waardoor er een interpreteerbare basis ontstaat voor veiligheidswaarschuwingen. Het fusiemodel demonstreerde een sterke aanpasbaarheid en stabiliteit in diverse scenario's van productielijnen, waaronder verspaning, assemblage en warehousing. De belangrijkste resultaten van dit artikel zijn als volgt:

(1) Een deep fusion-architectuur van YOLOv11 en CNN werd ontworpen om de detectiesnelheid en nauwkeurigheid in evenwicht te brengen.
(2) Er werd een mechanisme voor multi-schaal feature-fusie en attention-optimalisatie gebouwd om het vermogen te verbeteren om ons te concentreren op cruciale veiligheidselementen in complexe scenario's.
(3) Experimenten op de zelfgebouwde dataset voor veiligheid op de productielijn toonden aan dat het model een mAP@0.5 van 0,91 en een detectiesnelheid van 120 FPS bereikte. Bij testen in verschillende scenario's vertoonde het model een stabiele prestatie.

Typische casestudies toonden aan dat onder standaard verlichtingsomstandigheden een veiligheidshelm met slechts 40% blootstelling nauwkeurig werd gedetecteerd door multi-scale fusion en channel attention (betrouwbaarheid 0,93), terwijl het baseline-model dit onterecht als achtergrond classificeerde. In scenario's met weinig licht, wanneer een werknemer een gevarenzone betrad, kon spatial attention het doelwit succesvol begrenzen met directionele lijnen, terwijl de vergelijkingsmethode niet in staat was dit te detecteren. Fouten omvatten een steeksleutel die onterecht als gereedschap werd gedetecteerd vanwege de texturele gelijkenis met de achtergrond bij ernstige occlusie, en een veiligheidshelm die werd gemist door een lage signaal-ruisverhouding op afstand onder omstandigheden met weinig licht, wat beperkingen in de kenmerkrepresentatie onder extreme omstandigheden onthult. Deze resultaten geven aan dat het model robuust is in normale en matig complexe scenario's, maar nog verbetering behoeft onder extreme omstandigheden.

Openbaarmakingen

De auteurs hebben geen belangenconflicten te verklaren.

Dankbetuigingen

Dit werk werd gedeeltelijk gefinancierd door de Taizhou University Scientific Research Foundation for Advanced Talents "Research on key technologies of precision detection for intelligent manufacturing" (TZXY2020QDJJ006).

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
COCO API   N/ABeoordelingstool gebruikt voor de evaluatie van de nauwkeurigheid van targetdetectie en statistische analyse.
CUDA 11.4NVIDIAN/AParallel computing-platform gebruikt met het PyTorch 1.12 framework.
Edge TPU   N/AImplementatieplatform gebruikt voor het testen van latentie en stroomverbruik; de gerapporteerde latentie was 18 ms en het stroomverbruik was 15 W.
Jetson Xavier edge computing deviceNVIDIA   Edge computing-apparaat gebruikt voor throughput-testen; de gerapporteerde verwerkingssnelheid was 70 FPS met een latentie van het 99ste percentiel binnen 50 ms.
NVIDIA Tesla V100 GPUNVIDIA   GPU gebruikt in de trainings-/evaluatieserver.
PyTorch 1.12   N/ADeep learning framework gebruikt voor modeltraining en evaluatie.
scikit-learn    N/ABeoordelings-/statistische analysetool gebruikt voor modelevaluatie.
Zelfgebouwde veiligheidsdataset voor productielijnenN/AN/ADataset van 12.000 afbeeldingen van productielijnscenario's in VOC-formaat, met standaardverlichting, lage verlichting, gedeeltelijke occlusie, zware occlusie, bewegingsonscherpte en complexe achtergronden; zes annotatiecategorieën: werknemers, veiligheidshelmen, robotarmen, gevarenzones, gereedschappen en voertuigen.
Trainingsserver       Server uitgerust met een NVIDIA Tesla V100 GPU en Ubuntu 20.04 besturingssysteem.
Ubuntu 20.04 besturingssysteem     N/ABesturingssysteem gebruikt op de trainings-/evaluatieserver.
VOC-annotatieformaatN/AN/AAnnotatieformaat gebruikt voor de zelfgebouwde veiligheidsdataset voor productielijnen.
YOLOv11 objectdetectiemodelUltralyticsN/AObjectdetectiemodel gebruikt om werknemers, apparatuur en potentiële gevaren in realtime te detecteren.

Referenties

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Herprints en machtigingen

Tags

Realtime monitoringdeep learningdetectieYOLOv11convolutioneel neuraal netwerkmulti schaal featurefusieaandachtsmeganismeindustri le automatisering