Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Forschungsartikel

Forschung zum Erkennungsalgorithmus für persönliche Schutzausrüstung in Übertragungsleitungen basierend auf verbessertem YOLOv11

360 Ansichten

DOI:

10.3791/69489

30. Dezember 2025

In diesem Artikel

Zusammenfassung

Ziel dieses Protokolls ist es, einen Schritt-für-Schritt-Leitfaden zur Entwicklung eines verbesserten, YOLOv11n-basierten Modells zur PSA-Erkennung bereitzustellen. Sie beschreibt architektonische und trainingsbezogene Änderungen, die zu einem leichten, Echtzeit-Detektor mit einer hochmodernen Genauigkeit von 90,1 % mAP und inhärenter Interpretierbarkeit führen.

Zusammenfassung

Bei der Inspektion intelligenter Übertragungsleitungen stehen Edge-Computing-Geräte vor der entscheidenden Herausforderung, Echtzeitleistung mit Erkennungsgenauigkeit für persönliche Schutzausrüstung in komplexen Betriebsszenarien in Einklang zu bringen. Diese Studie schlägt WTLS-YOLOv11n vor, einen leichtgewichtigen und von Natur aus interpretierbaren Detektionsalgorithmus. Die Methodik integriert drei synergetische Innovationen in die YOLOv11n-Architektur. Ein C3K2-WTConv-Modul, das eine diskrete Wavelet-Transformation verwendet, zerlegt Merkmale in physikalisch bedeutungsvolle Frequenzkomponenten und ermöglicht so eine robuste, multiskalierte Merkmalsextraktion mit inhärenter Interpretierbarkeit. Ein leichter, gemeinsamer Composite-Detektionskopf erreicht durch strategische Gewichtsteilung eine erhebliche Parameterreduzierung und erhält gleichzeitig die Multi-Scale-Fusionsfähigkeiten. Die MPDIoU-Verlustfunktion verbessert die Lokalisierungsgenauigkeit für kleine und unregelmäßig geformte Ziele. Die experimentelle Validierung zeigt, dass das vorgeschlagene Modell eine überlegene Erkennungsgenauigkeit mit deutlich reduzierten Parametern und Rechenkomplexität im Vergleich zum Ausgangsmodell erreicht und gleichzeitig die Echtzeit-Inferenzleistung auf Edge-Hardware-Plattformen beibehält. Die quantitative Interpretierbarkeitsanalyse zeigt, dass Erkennungsentscheidungen überwiegend von niedrigfrequenten strukturellen Merkmalen und nicht von hochfrequenten texturalen Details getroffen werden, was transparente Einblicke in den Schlussfolgerungsprozess des Modells bietet. Vergleichsexperimente mit gängigen Detektionsmodellen bestätigen den überlegenen Genauigkeits-Effizienz-Kompromiss des vorgeschlagenen Ansatzes. Diese Arbeit etabliert eine transparente, effiziente und vertrauenswürdige Lösung für automatisierte Sicherheitsüberwachung im Strombetrieb, mit einer breiteren Anwendung auf sicherheitskritische Erkennungsaufgaben, die eine Randbereitstellung und interpretierbare Entscheidungsfindung erfordern.

Einleitung

Deep Learning hat industrielle Sicherheitsprotokolle transformiert und neue Ansätze im Arbeitsrisikomanagement eingeführt. Diese Transformation zeigt sich besonders in risikoreichen Bereichen wie der Energiesystemtechnik. Visionsbasierte intelligente Überwachungssysteme nutzen nun die YOLO (You Only Look Once)1-Architektur, um die automatisierte Erkennung von Schutzausrüstung (PPE)2,3 in Echtzeit zu ermöglichen. Diese Systeme haben sich als kritische Technologie für die Überwachung der Arbeitssicherheit etabliert und bieten erhebliche Verbesserungen bei der Erkennungsgenauigkeit und Reaktionsgeschwindigkeit im Vergleich zu herkömmlichen Methoden.

Diese Systeme überwachen kontinuierlich die Einhaltung von Sicherheitsstandards, reduzieren menschliche Fehler und verbessern die Aufsicht an komplexen Energiestandorten. Doch die tiefen neuronalen Netze, die diesen Systemen zugrunde liegen, stellen eine erhebliche Herausforderung dar: Ihre Entscheidungsprozesse bleiben undurchsichtig. Dieser Mangel an Interpretierbarkeit stellt das Haupthindernis für eine breitere Verbreitung in der Branche dar, insbesondere in sicherheitskritischen Anwendungen, bei denen das Verständnis des Systemdenkens unerlässlich ist, um Vertrauen aufzubauen und Rechenschaftspflicht sicherzustellen.

Wenn ein Modell eine falsche Einschätzung fällt, einen nicht konformen Mitarbeiter übersieht oder unnötige Betriebsabschaltungen auslöst, liefert der undurchsichtige Entscheidungsprozess keine umsetzbaren Informationen für Sicherheitsmanager. Ohne die Fähigkeit, Fehler zu diagnostizieren, Systemlogik zu verstehen oder Entscheidungen zu verifizieren, können diese Systeme die Zuverlässigkeitsstandards in Umgebungen, in denen menschliche Sicherheit auf dem Spiel steht, nicht erfüllen. Diese Lücke hat die wachsende Nachfrage nach Explainable Artificial Intelligence (XAI)4,5,6-Ansätzen getrieben, die sowohl Genauigkeit als auch Transparenz bieten. Das Ziel ist es, Systeme zu entwickeln, die Sicherheitspersonal in kritischen operativen Kontexten verstehen, validieren und vertrauen können.

Transparenz bleibt unerlässlich, muss jedoch auf Modellen aufgebaut werden, die unter herausfordernden Betriebsbedingungen zuverlässig funktionieren. Strombetriebsstandorte stellen besondere technische Anforderungen, die robuste Erkennungsfähigkeiten erfordern. Diese Umgebungen erleben extreme Beleuchtungsschwankungen, die von intensivem Tageslicht bis zu völliger Dunkelheit reichen. Komplexe Maschinen behindern häufig das Gesichtsfeld und schaffen Okklusionsprobleme, die Standard-Erkennungsmodelle nur schwer bewältigen können. Wetterbedingungen sorgen für weitere Variabilität, was die Sichtbarkeit und Bildqualität in verschiedenen Einsatzszenarien beeinflusst. Die Bewältigung dieser Herausforderungen erfordert Modelle, die trotz solcher Umweltkomplexität eine konstante Leistung aufrechterhalten.

Forscher haben verschiedene Ansätze verfolgt, um die YOLO-Leistung für Anwendungen an Stromstellen zu optimieren. Architektonische Veränderungen stellen eine bedeutende Forschungsrichtung dar. Mehrere Studien haben das YOLOv57-Netzwerkdurch die Integration zusätzlicher Detektionsköpfe in die Halsstruktur erweitert. Diese Modifikation adressiert eine anhaltende Herausforderung bei der Erkennung von PSA: die Schwierigkeit, kleine Objekte aus der Ferne oder in überladenen Gesichtsfeldern zu erkennen. Die zusätzlichen Detektionsschichten ermöglichen es dem Modell, feinere räumliche Details zu erfassen, die Standardarchitekturen übersehen könnten.

Eine zweite wichtige Forschungsrichtung konzentriert sich auf die Modelloptimierung für Einsatzumgebungen. Leistungsbetriebsstandorte erfordern oft Erkennungssysteme auf Randgeräten mit begrenzten Rechenressourcen. Diese Einschränkung hat Bestrebungen bei Modellkompression und Effizienzverbesserungen vorangetrieben. Forscher haben Techniken entwickelt, um Modellgröße und Inferenzzeit zu reduzieren und gleichzeitig die Erkennungsgenauigkeit zu erhalten, wodurch Echtzeitleistung auf Hardware mit eingeschränkter Verarbeitungskapazitätmöglich ist 8,9.

Jüngste Optimierungsbemühungen haben mehrere vielversprechende Techniken zur Reduzierung der Modellkomplexität eingeführt. Forscher haben effiziente Backbone-Netzwerke wie MobileNetv310 in Architekturen wie YOLO-M11 integriert. Andere haben Modellschnitt und Wissensdestillation angewandt, um kompakte Varianten wie Light-YOLOv412 zu entwickeln. Diese Ansätze haben messbare Verbesserungen in der Recheneffizienz und der Bereitstellungsmachbarkeit gezeigt.

Diese Optimierungsmethoden stehen jedoch vor einer grundlegenden Einschränkung, die konventionellen Faltungsarchitekturen innewohnt. Standard-Faltungsoperationen erfordern immer tiefere Netzwerkschichten oder größere Kernelgrößen13 , um das rezeptive Feld zu erweitern, was für die Erfassung kontextueller Informationen im gesamten Bild unerlässlich ist. Diese architektonische Anforderung schafft einen unvermeidbaren Kompromiss. Wenn Modelle die Fähigkeit gewinnen, reichhaltigere Merkmale zu extrahieren und einen breiteren räumlichen Kontext zu verstehen, steigen ihre Parameterzahlen und Rechenanforderungen erheblich. Die daraus resultierenden Modelle übersteigen oft die Verarbeitungskapazitäten von Edge-Geräten, was deren praktischen Einsatz in Echtzeit-Betriebsumgebungen einschränkt.

Diese Spannung zwischen der Fähigkeit zur Feature-Extraktion und der Recheneffizienz stellt eine bedeutende methodische Herausforderung dar, die aktuelle Ansätze noch nicht vollständig gelöst haben. Das Fachgebiet erfordert einen grundlegend anderen Ansatz zur Feature-Extraktion, der hierarchische, mehrskalige Features erfassen kann, ohne den proportionalen Anstieg der Parameter, wie herkömmliche Methoden es vorschreiben. Ein solcher Ansatz würde es Modellen ermöglichen, sowohl die für sicherheitskritische Anwendungen erforderliche Detektionsleistung als auch die für die Edge-Deployment erforderliche Effizienz aufrechtzuerhalten. Die Schließung dieser Lücke stellt eine entscheidende Forschungspriorität für die Weiterentwicklung praktischer PSA-Erkennungssysteme in Strombetriebsumgebungen dar.

Aktuelle Erklärbarkeitsmethoden zur Objekterkennung verwenden überwiegend Post-hoc-Analyseansätze14 wie Grad-CAM. Obwohl diese Methoden nützliche Visualisierungen bieten, arbeiten sie unabhängig vom Lernprozess des Modells. Ein alternativer Ansatz ist es, architektonische Komponenten zu entwerfen, die durch ihre operativen Mechanismen Transparenz bieten. Unsere wavelet-basierte Merkmalsextraktion bietet eine einfache Möglichkeit zu verstehen, welche Frequenzkomponenten zur Detektion beitragen, wobei weitere Forschung erforderlich ist, um diese Interpretierbarkeit vollständig zu quantifizieren.

Diese Forschung behandelt drei miteinander verbundene Herausforderungen in PSA-Detektionssystemen: Erkennungsgenauigkeit, Recheneffizienz und Modellinterpretierbarkeit. Die Arbeit modifiziert die YOLOv11n15-Architektur durch drei gezielte Designänderungen.

Die erste Modifikation führt das C3K2-WTConv-Modul ein, das die Standardfaltung durch einen von Wavelet inspirierten Merkmalextraktionsprozess ersetzt. Dieser Ansatz trennt visuelle Informationen in Frequenzkomponenten: Niederfrequente Signale enthalten Form- und Konturinformation, während hochfrequente Signale Textur- und Kantendetails kodieren. Diese Trennung verbessert die Merkmalsqualität und macht den Extraktionsprozess transparenter als herkömmliche Faltungsverfahren.

Die zweite Modifikation implementiert einen Lightweight Shared Composite Detection Head (LSCD), um die Rechenanforderungen zu reduzieren. Diese Komponente nutzt Parameterteilung über Detektionsskalen hinweg, verringert die Modellgröße und erhält gleichzeitig die Multi-Skalen-Erkennungsmöglichkeiten. Dieses Design zielt auf die Ressourcenbeschränkungen ab, die typisch für Edge-Geräte in Strombetrieben sind.

Die dritte Modifikation ersetzt die Standardverlustfunktion durch MPDIoU-Verlust16 , um die Genauigkeit der Begrenzungsboxen zu verbessern. Diese Änderung adressiert die Lokalisierungsherausforderungen, die mit kleinen und variabel geformten PSA-Gegenständen verbunden sind, indem sie während des Trainings eine bessere Steigungsstabilität bietet.

Tests zeigen, dass das modifizierte Modell eine durchschnittliche durchschnittliche Präzision um 3,8 % höher als der Ausgangswert erreicht, während 11,5 % weniger Parameter verwendet werden. Diese Ergebnisse zeigen, dass der Ansatz praktische Anforderungen für den Edge-Einsatz erfüllt und gleichzeitig die Erkennungsleistung verbessert. Die Arbeit bietet eine funktionale Lösung für die Sicherheitsüberwachung im Strombetrieb, obwohl weitere Validierungen unter verschiedenen Betriebsbedingungen weiterhin notwendig sind, um die Systemzuverlässigkeit vollständig zu bewerten.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Die Bilddaten für diese Studie wurden aus den Betriebsumgebungen der Stromversorgung mit den erforderlichen Genehmigungen erhoben. Alle Bilder wurden anonymisiert, ohne dass personenbezogene Daten gespeichert wurden. Diese Studie konzentriert sich darauf, persönliche Schutzausrüstung zu erkennen, anstatt Personen zu identifizieren. Da die Forschung ausschließlich die Entwicklung von Algorithmen unter Verwendung anonymisierter Daten umfasst, war keine ethische Genehmigung erforderlich.

Das folgende Protokoll beschreibt ein umfassendes Verfahren zur Entwurf, Schulung und Bewertung eines leichten, leistungsstarken und von Natur aus interpretierbaren Objekterkennungsmodells namens WTLS-YOLOv11n zur Erkennung von persönlicher Schutzausrüstung (PSA). Die in dieser Studie verwendete Software ist in der Materialtabelle aufgeführt.

Gesamtarchitektonischer Rahmen

Das vorgeschlagene WTLS-YOLOv11n-Modell basiert auf dem YOLOv11n-Basismodell. Die Kernmethodik besteht darin, zentrale Module im Rückgrat und im Kopf systematisch zu ersetzen oder zu verbessern, um Leistung, Effizienz und Interpretierbarkeit zu verbessern.

Das vorgeschlagene WTLS-YOLOv11n-Modell basiert auf dem YOLOv11n-Basismodell. Die Kernmethodik besteht darin, zentrale Module im Rückgrat und im Kopf systematisch zu ersetzen oder zu verbessern, um Leistung, Effizienz und Interpretierbarkeit zu verbessern. Das übergeordnete architektonische Paradigma von YOLOv11n, das aus Rückgrat, Nacken und Kopf besteht, wurde im vorgeschlagenen Modell beibehalten. Im Backbone wurden spezifische C3K2-Module durch die vorgeschlagenen C3K2-WTConv-Module ersetzt, um die Feature-Extraktion zu verbessern. Im Kopf wurde der ursprüngliche Detektionskopf durch den vorgeschlagenen Lightweight Shared Composite Detection Head (LSCD) ersetzt, um die Modellkomplexität zu reduzieren. Die vollständige Architektur des vorgeschlagenen WTLS-YOLOv11n-Modells, im Gegensatz zur Basislinie, ist in Abbildung 1 dargestellt.

C3K2-WTConv-Moduldesign

Dieses Modul ist darauf ausgelegt, die Standard-Faltungsmodule im YOLOv11n-Backbone zu ersetzen. Sein Design wird von zwei Hauptzielen geleitet: (a) das rezeptive Feld des Modells effizient zu erweitern, um kontextuelle Informationen in mehreren Maßstäben zu erfassen, ohne die Parameteranzahl oder Rechenkomplexität wesentlich zu erhöhen, und (b) robustere und grundsätzlich interpretierbare Merkmalsrepräsentationen zu lernen, indem Merkmalsabbildungen explizit in den Frequenzbereich zerlegt werden.

Design der Core WTConv-Schicht

Die grundlegende WTConv-Schicht (Wavelet Transform Convolution) ist darauf ausgelegt, die 2D-diskrete Haar-Wavelet-Transformation umzusetzen. Dieser Prozess wird durch eine Reihe spezifischer Wavelet-Kernel durchgeführt:

Wavelet-Kerne: Die Transformation wird über vier feste, nicht trainierbare Tiefenfaltungskerne (F_LL, F_LH, F_HL, F_HH) implementiert, die den Haar-Wavelet-Basisfunktionen entsprechen. Diese Kernel sind dafür verantwortlich, die Eingabefeature-Abbildung in ihre Nieder- und Hochfrequenzkomponenten zu zerlegen.

Dekomposition und Downsampling: Diese Kernel werden auf die Eingabefeature-Abbildung (X) mit einem Schritt 2 angewendet. Diese einzelne Operation führt effizient sowohl die Zerlegung der Merkmale als auch das räumliche Downsampling durch und teilt die Eingabe in vier verschiedene Unterbänder auf.

Physikalische Interpretation der Ausgangskomponenten

Die vier durch die Wavelet-Zerlegung erzeugten Feature-Unterbänder besitzen eine klare physikalische Interpretation. Wie in Abbildung 2 dargestellt, zerlegt die WTConv-Schicht die Eingabe rekursiv in folgende Komponenten:

Niederfrequente Komponente (LL): Diese Komponente bewahrt die Gesamtstruktur, Kontur und andere globale Informationen des Ziels bei halber räumlicher Auflösung. Sie dient als Grundlage für das Modell, um die "Form" des Ziels zu verstehen.

Hochfrequenzkomponenten (LH, HL, HH): Diese drei Komponenten erfassen feinkörnige Details wie horizontale, vertikale und diagonale Kanten bzw. Texturen. Sie ermöglichen es dem Modell, sich auf die "Details" des Ziels zu konzentrieren.

Integration in die C3K2-Modulstruktur

Die entworfene WTConv-Schicht ist nahtlos in die C3K2-Flaschenhalsstruktur von YOLOv11n integriert.

Ersatzstrategie: Im ursprünglichen C3K2-Modul wird die Standard-3x3-Faltungsschicht durch die WTConv-Schicht ersetzt. Dieser Ansatz bewahrt den effizienten Mechanismus der Wiederverwendung von Funktionen der C3K2-Architektur und führt dabei die Vorteile der Wavelet-Transformation ein, was zum endgültigen C3K2-WTConv-Modul führt (detaillierte Struktur in Abbildung 3).

Kaskadierte rezeptive Felderweiterung: Der WTConv-Prozess kann rekursiv auf den Niederfrequenzausgang (LL) der vorhergehenden Stufe angewendet werden. Dieser kaskadierte Zerlegungsmechanismus ermöglicht es dem Modell, Merkmale über einem exponentiell wachsenden rezeptiven Feld mit minimalem Rechenaufwand zu analysieren und so einen effizienten Multi-Skala-Frequenzdekompositionspfad zu schaffen.

Lightweight Shared Composite Detection Head (LSCD) Design

Dieses Modul wurde entwickelt, um den ursprünglichen YOLOv11n-Detektionskopf zu ersetzen, mit dem Hauptziel, die Modellkomplexität und den Rechenaufwand drastisch zu reduzieren, um eine effiziente Bereitstellung auf ressourcenbegrenzten Edge-Geräten zu ermöglichen. Das Design berücksichtigt die signifikante Parameterredundanz, die in Standard-Multi-Scale-Detektionsköpfen gefunden wird (detaillierte Struktur in Abbildung 4 dargestellt.

Begründung und Entwurfsziele

Die unabhängigen Vorhersagezweige für jede Merkmalsskala (P3-P5) im ursprünglichen YOLOv11-Kopf führen zu einer hohen Parameteranzahl. Das LSCD führt eine hybride Parameter-Sharing-Strategie ein, um eine überlegene Parametereffizienz zu erreichen und dabei kritische Multi-Scale-Feature-Fusionsfähigkeiten zu erhalten.

Parameter-Sharing und Mechanismus zur Funktionsfusion

Der Kern des LSCD liegt in seiner zweistufigen Feature-Processing-Pipeline:

Skalenspezifische Vorverarbeitung: Für jede Eingabefeature-Map vom Hals (P3, P4, P5) wird eine nicht geteilte 1x1-Faltung gefolgt von einer Group Normalization (GN)-Schicht angewendet. Dieser erste Schritt ermöglicht es dem Netzwerk, skalierungsspezifische Kanaltransformationen zu erlernen und sicherzustellen, dass die einzigartigen Eigenschaften jedes Merkmalsniveaus vor der Fusion erhalten bleiben.

Effiziente Kreuz-Skala-Fusion: Nach der Vorverarbeitung werden eine Reihe gemeinsamer 3x3-Faltungs-GN-Module eingesetzt, um die Kernfunktionsfusion über verschiedene Skalen hinweg durchzuführen. Durch das Teilen von Gewichten lernen diese Module ein verallgemeinertes Merkmalfusionsmuster, das die Hauptquelle für die Parameterreduktion ist. Dieses Design zwingt das Modell dazu, robustere und universellere Fusionsdarstellungen zu lernen.

Dynamische Skalenanpassung und Verzweigungsoptimierung

Um möglichen Informationsverlust durch Gewichtsteilung auszugleichen und die Vorhersagegenauigkeit zu verfeinern, werden zwei zusätzliche Mechanismen eingeführt:

Learnable Scale Layer: Für jede Detektionsskala wird eine learnable Scale-Ebene hinzugefügt. Diese Schicht führt einen per-maßstabsfähigen lernbaren Skalar ein, der die fusionierten Merkmale dynamisch neu gewichtet, sodass das Modell Merkmale adaptiv betonen oder unterdrücken kann, basierend auf den auf diesem Maßstab vorherrschenden Zielobjektgrößen.

Optimierter Klassifikationszweig: Der Klassifikationszweig wird durch die Verwendung der Softmax-Aktivierungsfunktion für die Wahrscheinlichkeitsverteilung und die Einbindung einer Gruppennormalisierungsschicht (GN) erweitert. Dies stabilisiert das Training der Klassifikationsaufgabe und verbessert die Robustheit der Konfidenzvorhersagen, eine Technik, die sich in Architekturen wie FCOS als wirksam erwiesen hat.

Verbessertes Design der Verlustfunktion (MPDIoU)

Die Verlustfunktion wurde speziell neu entwickelt, um die Herausforderungen der genauen Begrenzungsbox-Regression für kleine, überladene und unregelmäßig geformte Ziele zu adressieren, die in PSA-Detektionsszenarien häufig vorkommen.

Motivation und Einschränkungen des traditionellen IoU-Verlusts

Standard-IoU-basierte Verluste leiden in diesem Zusammenhang unter mehreren kritischen Nachteilen:

Verschwindende Gradienten: Wenn die vorhergesagten und die Ground-Truth-Boxen keine Überschneidung haben, ist das IoU null und der Verlustgradient verschwindet, wodurch der Lernprozess ins Stocken kommt.

Unempfindlichkeit gegenüber der Ausrichtung: Mehrere Begrenzungsbox-Konfigurationen können denselben IoU-Wert ergeben, wodurch die Verlustfunktion unempfindlich gegenüber der Qualität der Ausrichtung ist (z. B. Mittelpunktabweichung vs. Formungleichheit).

Schlechte Leistung bei kleinen Objekten: Bei kleinen Zielen können selbst geringfügige Pixelabweichungen erheblich sein, führen aber oft zu vernachlässigbaren Änderungen des IoU-Werts, was zu ungenauer Lokalisierung führt.

Einführung des Verlusts der Mindestpunktentfernung IoU (MPDIoU)

Um die oben genannten Einschränkungen zu überwinden, ersetzt das Protokoll den Standardverlust durch den Minimum Point Distance IoU (MPDIoU)-Verlust. MPDIoU erweitert die Standard-IoU-Metrik, indem es einen Strafterm einbaut, der direkt den Abstand zwischen den vorhergesagten und den Ground-Truth-Boxen bestraft, selbst wenn sie sich nicht überlappen.

Kernmechanismus: Der Strafterm leitet sich aus dem euklidischen Abstand zwischen den entsprechenden Eckpunkten der vorhergesagten Box (pred) und der Ground-Truth-Box (gt) ab. Konkret werden die quadrierten Abstände für die oben linken Ecken Gleichung 1) und die unten rechten Ecken (Gleichung 2) berechnet:

Gleichung 3(1)
Gleichung 4(2)

Um sicherzustellen, dass die Strafe skaleninvariant ist, wird dieser Abstand durch die Maße der kleinsten umschließenden Box normalisiert, die sowohl die vorhergesagte als auch die Ground-Truth-Box abdeckt. Sei w und h die Breite bzw. Höhe dieser umschließenden Kiste. Die MPDIoU-Metrik wird dann wie folgt formuliert:

Gleichung 7(3)

Schließlich ist die MPDIoU-Verlustfunktion (LMPDIoU) definiert als:

LMPDIoU = 1 - MPDIoU (4)

Wichtige Vorteile: Dieser geometrische Strafbegriff adressiert die oben genannten Probleme direkt: i) einen aussagekräftigen, von null verschiedenen Gradienten zu schaffen, auch wenn Boxen sich nicht überlappen, wodurch das Verschwinden des Gradienten verhindert und eine kontinuierliche Modelloptimierung sichergestellt wird, ii) eine erhöhte Empfindlichkeit gegenüber Abweichungen von Position, Größe und Seitenverhältnis bietet, was für die präzise Lokalisierung kleiner und vielfältiger PSA-Elemente entscheidend ist, iii) stabilere und konsistentere Gradientensignale während des gesamten Trainings liefern, was eine schnellere Konvergenz fördert und zu einer überlegenen Lokalisierungsgenauigkeit führt.

Datensätze und experimentelle Einrichtung

Selbsterstellter PSA-Erkennungsdatensatz

Wir haben einen PSA-Detektionsdatensatz mit 5.000 hochauflösenden Bildern von Stromübertragungsleitungen erstellt, mit LabelImg annotiert und in das YOLO-TXT-Format konvertiert. Der Datensatz umfasst fünf Kategorien: Schutzhelme (1.245 Fälle), Sicherheitsgurte (1.128 Fälle), Armbänder (892 Fälle), Arbeitsstatus in Höhe (1.056 Fälle) und Status auf Bodenniveau (1.124 Fälle). Die Daten werden in Trainingssätze (4.000 Bilder), Validierung (500 Bilder) und Testsätze (500 Bilder) aufgeteilt. Die Bilder zeigen herausfordernde Bedingungen, darunter extreme Beleuchtung, starke Verdeckung (23 % mit >50 % Abdeckung) und komplexe industrielle Hintergründe. Standard-Augmentationstechniken (zufälliges Umdrehen, Drehen, Farbjitter, Mosaik) wurden während des Trainings angewendet.

PASCAL VOC-Datensatz für Generalisierungstests

Um die Verallgemeinerungsfähigkeit des Modells über Energiebetriebsszenarien hinaus zu bewerten, verwendeten wir den PASCAL VOC-Datensatz, der VOC2007 und VOC2012 kombiniert und insgesamt 21.503 Bilder umfasst. Gemäß der Standardpraxis verwendeten wir 11.540 Bilder von VOC2012 für Schulung und Validierung sowie 9.963 Bilder von VOC2007 für Tests. Der VOC-Datensatz enthält 20 Objektkategorien in verschiedenen realen Szenarien. Obwohl die spezifischen Objekte von unseren PSA-Kategorien abweichen, sind die Erkennungsherausforderungen (Skalenvariation, Okklusion, komplexe Hintergründe) ähnlich, was es geeignet macht, die allgemeinen Detektionsfähigkeiten und Übertragbarkeit des Modells zu bewerten.

Implementierungsdetails

Dieses Protokoll beschreibt das Verfahren zum Training und zur Bewertung des Modells. Es wird angenommen, dass der Benutzer Zugriff auf den Quellcode, eine geeignete Python-Umgebung und die vorbereiteten Datensätze hat.

System- und Umweltvorbereitung

Eine Workstation mit einer NVIDIA-GPU mit mindestens 24 GB VRAM wurde verwendet, um ausreichend Speicher für das Training sicherzustellen (z. B. NVIDIA GeForce RTX 4090). Das PyTorch-Deep-Learning-Framework (Version 1.12.0 oder höher) zusammen mit dem entsprechenden CUDA-Toolkit wurde auf der Workstation installiert. Die Installation wurde überprüft, indem ein Terminal geöffnet und der Befehl "python -c'import torch; print(torch.cuda.is_available())'", was voraussichtlich "True" zurückgeben würde. Erforderliche Python-Pakete wurden installiert, indem man zum Projekt-Root-Verzeichnis navigierte und den Befehl "pip install -r requirements.txt" ausführte. Dieser Befehl installierte automatisch Abhängigkeiten wie numpy, opencv-python, pyyaml, tensorboard und torchvision. Die Datensatzvorbereitung wurde überprüft, um sicherzustellen, dass Trainingsbilder in /data/train/images/ und Annotationsdateien in /data/train/labels/ im YOLO-Format (Klasse x_center y_center Breite Höhe) lagen. Der gleiche Verifikationsprozess wurde auf die Validierungs- (/data/val/) und Testdatensätze (/data/test/) angewendet.

Ausbildungskonfiguration

Die Konfigurationsdatei config/wtls_yolov11n.yaml wurde mit einem Texteditor geöffnet, um die Trainingsparameter einzurichten. Datenpfade wurden konfiguriert, indem der Parameter 'path' gefunden und in das Root-Verzeichnis des Datensatzes gesetzt wurde, während die Parameter 'train', 'val' und 'test' überprüft wurden, um auf die richtigen Unterverzeichnisse zu verweisen. Der 'nc'-Parameter (Anzahl der Klassen) wurde bestätigt, um mit dem Datensatz übereinzustimmen, der für die PPE-Erkennung auf 5 gesetzt wurde. Die Trainingshyperparameter wurden so konfiguriert, dass die Anzahl der Epochen auf 300 für das vollständige Training und die Batchgröße auf 16 gesetzt war, mit dem Verständnis, dass dieser Wert basierend auf der GPU-Speicherverfügbarkeit angepasst und bei Ausfallfehlern auf 8 reduziert werden konnte. Die Eingabebildgröße (imgsz) wurde auf 640 gesetzt, und der Optimierer wurde als SGD mit einer anfänglichen Lernrate (lr0) von 0,01 bestätigt. Der Gewichtsabfall wurde auf 0,0005 bestätigt und der Impuls auf 0,937 gesetzt. Datenaugmentationstechniken wurden mit den standardmäßig konfigurierten Einstellungen aktiviert, die Mosaik-Augmentation (Mosaik: 1,0), zufälligen horizontalen Flip mit 50 % Wahrscheinlichkeit und Farbjitter mit den Parametern HSVH: 0,015, HSVS: 0,7 und HSVV : 0,4 umfassten. Die Hardware-Auslastungsparameter wurden so konfiguriert, dass die Anzahl der Arbeiter für CPU-Threads beim Datenladen auf 8 gesetzt wurde und der Geräteparameter auf 0 gesetzt wurde, um die erste GPU zu verwenden, mit der Möglichkeit, ihn bei Bedarf für Multi-GPU-Training auf "0,1" zu setzen.

Modelltrainingsausführung

Das Modelltraining wurde über die Kommandozeile initialisiert, indem der Befehl "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml" ausgeführt wurde, wobei der --cfg-Parameter die Modellkonfigurationsdatei angab, der --weights-Parameter auf eine leere Zeichenkette gesetzt wurde, um von Grund auf zu trainieren (alternativ konnte yolov11n.pt für Transfer Learning verwendet werden), und der --data-Parameter die Datensatzkonfiguration spezifizierte. Während des Trainings wurden Konvergenzindikatoren beobachtet, um die Modellleistung zu verfolgen. In den ersten 50 Epochen wurde ein rascher Rückgang des Verlusts beobachtet, wobei box_loss von etwa 1,5 auf 0,8 absank. Zwischen Epochen 50 und 150 wurde eine stetige Verbesserung festgestellt, da box_loss von etwa 0,8 auf 0,5 abnahm. In den Epochen 150 bis 300 fand die Feinabstimmungsphase statt, wobei box_loss sich um 0,4 bis 0,5 stabilisierte. Die Validierungsmetrik mAP@0,5 sollte bis Epoche 200 über 85 % erreichen. Das Checkpoint-Speichern wurde überprüft, um sicherzustellen, dass das Training Checkpoints alle 10 Epochen automatisch im Verzeichnis runs/train/exp/weights/speicherte. Das Vorhandensein von last.pt (letzter Checkpoint) und best.pt (höchster mAP-Checkpoint) wurde bestätigt, wobei jede Checkpoint-Datei etwa 5 bis 6 MB groß sein sollte. Der Trainingsfortschritt konnte optional mit TensorBoard überwacht werden, indem ein neues Terminal geöffnet und der Befehl "tensorboard --logdir runs/train" ausgeführt wurde, und dann durch einen http://localhost:6006 Browser navigiert wurde, um Echtzeitdiagramme von Verlustkurven, Lernratenplan und mAP-Trends anzuzeigen. Häufige Probleme wurden durch Fehlerbehebungsverfahren behoben, bei denen CUDA-Out-of-Memory-Fehler durch Reduzierung der Batchgröße auf 8 oder 4 behoben wurden, NaN-Verlustwerte durch Reduzierung der Lernrate auf 0,005 und mAP-Plateaus unter 80 % durch Überprüfung der Annotationskorrektheit und Erhöhung der Trainingsepochen auf 400 untersucht wurden.

Modellbewertungsprotokoll

Ein vielschichtiges Bewertungsverfahren wurde durchgeführt, um die Wirksamkeit, Effizienz und Interpretierbarkeit des vorgeschlagenen Modells umfassend zu validieren.

Quantitative Leistungsbewertung

Leistungskennzahlen

Bewerten Sie die Modellgenauigkeit anhand der mittleren Durchschnittsgenauigkeit (mAP) bei einem IoU-Schwellenwert von 0,5 (mAP@0,5), Präzision und Abruf. Bewertung der Modelleffizienz durch Messung der Gesamtzahl der Parameter (M) und Gleitkommaoperationen (FLOPs, G). Messen Sie die Inferenzgeschwindigkeit in Frames Per Sekunde (FPS) sowohl auf einer Server-GPU als auch auf einem Edge-Gerät. Für Edge-Geräte-Tests stellen Sie den Energiemodus auf maximale Leistung ein und erwärmen Sie das Modell mit 100 Dummy-Inferenzen, bevor Sie FPS-Aufnahmen von über 500 Testbildern aufnehmen.

Vergleich mit modernen Modellen: Vergleichen Sie das vorgeschlagene WTLS-YOLOv11n-Modell mit seinem direkten Baseline (YOLOv11n) und einer vielfältigen Palette von Detektoren, darunter gängige CNN-basierte YOLO-Modelle (YOLOv5n, YOLOv8n, YOLOv9s), einen zweistufigen Detektor (Faster R-CNN) und einen transformatorbasierten Detektor (RT-DETR). Trainiere alle Modelle für 300 Epochen mit ihren empfohlenen Standard-Hyperparametern. Erfassen Sie alle im Abschnitt Leistungskennzahlen für jedes Modell definierten Kennzahlen sowohl im selbsterstellten PPE-Datensatz als auch im PASCAL-VOC-Datensatz. Für die VOC-Bewertung trainieren Sie auf der kombinierten VOC2012 Trainval- und VOC2007 Trainval-Sets und testen Sie dann auf VOC2007 Testsatz gemäß dem Standardprotokoll.

Ablationsstudien: Führen Sie eine systematische Ablationsstudie durch, um die individuellen Beiträge der vorgeschlagenen Komponenten zu analysieren.

Analyse der Komponentenwirksamkeit: Ausgehend vom Basismodell YOLOv11n integrieren Sie schrittweise das C3K2-WTConv-Modul, den LSCD-Kopf und den MPDIoU-Verlust. Für jede Konfiguration wird das Modell für 300 Epochen mit identischen Hyperparametern (Batchgröße 16, Lernrate 0,01, SGD-Optimierer) neu trainiert. Zeichnen Sie die Änderungen in mAP, Präzision, Rückruf, Parametern, FLOPs und FPS auf, um die Wirksamkeit jeder Komponente zu überprüfen. Berechnen Sie prozentuale Verbesserungen im Verhältnis zum Ausgangswert für jede Kennzahl.

Platzierungsanalyse: Um die optimale Platzierung des C3K2-WTConv-Moduls zu bestimmen, integrieren Sie es in verschiedene Teile der Netzwerkarchitektur. Testen Sie drei Konfigurationen: (i) Nur-Backbone-Integration, (ii) Nacken-Only-Integration und (iii) vollständige Integration sowohl in Backbone als auch in Nacken. Trainieren Sie jede Konfiguration über 300 Epochen und vergleichen Sie die resultierenden mAP@0,5-Werte, um die effektivste Integrationsstrategie zu identifizieren. Wählen Sie die optimale Konfiguration für alle nachfolgenden Experimente aus.

Qualitative Leistungsbewertung

Erkennungsergebnis-Visualisierung: Wählen Sie 12–15 repräsentative Bilder aus dem Testset aus, die herausfordernde reale Szenarien zeigen, darunter starke Hintergrundbeleuchtung, starke Objektverdeckung, komplexe Hintergründe und unkonventionelle Kamerawinkel. Für jedes Vergleichsmodell (Baseline, YOLOv5n, YOLOv8n, YOLOv9s und WTLS-YOLOv11n) wird auf diesen Bildern mit einer Konfidenzschwelle von 0,25 und einer IoU-Schwelle von 0,45 abgeleitet. Erzeugen und rendern Sie die Erkennungsausgaben (Begrenzungsboxen mit Klassenlabels und Konfidenzwerten) auf diese Bilder. Ordne Visualisierungen in einem Rasterformat an, bei dem Zeilen verschiedene Szenarien und Spalten unterschiedliche Modelle darstellen.

Robustheitsanalyse: Vergleichen Sie visuell die gerenderten Erkennungsergebnisse verschiedener Modelle. Bewerten Sie die Robustheit und Überlegenheit des vorgeschlagenen Modells, indem Sie Fälle von falschen Negativen (verpasste Objekte), falsch positiven (falsche Erkennungen) und doppelten Erkennungen (mehrere Boxen für ein einzelnes Objekt mit IoU > 0,7 zwischen den Vorhersagen) zählen und markieren. Verwenden Sie rote Kreise, um problematische Erkennungen in der Visualisierungsfigur hervorzuheben. Berechnen Sie pro Modell Fehlnegativraten und Falsch-Positiv-Zählungen über die ausgewählten Testbilder. Extrahieren und vergleichen Sie die mittleren Konfidenzwerte für echte positive Detektionen zwischen den Modellen.

Interpretierbarkeitsanalyse

Um die inhärente Interpretierbarkeit des C3K2-WTConv-Moduls zu validieren, wurde ein Visualisierungsverfahren an ausgewählten Eingabebildern durchgeführt. Das trainierte WTLS-YOLOv11n-Modell wurde geladen und ein Forward Hook wurde am C3K2-WTConv-Modul an der vierten Schicht des Backbone registriert. Die Vorwärtsausbreitung wurde auf dem Eingabebild durchgeführt, und der Ausgabe-Merkmalstensor wurde erfasst. Aus dem erfassten Merkmalstensor der Form [Batch, Kanäle, Höhe, Breite] wurden Kanäle, die verschiedenen Frequenzkomponenten entsprechen, getrennt. Die ersten 25 % der Kanäle wurden als Niederfrequenzkomponente (LL) bezeichnet, die restlichen 75 % als Hochfrequenzkomponenten (LH, HL, HH). Für jeden Frequenzkomponententyp wurde der Durchschnitt über alle Kanäle innerhalb dieser Komponente berechnet, um Einzelkanal-Aktivierungskarten zu erstellen. Die L2-Norm wurde bei Bedarf über räumliche Dimensionen hinweg angewendet, um starke Aktivierungen zu betonen. Die Aktivierungskarten wurden auf den Bereich [0, 1] normalisiert und eine Farbkarte (z. B. 'Jet'-Farbkarte) angewendet. Die Heatmaps wurden durch bilineare Interpolation auf die ursprüngliche Bildauflösung angepasst. Die Niederfrequenz-Heatmap und die Hochfrequenz-Heatmap wurden mit 40 % Transparenz auf das Originalbild gelegt, um interpretierbare Visualisierungen zu erstellen, die zeigen, wo das Modell sich auf strukturelle versus texturale Merkmale konzentriert.

Um rigoros zu validieren, dass Erkennungsentscheidungen von Frequenzbereichsmerkmalen abhängen, wurde eine quantitative Analyse durchgeführt. Eine Teilmenge von 200 bis 300 Bildern wurde aus dem Testsatz ausgewählt, die erfolgreiche Erkennungen enthielten (Konfidenzwert größer als 0,5). Diese Teilmenge wurde so gesichert, dass sie vielfältige Szenarien darstellt, um Stichprobenverzerrungen zu vermeiden. Für jedes Bild in der Teilmenge wurde eine Vorwärtspropagation durchgeführt, und die Ausgabe des C3K2-WTConv-Moduls auf der vierten Backbone-Schicht wurde extrahiert. Der Merkmalstensor wurde in Niederfrequenzkomponenten (LL, erste 25 % der Kanäle) und Hochfrequenzkomponenten (HF, verbleibende 75 % der Kanäle) unterteilt. Für jedes Bild wurde die mittlere absolute Aktivierungsstärke über die räumlichen Dimensionen (Höhe und Breite) für beide Frequenzkomponenten berechnet. Die LL-Stärke wurde als Mittelwert des Absolutwerts der LL-Merkmale über alle räumlichen Positionen berechnet, und die HF-Stärke als Mittelwert des Absolutwerts der HF-Merkmale über alle räumlichen Positionen. Diese Werte wurden zusammen mit dem maximalen Erkennungskonfidenzwert für dieses Bild erfasst. Mit den gesammelten Daten (LL_strength, HF_strength, confidence_score) über alle Bilder hinweg wurden Pearson-Korrelationskoeffizienten berechnet. Die Korrelation zwischen LL-Stärke und Vertrauensscore wurde berechnet, ebenso wie die Korrelation zwischen HF-Stärke und Vertrauenswert. Statistische Software oder Pythons Funktion scipy.stats.pearsonr wurden verwendet, um sowohl Korrelationskoeffizienten (r) als auch p-Werte zu erhalten. Die statistische Signifikanz wurde anhand eines p-Schwellenwerts von 0,05 bewertet, wobei ein p-Wert unter 0,05 anzeigte, dass die Korrelation statistisch signifikant war. Die Größe der Korrelationskoeffizienten wurde verglichen, um zu bestimmen, welche Frequenzkomponente eine stärkere Verbindung mit der Erkennungskonfidenz hatte. Die folgenden Metriken wurden in strukturiertem Format erfasst: LL-Korrelationskoeffizient (rLL) und p-Wert (pLL), HF-Korrelationskoeffizient (rHF) und p-Wert (pHF), mittlere Aktivierungsstärken (meanLL, meanHF) und Stichprobengröße (Anzahl der analysierten Bilder). Die erwarteten Ergebnisse waren, dass niederfrequente Merkmale eine stärkere positive Korrelation mit Konfidenzwerten (rLL größer als 0,60, p unter 0,001) als hochfrequente Merkmale (rHF etwa 0,40 bis 0,50, p unter 0,01) aufweisen würden, was darauf hindeutet, dass Erkennungsentscheidungen überwiegend von strukturellen Informationen aus der LL-Komponente bestimmt wurden.

Diese quantitative Analyse etablierte eine Interpretierbarkeit jenseits der Beschränkungen qualitativer Visualisierung. Die Kombination aus Korrelationsanalyse (die statistische Assoziation demonstriert) und Frequenzdomänenvisualisierung (Anzeige räumlicher Aufmerksamkeit) lieferte rigorose empirische Belege dafür, dass die Entscheidungsfindung des Modells tatsächlich auf niedrigfrequenten strukturellen Merkmalen beruhte, wie es vom Design beabsichtigt war.

Erwartete Ergebnisse: Niederfrequente Merkmale sollten eine stärkere positive Korrelation mit Konfidenzwerten (rLL > 0,60, S. < 0,001) im Vergleich zu hochfrequenten Merkmalen (rHF≈ 0,40–0,50, S. < 0,01) aufweisen, was darauf hindeutet, dass Erkennungsentscheidungen überwiegend von strukturellen Informationen aus der LL-Komponente getroffen werden.

Diese quantitative Analyse stellt eine Interpretierbarkeit jenseits qualitativer Visualisierung dar. Die Kombination aus Korrelationsanalyse (Nachweis statistischer Assoziation) und Frequenzdomänenvisualisierung (Anzeige räumlicher Aufmerksamkeit) liefert rigorose empirische Belege dafür, dass die Entscheidungsfindung des Modells tatsächlich auf niederfrequenten strukturellen Merkmalen beruht, wie es vom Design beabsichtigt ist.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Um die Leistung des vorgeschlagenen WTLS-YOLOv11n-Modells zu bewerten, führten wir Experimente mit unserem selbsterstellten PSA-Datensatz und dem PASCAL VOC 2007+2012-Datensatz durch. Alle Kennzahlen werden in den jeweiligen Testsätzen angegeben, sofern nicht anders angegeben.

Vergleich mit modernen Modellen

Wir verglichen WTLS-YOLOv11n mit gängigen Objektdetektoren über drei architektonische Paradigmen: CNN-basierte YOLO-Modelle (YOLOv5n, YOLOv8n,...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Die experimentellen Ergebnisse zeigen, dass WTLS-YOLOv11n 90,1 % mAP erreicht und die Parameter im Vergleich zum YOLOv11n-Ausgangszustand um 11,5 % reduziert. Diese Verbesserung sowohl in Genauigkeit als auch Effizienz resultiert aus der synergetischen Integration von drei Komponenten: wavelet-basierte Feature-Extraktion, leichtes Detektionskopfdesign und verbesserte Lokalisierungsverluste.

Die Ablationsstudie zeigt, dass das C3K2-WTConv-Modul den größten indi...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären keine Interessenkonflikte.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
CUDA-ToolkitNVIDIA CorporationCUDA Toolkit Version 11.7
Deep-Learning-FrameworkPyTorch StiftungPyTorch Version 1.12.0
GrafikverarbeitungseinheitNVIDIA CorporationGeForce RTX 4090
NumPyNumPy-EntwicklerNumPy
OpenCVOpenCV-Teamopencv-python
BetriebssystemCanonical Ltd.Ubuntu 22.04 LTS (oder gib dein Betriebssystem an)
PythonPython Software FoundationPython Version 3.8 oder höher
TensorBoardTensorFlow-AutorenTensorBoard
TorchvisionPyTorch StiftungTorchvision

Referenzen

  1. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit, , (2016).
  2. Liu, M., Li, Z., Li, Y., Liu, Y. A fast and accurate method of power line intelligent inspection based on edge computing. IEEE Trans Instrum Meas. 71, 1-12 (2022).
  3. Gallo, G., Di Rienzo, F., Garzelli, F., Ducange, P., Vallati, C. A smart system for personal protective equipment detection in industrial environments based on deep learning at the edge. IEEE Access. 10, 110862-111110 (2022).
  4. Selvaraju, R. R., et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128, 336-359 (2020).
  5. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf Appl Comput Vis (WACV, , (2018).
  6. Axiom-based grad-CAM: Towards accurate visualization and explanation of CNNs. Fu, R., et al. Proc Brit Mach Vis Conf, , (2020).
  7. Yipeng, L., Junwu, W. Personal protective equipment detection for construction workers: A novel dataset and enhanced YOLOv5 approach. IEEE Access. 12, 47338-47358 (2024).
  8. BN, R., Guru, R. Small object detection for indoor assistance to the blind using YOLO NAS small and super gradients. arXiv preprint. , (2024).
  9. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Liao, H. Y. M. Eur Conf Comput Vis, , Springer Nature. Switzerland, Cham. (2024).
  10. Searching for mobilenetv3. Howard, A., et al. Proc. IEEE/CVF Int Conf Comput Vis, , https://ieeexplore.ieee.org/document/9008835 (2019).
  11. Liu, B., et al. YOLO-M: An efficient YOLO variant with MobileOne backbone for real-time license plate detection. Proc Int Semin Artif Intell Netw Inf Technol (AINIT). , IEEE. (2024).
  12. Ma, X., et al. Light-YOLOv4: An edge-device oriented target detection method for remote sensing images. IEEE J Sel Top Appl Earth Obs Remote Sens. 14, 10808-10820 (2021).
  13. Scaling up your kernels to 31x31: Revisiting large kernel design in CNNs. Ding, X., Zhang, X., Han, J., Ding, G. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2022/papers/Ding_Scaling_Up_Your_Kernels_to_31x31_Revisiting_Large_Kernel_Design_CVPR_2022_paper.pdf (2022).
  14. Black-box explanation of object detectors via saliency maps. Petsiuk, V., Jain, R., Manjunatha, V. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , (2020).
  15. He, L., et al. Research and application of YOLOv11-based object segmentation in intelligent recognition at construction sites. Buildings. 14 (12), 3777(2024).
  16. Liu, Q., Lv, J., Zhang, C. MAE-YOLOv8-based small object detection of green crisp plum in real complex orchard environments. Comput Electron Agric. 226, 109458(2024).
  17. Fast r-cnn. Girshick, R. Proc IEEE Int Conf Comput Vis, , https://www.cv-foundation.org/openaccess/content_iccv_2015/papers/Girshick_Fast_R-CNN_ICCV_2015_paper.pdf (2015).
  18. Detrs beat yolos on real-time object detection. Zhao, Y., et al. Proc IEEE/CVF Conf Comput Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2024/papers/Zhao_DETRs_Beat_YOLOs_on_Real-time_Object_Detection_CVPR_2024_paper.pdf (2024).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Schlagwörter

Inspektion von bertragungsleitungenYOLOv11 AlgorithmusEdge ComputingObjekterkennungWavelet Transformationmehrskalige MerkmalsextraktionErkennungsgenauigkeitleichtgewichtiges ModellModellinterpretierbarkeit