Forschungsartikel

Ein neuartiges hybrides Deep-Learning-Modell zur Angriffserkennung in IoT-Umgebungen: Faltungsneurales Netzwerk mit Transformator-Ansatz

DOI:

10.3791/68750

18. November 2025

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Studie präsentiert ein hybrides Deep-Learning-Modell, das Convolutional Neural Networks (CNN) und Transformers kombiniert, um Angriffe in IoT-Umgebungen zu erkennen. Mit dem CIC-IoT-2023-Datensatz erreichte das Modell hohe Leistungskennzahlen: 99,97 % Genauigkeit und einen Verlust von 0,0123, was seine Wirksamkeit bei der Echtzeit-Angriffserkennung demonstriert.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die rasante Entwicklung von Internet-of-Things-(IoT)-Geräten hat die Konnektivität und Zugänglichkeit verbessert. Dennoch stellt die zunehmende Vernetzung dieser Umgebungen neue Bedrohungsstufen dar, die eine robuste Anomalieerkennung erfordern. In dieser Studie wird eine neue Sicherheitsmethode vorgestellt, die auf Deep Learning basiert, um die besonderen Bedrohungen zu mindern, die mit Internet-of-Things-Netzwerken verbunden sind. Der vorgeschlagene Ansatz nutzt tiefe neuronale Netze, um Netzwerkaktivitätsmuster effizient zu überwachen und potenzielle Schwachstellen in Echtzeitkommunikation zu erkennen. Ein hybrides CNN-Transformer-Modell zur Angriffserkennung und -klassifizierung in IoT-Netzwerken wird in dieser Studie vorgeschlagen. Um diesen Ansatz zu erstellen und zu testen, haben wir den CIC-IoT-2023-Datensatz analysiert, der 33 verschiedene IoT-Bedrohungstypen umfasst, verteilt auf 7 verschiedene Kategorien. Die experimentellen Ergebnisse zeigen, dass das vorgeschlagene Modell hervorragend funktioniert, mit einer Genauigkeit von 99,96 %, einem Rückruf von 99,96 %, einem F1-Wert von 99,96 % und einer Genauigkeit von 99,97 % bei einem Verlust von 0,0123. Darüber hinaus wird das vorgeschlagene Modell anhand von Rechenzeit und Ressourcenverbrauch analysiert, was seine Wirksamkeit bei der Erkennung und Klassifizierung von Angriffen mit minimierter Rechenkomplexität und hoher Genauigkeit demonstriert.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Technologie des Internets der Dinge hat sich in den letzten Jahren erheblich weiterentwickelt, und wir sind in eine stark vernetzte digitale Welt eingetreten. Viele verschiedene Branchen nutzen derzeit Internet-of-Things-(IoT)-Geräte, darunter Gesundheitswesen, landwirtschaftliche Tätigkeit, Transport, Luft- und Raumfahrtund Produktion. Renommierte Experten prognostizieren, dass das Internet der Dinge (IoT) und verwandte Anwendungen bis 2025 die Weltwirtschaft erheblich beeinflussen werden, mit jährlichen Auswirkungen von 3,9 Billionen bis 11,1 BillionenDollar. Andererseits entstehen durch diese fehlerfreie Verbindung neue sicherheitsbezogene Schwierigkeiten. Mit der Weiterentwicklung von IoT-Geräten sind sie zunehmend anfällig für Cyberangriffe geworden, weshalb unbefugter Zugriff und Angriffe auf diese Geräte verhindert werden müssen. In einer Umgebung mit einer Vielzahl von Geräten sind manche Geräte anfälliger für Angriffeals andere. Diese Geräte beeinträchtigen nicht nur die Sicherheit des Internet-of-Things-Systems, sondern auch die Übertragungskanäle, die Teil des Systems sind, und sie können sogar dazu führen, dass das Übertragungsnetz ganz oder teilweise ausfällt. Maschinelles Lernen (ML) und Deep Learning (DL) sind zwei Zweige der künstlichen Intelligenz (KI), die mehrere Bereiche erheblich verbessert haben, wie Gesundheitssysteme4, Computer Vision5, drahtlose Kommunikation6 und Netzwerksicherheit7. Diese Fortschritte wurden durch die Verbesserung ihrer jeweiligen Technologien ermöglicht. Bezüglich des Internets der Dinge ist es gängige Praxis, Intrusionserkennungssysteme einzurichten, die auf Deep Learning und Machine Learning 4,5 basieren.

Das vorgeschlagene Eindringlingserkennungssystem scannt den Netzwerkverkehr nach ungewöhnlichen Datenströmen und verarbeitet Pakete, einschließlich kürzlich erfasster gutartiger Informationen. Dies ermöglicht es dem System, innovative Angriffe zu erkennen. Es werden zwei Ansätze verwendet, signaturbasiert und anomaliebasiert, um Eindringlinge zu erkennen. Eine Methode zur Störungserkennung, die auf Signaturen beruht, besteht darin, den Paketverkehr im Netzwerk zu überprüfen und die gefundenen Werte mit denen bekannter Angriffe zu vergleichen. Dies geschieht, um Schwachstellen im Netzwerk zu identifizieren. Anomaliebasierte Methoden werden verwendet, um Angriffe zu identifizieren, indem Benutzerparameter aufgezeichnet werden, die von den für Nutzer als authentisch betrachteten Parametern abweichen. Daher führt diese Forschung zur Verbesserung der Angriffserkennung ein Deep-Learning-Modell ein, das einen Transformer mit einem konvolutionalen neuronalen Netzwerk (CNN) kombiniert. Um multispace-Merkmalsteilmengen zu erzeugen, die eine umfassendere nichtlineare Darstellung ermöglichen, werden die ursprünglichen Daten mithilfe einer CNN-Komponente im vorgeschlagenen Modell in mehrere Teilräume umgewandelt. Danach werden die Feature-Assoziationen finalisiert und tiefere Qualitäten, wie detaillierte Features, werden mit der Transformer-Komponente extrahiert. Am Ende baut die Softmax-Funktion Beziehungen zwischen Features und Labels auf. Der vorgeschlagene Ansatz zeigt herausragende Leistung bei der Erkennung von Angriffen, indem er die besten Eigenschaften des CNN-Ansatzes und des Transformer-Modells kombiniert.

Im Folgenden werden die Hauptziele dieser Forschung hervorgehoben: (i) Aufbau eines fortschrittlichen Rahmens zur Erkennung von Anomalien im Kontext des Internets der Dinge. Dieses Framework ermöglicht es, die Erkennung bösartiger Informationen, die von heterogenen Internet-of-Things-(IoT)-Geräten erzeugt werden, zu verbessern, die gehackt oder kompromittiert wurden. (ii) Die Forschung demonstriert eine effektive Methode, um relevante Eigenschaften aus Datensätzen zu extrahieren, um Anomalien auf Basis von IoT zu erkennen. Wenn diese Technik auf diese Geräte angewendet wird, macht sie die Angriffserkennung effektiver. (iii) Zur Identifizierung von Angriffen präsentiert der Artikel ein adaptives Modell, das Transformers und CNN verwendet. Dieses Modell zielt darauf ab, Eindringlinge in die Internet-of-Things-Umgebung zu erkennen, die vom Netzwerk ausgehen. (iv) Eine Multiclass-Klassifikationstechnik wird verwendet, um das vorgeschlagene Modell mit dem CIC-IoT23-Sicherheitsdatensatz zu testen und zu verifizieren. Mit einer Multiclass-Klassifikationstechnik unterscheidet die Bewertung erfolgreich zwischen sieben von IoT-Botnetzen gestarteten Angriffen und harmlosem Datenverkehr. (v) Anhand verschiedener Eigenschaften wird der vorgeschlagene Ansatz mit aktuellen Methoden verglichen. Diese Vergleichsuntersuchung zeigt, dass der vorgeschlagene Ansatz besser und erfolgreich ist, um Angriffe auf das Internet der Dinge (IoT) zu identifizieren.

Das vorgeschlagene hybride CNN-Transformer-Modell ist besser darin, zu verallgemeinern und robust zu sein als traditionelle signatur- und anomaliebasierte IDS-Methoden 2,5, da es räumliche Merkmalextraktion mit zeitlicher Aufmerksamkeit kombiniert. Sie erreicht eine bessere Genauigkeit und Rückrufe mit weniger manueller Feature-Engineering als traditionelle ML/DL-Methoden 6,8. Frühere Hybridmodelle 9,10 konnten sich nicht in Echtzeit an Veränderungen anpassen. Der vorgeschlagene Ansatz löst dies durch die Verwendung einer leichtgewichtigen Architektur und Optimierung.

Das rasant wachsende Gebiet des IoT und der damit verbundenen Sicherheitsfragen hat umfangreiche Studien zur Eindringlingserkennung ausgelöst. Die Literaturübersicht konzentriert sich auf zentrale Forschungsarbeiten und deren Beiträge, um ein tieferes Verständnis der derzeit als Stand der Technik geltenden Lösungen zu ermöglichen.

Ein hybrides Modell, das eine adaptive CNN-GRU-Architektur nutzt, wurde von Nandanwar und Katarya11 vorgeschlagen, um Botnet-Angriffe in Industrial Internet of Things (IIoT)-Umgebungen zu erkennen und zu klassifizieren.

Mit einem F1-Wert von 98,59 % und einer Genauigkeitsrate von 98,75 % unter Verwendung des CIC-IoT2023-Datensatzes schlugen Jony et al.12 ein LSTM-basiertes Modell vor, das Cyberangriffsmuster erfolgreich vorhersagt. In dieser Forschungwurde eine Machine-Learning-Ensemble-Strategie vorgeschlagen, als binäre Klassifikationsmethode zur Erkennung und Beseitigung falscher Daten in IoT-Netzwerken. Das Modell verwendet ein Gradient-Boosting-Maschinenensemble, um Anomalien zu identifizieren und Zero-Day-Angriffe zu mindern. Das Modell erreichte eine Genauigkeit von 98,27 %. Außerdem liegen Präzision und Rückruf bei 96,40 % bzw. 95,70 %, was sie für essentielle IoT-Anwendungen geeignet macht. de Caldas Filho et al.13 entwickelten ein hybrides Intrusion Detection System (IDS), das netzwerkbasiertes und hostbasiertes IDS kombiniert. Dieses integrierte Intrusion Response System (IRS) erkennt proaktiv Zero-Day-Bedrohungen und verhindert sie. Der Autor nutzte außerdem ein dezentralisiertes föderiertes Lernsystem, um Anomalien mittels Deep Learning zu identifizieren. Dieses föderierte Training und die Erkennung mit Deep Learning erreicht eine Erkennungsgenauigkeit von 89,753 % in einer dezentralen IoT-Infrastruktur. Wang et al.14 präsentierten ein Bedrohungserkennungstool namens ThreatInsight, das den Bedarf an Systemaudit-Logs reduzierte. ThreatInsight identifiziert und bezeichnet Angreifer mit faktenbasierten und semantischen Argumentationsmethoden. Durch die Erstellung von Analyseberichten verbessert die Technologie die Früherkennungsfähigkeiten in Cybersicherheitsschutzsystemen und ermöglicht Echtzeitanalysen.

Chai et al.15 stellten eine Methode zur Erkennung von Schadsoftware vor, die dynamische Konvolution verwendet, um Features und Klassenmerkmale adaptiv zu extrahieren. Der Autor schlug eine dynamische Aktivierungsfunktion vor, die Stichprobenkorrelationen nutzt, um die Auswirkungen irrelevanter Merkmale zu verringern, basierend auf der Analyse der Doppelstichprobe. Der Abstand zwischen Abfrageproben und Prototypen wird mittels einer metrikbasierten Technik zur erfolgreichen Malware-Identifikation berechnet. Was experimentelle Ergebnisse betrifft, zeigt diese Methode erhebliche Verbesserungen gegenüber bestehenden Algorithmen zur Erkennung von Malware-Malware mit wenigen Schüssen. Shah et al.16 stellen ein KI-gesteuertes Systemmodell vor, das darauf abzielt, die Sicherheit des IoT zu verbessern, indem böswillige Nutzer durch binäre Klassifizierung erkannt und Blockchain-Technologie für sichere Datenspeicherung eingesetzt werden. Es adressiert potenzielle Exploits von Blockchain-Smart Contracts durch die Implementierung von Deep-Learning-Algorithmen zur Klassifizierung und bietet letztlich ein umfassendes Sicherheitsrahmen, das anhand verschiedener Leistungskennzahlen bewertet wird.

Luo et al.17 führten ein neuartiges System für Internet-of-Things-Anwendungen (IoT) ein, EDL-WADS, das vier Module umfasst: ein Feature-Learning-Modul für URL-Anfrage-Darstellungen, ein Deep-Learning-Modul mit drei Modellen für verschiedene URL-Anfrage-Darstellungen, ein Entscheidungsmodul zur Integration von Modellergebnissen mit einem Ensemble-Klassifikator und ein Feinabstimmungsmodul für Echtzeit-Updates. EDL-WADS übertraf Basismodelle mit einer Genauigkeit von 99,47 %, einer Wahr-Positiv-Rate von 99,29 %, einer Genauigkeit von 99,70 % und einer Fehl-Positiv-Rate von 0,0033 bei Tests auf verschiedenen Datensätzen. Zu den Einschränkungen gehörten die Konzentration des Systems auf SQL-Injektion und Crosssite-Scripting-Erkennung sowie die schlechte Leistung des CNN-Modells.

Tian et al.18 stellten eine verteilte, auf Deep-Learning-Basis basierende Methode zur Erkennung von Angriffen im Web durch Untersuchung von URLs vor. Das System, das auf Edge-Geräten eingesetzt wird, ist darauf ausgelegt, Webbedrohungen zu identifizieren. Zwei gleichzeitige Tiefenmodelle wurden verwendet, um Experimente am System durchzuführen, und das System wurde mit bestehenden Systemen unter Verwendung verschiedener Datensätze verglichen. Das System ist wettbewerbsfähig bei der Erkennung von Webangriffen mit einer Genauigkeit von 99,410 %, 98,91 % TPR und einer Erkennungsrate von 99,55 % bei normalen Anfragen.

Chai et al.19 schlugen MalFSCIL vor, ein neuartiges Framework, das einen entkoppelten Trainingsansatz mit einem variationalen Autoencoder verwendet, um katastrophales Vergessen zu reduzieren, sowie eine auf Klassenprototyping basierende dynamische Randabgrenzungstechnik zur exakten Entscheidungsgrenzabgrenzung. Dieser Ansatz übertrifft andere Methoden zur Erkennung und Klassifizierung von Malware bei Open-Source- und Unternehmensdatensätzen. Tabelle 1 9,7,20,21,22,23,24,25,26,27,28,29,30,31,32 gibt einen kurzen Überblick über bestehende Arbeiten.

Tabelle 1: Literatur zu bestehenden Arbeiten zur IoT-Angriffserkennung mittels ML/DL. Die Tabelle bietet einen kurzen Überblick über bestehende Arbeiten. Bitte klicken Sie hier, um diese Tabelle herunterzuladen.

Das vorgeschlagene CNN-Transformer-Modell bietet vollständige Sicherheit für IoT-Netzwerke, da es direkt die engen Angriffsmöglichkeiten und begrenzten Feature-Learning-Fähigkeiten früherer Methoden adressiert. Die Kombination von Faltungskodierung mit Selbstaufmerksamkeitsmechanismen eliminiert die niedrigen Detektionsgrenzen früherer CNN-only10,13- oder Transformer-only-33-Methoden. Außerdem machen die spezifischen Änderungen, die wir an jeder CNN-Codierungsschicht vorgenommen haben, den Domaintransfer effektiver und reduzieren gleichzeitig Trainingszeit und Rechenaufwand. Diese Verbesserungen ermöglichen den Einsatz von Sicherheitsanalysen in Echtzeit in operativen IoT-Umgebungen. Das vorgeschlagene Modell ist ein großer Schritt zum Schutz von IoT-Ökosystemen vor neuen, komplexeren Bedrohungen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Abschnitt behandelt Forschungsmaterialien und -methoden im Bereich Angriffserkennungssysteme im IoT-Umfeld. Um die Experimente auf dem CIC-IoT-2023-Datensatz zu replizieren, beschreibt dieses Protokoll spezifische Verfahren. Die folgende Materialtabelle enthält eine Liste aller verwendeten Hardware und Software. Python (pandas, scikit-learn und TensorFlow Keras) wird verwendet, um die Pipeline zu implementieren, die auf Google Colab läuft, wobei PySpark für die Vorverarbeitung großer Dateien verfügbar ist. Eine detaillierte Beschreibung der Datenvorverarbeitungsverfahren wurde bereitgestellt.

Dataset
Der CIC-IoT-2023-Datensatz, der vom Canadian Institute for Cybersecurity der University of New Brunswick veröffentlicht wurde. "CIC IoT Dataset 2023" (UNB CIC-Datensatzseite) und der Datensatz Artikel34 sind die offizielle CIC-Datensatzseite und das Papier. Der Datensatz kann von der CIC-Website heruntergeladen werden und ist für die breite Öffentlichkeit zugänglich. Anstatt rohe PCAPs zu verwenden, werden in dieser Forschung die vorab extrahierten Feature-CSV-Dateien (Flows/Features) verwendet. Wireshark/mergecap und CICFlowMeter werden in den rohen Experimenten verwendet, die den Datensatz generierten; vorgestellte CSVs werden in diesem Werk verwendet. Dieser Datensatz stammt aus echten IoT-Geräten und wird in dieser Forschung verwendet. Im Datensatz sind Datensätze von 33 bekannten Angriffen auf 105 verschiedene IoT-Geräte enthalten. Im Gegensatz zu früheren IoT-Datensätzen umfasst CIC-IoT-2023 eine große Vielfalt von Angriffstypen. Die Menge jedes Labels, die mit gutartigem Datenverkehr verknüpft ist, ist in Abbildung 1 dargestellt. Insgesamt bilden 46 Attribute und ein Label diesen Datensatz. Im Vergleich zum CSE-CIC-IDS 2018, das 84 Funktionen hatte, hat CIC-IoT-2023 37 Funktionen weniger.

figure-protocol-1
Abbildung 1: Anzahl der Angriffe im CICIoT2023-Datensatz. Die Zählnamen verschiedener Angriffsarten und gutartiger Aufzeichnungen im CICIot2023-Datensatz werden beschrieben. Diese verschiedenen Angriffsarten lassen sich grob in 7 Angriffsklassen einteilen. Es gibt also insgesamt 8 Klassen, einschließlich Beignen in der Multiclass-Klassifikation. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Datenvorverarbeitung
Datensätze sollten in Deep-Learning-Algorithmen nicht ohne ausreichende Vorverarbeitung verwendet werden. Die Vorverarbeitung dient dazu, dem Algorithmus feinere Daten zu liefern, was letztlich das Modell effizienter macht. Die Ausgabe der Vorverarbeitungs-Pipeline – nach Label-Codierung, Feature-Skalierung und Merkmalsauswahl – wird als "Enddaten" bezeichnet und dient als Eingabe sowohl für CNN- als auch für Transformer-Komponenten. Die folgenden Schritte finden Sie in Google Colab unter Verwendung von Python. Diese Forschung verwendete Python 3.8.10, pandas 1.3.4, NumPy 1.21.4, scikit-learn 1.0.2, matplotlib 3.4.3 und TensorFlow/Keras 2.6.0. Der zufällige Seed wurde für alle Durchläufe auf 42 gesetzt.

Datenerfassung
Dieser Schritt beinhaltet das Reinigen der aus realen Kontexten gewonnenen Daten, da er oft viele Fehler und Inkonsistenzen enthält. Wenn der Datensatz beispielsweise Textwerte enthält, ist es unmöglich, solche Werte im Deep-Learning-Training zu verwenden, ohne sie vorher in numerische Form umzuwandeln. Beim Arbeiten mit dem Datensatz wird zuerst getan, leere Werte zu entfernen und Zellen ohne Daten zu löschen. Reihen mit fehlenden Daten wurden entfernt, um unerwünschte Auswirkungen auf das Modell zu vermeiden.

Der CIC-IoT-2023-Datensatz wird mit pd.read_csv('ciciot2023_features_part.csv') geladen. Diese Forschung nutzte Google Colab für das Modelltraining und PySpark für die erste Reinigung. Zur Erkennung von Fehlfunktionen werden folgende Methoden verwendet: df.shape, df.info(), df.isnull().sum() und df.duplicated().sum() für Duplikate. Duplikate werden mit df.drop_duplicates(inplace=True) eliminiert. Der numerische Spaltentyp wird mit der Formel df[col] = pd.to_numeric(df[col], errors='coerce' verifiziert). Wenn neue NaNs erscheinen, wird die Behandlung fehlender Werte erneut angewendet. Merkmale, die konstant oder nahezu konstant sind, werden ebenfalls mit df.drop(columns=low_variance_cols, inplace=True) eliminiert.

Labelcodierung
Der nächste Schritt besteht darin, die Textbeschriftungen in eine numerische Darstellung umzuwandeln, damit das Modell sie verstehen kann. Für die binäre Klassifikation gibt es zwei verschiedene Arten von Labels. Es gibt 46.686.579 Datensätze, davon sind 45.588.384 als böswillige Angriffe eingestuft. Mit 1.098.195 eingeschlossenen Platten ist das gutartige Label auf 0 gesetzt. Es gibt sieben verschiedene Arten von Angriffen in der Multiclass-Klassifikation. Insgesamt gibt es acht Etiketten, einschließlich des harmlosen Verkehrs. Abbildung 2 zeigt die Anzahl jeder Kategorie dieser Labels. Die in dieser Forschung verwendete Multiclass-Mapping lautet: 0 für Benign, 1 für DoS, 2 für DDoS, 3 für Aufklärung, 4 für webbasierte Angriffe, 5 für Spoofing, 6 für BruteForce und 7 für Mirai-Angriffe.

figure-protocol-2
Abbildung 2: Der Prozentsatz der Angriffsklassen einschließlich gutartigem Verkehr. Es gibt sieben verschiedene Arten von Angriffen in der Multiclass-Klassifikation. Insgesamt gibt es acht Etiketten, einschließlich des harmlosen Verkehrs. Die Abbildung zeigt die Anzahl jeder Kategorie dieser Etiketten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Feature-Skalierung
Feature-Skalierung ist eine gängige Methode zur Verbesserung der Gesamtleistung von Deep-Learning-Modellen. Die Feature-Skalierung in dieser Studie erfolgt mit Min Max Scaler- und Standard Scaler-Technologien. Die Forschung verwendete sie nicht für Tests; stattdessen wurde der Scaler nur auf dem Trainingsset verwendet, um Datenlecks zu verhindern. Daten können mit Hilfe der Standard Scaler-Methode auf eine Null-Mittelwert-Verteilung mit einer Standardabweichung normalisiert werden. Eine Möglichkeit ist, die ursprüngliche Zahl durch die Standardabweichung zu teilen. Dafür wird die Funktion StandardScaler() aufgerufen, indem StandardScaler aus sklearn.preprocessing importiert wird. Durch Anwendung eines Bereichs, oft zwischen 0 und 1, normalisiert der Min Max Scaler die Daten. Die MinMaxScaler()-Funktion von scikit-learn wurde verwendet, um dies zu implementieren.

Wie in Gleichung (1) angegeben, lautet die Normierungsformel:

figure-protocol-3(1)

Dabei steht X für den ursprünglichen Punktwert und Xnormalisiert für seine transformierte Form, stellt Xmin den niedrigsten Wert der Variablen dar, während Xmax den höchsten Wert der Variablen im Datensatz bezeichnet.

Auswahl der Ausstattung
Alle Eigenschaften großer Datensätze in das Training einzubeziehen, ist nicht immer hilfreich. Merkmale im Datensatz können Korrelation zeigen und das Ergebnis möglicherweise nicht verbessern. Außerdem erhöhen zu viele Werte die Schulungskosten. Um Merkmale zu finden, die nicht benötigt werden, berechnen wir deren Korrelationsmatrizen und schließen die mit starken Korrelationen aus dem Datensatz aus. Der Pearsonsche Korrelationskoeffizient, der die lineare Beziehung zwischen zwei Merkmalen quantifiziert, wird zur Berechnung der Korrelation verwendet. Ein Wert zwischen -1 und +1 wird erhalten, indem die Kovarianz der beiden Variablen durch das Produkt ihrer Standardabweichungen geteilt wird. Dies ist optional und wird in der Pipeline mit Rekursiver Merkmalselimination (RFE) zur Merkmalsauswahl mit einem Entscheidungsbaum-Klassifikator durchgeführt. Die rekursive Feature-Elimination findet wiederholt die relevantesten Features, indem das Klassifikatormodell trainiert und die am wenigsten signifikanten verworfen werden. Der Code verwendet RFE von sklearn.feature_selection mit einem Decision Tree Classifier als Schätzer. Nach der Implementierung der rekursiven Merkmalselimination wurden 30 der 46 Eigenschaften für jede der sieben Angriffskategorien ausgewählt, wie in Tabelle 2 dargestellt. Ein Merkmal kann unter vielen Angriffsklassifikationen kategorisiert werden. Nach Abschluss des in Abbildung 3 dargestellten Prozesses wird die Auswahl der im Datensatz enthaltenen Angriffsklassen durchgeführt. Moderne CNNs sind hervorragend darin, hierarchische Darstellungen aus Rohdaten zu lernen, aber die Vorwahl eines kleinen, hochwertigen Funktionssatzes mit RFE hat erhebliche Vorteile. Erstens entfernt RFE mit einem Decision Tree-Klassifikator schnell verrauschte oder redundante Daten, die die Konvergenz während früher Trainingszyklen verzögern könnten. Zweitens reduziert die Zentrierung des CNN auf einen kleineren Pool tatsächlich wertvoller Signale Überanpassung, was in IoT-Datensätzen mit stark verzerrten harmlosen und schädlichen Mustern entscheidend ist. Die rekursive Eliminationsmethode des Entscheidungsbaums bewertet Merkmale für bessere Modellerklärbarkeit und die Identifizierung domänenspezifischer Verzerrungen vor dem tiefen Training. Schließlich führt die Initialisierung des CNN-Transformers auf diesem gekürzten Feature-Set zu einer schnelleren Konvergenz und einem geringeren GPU-Speicherverbrauch, was beweist, dass RFE das End-to-End-Feature Learning aktiv beschleunigt und stabilisiert.

Tabelle 2: Die ausgewählten Funktionen des Datensatzes "CIC-IoT-2023". 30 der 46 Eigenschaften wurden für jede der sieben Angriffskategorien in dieser Forschung mittels RFE ausgewählt. Die Tabelle beschreibt die ausgewählten 30 Merkmale. Bitte klicken Sie hier, um diese Tabelle herunterzuladen.

figure-protocol-4
Abbildung 3: Funktionsweise des vorgeschlagenen Hybridmodells. Der Abschluss des Prozesses ist in der Abbildung dargestellt. Der Prozess zur Auswahl der im Datensatz enthaltenen Angriffsklassen wird durchgeführt. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Teilen Sie den Datensatz in einen 80%-Zug und einen 20%-Testsatz auf, indem Sie den Schritt folgen: train_test_split (X_train, y_train, test_size=0,20, random_state=42). Der 80%-Trainingssatz wird weiter aufgeteilt und verwendet train_test_split(X_train, y_train, test_size=0,20,random_state=42). Alle Modellauswahl und Hyperparameter-Tuning erfolgen mit diesen präzisen Splits. Die synthetische Minderheiten-Übersampling-Technik (SMOTE) wird verwendet, wenn ein Klassenungleichgewicht vorliegt. Nur das Trainingsset wurde nach Spaltung und Skalierung SMOTE unterzogen. Die Wirkung von SMOTE wird in den Ergebnissen dargestellt. Nach RFE verläuft die Studie parallel zu den CNN- und Transformer-Verzweigungen und verwendet dieselben 30 Merkmale, die für jede Stichprobe ausgewählt wurden. Weitere Details zur Verarbeitung dieser 30 Merkmale werden im Abschnitt zur vorgeschlagenen Methodik erwähnt.

Vorgeschlagene Methodik
Ein effektives Sicherheitsframework für IoT-Systeme, das Angriffe genauer erkennen kann, wird mit Hilfe eines Deep-Learning-Modells aufgebaut. Eine hybride Sicherheitsstrategie, die konvolutionelle neuronale Netze (CNNs) mit Transformatormodellen kombiniert, wird vorgeschlagen. Diese Methode beinhaltet das Training der CNN-Architektur mit Gewichten aus einem größeren Datensatz und anschließend die Feinabstimmung der Modellparameter mit einem kleineren Datensatz als Ziel. Das Hauptziel dieses Modells ist es, die Effizienz der Eindringlingserkennung im IoT zu verbessern.

Diese Forschung nutzte PySpark, eine Google Colab-Plattform, die es Nutzern ermöglicht, Python-Programme auf Apache Spark auszuführen. Mit den Paketen Scikit-learn und Keras wurden Deep-Learning-Algorithmen entwickelt. Um das Modell zu trainieren und zu testen, wurde folgende Konfiguration verwendet: Betriebssystem: Mac OS v12.6; - M2 Apple Silicon; - 13,3-Zoll-Display; - 8-Kern-CPU; - 8-Kern-GPU; - 32 GB RAM; - 256 GB SSD.

Das Canadian Institute for Cybersecurity (CIC) hat einen umfassenden IoT-Bedrohungsdatensatz erstellt, um Sicherheitsanalysen in praktischen IoT-Umgebungen voranzutreiben34. Insgesamt gab es 33 Angriffe auf ein Netzwerk von 105 verbundenen Geräten in einem IoT-System. Mit insgesamt 46.179.314 Vorfällen werden Angriffe in sieben Gruppen eingeteilt: DDoS, Aufklärung, DoS, webbasiert, Spoofing und Brute Force, zusätzlich zu Mirai. Der Trainingssatz enthält 37.349.263 Fälle, 8.830.051 Fälle im Testsatz und insgesamt 46 Merkmale. In jedem Fall starten bösartige IoT-Geräte Angriffe auf andere IoT-Geräte. Insgesamt waren 67 IoT-Geräte sowie 38 Zigbee- und Z-Wave-Geräte, die an 5 Hubs angeschlossen sind, von den Angriffen betroffen. Ein Netzwerk aus vernetzten Sensoren, Kameras, Mikrocontrollern und Smart-Home-Geräten kann eingerichtet werden, um verschiedene Arten von Angriffen auszuführen und den daraus resultierenden Datenverkehr aufzuzeichnen. Wireshark erfasst Netzwerkverkehr im PCAP-Format für weitere Analysen. Da jedes Experiment zwei Datenströme speichert, wird Mergecap verwendet, um die PCAP-Dateien zu kombinieren. Verschiedene IoT-Geräte wurden zur Zusammenstellung des Datensatzes verwendet, darunter Audioplayer, Videorekorder, Hubs, Steckdosen, Hausautomationssysteme, Beleuchtung, Sensoren und NextGen-Geräte.

Dieser Abschnitt bietet eine detaillierte Forschungsmethodik, die aus vielen aufeinanderfolgenden Phasen besteht, die in der Studie verwendet werden. Darüber hinaus definiert der Teil den vorgeschlagenen Algorithmus sequenziell und bietet ein detailliertes Flussdiagramm des Forschungsprozesses.

CNN
Der CNN-Algorithmus verwendet ein künstliches neuronales Netzwerk, einen Deep-Learning-Ansatz. Abbildung 4 veranschaulicht den zugrundeliegenden Algorithmus, den CNN verwendet: vollständig zusammenhängende Schichten, Pooling, Flattening und Konvolution sind alle Teil davon. Ein CNN kann ohne die Faltungsschicht nicht funktionieren. Die empfangenden Zelldaten werden von der Faltungsschicht verarbeitet.

In Gleichung (2) wird das Ausgangsvolumen (Vo) durch P (Stride), Vi (Eingangsvolumen), S (Kerngröße des Faltungsschicht-Neurons) und M (Nullpolsterung) bestimmt.

figure-protocol-5(2)

Anschließend wird ein Filter verwendet, um die Eigenschaften des Eingabewerts während der Faltung zu extrahieren. Diese Ebene erstellt eine Merkmalskarte. Die Reduzierung der Eingabedatengröße durch Pooling vereinfacht das Training und reduziert die Anzahl der zu berechnenden Parameter. Die Pooling-Schicht kann entweder anhand des größten Wertes innerhalb der gegebenen Größe oder des Durchschnitts der Werte gewählt werden. Die entwickelte Technik umfasst zwei Schichten der Faltung und zwei Ebenen des Poolings. Der Prozess der Merkmalsextraktion beginnt hier. Die gewonnenen Feature-Daten werden für die Berechnung bereitgestellt. CNN-Algorithmen sind in einer, zwei oder drei Dimensionen verfügbar. Das Modell verwendete ein konvolutionales neuronales Netzwerk mit nur einer Dimension. Die Schichten im klassifizierenden Bereich werden als abgeflacht, vollständig zusammenhängend bezeichnet. Die Daten müssen nach der Faltungsphase abgeflacht werden, damit sie in der vollständig verbundenen Phase verwendet werden können. Die Abflachungsschicht ist der Ort, an dem dieser Prozess durchgeführt wird. Innerhalb der vollständig verknüpften Schicht wird das konventionelle Paradigma künstlicher neuronaler Netze verwendet. Um CNN auf nicht bildbasierte Daten anzuwenden, müssen die Eingabedimensionen transformiert werden. Daher kann CNN eindimensionale Faltungsschichten verwenden, die eindimensional35 sind.

figure-protocol-6
Abbildung 4: CNN-Grundalgorithmus. Die grundlegenden Funktionsweisen und Komponenten des CNN-Modells werden beschrieben. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Transformator-Lernen
Darüber hinaus nutzen wir zur Durchführung weiterer Experimente das Transformer-Modellierungs-Framework. Das Modell kann dank des Selbstaufmerksamkeitsmechanismus des Transformators gleichzeitig alle Punkte in der Sequenz verarbeiten. Das Ergebnis ist eine schnellere Trainingszeit für das Modell und eine bessere Nutzung der Computerressourcen durch den Transformator während der Inferenz und des Trainings. Der Transformator besteht hauptsächlich aus einer Reihe gestapelter Encoder und Decoder. Der Kodierungsprozess beinhaltet die Übergabe einer Sprache in eine andere, aber der Dekodierungsprozess beinhaltet die Bestimmung der Wahrscheinlichkeit, dass eine andere Sprache anhand früherer Ausgaben verwendet wird. Da Encoder hauptsächlich für die Feature-Extraktion verantwortlich sind, verwendet das vorgeschlagene Modell ausschließlich Encoderkomponenten. Der Transformatorencoder besteht aus Eingangs-/Positions-Embedding, einem Vorwärts-neuronalen Netzwerk, Schichtnormalisierung, Mehrkopf-Selbstaufmerksamkeit und einem Restnetzwerk.

Um die Eingabedaten für die Verarbeitung durch den Transformator vorzubereiten, wird eine Einbettungsschicht verwendet, um die kategorialen Eigenschaften in dichte Vektorrepräsentationen umzuwandeln. Position Embedding zeigt, wie Features sequentiell verbunden sind, während Input Embedding zeigt, wie verschiedene Eingaben in einem gemeinsamen Raum zusammenhängen. Bevor der Transformator kategorische Eigenschaften verarbeitet, wird in dieser Forschung Input Embedding verwendet, um diese in dichte Vektoren umzuwandeln.

Eine Erweiterung des Aufmerksamkeitsmechanismus, der Multihead-Selbstaufmerksamkeitsmechanismus, bildet die Grundlage der Transformatorarchitektur. Mit einem skalierten Punktprodukt verwendet diese Forschung den Multi-Headed Self-Attention-Mechanismus.

figure-protocol-7(3)

wobei die Abfragematrix (Q), die Schlüsselmatrix (K), die Wertmatrix (V) und die Schlüsselmatrixdimension (dk) jeweils bezeichnet werden. Indem das Modell sich auf Daten verschiedener Merkmale konzentrieren kann, die auf separate Unterräume abgebildet sind, was zu unterschiedlichen Aufmerksamkeitswerten führt, unterscheidet sich ein mehrköpfiger skalierter Punktprodukt-Aufmerksamkeitsmechanismus vom skalierten Punktprodukt-Aufmerksamkeitsmechanismus. Overfitting ist weniger wahrscheinlich, wenn die Aufmerksamkeitsstufen für jeden Kopf unabhängig berechnet werden. Die spezifische Formulierung ist wie folgt:

figure-protocol-8(4)

figure-protocol-9 (5)

Wobei h die Anzahl der Aufmerksamkeitsköpfe ist, das d, v- und d-Modell die Dimension von v und Modell darstellen. Auch

figure-protocol-10

Als Nächstes wird die Schichtnormalisierung verwendet, um den Trainingsprozess zu stabilisieren. Um eine Gradientenexplosion zu verhindern, begrenzt die Schichtnormalisierung die Ausgabe jeder Schicht auf einen bestimmten Bereich. Sowohl die Konvergenz als auch die Trainingsgeschwindigkeit des Modells können dadurch verbessert werden. Während die Batch-Normalisierung Batch-Daten berücksichtigt, tut die Layer-Normalisierung dies nicht.

CNN-Transformer vorgeschlagenes Modell
Diese Forschung bietet eine hybride CNN-Transformer-Technik zur Erkennung von Eindringlingen in IoT-Netzwerken unter Berücksichtigung der unterschiedlichen Vorteile beider Architekturen. Abbildung 5 zeigt die Hauptkomponenten der vorgeschlagenen CNN-Transformer-Hybridtechnik. Nach Durchführung aller Vorverarbeitungsschritte, einschließlich Reinigung, Normalisierung, Beschriftungskodierung und Merkmalsauswahl, wird jede Probe im Datensatz durch einen 30-dimensionalen Merkmalvektor dargestellt, der als Enddaten bezeichnet wird. Die gleichen Enddaten werden dupliziert und parallel zu beiden Zweigen des Hybridmodells eingespeist. Anschließend werden diese Enddaten gleichzeitig an sowohl den CNN- als auch den Transformer-Block gesendet. CNN und Transformator sind in keiner Weise voneinander abhängig; Sie können beide gleichzeitig mit denselben Eingabedaten arbeiten. Die abgeflachten Ausgänge der beiden Zweige, CNN und Transformer, werden miteinander verkettet, um einen fusionierten Merkmalsvektor zu erzeugen, der an die dichten Schichten weitergeleitet wird, welche sie klassifizieren. Der CNN-Block ändert die Eingabeform zu (num_features, 1), sodass Faltungsoperationen über Merkmalsdimensionen hinweg durchgeführt werden können, um lokale räumliche Muster zu finden. Gleichzeitig ändert der Transformer-Branch denselben Eingang in ein sequentielles Format und sendet ihn in einen höherdimensionalen Einbettungsraum, gefolgt von der Positionskodierung. Dies ermöglicht es dem Transformer, sich im Feature-Bereich selbst zu konzentrieren und globale kontextuelle Beziehungen zu finden. Das einzigartige Design des Transformators wird für die Feature-Extraktion verwendet, während die Sigmoid-Funktion und vollständig verknüpfte Schichten die Mapping-Verbindung zwischen Features und Labels herstellen. Das CNN-Transformer-Modell wird strukturell durch Abbildung 5 dargestellt. Das Ergebnis ist ein System mit acht Kategorien zur Klassifizierung von Angriffen, mit DDoS, Recon, DoS, Benign, Web-basiert, Spoofing, Brute Force und Mirai als Bestandteile. Der Bewertungsprozess des vorgeschlagenen CNN-Transformators ist in Abbildung 5 dargestellt.

figure-protocol-11
Abbildung 5: Architektur des vorgeschlagenen Modells. Die Abbildung zeigt die Eingangsform und den Auswertungsprozess des vorgeschlagenen CNN-Transformators. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Zwei eindimensionale konvolutionelle neuronale Netzwerke (CNNs) mit 64- und 128-Einheiten-Filtern und einer 3-Kernel-Größe, zwei Max-Pooling-Schichten, einem Abflachungsschritt, drei dichten Schichten mit 256, 128 und 64 Einheiten sowie drei Dropout-Schichten bilden die Schicht des Convolutional Neural Network (CNN).

Die Eingabedaten werden über eine 1D-Faltungsschicht mit einer ReLU-Aktivierungsfunktion, 64 Filtern, einem 3x3-Kernel und einem 1x1-Stride in der ersten Schicht verarbeitet. Auf die vorhergehende Schicht folgt eine MaxPooling1D-Schicht mit einer Poolgröße von 2. Um das Modell flexibler zu machen und seine Rechenkosten zu senken, verringert diese Schicht die räumlichen Abmessungen des Ausgabebereichs. Schicht drei ist eine weitere 1D-Faltungsschicht; er verfügt über 128 Filter, einen Kernel mit drei Größen, einen Schritt-Durchmesser von einer und eine Aktivierungsfunktion namens ReLU. Mit mehr Filtern zur Extraktion von Eingabemerkmalen ähnelt diese Schicht der ersten Max-Pooling-Schicht. Die Ausgabe der ersten Schicht wird dann mit dieser Technik verarbeitet. Anschließend wurde nach der zweiten Faltungsschicht eine maximale Poolschicht hinzugefügt, deren Poolgröße ebenfalls 2 betrug. Auch diese Ebene wird verwendet, um die Merkmalskarten herunterzusetzen. Die fünfte Schicht ist eine Abflachungsschicht, die die Ausgabe der vorherigen Schicht in einen eindimensionalen Vektor umwandelt.

Die erhaltenen Merkmalsteilmengen werden als letzten Schritt eingebettet, bevor sie zum Eingang des Transformators werden. Zusätzlich wird Multi-Head-Attention – ein eindimensionaler Vektor aus acht Köpfen mit einer Dimension von 32 Tasten – verwendet, um die Bedeutung jedes Kopfes zu bewerten. Die Mehrkopf-Aufmerksamkeitsschicht ist die Hauptkomponente des Transformators. Diese Schicht ermöglicht es dem Modell, aus den eingebetteten Darstellungen verschiedener Eigenschaften auf adaptive Weise zu lernen. Die Multi-Head-Aufmerksamkeitsschicht besteht aus mehreren Selbst-Attention-Heads, die auch als "skalierte Punktprodukt-Aufmerksamkeit" bezeichnet werden. Nach Anwendung der Schichtnormalisierung mit Epsilon auf 1e-6 ist das Ziel, Skalenabweichungen zwischen verschiedenen Eigenschaften zu beseitigen und die Ausgabestabilität sicherzustellen. Indem die Ausgabe jeder Schicht innerhalb eines vorgegebenen Bereichs gehalten wird, verringert die Schichtnormalisierung die Wahrscheinlichkeit einer Gradientenexplosion. Nach dem Ausgang des Transformators folgt eine Abflachungsschicht, die ihre Kombination mit dem CNN vereinfacht, indem sie sie auf einen einzigen Vektor reduziert.

Der nächste Schritt besteht darin, die abgeflachten Ausgänge von CNN und Transformer mithilfe einer Verkettungsschicht zu kombinieren. Die Aktivierungsfunktion "Relu", L2-Regularisierung und eine dichte Schicht mit 256 Einheiten folgen der Abflachungsschicht. Darauf folgt eine Dropout-Schicht mit einer Rate von 0,5, die hilft, Überanpassungen zu vermeiden. Eine zusätzliche 128-Einheiten-Dichtschicht mit L2-Regularisierung und der "Relu"-Aktivierungsfunktion folgt. Die Aussetzrate in einer zusätzlichen Aussetzerschicht beträgt 0,3. Die ReLU-Aktivierungsfunktion, L2-Regularisierung und eine 64-Einheiten-dichte Schicht bilden die folgende Schicht. Die nächste Schicht besteht aus einer 0,2-Rate-Dropout-Schicht, die zufällig 20 % der darin enthaltenen Einheiten eliminiert. Eine dichte Schicht mit einer Softmax-Aktivierungsfunktion erzeugt eine Wahrscheinlichkeitsverteilung für die Ausgabeklassen der letzten Schicht. In dieser Schicht gibt es genau so viele Einheiten wie es Ausgabeklassen gibt.

Das vorgeschlagene Modell kann numerisch wie folgt ausgedrückt werden:
Sei X die CNN-Eingabedaten, wobei X figure-protocol-12 R(n×1) nach der Umformung und n die Anzahl der ausgewählten Merkmale ist. X wird in einen höherdimensionalen Einbettungsraum der Form R(n × d_model) für den Transformatorblock gebracht. Bevor es in den Selbst-Aufmerksamkeitsmechanismus geht, wird Positionskodierung verwendet.

Im Folgenden ist der Ausdruck der Operation in der Conv1D-Schicht, die 64 Filter und eine Kerngröße von 3 verwendet:

figure-protocol-13(6)

wobei Yi,j der Ausgang an Position j desi-ten Filters ist, k der Kern der Größe 3, b1figure-protocol-14 R64 der Bias-Term für jeden Filter, Wk die Filtergewichte repräsentiert und ReLU die Aktivierungsfunktion ist. Anschließend wird die MaxPooling-Schicht mit einer Poolgröße von 2 angewendet, was die Ausgabe Z1,j ergibt.

figure-protocol-15(7)

Eine zusätzliche ID-Faltungsschicht mit 3 Kernelgrößen und 128 Filtern ist als dritte Schicht des Modells enthalten; Seine Ausdrucksweise lautet:

figure-protocol-16(8)

Dabei ist k der Kern der Größe 3, b2 figure-protocol-17 R128 der Vorspannterm für jeden Filter und ReLU die Aktivierungsfunktion. Eine weitere Max-Pool-Schicht wird angewendet, die die Eingabe von der zweiten Faltungsschicht mit einer Poolgröße von 2 bekommt. Der Ausgang Z2,j ist gegeben durch:

figure-protocol-18(9)

Die fünfte Schicht ist eine Abflachungsschicht, ausgedrückt als:

figure-protocol-19(10)

Als nächstes kommen die Transformer-Schichten, zu denen eine Embedding-Schicht, eine Multi-Head-Aufmerksamkeitsschicht und eine Schichtnormalisierung gehören

figure-protocol-20(11)

E ist der Einbettungsvektor für das Eingabeklassenlabel c, und We ist die Gewichtsmatrix, die Einbettungsvektoren für alle Kategorien enthält. Dadurch wird jede ganze Zahl in c auf einen dichten Vektor aus 32 reellwertigen Komponenten abgebildet. Als nächstes folgt eine Mehrkopf-Aufmerksamkeitsschicht, wie sie in Gleichungen (3), (4) und (5) formuliert ist.

Die Schlüsselmatrix hat die Größe dk = 32 und die Dimension h = 8. D, V und DModell stehen für die jeweiligen Maße von V und Modell. Auch figure-protocol-21

Für einen Ausgang x = MultiHead(Q,K,V) ergibt die Schichtnormalisierung:

figure-protocol-22(12)

Wobei y die normalisierte Ausgabe ist, γ und β die lernbaren Parameter und μ und σ2 jeweils den Mittelwert und die Varianz für x bezeichnen. Als nächstes folgt die Abflachungsschicht für den Transformator, definiert als

figure-protocol-23

Am Ende aller Schichten wird der resultierende Ausdruck wie folgt dargestellt:

figure-protocol-24

figure-protocol-25

figure-protocol-26

figure-protocol-27

figure-protocol-28

figure-protocol-29

figure-protocol-30

figure-protocol-31

Wobei Z1figure-protocol-32R256, Z2figure-protocol-33R128, Z3figure-protocol-34R64 und Yfigure-protocol-35R8 sind. Dieses Hybridmodell berechnet auch die Verlustfunktion für die Mehrklassenklassifikation, die wie folgt ausgedrückt werden kann

figure-protocol-36

wo:
Yc stellt das wahre Label (One-Hot-codiert) für die Klasse cc dar,
Y'c ist die vorhergesagte Wahrscheinlichkeit für Klasse c
Der vorgeschlagene Algorithmus wird in Tabelle 3 ausführlich erklärt.

Tabelle 3: Der vorgeschlagene CNN-Transformer-Algorithmus. Der vorgeschlagene Algorithmus wird in Tabelle 3 Schritt für Schritt erklärt. Bitte klicken Sie hier, um diese Tabelle herunterzuladen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Abschnitt stellt die Bewertungsparameter zusammen mit den Testergebnissen dar.

Leistungsbewertungskennzahlen
Die Wirksamkeit der Modelle kann anhand mehrerer definierter Kriterien bewertet werden. Genauigkeit, Abruf, Präzision, F1-Wert, ROC, Verwirrungsmatrix und andere statistische Kennzahlen sind in Tabelle 4 dargestellt. Einblicke in die Gesamtleistung der Modelle werden durch die Kennzahlen bereitgestellt.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das CNN-Transformer-Modell wurde auf den CICIoT2023-Datensätzen getestet, wobei 80 % für Training und 20 % für Tests reserviert waren. Das Modell erreichte eine Genauigkeit von 99,97 %, einen F1-Wert von 99,96 %, Rückruf von 99,97 %, eine Präzision von 99,96 % und einen Verlust von 0,0123, was seine Wirksamkeit bei der IoT-Intrusionserkennung bestätigt. CNN-basierte Ansätze, ähnlich den Ergebnissen13, sind geschickt darin, kleine räumliche Muster in Netzwerkverkeh...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben keine Interessenkonflikte zu erklären.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ich möchte meinem Guide, Dr. Sima, meinen besonderen Dank und meinen Dank aussprechen, dass sie ihr Wissen und ihre Expertise in dieser Studie weitergegeben hat.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Apple M2 (8-Kern-CPU)ApfelN/A(OS) bietet die Umgebung, in der Deep-Learning-Frameworks und -Tools arbeiten.
CICIoT2023 DatensatzUNBhttps://www.unb.ca/cic/datasets/iot2023.htmlÖffentlich zugängliches Daset von IoT
Keras 2.6.0Kerashttps://keras.io/Eine API, die auf TensorFlow läuft und eine benutzerfreundliche Oberfläche bietet.
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Visualisierungsbibliothek für Python.
NumPy 1.21.4Numpyhttps://numpy.org/Grundlegendes Paket für wissenschaftliches Rechnen mit Python
NVIDIA Tesla P100 GPU (16 GB VRAM)Google Colab ProN/ATrainingsgeräte
Pandas 1.3.4Pandashttps://pandas.pydata.org/Werkzeug zur Datenanalyse und -manipulation.
Python 3.8.10Python Software Foundationhttps://www.python.org/downloads/release/python-3810/Die beliebteste Sprache für Deep Learning aufgrund ihrer umfangreichen Bibliotheken und der Community-Unterstützung.
scikit-learn 1.0.2Scikit Learnhttps://scikit-learn.org/Maschinelle Lernbibliothek für Python.
Seaborn 0.11.2Seabornhttps://seaborn.pydata.org/Bibliothek zur statistischen Datenvisualisierung.
System-RAMN/AN/A32 GB RAM
TensorFlow 2.6.0Googelnhttps://www.tensorflow.org/Weit verbreitet für seine umfassenden Werkzeuge und Bibliotheken.

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abbas, S., et al. A novel federated edge learning approach for detecting cyberattacks in IoT infrastructures. IEEE Access. 11, 112189-112198 (2023).
  2. Asharf, J., et al. A review of intrusion detection systems using machine and deep learning in internet of things: challenges, solutions and future directions. Electronics. 9 (7), 1177(2020).
  3. Qiu, J., Tian, Z., Du, C., Zuo, Q., Su, S., Fang, B. A survey on access control in the age of internet of things. IEEE Internet Things J. 7 (6), 4682-4696 (2020).
  4. Zhang, K., et al. Compacting deep neural networks for internet of things: methods and applications. IEEE Internet Things J. 8 (15), 11935-11959 (2021).
  5. Farooq, U., Tariq, N., Asim, M., Baker, T., Al-Shamma'a, A. Machine learning and the internet of things security: solutions and open challenges. J Parallel Distrib Comput. 162, 89-104 (2022).
  6. Regan, C., et al. Federated IoT attack detection using decentralized edge data. Mach Learn Appl. 8, 100263(2022).
  7. Sarhan, M., Layeghy, S., Moustafa, N., Portmann, M. Cyber threat intelligence sharing scheme based on federated learning for network intrusion detection. J Netw Syst Manage. 31 (1), (2023).
  8. Verma, P., et al. A novel intrusion detection approach using machine learning ensemble for IoT environments. Appl Sci. 11 (21), 10268(2021).
  9. Rajagopal, S., Kundapur, P. P., Hareesha, K. S. A stacking ensemble for network intrusion detection using heterogeneous datasets. Secur Commun Netw. 2020, 4586875(2020).
  10. Enhancing IoT security with CNN and LSTM-based intrusion detection systems. Gueriani, A., Kheddar, H., Mazari, A. C. Proc Int Conf Pattern Anal Intell Syst, 6, 1-7 (2024).
  11. Nandanwar, H., Katarya, R. Deep learning enabled intrusion detection system for industrial IoT environment. Expert Syst Appl. 249, 123808(2024).
  12. Jony, A. I., Arnob, A. K. B. A long short-term memory based approach for detecting cyber attacks in IoT using CIC-IoT2023 dataset. J Edge Comput. 3 (1), 28-42 (2024).
  13. de Caldas Filho, F. L., et al. Botnet detection and mitigation model for IoT networks using federated learning. Sensors. 23 (14), 6305(2023).
  14. Wang, Z., et al. ThreatInsight: innovating early threat detection through threat-intelligence-driven analysis and attribution. IEEE Trans Knowl Data Eng. 36 (12), 9388-9402 (2024).
  15. Chai, Y., Du, L., Qiu, J., Yin, L., Tian, Z. Dynamic prototype network based on sample adaptation for few-shot malware detection. IEEE Trans Knowl Data Eng. 35 (5), 4754-4766 (2023).
  16. Shah, H., et al. Deep learning-based malicious smart contract and intrusion detection system for IoT environment. Mathematics. 11 (2), 418(2023).
  17. Luo, C., et al. A novel web attack detection system for internet of things via ensemble classification. IEEE Trans Ind Inform. 17 (8), 5810-5818 (2021).
  18. Tian, Z., et al. A distributed deep learning system for web attack detection on edge devices. IEEE Trans Ind Inform. 16 (3), 1963-1971 (2020).
  19. Chai, Y., et al. MalFSCIL: a few-shot class-incremental learning approach for malware detection. IEEE Trans Inf Forensics Secur. 20, 2999-3014 (2025).
  20. Maghrabi, L. A. Automated network intrusion detection for internet of things: security enhancements. IEEE Access. 12, 30839-30851 (2024).
  21. He, M., et al. Reinforcement learning meets network intrusion detection: a transferable and adaptable framework for anomaly behavior identification. IEEE Trans Netw Serv Manage. 21 (2), 2477-2492 (2024).
  22. Oseni, A., et al. An explainable deep learning framework for resilient intrusion detection in IoT-enabled transportation networks. IEEE Trans Intell Transp Syst. 24 (1), 1000-1014 (2023).
  23. Khan, F., et al. Trustworthy and reliable deep-learning-based cyberattack detection in industrial IoT. IEEE Trans Ind Inform. 19 (1), 1030-1038 (2023).
  24. IoT anomaly detection using a multitude of machine learning algorithms. Balega, M., et al. Proc IEEE Appl Imagery Pattern Recognit Workshop, 2022, 1-7 (2022).
  25. A hybrid machine learning approach to anomaly detection in industrial IoT. Jayesh, T. P., et al. Proc Int Conf Adv Comput Commun Embedded Syst, 3, 32-36 (2023).
  26. Mezina, A., Burget, R., Travieso-Gonzalez, C. M. Network anomaly detection with temporal convolutional network and U-Net model. IEEE Access. 9, 143608-143622 (2021).
  27. Ahmad, Z., et al. Anomaly detection using deep neural network for IoT architecture. Appl Sci. 11 (15), 7050(2021).
  28. Raman, M., et al. An efficient intrusion detection technique based on support vector machine and improved binary gravitational search algorithm. Artif Intell Rev. 53, (2020).
  29. Thaseen, I. S., et al. A hadoop based framework integrating machine learning classifiers for anomaly detection in the internet of things. Electronics. 10 (16), 1955(2021).
  30. Almiani, M., et al. Deep recurrent neural network for IoT intrusion detection system. Simul Model Pract Theory. 101, 102031(2020).
  31. A novel approach to detect IoT malware by system calls using deep learning techniques. Shobana, M., Poonkuzhali, S. Proc Int Conf Innovative Trends Inf Technol, 2020, 1-5 (2020).
  32. Farsi, M. Application of ensemble RNN deep neural network to the fall detection through IoT environment. Alex Eng J. 60 (1), 199-211 (2021).
  33. Tseng, S. M., Wang, Y. Q., Wang, Y. C. Multiclass intrusion detection based on transformer for IoT networks using CIC-IoT-2023 dataset. Future Internet. 16 (8), 284(2024).
  34. Neto, E. C. P., et al. CICIoT2023: a real-time dataset and benchmark for large-scale attacks in IoT environment. Sensors. 23 (13), 5941(2023).
  35. Tsimenidis, S., Lagkas, T., Rantos, K. Deep learning in IoT intrusion detection. J Netw Syst Manage. 30 (1), 8(2021).
  36. Kamal, H. Advanced hybrid transformer-CNN deep learning model for effective intrusion detection systems with class imbalance mitigation using resampling techniques. Future Internet. 16 (12), 481(2024).
  37. Alghieth, M. DeepECG-Net: a hybrid transformer-based deep learning model for real-time ECG anomaly detection. Sci Rep. 15 (1), 20714(2025).
  38. Kethineni, K., Pradeepini, G. Intrusion detection in internet of things-based smart farming using hybrid deep learning framework. Clust Comput. 27 (2), 1719-1732 (2024).
  39. Alharbi, A., et al. Botnet attack detection using local global best bat algorithm for industrial internet of things. Electronics. 10 (11), 1341(2021).
  40. Kunang, Y. N., et al. Attack classification of an intrusion detection system using deep learning and hyperparameter optimization. J Inf Secur Appl. 58, 102804(2021).
  41. Han, W., et al. Heterogeneous data-aware federated learning for intrusion detection systems via meta-sampling in artificial intelligence of things. IEEE Internet Things J. 11 (8), 13340-13354 (2024).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

IoT SicherheitHybridmodellTransformer ModellNetzwerk AnomalieerkennungIoT BedrohungsklassifizierungEchtzeit berwachungCIC IoT 2023 Datensatz

Verwandte Artikel