$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Die auf Wrapper basierende Feature-Auswahlmethode mit Auto-Encodern wird in der vorgeschlagenen Architektur für die Android-Malware-Erkennung verwendet, wie in Abbildung 1 dargestellt. Der Datensatz ist in 70:30-Trainings- und Testuntersätze unterteilt. Klassifizierung und Feature-Auswahl sind die beiden Hauptschritte im Malware-Analyseprozess.
Merkmalauswahl (FS): Dieser Schritt besteht darin, iterativ nach den besten Feature-Subsets zu suchen (siehe Definition 1) mithilfe von Schwarmintelligenz-basierten Algorithmen, insbesondere Cuckoo Search Optimization (CSO), Ant Lion Optimization (ALO) und Firefly Optimization (FO). Danach verarbeiten Auto-Encoder die ausgewählten Merkmale, um eine komprimierte Darstellung der eingehenden Daten zu erzeugen. Ein Induktionsansatz nutzt dann die Ausgabe der Auto-Encoder, um zu bewerten, wie gut diese Funktionen zwischen gefährlichen und harmlosen Apps unterscheiden. Um eine präzise Kategorisierung nachfolgender Fälle zu ermöglichen, erstellt der Induktionsalgorithmus einen Klassifikator, indem er den Merkmalsraum auf eine Sammlung von Klassenlabels abbildet.
Klassifikation: Mit dem vorgeschlagenen künstlichen neuronalen Klassifikator und bekannten Induktionsmethoden wird der reduzierte Funktionssatz aus der Merkmalauswahlphase in dieser Phase bewertet, um zu sehen, wie effektiv er Android-Malware erkennen kann.
Durch den Einsatz ausgefeilter Klassifikationsansätze und die Konzentration auf die informativsten Funktionen versucht diese Methodik, die Genauigkeit und Effizienz der Android-Malware-Erkennung zu verbessern.
Auswahl der Ausstattung
Ein entscheidender Schritt im maschinellen Lernen ist die Merkmalsauswahl, bei der festgestellt wird, welche Merkmale für den Modellbau am zuverlässigsten, relevantesten und nicht redundant sind. Die methodische Reduzierung von Funktionsmengen wird immer wichtiger, da die Datensätze weiter an Größe und Komplexität wachsen. Das Hauptziel der Feature-Auswahl ist es, die Modellleistung zu maximieren und gleichzeitig die Rechenkosten zu senken. Wiederholende und unnötige Funktionen werden entfernt, sodass sich der Prozess auf die für das Modell wichtigsten Variablen konzentrieren kann. Anstatt sich auf den Machine-Learning-Algorithmus zu verlassen, um signifikante Merkmale zu identifizieren, sind folgende Vorteile der Merkmalsauswahl vor dem Modelltraining aufgeführt:
Vereinfachte Modelle: Die Reduzierung der Anzahl der Eingabevariablen führt zu einfacheren Modellen, die leichter zu interpretieren und verständlich sind.
Varianzreduktion: Durch den Fokus auf wesentliche Merkmale hilft die Merkmalsauswahl, die Modellvarianz zu verringern, wodurch Überanpassung abgemildert und die Verallgemeinerung auf neue Daten verbessert wird.
Verkürzte Trainingszeit: Ein kleinerer Funktionssatz verringert die Rechenbelastung, was zu schnellerem Modelltraining und -auswertung führt.
Abschwächung des Fluchs der Dimensionalität: Hochdimensionale Daten können Herausforderungen wie erhöhte Komplexität und Überanpassung darstellen; Die Merkmalsauswahl adressiert diese Probleme, indem der Merkmalsraum auf die informativsten Variablen beschränkt wird.
Definition 1 der Merkmalsauswahl
Stellen Sie sich einen Induktor I und einen Datensatz D vor, der eine Verteilung D über einen beschrifteten Instanzraum hat und Features enthält (x1,x 2,x 3,... ,xn). Die Teilmenge der Merkmale, die die Genauigkeit des Klassifikators C=I(D) optimiert, wird als optimale Merkmalsteilmenge Xopt bezeichnet.
Bei der unbeaufsichtigten Merkmalsauswahl zielen wrapperbasierte Ansätze darauf ab, die optimale Kombination von Funktionen zu identifizieren, die die Modellleistung verbessern. Durch systematische Hinzufügen oder Entfernung von Merkmalen, oft durch gierige Algorithmen, bewerten diese Methoden verschiedene Modelle, um die wirkungsvollsten Merkmale für die Modellentwicklung auszuwählen. Dieser Prozess ist in Abbildung 2 dargestellt.
Für die Feature-Auswahl werden Schwarmintelligenzalgorithmen wie Firefly Optimization (FO), Cuckoo Search Optimization (CSO) und Ant Lion Optimization (ALO) eingesetzt, um konventionelle gierige Taktiken zu übertreffen. Die in der Fitnessbewertungsphase gewählte Zielfunktion hat einen erheblichen Einfluss auf die Wirksamkeit dieser Algorithmen. Sowohl die Anzahl der ausgewählten Features als auch der Fehler des Modells am Ende jeder Iteration werden im iterativen, wrapperbasierten Merkmalsauswahlverfahren berücksichtigt, um die Angemessenheit der ausgewählten Features zu bewerten. Gleichung (1) formalisiert diese Auswertung.
(1)
Die Strafe des Lernalgorithmus für Fehler, die während der Fitnessbewertung gemacht werden, wird in dieser Gleichung durch τ dargestellt, wobei τ ∈ [0,1]. Die Länge der gewählten Merkmals-Teilmenge wird durch die Variable l bezeichnet, und die Gesamtzahl der Merkmale wird durch die Variable u dargestellt.
Auto-Encoder
Neuronale Netze, die sich auf das Erlernen komprimierter Darstellungen von Eingabedaten spezialisiert haben, werden als Autoencoder bezeichnet. Ein Encoder und ein Decoder sind die beiden Hauptteile von ihnen. Während der Decoder versucht, die ursprüngliche Eingabe aus dieser komprimierten Form wiederherzustellen, verarbeitet der Encoder die Eingabedaten und komprimiert sie in eine latente Raumrepräsentation. Das Training von Machine-Learning-Modellen wird dadurch erleichtert, dass der Encoder nach dem Training wertvolle Funktionen aus unverarbeiteten Daten extrahieren kann.
Die vorgeschlagene Autoencoder-Architektur (wie in Abbildung 3 dargestellt) umfasst einen Encoder, der aus einer Eingabeschicht mit N Knoten besteht, gefolgt von zwei versteckten Schichten mit N*2 bzw. N Knoten. Es gibt eine zweite versteckte Schicht mit N/2 Knoten, die als latenter Raum bezeichnet wird. Mit zwei versteckten Schichten von [N, N*2]-Knoten repliziert der Decoder diese Struktur und endet mit einer Ausgabeschicht von N Knoten.
Auf jede versteckte Schicht folgt eine Batch-Normalisierung, um den Trainingsprozess zu beschleunigen und zu stabilisieren, und alle Schichten verwenden die LeakyReLU-Aktivierungsfunktion, um mögliche Probleme mit dem Verschwindungsgradienten zu bewältigen. Gleichung (2) liefert eine mathematische Definition der LeakyReLU-Aktivierungsfunktion:
(2)
Wobei hθ(x) mit Gleichung (3) erhalten wird
(3)
Hier stellt xi=(x1,x 2,...,xn) die Eingabewerte für die Knoten dar, während wi=(w1,w 2,...,wn) die Gewichte für diese Knoten bezeichnet. Während des Lernprozesses werden die Gewichte angepasst, nachdem sie zunächst zufällig innerhalb des Bereichs [0,1] zugewiesen wurden. Um zu verhindern, dass die Parameter durch den Ursprung gehen, wird an jeder Schicht ein Bias-Term hinzugefügt. Gleichung (4) definiert den Schwellenwert, und wenn das aus Gleichung (3) erhaltene Ergebnis diese übersteigt, wird ein Knoten ausgelöst.
(4)
Ameisenlöwen-basierte Feature-Auswahloptimierung (ALWFSO)
Der Ant Lion Optimizer (ALO) modelliert das natürliche räuberische Verhalten des Ameisenlöwen, wurde erstmals von Seyed Ali Mirjalili34 vorgestellt. Dieser Optimierungsalgorithmus identifiziert effizient optimale Lösungen unabhängig von den Anfangsparameterwerten. ALO zeigt eine schnelle Konvergenz und verwaltet sowohl ganzzahlige als auch diskrete Nebenbedingungen effektiv. Beutefang, Fallen erlegen, Ameisen einschließen, zufällige Ameisenbewegungen und Fallenreparatur sind die Schritte, die den Jagdprozess in ALO ausmachen.
Im Kontext des Ant Lion Optimizer (ALO)-Algorithmus repräsentieren Ameisen Kandidatenlösungen, die Zufallssuchen im Lösungsraum durchführen, während Ameisen den Fallen oder Leitfäden entsprechen, die die Bewegungen der Ameisen basierend auf Fitnesswerten beeinflussen. Diese doppelte Population modelliert das natürliche räuberische Verhalten von Ameisenlöwen, die Ameisen fangen. Zu Beginn werden die Populationen von Ameisen und Ameisenlöwen zufällig initialisiert. Ameisenlöwen werden für jede Ameise mittels des Roulette-Rad-Auswahlmechanismus ausgewählt, gefolgt von einem Zufallsgang (wie in Algorithmus-1 gezeigt). Gleichung (5) beschreibt dann, wie dieser Gang normalisiert wird.
(5)
Anfangs werden Ameisen- und Ameisenlöwenpopulationen zufällig gebildet. Für jede Ameise wird ein Ameise mit einem Roulette-Rad-Mechanismus gewählt, der einen Zufallsgang ermöglicht, der mit vorgegebenen Formeln normalisiert wird. Dieser Prozess stellt sicher, dass die Bewegungen der Ameisen von den Positionen der Ameisenlöwen beeinflusst werden, wodurch der natürliche Jagdprozess effektiv simuliert wird. Die Position jeder Ameise wird dann basierend auf dieser Interaktion aktualisiert, wodurch die Suche zu optimalen Lösungen geleitet wird.
Aufgrund seiner Architektur kann der ALO-Algorithmus komplexe Suchräume effektiv durchlaufen und ist damit ein mächtiges Werkzeug zur Lösung verschiedener Optimierungsprobleme. Die Fitness jeder Ameise wird am Ende jeder Wiederholung bewertet. Wie in Algorithmus-1 gezeigt, wird der Ameisenlöwe gegen die Ameise ersetzt, wenn die Ameise fitter ist als ihr Gegenstück. In diesem Fall
bezeichnet , die Position deri-ten Ameise bei Iteration t; I ist ein Verhältnis;
zeigt die Position des j. Th. Ameisenlöwen bei Iteration t an;
ist die Elite für den Zufallsgang bei Iteration t, der vom Rouletterad ausgewählt wird; und
ist der Zufallsgang des Ameisenlöwen in Iteration t, der ebenfalls vom Rouletterad bestimmt wird. Nach Abschluss jedes Zyklus wird die global optimale Lösung, bestätigt durch den integrierten Wrapper-Klassifikator, zurückgegeben.
Algorithmus 1: ALWFSO
Definiere die Zielfunktion: f(x):x=(x1,x 2,...,xd)
Initialisierung der Ameisen- und Ameisenkolonie zufällig
Berechnung der Fitness von Ameisen und Ameisenlöwen
Wähle die besten Ameisenlöwen und gehe davon aus, dass sie Elite sind.
Wiederholen, bis die Abschlussbedingung erfüllt ist oder f(x):x=(x1,x 2,...,xd)
Für jede Ameisen-Ameisen-Löwen-Auswahl: Verwenden Sie einen Roulette-Rad-Auswahlmechanismus, um probabilistisch einen Ameisenlöwen auszuwählen, der die Bewegung der Ameise beeinflusst
X(t) = [0,cum_sum(2r(t1) - 1),cum_sum(2r(t2) - 1),...,cum_sum(2r(tn)-1)]


Ende der Ameisenschleife
Fitnessbewertung: Berechnen Sie die Fitnesswerte aller Ameisen basierend auf ihren neuen Positionen neu.
Ersetzen Sie Ameisenlöwen durch Ameisen, wenn diese eine überlegene Fitness zeigen
Wenn ein Ameisenlöwe fitter wird, dann

Ende während
Cuckoo Search Wrapper-basierte Feature-Auswahloptimierung (CSWFSO)
Inspiriert vom Brutparasitismus einiger Kuckucksarten, die ihre Eier in die Nester anderer Wirtsvögel legen, entwickelten Xin-She Yang und Susah Deb35 2009 den Cuckoo Search-Algorithmus. Bei diesem Verfahren legt jeder Kuckuck ein Ei in ein zufällig ausgewähltes Nest. Zukünftige Generationen werden Nester mit den besten Eiern erben. Die Wahrscheinlichkeit, dass ein Wirtsvogel ein außerirdisches Ei entdeckt, liegt bei null, und es gibt nur eine begrenzte Anzahl von Wirtsnestern.
Algorithmus 2: CSWFSO
Definiere Zielfunktion: f(x):x = (x1,x 2,...,xd)
Erzeugen Sie zufällig eine Anfangspopulation von n Host-Nestern, die jeweils einer Kandidatenlösung xi entsprechen (i=1,2,3,...,n)
Wiederholen Sie sich, bis die Stoppbedingung erfüllt ist oder (tFür einen zufällig ausgewählten Kuckuck i erstelle eine neue Kandidatlösung mit Lévy-Flug

Berechnen Sie die Fitness der neu generierten Lösung Fi [Zur Maximierung gilt Fi α f(xi)]
Wählen Sie zufällig ein Wirtsnest j aus der Population n aus
wenn (Fi >Fj), dann wird j durch eine neue Lösung ersetzt
Ende, wenn
Geben Sie einen Teil der schlechteren Netze mit (pa) Bruchteil auf
Neue Nester werden im Abandoned Fraction (pa) gebaut, wobei verwendet wird 
Legen Sie die besten Lösungen oder Nester beiseite.
Indem Sie sie bewerten, wählen Sie das beste Nest oder die beste Lösung, die gerade jetzt verfügbar ist.
Die nächste Generation erbt die beste Lösung, die derzeit verfügbar ist.
Ende während
Zu Beginn werden alle Nester zufällig initialisiert. Im Verlauf der Iterationen ändert jeder Kuckuck seine Position im Lösungsraum durch Lévy-Flüge, wie in Algorithmus 2 beschrieben. Die Schrittlänge wird um ∝ angepasst, und eine sigmoidische Operation wandelt die durch die Cuckoo Search Optimization (CSO) erzeugten kontinuierlichen Werte in ein binäres Format um, wie in den Gleichungen (6) und (7) dargestellt.
(6)
(7)
Wie in Algorithmus 2 gezeigt, wobei
und
zufällig ausgewählte Nester und δ ∈ [0,1] sind, werden am Ende jeder Iteration einige Nester aufgegeben und mit neuen Kandidatenlösungen aktualisiert.
Inspiriert vom Brutparasitismus des Kuckucksvogels hat sich der Cuckoo Search Optimization (CSO)-Algorithmus als nützliches Werkzeug für Feature-Auswahlaufgaben35 erwiesen. Die Technik beginnt mit der Initialisierung einer Population von Nestern, von denen jedes eine mögliche Lösung im Kontext der wrapperbasierten CSO-Feature-Auswahl darstellt. Eine vorgegebene Zielfunktion wird verwendet, um die Fitness dieser Nester zu bewerten. Durch Fitnessbewertungen bestimmt der Algorithmus bei jeder Iteration die optimale Lösung – die als globale beste bezeichnet wird. Um den Lösungsraum besser zu erforschen, wird ein Teil des Nästes, dargestellt durch Erbse, gemäß dem CSO-Protokoll durch neue ersetzt. Der eingebettete Wrapper-Klassifikator bestätigt, dass der Algorithmus nach Abschluss aller Iterationen die global optimale Antwort liefert.
Firefly-basierte Feature-Auswahloptimierung (FWFSO)
Algorithmus 3: FWFSO
Definiere die Zielfunktion: f(x):x = (x1,x 2,...,xd)
Erzeugen Sie einen Anfangsschwarm von n Glühwürmchen, von denen jede eine Lösung xi repräsentiert (i = 1,2,3,...,n)
Bestimme die Lichtintensität I jedes Glühwürmchens anhand des Werts der Zielfunktion
Definiere den Lichtabsorptionskoeffizienten γ
Wiederholen Sie sich, bis die Stoppbedingung erfüllt ist oder (t < MaxGeneration)
Für jedes Glühwürmchen i (∀ i=1,2,3,... ,n)
für jedes Glühwürmchen j (∀ j=1,2,3,... ,i)
Erhalten Sie Lichtintensitäten von Ii undI j
wenn ichi < jdann


oder
Bewege das Glühwürmchen zufällig, um den Suchraum zu erkunden
Ende, wenn
Die Attraktivität nimmt mit der Entfernung ab, als 
Bewerten Sie die aktualisierte Lösung und passen Sie die Intensität des Glühwürmchens entsprechend an
Ende für
Ende für
Bewerten Sie die Glühwürmchen nach ihrer Lichtintensität und identifizieren Sie die mit der höchsten Helligkeit als aktuell beste Lösung
Der Firefly Optimization Algorithmus, eingeführt von George Lindfield und John Penny36, emuliert das natürliche Verhalten von Glühwürmchen, um andere anzulocken. In diesem Algorithmus ist die Attraktivität eines Glühwürmchens direkt proportional zu seiner Helligkeit, während der Abstand zwischen zwei Glühwürmchen umgekehrt proportional zu ihrer Attraktivität ist. Wenn keine helleren Glühwürmchen in der Nähe sind, bewegt sich ein Glühmwürmchen zufällig.
Zwei Glühwürmchen fühlen sich aufgrund ihrer Helligkeit voneinander angezogen; Ein weniger helles Glühwürmchen tendiert zu einem helleren. Zufällige Bewegung wird verwendet, wenn kein helleres Glühwürmchen vorhanden ist. Mit β0 als Schönheit wird der Abstand r=0 zwischen zwei Glühwürmchen verwendet, um ihre Attraktivität zu berechnen. Die rjk Trennung zwischen Glühwürmchen j und k wird wie folgt berechnet:
Hier notieren rji und rki die räumlichen Komponenten deri-ten Dimension für Glühwürmchen jth bzw. kth, und n stellt die Anzahl der Dimensionen dar. Die Bewegung eines Glühwürmchens zu einem anderen wird durch den Grad der Anziehung zwischen ihnen bestimmt:
. In dieser Gleichung ist rj die aktuelle Position von Glühwürmchen j, γ ist das Licht. Ranard ist eine Zufallszahl zwischen 0 und 1, α ist die Mutationsrate und der Absorptionskoeffizient. Sollte es keine brillanten Glühwürmchen mehr geben, bewegt sich das Glühwürmchen laut αα zufällig. Nach jeder Iteration validiert der eingebettete Wrapper-Klassifikator die globale Minimallösung, die dann zurückgegeben wird.
Klassifikator
Sowohl strukturierte als auch unstrukturierte Datensätze können klassifiziert werden, indem sie in diskrete Gruppen oder Klassen unterteilt werden. Das Ziel ist es, die Attribute frischer Datenpunkte zu verwenden, um deren Klasse oder Label vorherzusagen. Dieses Verfahren bestimmt die Kategorie, zu der frische Daten gehören, indem eine Abbildung von Eingabevariablen auf diskrete Ausgabevariablen approximiert wird.
Random Forests, Decision Trees, K-Nearest Neighbors, Logistic Regression und Support Vector Machines gehören zu den Induktions- oder Klassifikationsalgorithmen, die zur Bewertung der vorgeschlagenen Android-Malware-Erkennungslösung37 verwendet werden. Darüber hinaus präsentiert diese Arbeit den Artificial Neuronal Classifier, einen revolutionären hybriden Klassifikator, der konventionelle Induktionsalgorithmen mit künstlichen neuronalen Netzwerken kombiniert.
Künstlicher neuronaler Klassifikator
Das vorgeschlagene Design des künstlichen neuronalen Klassifikators (ANC) kombiniert einen Induktionsklassifikator und künstliche neuronale Netzwerke (ANN), wie in Abbildung 4 zu sehen ist. Nach dieser Architektur wird dem ANN beigebracht, Muster und Korrelationen zwischen den Eingabemerkmalen zu erkennen. Der Induktionsklassifikator nutzt die von der ANN gewonnenen Informationen, um die Präzision bei der Identifizierung von schädlicher Software von sicherer Software zu verbessern.
Nach umfangreichen Tests wurde das ANN im ANC mit drei vollständig verbundenen versteckten Schichten konfiguriert, jede mit M-Knoten, die einer Eingangsschicht mit N Knoten folgten. Es gibt eine Ausgangsschicht, die nach einer weitergehend vollständig verbundenen versteckten Schicht mit M/2-Knoten mit dem Induktionsklassifikator verbunden ist. Gleichung (8) bestimmt die Anzahl der Knoten in den verborgenen Schichten:
(8)
wobei M die Anzahl der Knoten in einer versteckten Schicht bezeichnet, N die Anzahl der Eingabemerkmale und α ein Parameter zwischen 2 und 10 ist. Die Aktivierungsfunktion (wie in Gleichung (9) gezeigt) spielt eine entscheidende Rolle bei der Feststellung, ob ein Neuron aktiviert wird, abhängig davon, dass der Ausgang einen bestimmten Schwellenwert überschreitet.
(9)
Hier wird hθ(x) gemäß Gleichung (3) berechnet. Der ANC nutzt den Adam-Optimierer, um Netzwerkgewichte und Lernraten anzupassen. In Adam werden die Zerfallsraten für die erste Momentschätzung
und die zweite Momentschätzung
für jedes Gewicht ωij mit β1 bzw. β2 bezeichnet. Sei N für die Lernrate. Die Aktualisierungsregeln für Adam sind in den Gleichungen (10) und (11) dargestellt:
(10)
(11)
Die bias-korrigierten Erst- und Zweitmoment-Schätzungen
und
, werden mit den Gleichungen (12) und (13) berechnet:
(12)
(13)
Diese Berechnungen stellen sicher, dass der Optimierer für jedes Gewicht angemessene Lernraten einhält, was ein effizientes und effektives Training des ANC ermöglicht.
Die Gewichtungsaktualisierungsregel für jede Verbindung im neuronalen Netz ist durch Gleichung (14) definiert:
(14)
Nach Aktualisierung der neuronalen Netzgewichte wird die Leistung mit einer Verlustfunktion bewertet, die die Diskrepanz zwischen den vorhergesagten und tatsächlichen Ausgaben misst. In diesem Modell wird der mittlere absolute Fehler (MAE), wie in Gleichung (15) definiert, zu diesem Zweck verwendet:
(15)
In diesem Zusammenhang stellt yi die tatsächliche Ausgabe dar,
bezeichnet die vorhergesagte Ausgabe und n ist die Gesamtzahl der Ausgabeinstanzen. Nachdem das neuronale Netzwerk über eine definierte Anzahl von Epochen trainiert wurde, werden die erlernten Darstellungen aus dem Featurespace auf den Induktionsklassifikator übertragen, um zwischen Malware und harmloser Software zu unterscheiden.
Der vorgeschlagene Artificial Neuronal Classifier (ANC) fungiert als hybrides Framework, das die Feature-Learning-Fähigkeiten eines künstlichen neuronalen Netzwerks (ANN) mit den Entscheidungsstärken traditioneller Induktionsklassifikatoren wie Random Forest und Decision Tree kombiniert. In diesem Design verarbeitet das ANN zunächst die ausgewählten Merkmale, die vom Autoencoder erhalten werden, um komplexe Muster und Korrelationen zwischen Eingabeattributen zu lernen. Die resultierenden erlernten Darstellungen werden dann an den Induktionsklassifikator weitergegeben, der die endgültige Klassifikation der Android-Anwendungen als gutartig oder bösartig durchführt. Auf diese Weise fungiert das ANC als Wrapper, das konventionelle Klassifikatoren mit tiefen Merkmalseinbettungen verbessert und gleichzeitig deren Interpretierbarkeit bewahrt. Dieser hybride Mechanismus ermöglicht es dem ANC, sowohl die hochrangige Feature-Abstraktion aus dem ANN als auch robuste Entscheidungsfindung durch etablierte Machine-Learning-Klassifikatoren zu nutzen, was zu einer verbesserten Erkennungsgenauigkeit und Verallgemeinerung führt.
Experimenteller Aufbau
Ein 64-Bit-Windows-10-Betriebssystem mit einem i5-Prozessor – 2,30 GHz, 8 GB RAM und einer 2-TB-Festplatte – wurde im experimentellen Setup verwendet. Python 3.7 wurde als Programmiersprache verwendet, und die Jupyter-Plattform wurde eingerichtet, um maschinelles Lernen und Deep-Learning-Pakete zu ermöglichen.
Der IEEE Dataport lieferte die API-Aufrufsequenzdaten des Experiments, die 43.876 Sequenzen umfassten – davon wurden 42.797 als Malware und 1.079 als Goodware klassifiziert. Virus Total wurde zur Verifikation verwendet, und die Cuckoo Sandbox-Umgebung wurde für die Datenerhebung genutzt. Tabelle 1 bietet eine umfassende Erklärung der API-Aufrufsequenzen.