学習した特徴表現と従来の分類器を活用し、検出精度を高め、手動の特徴設計を削減し、進化するマルウェア脅威に効果的に対抗するハイブリッド型Androidマルウェア検出フレームワークが提案されています。
研究記事
学習した特徴表現と従来の分類器を活用し、検出精度を高め、手動の特徴設計を削減し、進化するマルウェア脅威に効果的に対抗するハイブリッド型Androidマルウェア検出フレームワークが提案されています。
マルウェアセキュリティインテリジェンスは、アプリケーションとそのメタデータを分析し、潜在的なセキュリティ脅威を特定することを含みます。アプリケーションプログラミングインターフェース(API)呼び出しは、マルウェア検出のための貴重な情報源となります。マルウェア分析における機能量の削減は、脅威識別の効率を高めます。本研究は、Androidマルウェア検出の精度を高めるために最も重要なAPI呼び出し機能を特定することを目的としています。3つの群れ知能に基づく最適化手法—ホタル最適化、カッコウ探索最適化、アリコロニー最適化—がオートエンコーダと併用され、最も重要な特徴を抽出しています。これらの自然に着想を得たラッパーベースの手法を評価するために、K近傍(KNN)、ランダムフォレスト(RF)、サポートベクターマシン(SVM)、意思決定木(DT)、線形回帰(LR)などの人気の機械学習分類器が用いられています。さらに、ハイブリッド人工ニューラル分類器はマルウェア分類の性能を向上させることが示されています。提案された方法の有効性は、100のAPI呼び出し機能のうち7つのみを用いた実験結果によって示されており、98.87%の精度が示されています。
最も人気のあるモバイルOSはAndroidで、Linuxをベースにしており、世界市場シェアは72.55%です。厳しい法律や著作権の対象となる他のオペレーティングシステムとは異なり、Androidは世界中の開発者からの貢献を歓迎するオープンソースプラットフォームです。しかし、ユーザーベースが大きいため、ウイルス攻撃は頻繁に襲われます。マルウェアとは、コンピュータシステムの動作を侵害したり、個人情報を悪用することを目的とした悪意のあるソフトウェアのことを指します。Androidエコシステムにおけるマルウェア侵入の最も一般的な方法はアプリのダウンロードです。信頼できるソースから入手したアプリケーションは一般的に安全ですが、未検証または悪意のあるプラットフォームからダウンロードされたものには有害なソフトウェアが含まれている可能性があります。サイバー犯罪者はしばしばデバイスのセキュリティ脆弱性を悪用し、マルウェアを展開してその完全性を侵害します。
ユーザー数が増加し続けるにつれて、サイバー攻撃者がアクセスできる貴重なデータの量も増加しています。攻撃者はこれを悪用し、公式のモバイルアプリマーケットプレイスで悪意のあるアプリケーションを配布することもあります。一度無防備なユーザーがアプリをインストールすると、誤って攻撃者にデバイスへのアクセス権を与えてしまいます。このような脅威の増加を踏まえ、高度なマルウェア検出技術は膨大な数の悪意あるアプリケーションに対抗するために不可欠です。Androidマルウェア6.7を予測するために既存の技術がいくつか開発されています。しかし、これらの手法は主にシグネチャベースの検出に依存しており、アプリケーションコード内に埋め込まれたデジタル痕跡を特定することを指します。これらの署名はソフトウェアのAndroid Package Kit(APK)から抽出され、既知の敵対的パターンのデータベースと照合されます。この方法はすでに報告されたマルウェアの検出には成功しますが、まだデータベースに追加されていない新たな脅威を認識することはできません。8
マルウェアが増加し、マルウェアの普及が増える中で、さまざまなタイプのマルウェアを正確に検出しつつ、時間と計算資源を最適化できるソリューションを開発することが極めて重要です。Androidスマートフォンでのマルウェア検出を改善するために、多くの作業が行われてきました。従来の署名ベースの検出技術は、APKファイルの署名と、特定されてデータベースに保存された悪意のある署名と照合します。しかし、この方法はまだ発見されていないマルウェアには適用されず、より高度な検出システムの必要性を強調しています。
この記事が検証しようとしている仮説は、疑わしいAPI呼び出しを特定し、無害かつ悪意のあるAndroidアプリケーションの分類精度を向上させること。オートエンコーダと人工ニューラルネットワークを統合したハイブリッド分類モデルの開発と実装。群知能最適化のための目的関数を定式化し、学習プロセスを強化することで、ほぼ最適解の発見を促進するペナルティを導入します。複数のパフォーマンス指標を検討し、Androidマルウェア予測に最適な方法を選択します。
関連活動
Androidプラットフォームの広範な利用によりマルウェアの多様性と量が著しく増加し、研究者たちは効率的な検出・防止技術の開発に取り組んでいます。統計研究を通じて、DeckardとRasoolzadegan16はAndroidマルウェア検出における不均衡なデータセットの問題に取り組みました。データの前処理とバランス調整のために、合成少数派過剰サンプリング技術(SMOTE)、過小サンプリング、ランキング技術を用いました。KNN、SVM、反復二分法3(ID3)分類器を用いて、SMOTEアプローチとKNN分類器16を組み合わせた際に検出モデルは98.69%の高精度を達成しました。
Androidマルウェア識別のための用語頻度逆文書頻度(TF-IDF)の使用は、PriyaとVisalakshi17 によって別の研究で調査されました。彼らは許可を採点・採点するための許可採点器を作成し、その後人工ニューラルネットワークを使って分類しました。この方法は既存のシステムを94.22%の精度で上回る性能を示しました。さらに、線形回帰に基づくAndroidマルウェア分類性能向上のため、Yildizらによって特徴選択手法が考案されました。この方法は訓練時間を短縮し、精度を96.1%向上させました。Androidマルウェア検出の精度と効率を高めるために、本研究は特徴選択や不均衡なデータセットといった課題に取り組む重要性を強調しています。
再帰的特徴選択(RFS)とアンサンブル分類器は、Al Sarahらが提示したモデルでAndroidマルウェア検出を改善するために用 いられました。この手法では、LightGBMアルゴリズムを用いてRFSが特定した最も関連性の高い特徴を分類します。実験の結果、モデルは99.5%の分類精度で効果的であることが示されました。Androidマルウェアの分類に関しては、Dingら20 も畳み込みニューラルネットワーク(CNN)を用いたディープラーニングアーキテクチャを提案しました。その過程で、Android APKからバイトコードファイルが抽出され、二次元のバイトコード行列に変換されます。これらの行列はCNNモデルの訓練に用いられ、実験では95.1%の精度を達成しました。本研究は、ディープラーニングモデルと特徴選択技術をアンサンブル分類器と組み合わせることで、Androidマルウェア検出システムの精度を高める方法を強調しています。
ディープラーニング技術を用いることで、ElayanとMustafa21 は、更新されたAndroidシステムにおける従来のマルウェア検出手法の欠点を克服しました。彼らは、ゲーテッド・リカレント・ユニット(GRU)を用いて悪意のあるアプリと無害なアプリを区別し、従来の手法を上回る成功率を上げ、98.2%の精度を達成しました。分析階層プロセス(AHP)は、Arifらによって提案されたリスクベースのファジィ技術(モバイルウイルス検出)にも統合されました。マルウェアの特定に加え、システムはリスクレベルを評価し、極低、低、中、高の4つのグループに分けています。この徹底した手法により、全体の精度は90.54%に達しました。ファジーAHPフレームワークやGRUベースのディープラーニングモデルのような高度な機械学習手法が、Androidマルウェア検出システムの精度と回復力を向上させる効果がこれらの研究で示されています。
シグネチャベースの手法の欠点を克服するため、MercaldoとSantone23 は音声信号処理技術を用いて、アプリケーションの実行ファイルから数値情報を抽出し、それらをオーディオファイルに変換しました。彼らの手法はニューラルネットワーク分類器を用い、検出精度は95.2%に達しました。骨の折れる特徴工学に伴う困難を克服するために、Zhangらはテキスト分類技術を用いた自動フレームワークTC-Droidを提示 しました。96.6%の精度で、この手法は畳み込みニューラルネットワークを用いてアプリケーション解析レポートのテキストシーケンスを解析します。
Imtiazらは93.4%の精度で、Androidマルウェアの効果的な分類と早期検出を目的とした人工ニューラルネットワークベースの技術DeepAMDを発表 しました。Firdausら26 は、Androidマルウェア検出における静的解析のための遺伝子検索ベースの特徴選択技術を開発しました。95%の精度で、関数木はテストにおいて他の機械学習分類器を上回る性能を示しました。特徴選択法Delta_IDFはPeynirciらによって提案されました。APKファイル内の文字列出現に基づいて逆のドキュメント頻度値を計算します。他のアルゴリズムと比べて、彼らの実験は有望な結果を生み出しました。
Shiら28 は、特徴抽出と分類のために畳み込み層と高密度層の強みを組み合わせることで高い検出精度を示すハイブリッドCNN-DNNフレームワークを提案しました。同様に、ShuらはCNNベースのAndroidマルウェア検出手法に関する包括的な調査を提供し、 APIおよびオペコードシーケンス内の空間依存関係を捉える強みを強調しました。モノのインターネット(IoT)の文脈では、Naeemらはマルウェア分類のための深層畳み込みネットワークのスタックアンサンブルを開発し、 異種なIoT脅威環境間での堅牢性を向上させました。最近では、ShuとDong31 がLG-PNを導入しました。これは、プロトタイプネットワークにおける局所・グローバル融合アプローチで、これまで未発見のAndroidマルウェアの検出を強化するためのものです。これらの手法は顕著な成功を収めましたが、主に深い畳み込みアーキテクチャに依存し、膨大な計算資源を必要とします。これに対し、本研究は群知能とオートエンコーダベースの特徴選択を統合し、次元を低減し効率を向上させ、深層CNNベースの解法に対する補完的かつ軽量な代替手段を提供しています。
これまでのいくつかの研究では、APIコールベースのAndroidマルウェア検出に特化しており、APIシーケンスは悪意のある活動の強力な行動指標となっています。例えば、KarbabらはAPIメソッド呼び出しのシーケンスに対するディープラーニングを用いて 悪意のあるアプリケーションを特定し、API使用における時間的パターンがマルウェアと無害なアプリを効果的に区別できることを示しました。同様に、MuzaffarらはAPI呼び出し機能に関する様々な機械学習モデルを評価し 、検出性能向上における特徴選択と表現の重要性を強調しました。これらの研究はAPIレベルの機能の有用性を強調していますが、多くは深い配列モデルや手作業による特徴量エンジニアリングに依存しており、これらは計算コストが高く、汎用化が難しい場合があります。対照的に、本研究は群知能アルゴリズムとオートエンコーダを組み合わせてAPIの特徴次元を自動的に低減し、その後ハイブリッド人工ニューロン分類器を用いて検出性能を向上させています。これにより、私たちのアプローチは高次元のAPI呼び出しデータの課題に直接対応する軽量かつ効果的な代替手段として位置づけられています。
人工ニューラルネットワーク(ANN)の統合を通じて、本研究で提案された手法は、Androidマルウェアの検出と分類の向上を目指しています。まず、オートエンコーダはラッパーベースの特徴選択技術で使われ、危険なアプリと無害なアプリを区別する最も重要な特徴を見つけ出します。Androidマルウェア分類の効果を高めるために、ANNと誘導分類器を組み合わせた独自の人工ニューロン分類器が評価されます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
図 1に示すように、Androidマルウェア検出の提案アーキテクチャでは、自動エンコーダを用いたラッパーベースの機能選択方法が使用されています。データセットは70:30のトレーニングおよびテストのサブセットに分割されています。分類と特徴選択はマルウェア分析プロセスの二大主要ステップです。
機能選択(FS): このステップは、群知能ベースのアルゴリズム、特にカッコウ探索最適化(CSO)、アリライオン最適化(ALO)、ファイアフライ最適化(FO)を用いて、最適な特徴部分集合を反復的に探索することです。その後、オートエンコーダが選択した特徴を処理し、入力データの圧縮表現を生成します。誘導法では、オートエンコーダの出力を用いて、これらの特徴が危険なアプリと無害なアプリをどれだけ区別できるかを評価します。後続のケースを正確に分類できるように、帰納法は特徴空間をクラスラベルの集合に写すことで分類器を構築します。
分類: 提案された人工ニューロン分類器(Artificial Neuronal Classifier)とよく知られた誘導法を用いて、特徴選択段階で削減された特徴セットをこの段階で評価し、Androidマルウェアをどれだけ効果的に検出できるかを検証します。
高度な分類手法を用い、最も情報的な特徴に集中することで、この手法はAndroidマルウェア検出の正確性と効率を向上させようとしています。
特徴選択
機械学習の重要なステップは特徴選択であり、これはモデル構築において最も信頼性が高く、関連性があり、冗長でない特徴を特定することを意味します。データセットの規模と複雑さが増し続けるにつれて、特徴セットを体系的に削減することがより重要になります。特徴選択の主な目的は、計算コストを削減しつつモデルの性能を最大化することです。重複的で不要な特徴が排除され、モデルにとって最も重要な変数に集中できるようになります。重要な特徴を特定するために機械学習アルゴリズムに頼る代わりに、モデルトレーニング前に特徴選択を行う利点は以下の通りです。
簡略モデル: 入力変数の数を減らすことで、より解釈しやすく理解しやすいモデルが生まれます。
分散削減: 本質的な特徴に焦点を当てることで、特徴選択はモデルの分散を低減し、過学習を軽減し、新しいデータへの一般化を強化します。
トレーニング時間の短縮: より少ない特徴セットは計算負荷を軽減し、モデルの訓練と評価を高速化します。
次元の呪いの緩和: 高次元データは複雑さの増加や過学習などの課題をもたらすことがあります。特徴選択は、特徴空間を最も情報量のある変数に限定することでこれらの問題に対応します。
特徴選択の定義1
誘導器Iと、ラベル付きインスタンス空間上の分布Dを持ち特徴量(x1,x 2,x 3,... ,xn)を含むデータセットDを考えてみてください。分類器C=I(D)の精度を最適化する特徴の部分集合は最適特徴部分集合Xoptとして知られています。
教師なし特徴選択において、ラッパーベースのアプローチはモデルのパフォーマンスを向上させる最適な特徴の組み合わせを特定することを目指します。これらの手法は、しばしば貪欲なアルゴリズムを使って体系的な特徴の追加・削除を通じて、さまざまなモデルを評価し、モデル開発に最も影響を与える特徴を選択します。この過程は 図2に示されています。
特徴選択には、Firefly Optimization(FO)、Cuckoo Search Optimization(CSO)、Ant Lion Optimization(ALO)などの群知能アルゴリズムが用いられ、従来の強欲な戦術を上回ります。適合度評価段階で選択される目的関数は、これらのアルゴリズムの有効性に大きな影響を与えます。選択された特徴量と各反復終了時のモデルの誤差の両方が、反復ラッパーベースの特徴選択手法で考慮され、選択された特徴の適切性を評価します。式(1)はこの評価を形式化しています。
(1)
適応度評価中の誤りに対する学習アルゴリズムのペナルティは、この式のτで表され、τ ∈ [0,1]です。選択された特徴部分集合の長さは変数lで表され、特徴の総数は変数uで表されます。
オートエンコーダ
入力データの圧縮表現を学習することを専門とするニューラルネットワークはオートエンコーダと呼ばれます。エンコーダーとデコーダがその主要な二つの部品です。デコーダがこの圧縮された形から元の入力を復元しようとしている間、エンコーダは入力データを処理し、潜在空間表現に圧縮します。機械学習モデルの訓練は、エンコーダが未処理データから学習後に価値ある特徴を抽出できるため容易になります。
提案されたオートエンコーダアーキテクチャ( 図3参照)は、N個のノードを持つ入力層と、それぞれN*2およびN個ノードを含む2つの隠れ層からなるエンコーダで構成されています。潜在的な空間と呼ばれるN/2ノードの隠れ層が存在します。[N, N*2]ノードの2つの隠れ層を持つデコーダはこの構造を再現し、最終的にNノードの出力層を形成します。
各隠れ層の後にはバッチ正規化が行われ、学習プロセスを高速かつ安定化し、すべての層はLeakyReLUの活性化関数を使って、潜在的なゼロ勾配問題を処理します。式(2)はLeakyReLU活性化関数の数学的定義を示しています:
(2)
ここで hθ(x) は式(3)を用いて得られます。
(3)
ここで、xi=(x1,x 2,...,xn)はノードへの入力値を表し、wi=(w1,w 2,...,wn)はこれらのノードに関連付けられた重みを表します。学習過程では、重みは最初にランダムに割り当てられた後、[0,1]の範囲内で調整されます。パラメータが原点を通過するのを防ぐために、各層にバイアス項が追加されます。式(4)が閾値を定義し、式(3)の出力が閾値を超えるとノードがトリガーされます。
(4)
アリライオンラッパーに基づく特徴選択最適化(ALWFSO)
アリライオンの自然な捕食行動をモデル化したアリライオン最適化装置(ALO)は、セイエド・アリ・ミルジャリリ34によって初めて発表されました。この最適化アルゴリズムは、初期パラメータ値に関係なく最適解を効率的に識別します。ALOは迅速な収束を示し、整数制約と離散制約の両方を効果的に管理します。獲物の捕獲、罠の作成、アリの捕獲、ランダムなアリの移動、罠の修理が、ALOの狩猟プロセスを構成するステップです。
Ant Lion Optimizer(ALO)アルゴリズムの文脈では、アリは解空間内でランダムな探索を行う候補解を表し、アントライオンは適応度値に基づいてアリの動きに影響を与える罠やガイドに対応します。この二重集団は、アリを捕らえるアンリライオンの自然な捕食行動をモデル化しています。最初は、アリとアリライオンの両方の個体群がランダムに初期化されます。アントリオンはルーレットホイール選択機構で各アリごとに選ばれ、その後ランダムウォークプロセス(アルゴリズム1参照)が行われます。式(5)はこの歩行がどのように正規化されるかを記述します。
(5)
最初は、アリとアリライオンの個体数がランダムに形成されます。ルーレットホイール機構でアントライオンを選び、あらかじめ決められた式で正規化されたランダムウォークを可能にします。このプロセスにより、アリの動きはアリライオンの位置に影響され、自然な狩猟過程を効果的にシミュレートします。この相互作用に基づいて各アリの位置が更新され、最適な解へと探索を導きます。
そのアーキテクチャにより、ALOアルゴリズムは複雑な探索空間を効果的に移動でき、さまざまな最適化課題を解決する強力なツールとなっています。各リプトの適応度は、各反復の最後に評価されます。アルゴリズム1で示されているように、アリが相手よりも適応力が高い場合、アリライオンはアリに置き換えられます。この場合、
は反復tにおけるi番目の 蟻の位置を示します。Iは比率であり、
は反復tにおける第j番目のアントリオンの位置を示します;
は反復t時のランダムウォークのエリートであり、ルーレットホイールによって選ばれます。
は反復tにおけるアリライオンのランダムウォークであり、これもルーレットホイールによって決定されます。各サイクルが終了すると、積分ラッパー分類器によって確認されたグローバル最適解が返されます。
アルゴリズム1:ALWFSO
目的関数を定義します:f(x):x=(x1,x 2,...,xd)
アリとアリライオンのコロニーをランダムに初期化する
アリとアリグリオンの適応度計算
最高のアリライオンを選び、彼らがエリートだと仮定しましょう。
終了条件が満たされるまで繰り返します。またはf(x):x=(x1,x 2,...,xd)
各アリとアリの選択について:ルーレットホイール選択機構を使い、アリの動きに影響を与える確率的にアリを選びます
X(t) = [0,cum_sum(2r(t1) - 1),cum_sum(2r(t2) - 1),...,cum_sum(2r(tn)-1)]


アントループの終わり
適応度評価:すべてのアリの新しい位置に基づいて適応度値を再計算します。
アリが優れた適応力を示した場合は、アリに置き換えてください
もしアリライオンがより健康になるなら、

終了
Cuckoo検索ラッパーベースの特徴選択最適化(CSWFSO)
他の宿主の巣に卵を産みつけるカッコウの寄生行動に触発され、Xin-She YangとSusah Deb35 は2009年にカッコウ検索アルゴリズムを作成しました。この手順では、カッコウがランダムに選ばれた巣に卵を産みます。将来の世代は最高の卵を持つ巣を受け継ぐでしょう。宿主の鳥が異星人の卵を見つける確率はゼロで、アクセス可能な宿主の巣の数は限られています。
アルゴリズム2:CSWFSO
目的関数の定義:f(x):x = (x1,x 2,...,xd)
ランダムにn個のホストネストの初期集団を生成し、それぞれが候補解xi に対応する(i=1,2,3,...,n)
停止条件が満たされるか(tランダムに選ばれたカッコウiに対して、レヴィフライトを用いて新しい候補解を生成します。

新たに生成された解の適合度を計算します Fi [最大化のために、Fi α f(xi)]
集団nからホストネストjをランダムに選択します。
もし (Fi >Fj) ならば、j は新しい解に置き換えられます
終了
より悪いネットの一部を(pa)の割合で放棄する
新しい巣は放棄された分割(p)に作られます。 
最良の解決策や巣を取っておきましょう。
ランキングを通じて、現在利用可能な最適な巣やソリューションを選びましょう。
次世代は現在利用可能な最高のソリューションを受け継ぎます。
終了
最初は、すべてのネストがランダムに初期化されます。反復が進むにつれて、各カッコウはアルゴリズム2に示されたようにレヴィ飛行を通じて解空間内での位置を変化させます。ステップサイズは∝で調整され、シグモイド演算によりCuckoo Search Optimization(CSO)で生成された連続値を2進形式に変換します。これは式(6)および(7)に示されています。
(6)
(7)
アルゴリズム2で示されているように、
と
はランダムに選ばれたネストであり、δ ∈[0,1]。各反復の終わりに、いくつかのネストは放棄され、新しい候補解で更新されます。
カッコウの寄生性に触発されたカッコウ検索最適化(CSO)アルゴリズムは、特徴選択タスク35に有用なツールであることが証明されています。この手法は、ラッパーベースのCSO特徴選択の文脈で可能な解決策を表すネストの集団を初期化することから始まります。これらの巣の適性を評価するために、あらかじめ設定された目的関数が用いられます。適応度評価を用いて、アルゴリズムは各反復で最適解(グローバルベスト)を決定します。解空間をよりよく探求するために、エンドウで表される巣の一部を捨て、CSOプロトコルに従って新しいものに置き換えます。組み込みラッパー分類器は、すべての反復が完了した後にアルゴリズムがグローバルに最適な答えを導き出すことを確認しています。
Fireflyラッパーベースの特徴選択最適化(FWFSO)
アルゴリズム3:FWFSO
目的関数を定義します:f(x):x = (x1,x 2,...,xd)
最初の群れを生成します。n匹のホタルはそれぞれ解 xi(i = 1,2,3,...,n)を表します
目的関数の値に基づいて各ホタルの光強度Iを決定します
光の吸収係数を定義するγ
停止条件を満たすか(t各ホタル i(∀ i=1,2,3,... ,n)
すべてのホタル j に対して (∀ j=1,2,3,... ,i)
Ii と I j の光の強度を得てください
もし私が<ならj


そうでなければ
ホタルiをランダムに動かして探索空間を探索します
終了
引力は距離とともに減少します。 
更新された解決策を評価し、ホタルの強度を適切に調整してください
終わり
終わり
蛍の光強に基づいてランク付けし、最も明るいものを現在の最良の解と特定しましょう
ジョージ・リンドフィールドとジョン・ペニーによって導入されたFirefly最適化アルゴリズム(36)は、ホタルの自然な行動を模倣して他者を引き寄せます。このアルゴリズムでは、ホタルの魅力は明るさに比例し、2匹のホタル間の距離は魅力に反比例します。近くに明るいホタルがいなければ、ホタルはランダムに動きます。
2匹のホタルは明るさで互いに引き寄せられます。明るくないホタルは明るいホタルに引き寄せられます。明るいホタルがいない場合、ランダム移動が使われます。β0が美しさを示し、2匹のホタル間の距離r=0を用いてその魅力を計算します。ホタルjとkのrjk分離は次のように計算されます。
ここでrjiとrkiは、ホタルjthとkthのi次元空間成分を脇に置き、nは次元数を表します。ホタルが他のホタルに向かう動きは、その間の引力の度合い(
)によって決まります。この式において、rj は蛍jの現在の位置であり、γは光。ラナードは0から1の間の乱数、αは突然変異率、吸収係数です。もし輝くホタルがもういなければ、ホタルはααに従ってランダムに動きます。各反復の後、埋め込みラッパー分類器はグローバルな最小解を検証し、それを返します。
分類器
構造化データセットと非構造化データセットの両方は、離散的なグループやクラスに分けて分類できます。目標は、新しいデータポイントの属性を使ってそのクラスやラベルを予測することです。この手順は、入力変数から離散出力変数への写像関数を近似することで、新しいデータが属するカテゴリを決定します。
ランダムフォレスト、決定木、K近傍、ロジスティック回帰、サポートベクターマシンなどが、提案されたAndroidマルウェア検出ソリューションを評価するために用いられる帰納法または分類アルゴリズムの一部です。さらに、本研究では従来の誘導アルゴリズムと人工ニューラルネットワークを組み合わせた革新的なハイブリッド分類器である人工ニューロン分類器を提示しています。
人工ニューロン分類器
提案されている人工ニューロン分類器(ANC)設計は、誘導分類器と人工神経ネットワーク(ANN)を組み合わせたもので、 図4に示されています。このアーキテクチャに基づき、ANNは入力特徴間のパターンや相関を識別することを教えられます。誘導分類器は、ANNが学んだ情報を活用し、悪意のあるソフトウェアと安全なソフトウェアの識別精度を向上させます。
広範なテストの結果、ANC内のANNは、入力層に続くMノードを持つ3つの完全接続の隠れレイヤーで構成され、Nノードの入力層に続きました。さらにM/2ノードを持つ完全接続の隠れ層の後に、帰納分類器に接続された出力層があります。式(8)は隠れ層のノード数を決定します。
(8)
ここでMは隠れ層内のノード数、Nは入力特徴数、αは2から10の範囲のパラメータを表します。活性化関数(式(9)に示されているように)は、出力が指定された閾値を超えた場合に依存するニューロンが活性化されるかどうかを決定する上で重要な役割を果たします。
(9)
ここで、hθ(x) は式(3)に従って計算されます。ANCはAdamオプティマイザーを利用してネットワークの重み付けと学習率を調整します。アダムでは、各重みωijに対する第一モーメント推定
と第二モーメント推定
の崩壊率はそれぞれβ1とβ2で表されます。Nを学習率を表すとする。アダムの更新ルールは式(10)および式(11)に示されています。
(10)
(11)
バイアス補正された第一モーメントおよび第2モーメント推定値、
および
は式(12)および式(13)を用いて計算されます。
(12)
(13)
これらの計算により、オプティマイザーが各重みに対して適切な学習率を維持し、ANCの効率的かつ効果的なトレーニングが可能となります。
ニューラルネットワーク内の各接続の重み更新ルールは式(14)によって定義されます:
(14)
ニューラルネットワークの重み付けを更新した後、予測された出力と実際の出力の不一致を測定する損失関数を用いてパフォーマンスを評価します。このモデルでは、式(15)で定義された平均絶対誤差(MAE)がこの目的のために用いられています。
(15)
この文脈では、yi は実際の出力を表し、
は予測出力、n は出力インスタンスの総数を表します。ニューラルネットワークが一定数のエポックにわたって訓練された後、特徴空間から得られた表現は帰納分類器に転送され、マルウェアと無害なソフトウェアを区別します。
提案された人工ニューロン分類器(ANC)は、人工ニューラルネットワーク(ANN)の特徴学習能力と、ランダムフォレストや意思決定木などの従来型誘導分類器の意思決定能力を組み合わせたハイブリッドフレームワークとして機能します。この設計では、ANNはまずオートエンコーダから得られた選択された特徴を処理し、入力属性間の複雑なパターンや相関を学習します。得られた表現は帰納分類器に渡され、最終的にAndroidアプリケーションを良性か悪意か分類します。このようにして、ANCはラッパーとして機能し、深い特徴埋め込みで従来の分類器を強化しつつ、その解釈可能性を保ちます。このハイブリッドメカニズムにより、ANCはANNからの高レベル特徴抽象化と既存の機械学習分類器による堅牢な意思決定の両方を活用でき、検出精度と一般化の向上につながります。
実験装置
実験的なセットアップには、i5プロセッサ(2.30 GHz、8 GB RAM、2 TBハードドライブ)を搭載した64ビットのWindows 10オペレーティングシステムが使用されました。プログラミング言語としてPython 3.7が使用され、機械学習や深層学習パッケージを可能にするためにJupyterプラットフォームが構築されました。
IEEEデータポートは実験のAPIコールシーケンスデータを提供し、43,876件のシーケンスを含み、そのうち42,797件がマルウェアに分類され、1,079件がグッドウェアに分類されました。検証にはVirus Totalが使用され、データ収集にはCuckoo Sandbox環境が使用されました。 表1は APIコールシーケンスの包括的な説明を提供しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案されているAndroidマルウェア検出システムでは、平均二乗誤差(MSE)、平均二乗根誤差(RMSE)、精度、リコール、F1スコア、精度などの複数のパフォーマンス指標が分類精度の評価に用いられています。以下はこれらの指標の定義です。


アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
Androidマルウェアの脅威は増加しており、敵対者はますます高度な回避手法を用いています。Androidベースのモバイルシステムやアプリケーションは、スマートシティや産業環境において重要な役割を果たしています。これらのシステムのセキュリティを確保するには、特に重要な領域において堅牢なマルウェア検出メカニズムが必要です。最近、機械学習に基づくマルウェア検出研究が大きな注目を集めています。しかし、多くの既存の手法は特徴工学17に依存しており、これは特徴解析とシミュレーション経験に基づく選択を必要とする労力集約的なプロセスです。したがって、特徴選択と検出性能の継続的な進歩が不可欠です。
本研究は特徴選択の最適化のためのオートエンコーダを用いた次元削減アプローチを探ります。特徴パターンを調べるために、まず全特徴セットをオートエンコーダで処理します。最も重要な特徴を見つけるために、ラッパーベースの特徴選択技術を用いて情報を取得し...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
利益相反や外部からの影響はこの研究の結果に影響を与えませんでした。提示されるすべての方法、結果、解釈は独創的かつ偏りのないものです
この活動を支援してくださったガイドとKLUに心から感謝申し上げます。彼らの指導、フィードバック、そして励ましは、このプロジェクトの発展において非常に貴重でした。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| アナコンダ・ナビゲーター | アナコンダ社 | ナビゲーター-2023 | |
| Google Colab | Google LLC | 該当なし | |
| ジュピター・ノートブック | プロジェクト・ジュピター | 該当なし | |
| パイソン | Pythonソフトウェア財団 | >=3.9 | |
| パイトーチ | FacebookのAI研究 | >=2.0 | |
| Scikit-learn(シキット学習) | コミュニティ主導 | >=1.0 | |
| テンソルフロー | Google Brain | >=2.8 | |
| Windowsオペレーティングシステム | マイクロソフト・コーポレーション | 11 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト