本研究は、IoT環境における攻撃を検出するために畳み込みニューラルネットワーク(CNN)とトランスフォーマーを組み合わせたハイブリッドディープラーニングモデルを提示します。CIC-IoT-2023データセットを活用し、モデルは99.97%の精度と0.0123の損失という高性能指標を達成し、リアルタイム攻撃検出における有効性を示しました。
研究記事
本研究は、IoT環境における攻撃を検出するために畳み込みニューラルネットワーク(CNN)とトランスフォーマーを組み合わせたハイブリッドディープラーニングモデルを提示します。CIC-IoT-2023データセットを活用し、モデルは99.97%の精度と0.0123の損失という高性能指標を達成し、リアルタイム攻撃検出における有効性を示しました。
モノのインターネット(IoT)デバイスの急速な発展により、接続性とアクセス性が向上しています。それでも、これらの環境の相互接続性の高まりは新たな脅威レベルをもたらし、堅牢な異常検出が求められています。本研究では、IoTネットワークに関連する特定の脅威を軽減するために、ディープラーニングに基づく新しいセキュリティ手法を提示します。提案されたアプローチは、ディープニューラルネットワークを用いてネットワークの活動パターンを効率的に監視し、リアルタイム通信における潜在的な脆弱性を検出します。本研究では、IoTネットワークにおける攻撃検出および分類のためのハイブリッドCNN-トランスフォーマーモデルを提案しています。このアプローチを作成・検証するために、CIC-IoT-2023データセットを分析しました。このデータセットには7つの異なるカテゴリーにまたがる33種類の異なるIoT脅威タイプが含まれています。実験結果は、提案モデルが精度99.96%、リコール率99.96%、F1スコア99.96%、精度99.97%、損失0.0123で非常に優れた性能を発揮していることを示しています。さらに、提案されたモデルは計算時間とリソース消費に基づいて分析され、高い精度を維持しつつ計算複雑さを最小限に抑えつつ攻撃の検出と分類に有効であることが示されています。
モノのインターネット技術は近年大きく進歩し、私たちは高度に相互接続されたデジタルの世界に入りました。現在、医療、農業、交通、航空宇宙、生産など、多くの異なる産業がモノのインターネット(IoT)デバイスを活用しています。著名な専門家は、モノのインターネット(IoT)および関連アプリケーションが2025年までに世界経済に大きな影響を与えると予測しており、年間の影響は3.9兆ドルから11.1兆ドルに及びます。一方で、この完璧な接続のために新たなセキュリティ関連の課題が生じます。IoTデバイスが進化するにつれて、サイバー攻撃に対してますます脆弱になっており、不正アクセスや攻撃を防ぐことが求められています。多様なデバイスが存在する環境では、一部の機器は他のものよりも攻撃に対して脆弱です。これらのデバイスはモノのインターネットシステムのセキュリティに影響を与えるだけでなく、システムの一部である伝送チャネルにも影響を及ぼし、場合によっては伝送ネットワークの一部または全体が故障する原因となることもあります。機械学習(ML)と深層学習(DL)は人工知能(AI)の二つの分野であり、医療システム4、コンピュータビジョン5、無線通信6、ネットワークセキュリティ7など、いくつかの分野で大きく改善してきました。これらの進歩は、それぞれの技術の進歩によって可能となりました。モノのインターネットに関しては、ディープラーニングや機械学習に依存する侵入検知システムを設置するのが一般的な慣行です。
提案される侵入検知システムは、ネットワークトラフィックを異常なデータフローでスキャンし、最近取得した無害な情報を含むパケットを処理します。これにより、システムは革新的な攻撃を特定できます。侵入を検出するためには、シグネチャーベースのアプローチと異常ベースの2つのアプローチが用いられます。シグネチャに依存する侵入検知方法の一つは、ネットワーク内のパケットトラフィックをチェックし、既知の攻撃のシグネチャと指定された値と比較することです。これはネットワーク内の脆弱性を特定するために行われます。異常に基づく手法は、ユーザーにとって真正とみなされたパラメータから逸脱したユーザーパラメータを記録することで攻撃を特定するために用いられます。したがって、攻撃の検出を改善するために、本研究はトランスフォーマーと畳み込みニューラルネットワーク(CNN)を組み合わせた深層学習モデルを導入します。より詳細な非線形表現を可能にする多空間特徴部分セットを作成するために、提案モデル内のCNN成分を用いて元のデータを複数の部分空間に変換します。その後、特徴の関連付けが最終化され、詳細な特徴などのより深い特性はトランスフォーマーコンポーネントを用いて抽出されます。最終的に、softmax関数は特徴とラベル間の関係を築きます。提案されたアプローチは、CNNアプローチとトランスフォーマーモデルの最良の特徴を組み合わせることで、攻撃検出において優れた性能を示しています。
以下に、本研究の主な目的を紹介します。(i) モノのインターネット(IoT)における異常検出のための高度なフレームワークを構築すること。このフレームワークにより、ハッキングや侵害された異種IoTデバイスによって生成された悪意ある情報の検出能力が向上します。(ii) 本研究は、IoTに基づく異常を検出するためにデータセットから関連特性を抽出する効果的な方法を示しています。これらのデバイスに適用すると、攻撃検知の効果が高まります。(iii) 攻撃を特定するために、記事ではトランスフォーマーとCNNを用いた適応モデルを提示しています。このモデルは、ネットワークから発生するモノのインターネット環境への侵入を検出することを目的としています。(iv) CIC-IoT23セキュリティデータセットを用いて、提案モデルを多クラス分類技術でテスト・検証します。マルチクラス分類技術を用いて、評価ではIoTボットネットによる7つの攻撃と無害なトラフィックを効果的に区別しました。(v) いくつかの特徴を用いて、提案されたアプローチを現在の手法と比較する。この比較調査では、提案されたアプローチの方がIoT(モノのインターネット)への攻撃を特定する上でより優れており、成功していることが示されています。
提案されたハイブリッドCNN-トランスフォーマーモデルは、空間的特徴抽出と時間的注意を組み合わせているため、従来の署名および異常に基づくIDS手法よりも一般化と堅牢性に優れています。従来のML/DL手法よりも手作業の機能設計が少なく、精度とリコール率が向上します6,8。以前のハイブリッドモデル9,10はリアルタイムで変化に適応できませんでした。提案されたアプローチは、軽量アーキテクチャと最適化を用いることでこの問題を解決しています。
急速に拡大するIoTおよびそれに関連するセキュリティ課題の分野は、大規模な侵入検知研究を促しています。文献レビューは主要な研究成果とその貢献に焦点を当て、現在最先端とされる解決策をより深く理解することを目的としています。
NandanwarとKatarya11 によって、産業用IoT(IoT)環境におけるボットネット攻撃の検出と分類を目的として、適応型CNN-GRUアーキテクチャを用いたハイブリッドモデルが提案されました。
CCIC-IoT2023データセットを用いてF1スコア98.59%、正確率98.75%を記録し、Jonyら12 はサイバー攻撃パターンを成功裏に予測するLSTMベースのモデルを提案しました。本研究では 、IoTネットワークにおける偽データを検出・排除するための二値分類手法として、機械学習アンサンブル戦略が提案されました。このモデルは、異常を特定しゼロデイ攻撃を軽減するために勾配ブースティングマシンのアンサンブルを用いています。モデルの精度は98.27%に達しました。また、精度と呼び戻し率はそれぞれ96.40%と95.70%であり、重要なIoTアプリケーションに適しています。de Caldas Filhoらは、ネットワークベースとホストベースのIDSを組み合わせたハイブリッド侵入検知システム(IDS)を開発しました 。この統合型侵入対応システム(IRS)は、ゼロデイ脅威を積極的に検知し防止します。著者はまた、分散型の連邦学習システムを用いて深層学習を用いて異常を特定しました。このディープラーニングを用いたフェデレーショントレーニングと検出は、分散型IoTインフラにおいて89.753%の検出精度を達成しています。WangらはThreatInsightという脅威検出ツールを提示 し、システム監査ログの必要性を減らしました。ThreatInsightは、事実に基づく理論的推論手法を用いて攻撃者を特定し、属性を特定します。分析レポートを作成することで、サイバーセキュリティ保護システムの早期検知能力を向上させ、リアルタイムの分析を提供します。
Chaiら15 は、動的畳み込みを用いたマルウェア検出手法を提示し、特徴量とクラス特徴を適応的に抽出しました。著者は、二重標本分析に基づき、無関係な特性の影響を減らすためにサンプル相関を用いる動的活性化関数を提案しました。クエリサンプルとプロトタイプ間の距離は、マルウェアの識別に成功するためにメトリックベースの手法を用いて計算されます。実験的結果としては、この手法は既存の少数ショットマルウェア検出アルゴリズムに比べて大きな改善を示しています。Shahらは、二分分類による悪意あるユーザーを検出し、ブロックチェーン技術を用いた安全なデータ保存を活用し、IoTのセキュリティを強化するAI駆動のシステムモデルを提示 しています。分類のためのディープラーニングアルゴリズムを実装することで、ブロックチェーンスマートコントラクトの潜在的な悪用に対処し、最終的には様々なパフォーマンス指標で評価される包括的なセキュリティフレームワークを提供します。
LuoらはIoT(モノのインターネット)アプリケーション向けの新しいシステムEDL-WADSを導入 し、URLリクエスト表現のための特徴学習モジュール、多様なURLリクエスト表現のための3つのモデルを持つディープラーニングモジュール、アンサンブル分類器を用いたモデル結果統合の決定モジュール、そしてリアルタイム更新のためのファインチューニングモジュールの4つのモジュールで構成されています。EDL-WADSは、多様なデータセットでのテストにおいて、99.47%の精度、99.29%の真陽性率、99.70%の精度、0.0033の偽陽性率でベースラインモデルを上回りました。その制約には、SQLインジェクションやクロスサイトスクリプティング検出に重点を置いていること、そしてCNNモデルの性能低下が含まれていました。
TianらはURLを調べてウェブ上の攻撃を検出するための分散型深層学習手法を提示 しました。エッジデバイスに搭載され、ウェブ脅威を特定するよう設計されています。同時に2つのディープモデルを用いてシステムの実験を行い、さまざまなデータセットを用いて既存システムと比較しました。このシステムは、ウェブ攻撃検出において99.410%の精度、98.91%のTPR、99.55%の通常リクエスト検出率と競争力を持っています。
Chaiら19は、変分オートエンコーダを用いたデカップルドトレーニング手法を用いた破滅的な忘却と、クラスプロトタイピングに基づく動的境界線定技術を用いた正確な決定境界線区分を用いた新しいフレームワークMalFSCILを提案しました。このアプローチは、オープンソースや企業向けのデータセットにおいて、他のマルウェア検出・分類手法を上回る性能を発揮します。表1 9,7,20,21,22,23,24,25,26,27,28,29,30,31,32は、既存の研究の簡単なレビューを示しています。
表1:ML/DLを用いたIoT攻撃検出に関する既存の研究文献。この表は既存の研究を簡単に振り返ります。 この表をダウンロードするには、こちらをクリックしてください。
提案されたCNN-トランスフォーマーモデルは、従来の手法の狭い攻撃可能性や限られた特徴学習能力に直接対応するため、IoTネットワークに完全なセキュリティを提供します。畳み込み符号化と自己注意機構を組み合わせることで、従来のCNNのみの10,13やトランスフォーマーのみの33法の低い検出境界を排除できます。また、各CNNエンコーディング層に加えた具体的な変更により、ドメイン転送がより効果的になり、トレーニング時間や計算負荷も削減されました。これらの改善により、運用中のIoT環境でリアルタイムでセキュリティ分析を活用できるようになります。提案されたモデルは、より複雑な新たな脅威からIoTエコシステムを守る上で大きな一歩です。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このセクションでは、IoT環境における攻撃検知システム関連の研究資料と手法について論じます。CIC-IoT-2023データセット上で実験を再現するために、このプロトコルは具体的な手順を概説しています。続く 材料表 には、使用されたすべてのハードウェアおよびソフトウェアのリストが掲載されています。パイプラインの実装にはPython(pandas、scikit-learn、TensorFlow Keras)が使用され、Google Colab上でPySparkが大規模ファイルの前処理に利用可能です。データ前処理手順の詳細な説明が提供されています。
データセット
ニューブランズウィック大学カナダサイバーセキュリティ研究所が公開したCIC-IoT-2023データセットです。「CIC IoT dataset 2023」(UNB CICデータセットページ)およびデータセット記事34 は、公式のCICデータセットページおよび論文です。このデータセットはCICのウェブサイトからダウンロードでき、一般公開されています。生のPCAPの代わりに、事前に抽出された特徴CSVファイル(フロー/特徴量)を本研究で使用します。Wireshark/mergecapとCICFlowMeterは、データセットを生成する生実験で使用されます。本作では特集CSVが使用されています。このデータセットは実際のIoTデバイスから得られ、本研究に使用されています。データセットには、105種類の異なるIoTデバイスに対する33件の既知攻撃の記録が含まれています。従来のIoTデータセットとは異なり、CIC-IoT-2023には多様な攻撃タイプが含まれています。無害トラフィックにリンクされた各ラベルの量は 図1に示されています。このデータセットは合計46の属性と1つのラベルで構成されています。84の機能があったCSE-CIC-IDS 2018と比べて、CIC-IoT-2023は37個少ない機能です。

図1:CICIoT2023データセットにおける攻撃件数。 CICIot2023データセットにおける異なる攻撃の種類や無害な記録のカウント名が記載されています。これらの異なる攻撃タイプは大まかに7つの攻撃クラスに分類されます。したがって、多重クラス分類における良性を含む合計8つのクラスがあります。 この図の拡大版はこちらをクリックしてご覧ください。
データ前処理
十分な前処理なしに深層学習アルゴリズムでデータセットを活用すべきではありません。前処理はアルゴリズムにより細かいデータを提供し、最終的にモデルの効率を高めるために行われます。前処理パイプラインの出力(ラベルエンコーディング後の処理、特徴のスケーリング、特徴選択)は「最終データ」と呼ばれ、CNNおよびトランスフォーマーコンポーネントの入力として機能します。以下の手順はGoogle ColabでPythonを使って行います。この研究ではPython 3.8.10、pandas 1.3.4、NumPy 1.21.4、scikit-learn 1.0.2、matplotlib 3.4.3、TensorFlow/Keras 2.6.0が使用されました。ランダムシードはすべてのランで42に設定されていました。
データ取得
このステップには、多くの誤りや不整合を含むことが多いため、実際の文脈から取得されたデータのクリーニングも含まれます。例えば、データセットにテキスト値が含まれている場合、その値を数値化せずに深層学習トレーニングで活用することは不可能です。データセットを扱う際、まず最初に行うことは空欄の値を削除し、データのないセルを削除することです。モデルに悪影響を及ぼさないように、欠損した行は削除されました。
CIC-IoT-2023データセットはpd.read_csv('ciciot2023_features_part.csv')で読み込みます。この研究では、モデルトレーニングにGoogle Colab、初期クリーニングにPySparkを使用しました。欠損を検出するために、重複の場合はdf.shape、df.info()、df.isnull().sum()、df.duplicated().sum()の以下の方法が用いられます。重複はdf.drop_duplicates(inplace=True)で除去されます。数値カラムタイプは、df[col] = pd.to_numeric(df[col]、errors='coerce')で検証されます。新しいNaNが現れた場合、欠損值処理が再適用されます。定数またはほぼ一定の特徴量もdf.drop(columns=low_variance_cols, inplace=True)で除去されます。
ラベル符号化
次のステップは、テキストラベルを数値表現に変換し、モデルがそれらを理解できるようにすることです。二値分類には2種類のラベルがあります。記録は4,668万6,579件あり、そのうち45,588万384件が悪意のある攻撃と分類されています。1,098,195枚のレコードが含まれる中で、無害ラベルは0に設定されています。マルチクラス分類には7つの異なる攻撃タイプがあります。合計で8つのラベルがあり、無害なトラフィックも含まれています。 図2 はこれらのラベルの各カテゴリのカウントを示しています。この研究で用いられるマルチクラスマッピングは、ベニグンが0、DoSが1、DDoSが2、偵察が3、ウェブベースの攻撃が4、スプーフィングが5、ブルートフォースが6、未来攻撃が7です。

図2:無害なトラフィックを含む攻撃クラスの割合。 マルチクラス分類には7つの異なる攻撃タイプがあります。合計で8つのラベルがあり、無害なトラフィックも含まれています。図はこれらのラベルの各カテゴリのカウントを示しています。 この図の拡大版はこちらをクリックしてご覧ください。
特徴のスケーリング
特徴スケーリングは、ディープラーニングモデルの全体的な性能を向上させる一般的な手法です。本研究における特徴スケーリングは、最小最大スケーラーおよび標準スケーラー技術を用いて実現されています。研究では検査には使われていませんでした。代わりに、トレーニングセットのスケーラーのみを使用してデータの漏洩を防ぎました。標準スケーラー法を用いて、データはゼロ平均、標準偏差1の分布に正規化することができます。その一つの方法は、元の数値を標準偏差で割ることです。この場合、StandardScaler()関数はsklearn.preprocessingからStandardScalerをインポートすることで呼び出されます。最小最大スケーラーは、しばしば0から1の間の範囲を適用することでデータを正規化します。この実装にはscikit-learnのMinMaxScaler()関数が使われました。
式(1)に示されているように、正規化の公式は次の通りです。
(1)
ここでXは元の点値、X正規化は変換後形式を表します。Xminは変数の最小値を表し、Xmaxはデータセット内の変数の最高値を示します。
特徴選択
大規模なデータセットのすべての特性を訓練に組み込むことは必ずしも有益とは限りません。データセット内の特徴は相関を示す場合があり、結果を高めるとは限りません。さらに、過剰な価値観はトレーニング費用を増加させます。不要な特徴を見つけるために、相関行列を計算し、強い相関を持つものはデータセットから除外します。2つの特徴間の線形関係を定量化するピアソン相関係数を用いて相関係を算出します。-1から+1の値は、2つの変数の共分散を標準偏差の積で割ることで得られます。これはオプションであり、意思決定木分類器を用いた特徴選択のための再帰的特徴除去(RFE)を用いてパイプライン内で実行されます。再帰的特徴消去は、分類モデルを訓練し、最も重要で低い特徴を破棄することで、最も関連性の高い特徴を繰り返し見つけます。コードはsklearn.feature_selectionのRFEを利用し、推定器として決定木分類器を用いています。再帰的特徴除去の実装後、 表2に示すように、7つの攻撃カテゴリそれぞれで46の特徴のうち30が選ばれました。特徴は多くの攻撃分類に分類されることがあります。 図3に示されたプロセスの完了後、データセットに含まれる攻撃クラスの選択が行われます。現代のCNNは生データから階層的表現を学習するのに優れていますが、RFEを使って小規模で高品質な特徴セットを事前に選択することには大きな利点があります。まず、決定木分類器を用いたRFEは、初期の訓練サイクルで収束を遅らせる可能性のあるノイズや冗長なデータを迅速に除去します。第二に、CNNを実際に価値のある信号のより少ないプールに集中させることで、過度学習を減らします。これは、非常に偏った良性や有害なパターンを持つIoTトラフィックデータセットにおいて非常に重要です。意思決定木の再帰的消去法は、モデルの説明可能性を高め、深い訓練前にドメイン特有のバイアスを特定するために特徴をランク付けします。最後に、この剪定された特徴セット上でCNN-トランスフォーマーを初期化することで、収束速度が速くなりGPUメモリ使用量が低減され、RFEがエンドツーエンドの特徴学習を積極的に加速・安定化することを証明しています。
表2:「CIC-IoT-2023」データセットの選択特徴。本研究ではRFEを用いて、7つの攻撃カテゴリーそれぞれに対して46の特徴のうち30を選びました。表は選ばれた30の特徴を説明しています。 この表をダウンロードするには、こちらをクリックしてください。

図3:提案されたハイブリッドモデルの動作。 プロセスの完了は図に示されています。データセットに含まれる攻撃クラスの選択プロセスが行われます。 この図の拡大版はこちらをクリックしてご覧ください。
データセットを80%のトレーニングセットと20%のテストセットに分割します。ステップはtrain_test_split(X_train, y_train, test_size=0.20, random_state=42)です。80%の訓練セットはさらにtrain_test_split(X_train, y_train, test_size=0.20,random_state=42)で分割されます。すべてのモデル選択とハイパーパラメータの調整は、これらの正確な分割を用いて行われます。合成少数派オーバーサンプリング技術(SMOTE)は、クラス不均衡の問題がある場合に使用されます。スプリットとスケーリング後にSMOTEを受けたのはトレーニングセットのみでした。SMOTEの効果は結果に示されています。RFEの報告を受けて、研究はCNNとトランスの両枝を、各サンプルに選ばれた同じ30の特徴を用いて並行しています。これら30の特徴を処理する詳細は提案された方法論のセクションで述べられています。
提案された方法論
より正確に攻撃を検知できるIoTシステム向けの効果的なセキュリティフレームワークは、ディープラーニングモデルの助けを借りて構築されます。畳み込みニューラルネットワーク(CNN)とトランスモデルを組み合わせたハイブリッドセキュリティ戦略が提案されています。この方法は、より大きなデータセットの重みを使ってCNNアーキテクチャを訓練し、その後、より小さなデータセットを使ってモデルのパラメータを微調整することを目標とするものです。このモデルの主な目的は、IoTにおける侵入検知の効率を向上させることです。
この研究では、Apache Spark上でPythonプログラムを実行できるGoogle ColabのプラットフォームPySparkを使用しました。Scikit-learnとKerasパッケージを用いて、ディープラーニングアルゴリズムが開発されています。モデルの訓練とテストには、以下の構成が使用されました:オペレーティングシステム:Mac OS v12.6;- M2 アップルシリコン;- 13.3インチディスプレイ;- 8コアCPU;- 8コアGPU;- 32GB RAM;- 256GB SSD。
カナダサイバーセキュリティ研究所(CIC)は、実用的なIoT環境におけるセキュリティ分析アプリケーションを推進するため、包括的なIoT脅威データセットを作成しました。IoTシステム内の105台の接続デバイスネットワークに対して合計33件の攻撃が発生しました。総数46,179,314件のインシデントがあり、攻撃はDDoS、Recon、DoS、ウェブベース、スプーフィング、ブルートフォースの7つのグループに分類されます。さらにMiraiも含まれます。トレーニングセットには37,349,263件のインスタンス、テストセットには8,830,051件のインスタンス、そして合計46の特徴があります。あらゆる場合、悪意あるIoTデバイスが他のIoTデバイスに対して攻撃を仕掛けます。合計67台のIoTデバイスと、5つのハブに接続された38台のZigbeeおよびZ-Waveデバイスが攻撃の影響を受けました。接続されたセンサー、カメラ、マイクロコントローラー、スマートホームデバイスのネットワークを構築し、さまざまな種類の攻撃を実行し、それに伴う通信を記録することができます。WiresharkはネットワークトラフィックをPCAP形式でキャプチャし、さらなる解析のために行います。各実験は2つのデータストリームを保存するため、Mergecapを使ってPCAPファイルを結合します。オーディオプレーヤー、ビデオレコーダー、ハブ、電源コンセント、ホームオートメーションシステム、照明、センサー、次世代ガジェットなど、さまざまなIoTデバイスがデータセットの収集に使われました。
このセクションでは、研究で用いられる多くの連続した段階からなる詳細な研究手法を提供します。さらに、提案されたアルゴリズムを逐次的に定義し、研究プロセスの詳細なフローチャートも提供しています。
CNN
CNNアルゴリズムは人工ニューラルネットワーク、すなわちディープラーニング手法を用いています。 図4 はCNNが用いる基礎アルゴリズムを示しています。完全連結層、プーリング、フラッテン、畳み込みがすべてその一部です。CNNは畳み込み層なしでは機能しません。受信セルデータは畳み込み層によって処理されます。
式(2)では、出力体積(Vo)はP(ストライド)、Vi(入力体積)、S(畳み込み層ニューロン核サイズ)、M(パディングゼロ)によって決まります。
(2)
その後、畳み込み中に入力値の性質を抽出するためにフィルターを用います。このレイヤーは特徴マップを作成します。プーリングによって入力データサイズを削減することで、訓練が簡素化され、計算すべきパラメータ数も減ります。プーリング層は、与えられたサイズ内で最大の値または値の平均値のいずれかで選択できます。開発された手法には、2層の畳み込みと2層のプーリングが含まれます。特徴抽出のプロセスはここから始まります。取得された特徴データは計算のために利用可能です。CNNアルゴリズムは1次元、2次元、または3次元で利用可能です。このモデルは、1次元のみの畳み込みニューラルネットワークを用いていました。分類領域内の層は「平坦、完全連結」と呼ばれます。データは畳み込みフェーズの後にフラット化され、完全連結フェーズで使用される必要があります。このプロセスは平坦層で行われます。完全連結層内では、従来の人工ニューラルネットワークのパラダイムが用いられています。画像ベースでないデータにCNNを適用するには、入力寸法を変換する必要があります。その結果、CNNは一次元35の一次元畳み込み層を用いることがあります。

図4:CNNの基本アルゴリズム。 CNNモデルの基本的な動作と構成要素について説明します。 この図の拡大版はこちらをクリックしてご覧ください。
トランスフォーマー学習
さらに、さらなる実験を行うためにトランスモデリングフレームワークを活用します。トランスの自己注意機構により、モデルはシーケンス内のすべての点を同時に処理できます。その結果、モデルの訓練時間が短縮され、推論や訓練中のトランスによるコンピュータリソースの利用効率が向上します。トランスは主に積み重ねられたエンコーダとデコーダの連続で構成されています。符号化のプロセスは一つの言語を別の言語に変換することを含みますが、復号化のプロセスは以前の出力を使って異なる言語が存在する可能性を判定することを指します。エンコーダは主に特徴抽出を担当するため、提案モデルはエンコーダコンポーネントのみを使用します。トランスエンコーダは入力/位置埋め込み、フィードフォワードニューラルネットワーク、層正規化、マルチヘッド自己注意、残留ネットワークで構成されています。
トランスによる処理のために入力データを準備するために、埋め込み層を用いてカテゴリ特性を濃密なベクトル表現に変換します。位置埋め込みは特徴がどのように順序的に接続されているかを示し、入力埋め込みは異なる入力が共通空間でどのように関連しているかを示します。トランスフォーマーがカテゴリ特性を処理する前に、本研究では入力埋め込みを用いてそれらを高密度ベクトルに変換します。
注意メカニズムの拡張であるマルチヘッド自己注意機構はトランスフォーマーアーキテクチャの基盤です。本研究はスケールドット積を用いて、多頭自己注意メカニズムを用いています。
(3)
ここで、クエリ行列(Q)、鍵行列(K)、値行列(V)、鍵行列次元(dk)がそれぞれ表されます。モデルが異なる部分空間にマッピングされた様々な特徴のデータを集中させることで、異なる注意値が得られることで、マルチヘッドスケールドット積注意メカニズムはスケールドット積注意メカニズムとは異なります。各ヘッドごとに注意レベルを独立して計算すると、過学習は起こりにくいです。具体的な定式化は以下の通りです。
(4)
(5)
ここでhは注意ヘッドの数、dv 、dモデル はvとモデルの次元を表します。また

次に、レイヤー正規化を用いてトレーニングプロセスを安定化させます。勾配爆発を防ぐために、層正規化は各層の出力を一定の範囲に制限します。これによりモデルの収束速度と訓練速度の両方が向上する可能性があります。バッチ正規化はバッチデータを考慮しますが、レイヤー正規化は考慮しません。
CNNトランスフォーマー提案モデル
本研究は、IoTネットワークにおける侵入を検出するためのハイブリッドCNN-トランスフォーマー技術を提供し、両アーキテクチャの明確な利点を考慮しています。 図5 は提案されたCNN-トランスハイブリッド技術の主な構成要素を示しています。クリーンアップ、正規化、ラベルエンコーディング、特徴選択などすべての前処理段階を完了した後、データセット内の各サンプルは30次元の特徴ベクトル(最終データ)で表されます。同じ最終データが両部門に重複・供給されます。その後、この最終データはCNNとトランスブロックの両方に同時に送信されます。CNNとトランスフォーマーは互いに一切依存していません。両者は同時に同じ入力データを扱うことがあります。CNNとトランスフォーマーという2つの枝のフラット出力は連結され、融合特徴ベクトルが生成され、それが高密度層に渡され、分類されます。CNNブロックは入力形状を(num_features, 1)に変更することで、特徴次元を超えた畳み込み演算を行い局所的な空間パターンを見つけられます。同時に、トランスフォーマーブランチは同じ入力を逐次形式に変更し、高次元の埋め込み空間に送り、その後位置符号化を行います。これによりトランスフォーマーは特徴空間で自己注意を向け、グローバルな文脈的関係性を見出すことができます。トランス独自の設計は特徴抽出に用いられ、シグモイド関数と完全連結層は特徴とラベル間のマッピング接続を提供します。CNNトランスモデルは 図5で構造的に表されています。その結果、DDoS、Recon、DoS、良性攻撃、ウェブベース、スプーフィング、ブルートフォース、Miraiなどを含む8つのカテゴリーの攻撃分類システムが形成されました。提案されたCNNトランスの評価過程は 図5に示されています。

図5:提案モデルのアーキテクチャ。 図は提案されたCNNトランスの入力形状と評価過程を示しています。 この図の拡大版はこちらをクリックしてご覧ください。
64ユニットおよび128ユニットのフィルターと3カーネルサイズを持つ2つの一次元畳み込みニューラルネットワーク(CNN)、2つの最大プーリング層、フラット化ステップ、256、128、64ユニットの3つの濃密層、そして3つのドロップアウト層で構成され、コンボリューションニューラルネットワーク(CNN)層は構成されています。
入力データは、ReLU活性化関数、64のフィルター、3×3カーネル、1×1のストライドを備えた1次元畳み込み層を通じて処理されます。前の層に続くMaxPooling1D層はプールサイズ2です。モデルをより柔軟にし計算コストを削減するために、この層は出力領域の空間次元を縮小します。第3層はまた別の1次元畳み込み層であり、128個のフィルター、3サイズのカーネル、1つのストライド、そしてReLUというアクティベーション関数を備えています。入力特性を抽出するためにより多くのフィルターを使うことで、この層は最初のmaxプーリング層に似ています。最初の層の出力はこの技術で処理されます。その後、2番目の畳み込み層の後に最大プーリング層が追加され、そのプールサイズも2になりました。このレイヤーも特徴マップのダウンサンプリングに使用されます。5番目の層は平坦化層で、前の層の出力を1次元ベクトルに変換します。
得られた特徴部分集合は、トランスの入力となる前の最後のステップとして埋め込まれます。さらに、マルチヘッドアテンション(8つのヘッドからなる1次元ベクトルで32キー次元)が、各ヘッドの重要性を評価するために用いられます。マルチヘッドアテンション層がトランスの主な構成要素です。この層により、モデルは異なる特性の埋め込み表現から適応的に学習できます。マルチヘッドアテンション層は複数の自己注意ヘッドで構成されており、「スケールドット積アテンション」とも呼ばれます。イプシロンを1e-6に設定してレイヤー正規化を適用した後、さまざまな特性間のスケール不一致を除去し、出力の安定性を確保することが目的です。各層の出力をあらかじめ決められた範囲内に保つことで、層正規化は勾配爆発の可能性を低減します。トランスの出力の後には平坦化層があり、CNNとの結合を単一ベクトルに簡略化します。
次のステップは、CNNとトランスフォーマーのフラット出力を連結層で組み合わせることです。活性化関数「relu」、L2正則化、そして256単位の高密度層が平坦層に続きます。その後、0.5のドロップアウト層が続き、過学習を防ぐのに役立ちます。L2正則化と「relu」活性化関数を用いた追加の128ユニット密度層が続きます。追加のドロップアウト層でのドロップアウト率は0.3です。ReLU活性化関数、L2正則化、64単位の高密度層が次の層を構成します。次の層は0.2レートのドロップアウト層で、内部ユニットの20%をランダムに除去します。softmax活性化関数を持つ密層は、最後の層の出力クラスの確率分布を作り出します。この層には出力クラスの数とほぼ同じユニット数があります。
提案されたモデルは数値的に次のように表すことができます。
XをCNN入力データとし、ここでX
R(n×1)をリシェイプ後のものとし、nはそれぞれ選択された特徴の数とします。Xはトランスフォーマーブロックの形R(n × d_model) の高次元埋め込み空間に置かれます。自己注意機構に入る前に、位置符号化が用いられます。
以下は、64個のフィルターと核サイズ3を用いるConv1D層での演算の表現です。
(6)
ここでY i,j は第 i個のフィルターの位置 j の出力、k はサイズ 3 の核、b1 です
R64 は各フィルターのバイアス項、Wk はフィルターの重み、ReLU は活性化関数です。次に、MaxPooling層をプールサイズ2で適用し、出力Z1,jとなります。
(7)
モデルの第3層として、3カーネルサイズと128フィルターを持つ追加のID畳み込み層が含まれています。その式は次の通りです:
(8)
ここでkはサイズ3の核、b2
R128は各フィルターのバイアス項、ReLUは活性化関数です。さらに最大プール層を適用し、プールサイズ2の第2畳み込み層から入力を得ます。出力Z2,jは次のように与えられます:
(9)
第5層は平坦化層で、次のように表されます:
(10)
次にトランス層があり、埋め込み層、多ヘッド注意層、層正規化を含みます
(11)
E は入力クラスラベル c の埋め込みベクトルであり、We はすべての圏の埋め込みベクトルを含む重み行列です。これはcの各整数を32個の実数値成分からなる稠密なベクトルに写します。次に、式(3)、(4)、(5)で定式化される多頭注意層です。
鍵行列のサイズはdk =32、次元はh=8です。DV とDModel はそれぞれVとモデルの寸法を表します。また 
出力 x = MultiHead(Q,K,V) の場合、レイヤー正規化は次のようになります:
(12)
ここでyは正規化出力、γとβは学習可能なパラメータ、μとσ2 はそれぞれxの平均と分散を表します。次にトランスの平坦化層が定義されます。

すべての層の最後に、その結果の式は次のように示されます。








ここでZ1
R256、Z2
R128、Z3
R64、Y
R8。このハイブリッドモデルはまた、多重クラス分類の損失関数も計算しており、それは次のように表現できます。

どこ:
Yc はクラス cc の真のラベル(ワンホット符号化)を表します。
Y'c はクラス c の予測確率です
提案されたアルゴリズムは 表3 で詳細に説明されています。
表3:提案されたCNNトランスフォーマーアルゴリズム。提案されたアルゴリズムは表3でステップごとに説明されています。 この表をダウンロードするには、こちらをクリックしてください。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このセクションでは評価パラメータとテスト結果を示します。
パフォーマンス評価指標
モデルの有効性は、いくつかの定義された評価基準を用いて評価されます。正確度、想起率、精度、F1スコア、ROC、混乱行列およびその他の統計指標は 表4に示されています。モデルの全体的なパフォーマンスに関する洞察は、指標によって提供されます。
表4:パフォーマンス評価指標。本研究で使用された正確性、想起率、正確性、F1スコア、ROC、混乱行列およびその他の統計指標が表に示されています。 この表をダウンロードするには、こちらをクリックしてください。
...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
CNN-トランスフォーマーモデルはCICIoT2023データセットでテストされ、80%がトレーニング用、20%がテスト用に確保されました。モデルは99.97%の精度、F1スコア99.96%、リコール率99.97%、精度99.96%、損失0.0123を記録し、IoT侵入検知における有効性を確認しました。CNNベースのアプローチは、13の調査結果に類似し、ネットワークトラフィック特性内の小さな空間パターンを検出するのに熟練しています。しかし、長距離依存関係のモデリングにおいてはしばしば制約を示します。トランスモデル33 はグローバルなコンテキストリンクの抽出に優れていますが、単独で適用すると計算コストが高くなります。両設計の利点を組み合わせることで、我々のモデルは検出性能を向上させつつ計算効率を向上させました。ROC曲線は想起率と正確性の関係を示し、モデルのパフォーマンスは各クラスごとに真陰性率(TNR)や偽陽性率(FPR)などの指標を用いて評価されました。モデルの時間計算量は、...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には利益相反を主張するものはありません。
この研究において知識と専門性を授けてくださったガイドのシマ博士に特別な感謝と感謝を申し上げます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Apple M2(8コアCPU) | 林檎 | 該当なし | (OS)は、ディープラーニングフレームワークやツールが動作する環境を提供します。 |
| CICIoT2023データセット | UNB | https://www.unb.ca/cic/datasets/iot2023.html | IoTの公開利用可能なdaset |
| Keras 2.6.0 | ケラス | https://keras.io/ | TensorFlow上で動作するAPIで、使いやすいインターフェースを提供します。 |
| Matplotlib 3.4.3 | Matplotlib | https://matplotlib.org/ | Python用の可視化ライブラリ。 |
| NumPy 1.21.4 | ナンピー | https://numpy.org/ | Pythonを用いた科学計算のための基本パッケージ |
| NVIDIA Tesla P100 GPU(16GB VRAM) | Google Colab Pro | 該当なし | トレーニング用ハードウェア |
| パンダス 1.3.4 | パンダ | https://pandas.pydata.org/ | データ分析および操作ツール。 |
| Python 3.8.10 | Pythonソフトウェア財団 | https://www.python.org/downloads/release/python-3810/ | 豊富なライブラリとコミュニティのサポートにより、ディープラーニングで最も人気のある言語です。 |
| scikit-learn 1.0.2 | シキット・ラーン | https://scikit-learn.org/ | Python用の機械学習ライブラリ。 |
| シーボーン 0.11.2 | シーボーン | https://seaborn.pydata.org/ | 統計データ可視化ライブラリ。 |
| システムRAM | 該当なし | 該当なし | 32GB RAM |
| TensorFlow 2.6.0 | ググる | https://www.tensorflow.org/ | 包括的なツールとライブラリで広く利用されています。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト