$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
يناقش هذا القسم مواد وأساليب البحث المتعلقة بأنظمة كشف الهجمات في بيئة إنترنت الأشياء. لتكرار التجارب على مجموعة بيانات CIC-IoT-2023، يحدد هذا البروتوكول إجراءات محددة. يحتوي جدول المواد التالي على قائمة بجميع الأجهزة والبرمجيات المستخدمة. تستخدم بايثون (pandas، scikit-learn، وTensorFlow Keras) لتنفيذ خط الأنابيب، الذي يعمل على Google Colab مع توفر PySpark للمعالجة المسبقة للملفات الكبيرة. تم تقديم وصف مفصل لإجراءات معالجة البيانات المسبقة.
مجموعة البيانات
مجموعة بيانات CIC-IoT-2023، التي أصدرتها المعهد الكندي للأمن السيبراني بجامعة نيو برونزويك. "مجموعة بيانات CIC IoT 2023" (صفحة مجموعات بيانات UNB CIC) ومجموعة البياناتالمقالة 34 هما الصفحة الرسمية وورقة مجموعة بيانات CIC. يمكن تحميل مجموعة البيانات من موقع CIC الإلكتروني وهي متاحة للجمهور العام. بدلا من استخدام PCAPs الخام، تستخدم ملفات CSV (التدفقات/الميزات) المستخرجة مسبقا في هذا البحث. تستخدم Wireshark/mergecap وCICFlowMeter في التجارب الخام التي أنشأت مجموعة البيانات؛ تستخدم ملفات CSV المميزة في هذا العمل. تم اشتقاق هذه المجموعة من أجهزة إنترنت الأشياء الحقيقية، وتستخدم في هذا البحث. تتضمن مجموعة البيانات سجلات من 33 هجوما معروفا على 105 أجهزة إنترنت الأشياء المختلفة. على عكس مجموعات بيانات إنترنت الأشياء السابقة، يتضمن CIC-IoT-2023 مجموعة واسعة من أنواع الهجمات. مقدار كل علامة مرتبطة بحركة مرور حميدة موضح في الشكل 1. يتكون هذا المجموع من 46 خاصية وعلامة واحدة. مقارنة ب CSE-CIC-IDS 2018، الذي احتوى على 84 ميزة، فإن CIC-IoT-2023 يحتوي على 37 ميزة أقل.

الشكل 1: عدد الهجمات في مجموعة بيانات CICIoT2023. تم وصف أسماء العد لأنواع الهجمات المختلفة والسجلات الحميدة في مجموعة بيانات CICIot2023. يتم تصنيف هذه الأنواع المختلفة من الهجمات بشكل عام إلى 7 فئات هجوم. لذا هناك إجمالي 8 فئات، بما في ذلك الأنواع الحميدة في تصنيف متعدد الفئات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
معالجة البيانات المسبقة
لا ينبغي استخدام مجموعات البيانات في خوارزميات التعلم العميق دون معالجة مسبقة كافية. تجرى المعالجة المسبقة لتزويد الخوارزمية ببيانات أدق، مما يجعل النموذج أكثر كفاءة في النهاية. يطلق على مخرجات خط أنابيب المعالجة المسبقة - بعد ترميز الملصقات، وتكبير الميزات، واختيار الميزات - اسم "البيانات النهائية" وتعمل كمدخل لكل من مكونات CNN وTransformers. الخطوات التالية موجودة في Google Colab باستخدام بايثون. استخدم هذا البحث بايثون 3.8.10، وباندا 1.3.4، ونومبي 1.21.4، وسكيكيت-ليرن 1.0.2، وماتبلوتليب 3.4.3، وتينسورفلو/كيراس 2.6.0. تم تعيين التصنيف العشوائي على 42 لجميع الجولات.
جمع البيانات
تشمل هذه الخطوة تنظيف البيانات التي تم الحصول عليها من سياقات العالم الحقيقي، لأنها غالبا ما تحتوي على العديد من الأخطاء والتناقضات. إذا كانت مجموعة البيانات تحتوي على قيم نصية، على سبيل المثال، فمن المستحيل استخدام هذه القيم في تدريب التعلم العميق دون تحويلها أولا إلى شكل رقمي. عند العمل مع مجموعة البيانات، أول شيء يتم فعله هو إزالة القيم الفارغة وحذف الخلايا التي لا تحتوي على بيانات. تم حذف الصفوف التي تحتوي على بيانات مفقودة لتجنب أي آثار جانبية على النموذج.
يتم تحميل مجموعة بيانات CIC-IoT-2023 باستخدام pd.read_csv('ciciot2023_features_part.csv'). استخدم هذا البحث Google Colab لتدريب النماذج وPySpark للتنظيف الأولي. لاكتشاف الاختفاء، تستخدم الطرق التالية: df.shape، df.info()، df.isnull().sum()، و df.duplicated().sum() للنسخ. يتم القضاء على النسخ المكررة باستخدام df.drop_duplicates(inplace=True). يتم التحقق من نوع العمود الرقمي باستخدام الصيغة df[col] = pd.to_numeric(df[col], errors='coerce'). إذا ظهرت NaNs جديدة، يتم إعادة تطبيق معالجة القيمة المفقودة. الميزات التي تكون ثابتة أو شبه ثابتة يتم أيضا التخلص منها باستخدام df.drop(columns=low_variance_cols, inplace=True).
ترميز التسمية
الخطوة التالية هي تحويل تسميات النص إلى تمثيل رقمي حتى يتمكن النموذج من فهمها. بالنسبة للتصنيف الثنائي، هناك نوعان منفصلان من التسميات. هناك 46,686,579 سجلة، منها 45,588,384 تم تصنيفها كهجمات خبيثة. مع تضمين 1,098,195 تسجيلا، تم ضبط العلامة الحميدة على 0. هناك سبعة أنواع منفصلة من الهجمات في تصنيف متعدد الفئات. هناك ثمانية علامات تجارية إجمالا، بما في ذلك حركة المرور البسيطة. يوضح الشكل 2 عدد كل فئة من هذه التسميات. التعيين متعدد الفئات المستخدم في هذا البحث هو: 0 للحميدة، 1 ل DoS، 2 ل DDoS، 3 للاستطلاع، 4 للهجوم عبر الويب، 5 للانتحال، 6 للقوة الغاشمة، و7 لهجوم ميراي.

الشكل 2: نسبة فئات الهجوم بما في ذلك حركة المرور الحميدة. هناك سبعة أنواع منفصلة من الهجمات في تصنيف متعدد الفئات. هناك ثمانية علامات تجارية إجمالا، بما في ذلك حركة المرور البسيطة. يوضح الشكل عدد كل فئة من هذه التسميات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
توسيع الميزات
يعد توسيع الميزات طريقة شائعة لتعزيز الأداء العام لنماذج التعلم العميق. يتم تحقيق مقياس الميزات في هذه الدراسة باستخدام تقنيات Min Max Scaler وStandard Scaler. لم تستخدمها الأبحاث للاختبار؛ بدلا من ذلك، كان يستخدم فقط المقياس في مجموعة التدريب لمنع تسرب البيانات. يمكن تطبيع البيانات إلى توزيع متوسط صفري وانحراف معياري واحد بمساعدة طريقة المقياس القياسي. إحدى الطرق للقيام بذلك هي قسمة العدد الأصلي على الانحراف المعياري. لهذا يتم استدعاء دالة StandardScaler() عن طريق استيراد StandardScaler من sklearn.preprocessing. من خلال تطبيق نطاق، غالبا بين 0 و1، يقوم مقياس الحد الأدنى الأقصى بتطبيع البيانات. تم استخدام دالة MinMaxScaler() من scikit-learn لتنفيذ ذلك.
كما هو موضح في المعادلة (1)، صيغة التطبيع هي:
(1)
حيث يرمز X إلى القيمة النقطية الأصلية وXnormalized لشكله المحول، يمثل Xmin أدنى قيمة للمتغير بينما Xmax يرمز إلى أعلى قيمة للمتغير داخل مجموعة البيانات.
اختيار الميزات
دمج جميع الخصائص من مجموعات البيانات الكبيرة في التدريب ليس دائما مفيدا. قد تظهر الميزات داخل مجموعة البيانات ارتباطا وقد لا تعزز النتيجة. علاوة على ذلك، فإن العدد الكبير من القيم يزيد من تكلفة التدريب. لإيجاد الميزات غير الضرورية، نحسب مصفوفات الارتباط الخاصة بها ونستبعد تلك التي لها ارتباطات قوية من مجموعة البيانات. يستخدم معامل الارتباط لبيرسون، الذي يحدد العلاقة الخطية بين ميزتين، لحساب الترابط. يتم الحصول على قيمة بين -1 و +1 عن طريق قسمة التغاير بين المتغيرين على حاصل ضرب انحرافاتهم المعيارية. هذا اختياري ويتم في خط الأنابيب باستخدام إزالة الميزات العودية (RFE) لاختيار الميزات باستخدام مصنف شجرة القرار. الإزالة العودية للميزات تكتشف مرارا وتكرارا الميزات الأكثر أهمية من خلال تدريب نموذج المصنف وتجاهل الأقل أهمية. يستخدم الكود RFE من sklearn.feature_selection مع مصنف شجرة القرار كمقدر. بعد تطبيق إزالة الميزات العودية، تم اختيار 30 من أصل 46 خاصية لكل من فئات الهجوم السبع، كما هو موضح في الجدول 2. يمكن تصنيف الميزة تحت تصنيفات متعددة للهجوم. بعد إكمال العملية الموضحة في الشكل 3، يتم إجراء عملية اختيار فئات الهجوم المدرجة ضمن مجموعة البيانات. تتفوق شبكات CNN الحديثة في تعلم التمثيلات الهرمية من البيانات الخام، لكن اختيار مجموعة ميزات صغيرة وعالية الجودة مسبقا باستخدام RFE له مزايا كبيرة. أولا، يقوم ال RFE مع مصنف شجرة القرار بسرعة بإزالة البيانات الضوضاء أو الزائدة التي قد تؤخر التقارب خلال دورات التدريب المبكرة. ثانيا، تركيز شبكة CNN على مجموعة أصغر من الإشارات ذات القيمة الفعلية يقلل من فرط التركيب، وهو أمر بالغ الأهمية في مجموعات بيانات حركة إنترنت الأشياء ذات الأنماط المنحازة والغير ضارة للغاية. تقوم طريقة الحذف التكراري في شجرة القرار بترتيب الميزات لتحسين قابلية شرح النموذج وتحديد التحيزات الخاصة بالمجال قبل التدريب العميق. أخيرا، فإن تهيئة محول CNN على هذه المجموعة المعدلة من الميزات يؤدي إلى تقارب أسرع واستخدام ذاكرة أقل لوحدة معالجة الرسومات، مما يثبت أن RFE يسرع ويثبت التعلم من الطرف إلى الطرف بنشاط.
الجدول 2: الميزات المختارة لمجموعة البيانات "CIC-IoT-2023". تم اختيار 30 من أصل 46 خاصية لكل من الفئات الهجومية السبع في هذا البحث باستخدام RFE. يصف الجدول الميزات الثلاثين المختارة. يرجى الضغط هنا لتحميل هذا الجدول.

الشكل 3: عمل النموذج الهجين المقترح. يتم توضيح إكمال العملية في الشكل. يتم تنفيذ عملية اختيار فئات الهجوم المدرجة ضمن مجموعة البيانات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
قسم مجموعة البيانات إلى قطار بنسبة 80٪ ومجموعة اختبار بنسبة 20٪ باتباع الخطوة: train_test_split (X_train، y_train، test_size=0.20، random_state=42). يتم تقسيم مجموعة التدريب بنسبة 80٪ باستخدام train_test_split(X_train، y_train، test_size=0.20,random_state=42). يتم اختيار جميع النماذج وضبط المعاملات الفائقة باستخدام هذه التقسيمات الدقيقة. تستخدم تقنية أخذ العينات الزائدة للأقليات الاصطناعية (SMOTE) عندما توجد مشكلة في عدم توازن الطبقات. فقط مجموعة التدريب خضعت لاختبار SMOTE بعد التقسيم والتكبير. يظهر تأثير SMOTE في النتائج. وفقا لاختبار RFE، تتوازى الدراسة مع فرعي CNN وTransformer باستخدام نفس ال 30 ميزة التي تم اختيارها لكل عينة. التفاصيل الإضافية لمعالجة هذه الميزات الثلاثين مذكورة في قسم المنهجية المقترحة.
المنهجية المقترحة
سيتم بناء إطار أمني فعال لأنظمة إنترنت الأشياء يمكنه اكتشاف الهجمات بدقة أكبر بمساعدة نموذج التعلم العميق. يقترح استراتيجية أمنية هجينة تجمع بين الشبكات العصبية الالتفافية (CNNs) ونماذج المحولات. تتضمن هذه الطريقة تدريب بنية CNN باستخدام أوزان من مجموعة بيانات أكبر ثم ضبط معلمات النموذج بدقة باستخدام مجموعة بيانات أصغر كهدف. الهدف الأساسي لهذا النموذج هو تحسين كفاءة اكتشاف التسرب في إنترنت الأشياء.
استخدم هذا البحث منصة PySpark، وهي منصة Google Colab تتيح للمستخدمين تشغيل برامج بايثون على Apache Spark. باستخدام حزم Scikit-learn وKeras، تم تطوير خوارزميات التعلم العميق. لتدريب واختبار النموذج، تم استخدام التكوين التالي: نظام التشغيل: Mac OS v12.6؛ - M2 Apple Silicon؛ - شاشة عرض 13.3 بوصة؛ - معالج بثماني نوى؛ - وحدة معالجة رسومات بثماني أنوية؛ - 32 جيجابايت رام (RAM); - قرص SSD بسعة 256 جيجابايت.
أنشأ المعهد الكندي للأمن السيبراني (CIC) مجموعة بيانات شاملة لتهديدات إنترنت الأشياء لتعزيز تطبيقات تحليل الأمان في بيئات إنترنت الأشياء العملية34. كان هناك ما مجموعه 33 هجوما على شبكة مكونة من 105 أجهزة متصلة في نظام إنترنت الأشياء. مع إجمالي 46,179,314 حادثة، تم تصنيف الهجمات إلى سبع مجموعات: DDoS، الاستطلاع، DoS، الويب، التنويه، والقوة الغاشمة، بالإضافة إلى Mirai. هناك 37,349,263 حالة في مجموعة التدريب، و8,830,051 حالة في مجموعة الاختبار، وإجمالي 46 خاصية في مجموعة البيانات. في كل حالة، تشن أجهزة إنترنت الأشياء الخبيثة هجمات على أجهزة إنترنت الأشياء الأخرى. تأثر ما مجموعه 67 جهاز إنترنت الأشياء و38 جهاز Zigbee وZ-Wave متصل بخمسة مراكز من الهجمات. قد يتم إعداد شبكة من الحساسات والكاميرات والمتحكمات الدقيقة وأجهزة المنزل الذكي المتصلة لتنفيذ أنواع مختلفة من الهجمات وتسجيل حركة المرور الناتجة عنها. يلتقط وايرشارك حركة مرور الشبكة بصيغة PCAP لمزيد من التحليل. نظرا لأن كل تجربة تخزن تدفقا من البيانات، يستخدم mergecap لدمج ملفات PCAP. تم استخدام أجهزة إنترنت الأشياء المختلفة لتجميع مجموعة البيانات، بما في ذلك مشغلات الصوت، ومسجلات الفيديو، والمحاور، ومنافذ الطاقة، وأنظمة أتمتة المنازل، والإضاءة، وأجهزة الاستشعار، وأجهزة الجيل التالي.
يقدم هذا القسم منهجية بحث مفصلة تتكون من العديد من المراحل المتسلسلة المستخدمة في الدراسة. علاوة على ذلك، يحدد الجزء الخوارزمية المقترحة بشكل متسلسل ويوفر مخططا انسيابيا تفصيليا لعملية البحث.
سي
تستخدم خوارزمية CNN شبكة عصبية اصطناعية، وهي نهج تعلم عميق. يوضح الشكل 4 الخوارزمية الأساسية التي تستخدمها CNN: الطبقات المتصلة بالكامل، والتجميع، والتسطيح، والالتفاف كلها جزء منها. لا يمكن لشبكة CNN أن تعمل بدون طبقة الالتفاف. تتم معالجة بيانات الخلايا المستقبلة بواسطة الطبقة الالتفاوتية.
في المعادلة (2)، يتم تحديد حجم الخرج (Vo) بواسطة P (خطوة)، Vi (حجم الإدخال)، S (حجم نواة الطبقة الالفافية للعصبون)، وM (حشو صفري).
(2)
بعد ذلك، يستخدم مرشح لاستخراج خصائص قيمة الإدخال أثناء الالتفاف. هذه الطبقة تنشئ خريطة للميزات. تقليل حجم بيانات الإدخال عن طريق التجميع يبسط التدريب ويقلل من عدد المعلمات التي يجب حسابها. يمكن اختيار طبقة التجميع باستخدام أكبر قيمة ضمن الحجم المحدد أو متوسط القيم. تشمل التقنية المطورة طبقتين من الالتفاف ومستويين من التجميع. تبدأ عملية استخراج الميزات من هنا. بيانات الميزات التي تم الحصول عليها متاحة للحساب. تتوفر خوارزميات CNN بأبعاد واحدة أو اثنتين أو ثلاثة. استخدم النموذج شبكة عصبية الالتفافية ذات بعد واحد فقط. الطبقات في منطقة التصنيف تعرف بأنها مسطحة ومتصلة بالكامل. يجب تسطيح البيانات بعد الطور الالتفافي حتى يمكن استخدامها في الطور المتصلة بالكامل. طبقة التسطيح هي المكان الذي تجرى فيه هذه العملية. داخل الطبقة المترابطة بالكامل، يستخدم النموذج التقليدي للشبكات العصبية الاصطناعية. لتطبيق CNN على البيانات غير المعتمدة على الصورة، يجب تحويل أبعاد الإدخال. نتيجة لذلك، قد تستخدم CNN طبقات الالتفافية أحادية البعد وهي أحادية البعد35.

الشكل 4: خوارزمية CNN الأساسية. يتم وصف العمل الأساسي ومكونات نموذج CNN. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تعلم المحولات
علاوة على ذلك، لإجراء تجارب إضافية، نستخدم إطار عمل نمذجة المحولات. يمكن للنموذج التعامل مع جميع النقاط في التسلسل في نفس الوقت بسبب آلية التركيز الذاتي للمحول. والنتيجة هي وقت تدريب أسرع للنموذج واستخدام أفضل لموارد الحاسوب من قبل المحول أثناء الاستدلال والتدريب. يتكون المحول بشكل أساسي من سلسلة من المشفرات وأجهزة التشفير المكدسة. تتضمن عملية الترميز تحويل لغة إلى أخرى، لكن عملية فك الترميز تتضمن تحديد احتمال وجود لغة مختلفة باستخدام المخرجات السابقة. نظرا لأن المشفرات مسؤولة بشكل رئيسي عن استخراج الميزات، فإن النموذج المقترح يستخدم حصريا مكونات المشفر. يتكون مشفر المحول من تضمين المدخل/الموقع، وشبكة عصبية متقدمة، وتطبيع الطبقات، وتركيز ذاتي متعدد الرؤوس، وشبكة متبقية.
لتحضير بيانات الإدخال للمعالجة بواسطة المحول، تستخدم طبقة تضمين لتحويل الخصائص التصنيفية إلى تمثيلات متجهية كثيفة. يظهر تضمين الموقع كيف ترتبط الميزات بشكل متسلسل، بينما يظهر تضمين المدخلات كيف ترتبط المدخلات المختلفة في الفضاء المشترك. قبل أن يعالج المحول الخصائص الفئاتية، يستخدم هذا البحث تضمين المدخلات لتحويلها إلى متجهات كثيفة.
يعد نظام الانتباه الذاتي متعدد الرؤوس توسعة لآلية الانتباه الذاتي، وهو أساس بنية المحول. باستخدام حاصل ضرب نقاط متقن، يستخدم هذا البحث آلية التركيز الذاتي متعددة الرؤوس.
(3)
حيث يشار إلى مصفوفة الاستعلام (Q)، ومصفوفة المفتاح (K)، ومصفوفة القيمة (V)، وبعد مصفوفة المفتاح (dk) على التوالي. من خلال السماح للنموذج بالتركيز على بيانات من ميزات مختلفة مرتبطة بمساحات فرعية منفصلة، مما ينتج عنه قيم انتباه مميزة، تختلف آلية الانتباه متعددة الرؤوس المعدلة للضرب النقطي عن آلية الانتباه المعدلة للضرب النقطي. يكون التوافق الزائد أقل احتمالا عندما يتم حساب مستويات الانتباه بشكل مستقل لكل رأس. الصياغة المحددة هي كما يلي:
(4)
(5)
حيث h هو عدد رؤوس الانتباه، يمثل dv ونموذج d بعد v والنموذج. أيضًا

بعد ذلك، يستخدم تطبيع الطبقة لتثبيت عملية التدريب. لمنع انفجار التدرج، يحد تطبيع الطبقة من خرج كل طبقة إلى نطاق معين. قد يتحسن كل من تقارب النموذج وسرعة التدريب بهذا الشكل. بينما يأخذ التطبيع الدفعي بيانات الدفعات في الاعتبار، لا يأخذ التطبيع الطبقي ذلك.
النموذج المقترح ل CNN-Transformer
يقدم هذا البحث تقنية هجينة بين CNN-Transformer لاكتشاف التسللات في شبكات إنترنت الأشياء، مع الأخذ في الاعتبار الفوائد الفريدة لكلتا المعمارين. يوضح الشكل 5 المكونات الرئيسية لتقنية الهجينة المقترحة بين CNN والمحول الصناعي. بعد أداء جميع مراحل المعالجة المسبقة، بما في ذلك التنظيف، والتطبيع، وترميز العلامات، واختيار الميزات، يتم تمثيل كل عينة في مجموعة البيانات بواسطة متجه ميزة ثلاثي الأبعاد، يسمى البيانات النهائية. يتم تكرار نفس البيانات النهائية وتغذيتها بالتوازي مع كلا الفرعين من النموذج الهجين. ثم ترسل هذه البيانات النهائية إلى كل من كتل CNN وTransformer في نفس الوقت. لا تعتمد CNN والمحولات على بعضهما البعض بأي شكل من الأشكال؛ قد يعمل كلاهما على نفس بيانات الإدخال في نفس الوقت. يتم دمج المخرجات المسطحة للفرعين، CNN وTransformer، لإنتاج متجه ميزات مدمج، يمرر إلى الطبقات الكثيفة التي تصنفها. يغير كتلة CNN شكل الإدخال إلى (num_features، 1) بحيث يمكن إجراء العمليات الالفافية عبر أبعاد الميزات لإيجاد أنماط مكانية محلية. في الوقت نفسه، يقوم فرع المحول بتحويل نفس المدخل إلى تنسيق تسلسلي ويرسله إلى فضاء تضمين أعلى، يليه ترميز موضعي. هذا يسمح للمحول بالتركيز الذاتي في فضاء الفيلم وإيجاد علاقات سياقية عالمية. يستخدم التصميم الفريد للمحول لاستخراج الميزات، بينما توفر وظيفة السيجمويد والطبقات المترابطة بالكامل الاتصال بين الميزات والتسميات. يمثل نموذج CNN-Transformer هيكليا بالشكل 5. النتيجة هي نظام من ثماني فئات لتصنيف الهجمات، مع عناصر مثل DDoS، الاستطلاع، DoS، الحميدة، المعتمدة على الويب، الانتحال، القوة الغاشمة، والميراي كأجزاء مكونة. تظهر عملية تقييم جهاز CNN-Transformer المقترح في الشكل 5.

الشكل 5: هندسة النموذج المقترح. يوضح الشكل شكل الإدخال وعملية التقييم لمحول CNN المقترح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تشكل طبقة الشبكة العصبية الالتفافية (CNN) شبكتان عصبيتان الالتفافيتين أحاديتي البعد (CNNs) مع مرشحات بحجم 64 و128 وحدة وحجم 3 نواة، وطبقتان تجمع قصوى وخطوة تسطيح، وثلاث طبقات كثيفة بوحدات 256 و128 و64 وحدة، وثلاث طبقات انسحابية.
تتم معالجة بيانات الإدخال عبر طبقة التفافية أحادية البعد مع دالة تفعيل ReLU، و64 مرشحا، ونواة 3x3، وخطوة 1x1 في الطبقة الأولى. بعد الطبقة السابقة تأتي طبقة MaxPooling1D بحجم تجمع 2. لجعل النموذج أكثر مرونة وتقليل تكلفته الحسابية، تقلل هذه الطبقة من الأبعاد المكانية لمساحة الإخراج. الطبقة الثالثة هي طبقة الالتفافية أحادية الأبعاد أخرى؛ يحتوي على 128 مرشحا، نواة بثلاثة أحجام، خطوة واحدة بواحد، ودالة تفعيل تسمى ReLU. باستخدام المزيد من الفلاتر لاستخراج خصائص الإدخال، تشبه هذه الطبقة الطبقة الأولى من التجميع القصوى. ثم تتم معالجة مخرجات الطبقة الأولى باستخدام هذه التقنية. بعد ذلك، أضيفت طبقة تجميع قصوى بعد الطبقة الالفافية الثانية، وكان حجم المجموعة أيضا 2. مرة أخرى، تستخدم هذه الطبقة لتقليل عينات خرائط الميزات. الطبقة الخامسة هي طبقة تسوي، وتأخذ الناتج من الطبقة السابقة وتحوله إلى متجه أحادي البعد.
يتم تضمين المجموعات الفرعية من الميزات المكتسبة كخطوة أخيرة قبل أن تصبح مدخلات المحول. بالإضافة إلى ذلك، يستخدم الانتباه متعدد الرؤوس — وهو متجه أحادي البعد مكون من ثمانية رؤوس وبعد من 32 مفتاحا — لتقييم أهمية كل رأس. طبقة الانتباه متعددة الرؤوس هي المكون الرئيسي للمحول الكهربائي. تسمح هذه الطبقة للنموذج بالتعلم من التمثيلات المدمجة لخصائص مختلفة بطريقة تكيفية. تتكون طبقة الانتباه متعددة الرؤوس من عدة رؤوس تركيز ذاتي، وتسمى أيضا "انتباه النقطة الحاصل على التكبير". بعد تطبيق تطبيع الطبقة مع تعيين إبسيلون على 1e-6، الهدف هو القضاء على الفروقات في المقاييس بين الخصائص المختلفة وضمان استقرار المخرجات. من خلال الحفاظ على مخرج كل طبقة ضمن نطاق محدد مسبقا، يقلل تطبيع الطبقة من احتمالية انفجار التدرج. بعد خرج المحول طبقة تسوي، تبسط دمجها مع CNN عن طريق تقليله إلى متجه واحد.
الخطوة التالية هي دمج مخرجات CNN ومتحول المسطح باستخدام طبقة تسلسل. تتبع وظيفة التفعيل "relu"، وتنظيم L2، وطبقة كثيفة ب 256 وحدة طبقة مسطحة. يتبع ذلك طبقة انقطاع بمعدل 0.5، مما يساعد على تجنب الإفراط في التركيب. تتبع ذلك طبقة كثيفة إضافية مكونة من 128 وحدة باستخدام تنظيم اللغة الثانية ودالة تفعيل "relu". معدل الانقطاع في طبقة إضافية هو 0.3. تتكون وظيفة تفعيل ReLU، وتنظيم L2، وطبقة كثيفة ب 64 وحدة الطبقة التالية. الطبقة التالية تأخذ شكل طبقة انقطاع بمعدل 0.2، تقضي عشوائيا على 20٪ من الوحدات الموجودة بداخلها. طبقة كثيفة ذات دالة تفعيل softmax تخلق توزيعا احتماليا لفئات إخراج الطبقة الأخيرة. هناك بالضبط عدد الوحدات في هذه الطبقة يساوي عدد فئات الإخراج.
يمكن التعبير عن النموذج المقترح رقميا كما يلي:
لتكن X هي بيانات إدخال CNN، حيث X
R(n×1) بعد إعادة التشكيل، و n هو عدد الميزات المختارة على التوالي. يتم وضع X في فضاء تضمين ذو أبعاد أعلى من شكل R(n × d_model) لكتلة المبدل. قبل الدخول في آلية الانتباه الذاتي، يستخدم الترميز الموضعي.
فيما يلي تعبير العملية في طبقة Conv1D، التي تستخدم 64 مرشحا وحجم نواة 3:
(6)
حيث Yi,j هو المخرج عند الموضع j للمرشحi، وk هو النواة بحجم 3، وb1
R64 هو مصطلح التحيز لكل مرشح، وWk يمثل أوزان المرشح، وReLU هو دالة التفعيل. بعد ذلك، يتم تطبيق طبقة MaxPooling بحجم تجمع 2، مما يعطي مخرجا Z1,j.
(7)
تتضمن طبقة الالتفاف الإضافية للمعرف بحجم 3 نواة و128 مرشحا كطبقة ثالثة للنموذج؛ تعبيرها هو:
(8)
حيث k هي النواة بحجم 3، وb2
و R128 هو مصطلح التحيز لكل مرشح، وReLU هي دالة التفعيل. يتم تطبيق طبقة أخرى من الحد الأقصى للمجموعة، حيث تحصل على المدخلات من طبقة الالتفاف الثانية بحجم تجمع 2. الناتج Z2,j يعطى بواسطة:
(9)
الطبقة الخامسة هي طبقة مسطحة معبر عنها كالتالي:
(10)
بعد ذلك تأتي طبقات المحول، التي تشمل طبقة تضمين، وطبقة انتباه متعددة الرؤوس، وتطبيع الطبقة
(11)
E هو متجه التضمين لتسمية فئة الإدخال c، وWe هو مصفوفة الوزن التي تحتوي على متجهات تضمين لجميع الفئات. هذا يربط كل عدد صحيح في c إلى متجه كثيف مكون من 32 مكون حقيقيا القيمة. بعد ذلك طبقة انتباه متعددة الرؤوس، كما صيغت في المعادلات (3)، (4) و(5).
مصفوفة المفتاح لها حجم dk =32 وبعد h=8. dv وd model يرمز إلى أبعاد V والنموذج المعنية. أيضًا 
بالنسبة للمخرج x = MultiHead(Q,K,V)، يوفر تطبيع الطبقات:
(12)
حيث y هو الناتج التطبير، γ و β هما المعلمان القابلان للتعلم، و μ و σ2 يدلان على المتوسط والتباين ل x على التوالي. بعد ذلك تأتي طبقة تسطيح المحول، المعرفة بأنها

في نهاية جميع الطبقات، يظهر التعبير الناتج كالتالي








حيث Z1
R256، Z2
R128، Z3
R64، و Y
R8. هذا النموذج الهجين يحسب أيضا دالة الخسارة لتصنيف الفئات المتعددة، والتي يمكن التعبير عنها كالتالي

أين:
Yc يمثل التسمية الحقيقية (مشفر بزر واحد) للفئة cc،
Y'c هو الاحتمال المتوقع للفئة c
يتم شرح الخوارزمية المقترحة في الجدول 3 بالتفصيل.
الجدول 3: خوارزمية CNN-Transformer المقترحة. يتم شرح الخوارزمية المقترحة في الجدول 3 خطوة بخطوة. يرجى الضغط هنا لتحميل هذا الجدول.