Artículo de investigación

Un novedoso modelo híbrido de aprendizaje profundo para la detección de ataques en entornos IoT: Red Neuronal Convolucional con Enfoque Transformador

DOI:

10.3791/68750

18 de noviembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio presenta un modelo híbrido de aprendizaje profundo que combina Redes Neuronales Convolucionales (CNN) y Transformers para detectar ataques en entornos IoT. Utilizando el conjunto de datos CIC-IoT-2023, el modelo logró métricas de alto rendimiento: 99,97% de precisión y una pérdida de 0,0123, demostrando su eficacia en la detección de ataques en tiempo real.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El rápido desarrollo de los dispositivos del Internet de las Cosas (IoT) ha mejorado la conectividad y accesibilidad. No obstante, la creciente interconectividad de estos entornos presenta nuevos niveles de amenaza, que requieren una detección robusta de anomalías. En este estudio, se presenta un nuevo método de seguridad basado en el aprendizaje profundo para mitigar las amenazas particulares asociadas a las redes del Internet de las Cosas. El enfoque propuesto emplea redes neuronales profundas para monitorizar eficientemente los patrones de actividad de la red y detectar posibles vulnerabilidades en la comunicación en tiempo real. En este estudio se propone un modelo híbrido CNN-Transformer para la detección y clasificación de ataques en redes IoT. Para crear y probar este enfoque, analizamos el conjunto de datos CIC-IoT-2023, que incluye 33 tipos distintos de amenazas IoT distribuidos en 7 categorías distintas. Los hallazgos experimentales demuestran que el modelo propuesto funciona excelentemente, con una precisión del 99,96%, un recuerdo del 99,96%, una puntuación F1 del 99,96% y una precisión del 99,97% con una pérdida de 0,0123. Además, el modelo propuesto se analiza en función del tiempo computacional y el consumo de recursos, demostrando su eficacia para detectar y clasificar ataques, minimizando la complejidad computacional manteniendo una alta precisión.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La tecnología del Internet de las Cosas ha avanzado significativamente en los últimos años y hemos entrado en un mundo digital altamente interconectado. Actualmente, muchas industrias diferentes utilizan dispositivos de Internet de las Cosas (IoT), incluyendo sanidad, actividad agrícola, transporte, aeroespacial yproducción 1. Expertos reconocidos proyectan que el Internet de las Cosas (IoT) y las aplicaciones relacionadas afectarán significativamente a la economía mundial para 2025, con efectos anuales que oscilarán entre 3,9 billones y 11,1 billonesde dólares 2. Por otro lado, surgen nuevas dificultades relacionadas con la seguridad debido a esta conexión perfecta. A medida que los dispositivos IoT han evolucionado, se han vuelto cada vez más vulnerables a los ciberataques, lo que hace necesario prevenir accesos y ataques no autorizados a estos dispositivos. En un ambiente con una amplia variedad de dispositivos, algunos gadgets son más vulnerables al ataque queotros 3. Estos dispositivos no solo afectan a la seguridad del sistema de Internet de las Cosas, sino que también afectan a los canales de transmisión que forman parte del sistema, e incluso pueden causar fallos de la red de transmisión en parte o en su totalidad. El aprendizaje automático (ML) y el aprendizaje profundo (DL) son dos ramas de la inteligencia artificial (IA) que han mejorado significativamente varios dominios, como sistemassanitarios 4, visión porcomputador 5, comunicacionesinalámbricas 6 y seguridadde red 7. Estos avances han sido posibles gracias a la mejora de sus respectivas tecnologías. En cuanto al Internet de las Cosas, es práctica habitual instalar sistemas de detección de intrusiones que dependan del aprendizaje profundo y el aprendizajeautomático 4,5.

El sistema de detección de intrusiones sugerido escanea el tráfico de red en busca de flujos de datos inusuales y procesa paquetes, incluyendo información inocua capturada recientemente. Esto permite al sistema identificar ataques innovadores. Se utilizan dos enfoques, basados en firma y basados en anomalías, para detectar intrusiones. Un método de detección de intrusiones que se basa en firmas es mantener controles sobre el tráfico de paquetes dentro de la red y comparar los valores encontrados con los designados como firmas de ataques conocidos. Esto se hace para identificar vulnerabilidades en la red. Se utilizan métodos basados en anomalías para identificar ataques registrando parámetros de usuario que muestran una divergencia respecto a los parámetros considerados auténticos para los usuarios. Por ello, para mejorar la detección de ataques, esta investigación introduce un modelo de aprendizaje profundo que combina un Transformer con una red neuronal convolucional (CNN). Para crear subconjuntos de características multiespacio que permitan una representación no lineal más completa, los datos originales se transforman en varios subespacios utilizando un componente CNN en el modelo propuesto. Después de esto, se finalizan las asociaciones de características y se extraen cualidades más profundas, como características detalladas, usando el componente Transformer. Al final, la función softmax construye relaciones entre características y etiquetas. El enfoque sugerido muestra un rendimiento sobresaliente en la detección de ataques al combinar las mejores características del enfoque CNN y el modelo Transformer.

A continuación, se destacan los principales objetivos de esta investigación: (i) Construir un marco avanzado para detectar anomalías en el contexto del Internet de las Cosas. Este marco permite mejorar la detección de información maliciosa generada por dispositivos heterogéneos del Internet de las Cosas (IoT) que han sido hackeados o comprometidos. (ii) La investigación demuestra un método eficaz para extraer características relevantes de conjuntos de datos y detectar anomalías basadas en IoT. Cuando se aplica a estos dispositivos, esta técnica hace que la detección de ataques sea más efectiva. (iii) Para identificar ataques, el artículo presenta un modelo adaptativo que utiliza Transformers y CNN. Este modelo tiene como objetivo detectar intrusiones en el entorno del Internet de las Cosas que se originan en la red. (iv) Se utiliza una técnica de clasificación multiclase para probar y verificar el modelo propuesto utilizando el conjunto de datos de seguridad CIC-IoT23. Utilizando una técnica de clasificación multiclase, la evaluación distingue con éxito entre siete ataques lanzados por botnets IoT y tráfico inofensivo. (v) Utilizando varias características, se compara el enfoque sugerido con las metodologías actuales. Esta investigación comparativa muestra que el enfoque sugerido es mejor y exitoso para identificar ataques al Internet de las Cosas (IoT).

El modelo híbrido propuesto CNN-Transformer es mejor generalizando y siendo robusto que los métodos tradicionales IDS basados en firmas yanomalías 2,5 porque combina la extracción de características espaciales con la atención temporal. Obtiene mejor precisión y recuerdos con menos ingeniería manual de características que los métodos tradicionales de ML/DL 6,8. Los modelos híbridosanteriores 9,10 no podían adaptarse a cambios en tiempo real. El enfoque propuesto resuelve esto utilizando arquitectura ligera y optimización.

El dominio en rápida expansión del IoT y los problemas de seguridad asociados han provocado importantes estudios de detección de intrusiones. La revisión bibliográfica se centra en trabajos clave de investigación y sus contribuciones para proporcionar una comprensión más profunda de las soluciones actualmente consideradas de vanguardia.

Nandanwar y Katarya11 propusieron un modelo híbrido que utiliza una arquitectura adaptativa CNN-GRU con el propósito de detectar y clasificar ataques de botnets en entornos de Internet de las Cosas Industriales (IIoT).

Con una puntuación F1 del 98,59% y una tasa de precisión del 98,75% utilizando el conjunto de datos CIC-IoT2023, Jony et al.12 sugirieron un modelo basado en LSTM que predice con éxito los patrones de ciberataques. Enesta investigación 8 se sugirió una estrategia de ensamble de aprendizaje automático como método de clasificación binaria para detectar y erradicar datos falsos en redes IoT. El modelo emplea un conjunto de máquinas de aumento de gradiente para identificar anomalías y mitigar ataques de día cero. El modelo alcanzó una precisión del 98,27%. Además, la precisión y la memoria están en un 96,40% y 95,70% respectivamente, lo que lo hace adecuado para aplicaciones esenciales de IoT. de Caldas Filho y colaboradores desarrollaron un Sistema híbrido de Detección de Intrusiones (IDS) que combina IDS basado en red y basado en host. Este Sistema integrado de Respuesta a Intrusiones (IRS) detecta y previene proactivamente amenazas de día cero. El autor también utilizó un sistema de aprendizaje federado descentralizado para identificar anomalías mediante aprendizaje profundo. Este entrenamiento y detección federados con aprendizaje profundo alcanza una precisión de detección del 89,753% en una infraestructura IoT descentralizada. Wang et al.14 presentaron una herramienta de detección de amenazas llamada ThreatInsight, que redujo la necesidad de registros de auditoría del sistema. ThreatInsight identifica y atribuía a los atacantes utilizando enfoques de razonamiento basados en hechos y semánticos. Mediante la elaboración de informes de análisis, la tecnología mejora las capacidades de detección temprana en los sistemas de protección cibernética y ofrece análisis en tiempo real.

Chai et al.15 presentaron un método de detección de malware que utiliza convolución dinámica para extraer características y clases de características de forma adaptativa. El autor sugirió una función de activación dinámica que utiliza correlaciones de muestras para disminuir el impacto de características irrelevantes, basada en un análisis de doble muestra. La distancia entre las muestras de consulta y los prototipos se calcula utilizando una técnica basada en métricas para la identificación exitosa de malware. En cuanto a los hallazgos experimentales, este método muestra mejoras significativas respecto a los algoritmos existentes de detección de malware de pocos disparos. Shah et al.16 presentan un modelo de sistema impulsado por IA destinado a mejorar la seguridad del IoT detectando usuarios maliciosos mediante clasificación binaria y empleando tecnología blockchain para el almacenamiento seguro de datos. Aborda posibles exploits de los contratos inteligentes blockchain mediante la implementación de algoritmos de aprendizaje profundo para la clasificación, proporcionando finalmente un marco de seguridad integral evaluado mediante diversas métricas de rendimiento.

Luo et al.17 introdujeron un sistema novedoso para aplicaciones de Internet de las Cosas (IoT), EDL-WADS, que cuenta con cuatro módulos: un módulo de aprendizaje de características para representaciones de peticiones de URL, un módulo de aprendizaje profundo con tres modelos para representaciones diversas de peticiones de URL, un módulo de decisión para integrar resultados de modelos usando un clasificador de conjunto y un módulo de ajuste fino para actualizaciones en tiempo real. EDL-WADS superó a los modelos base con una precisión del 99,47%, una tasa de positivos verdaderos del 99,29%, una precisión del 99,70% y una tasa de falsos positivos del 0,0033 en pruebas en conjuntos de datos variados. Sus limitaciones incluían la concentración del sistema en la inyección SQL y la detección de scripts entre sitios, así como el bajo rendimiento del modelo CNN.

Tian et al.18 presentaron un método distribuido basado en aprendizaje profundo para detectar ataques en la web mediante el examen de URLs. Desplegado en dispositivos edge, el sistema está diseñado para identificar amenazas web. Se emplearon dos modelos profundos concurrentes para realizar experimentos en el sistema, y el sistema se comparó con sistemas existentes utilizando una variedad de conjuntos de datos. El sistema es competitivo para la detección de ataques web con una precisión del 99,410%, un 98,91% de TPR y una tasa de detección del 99,55% de solicitudes normales.

Chai et al.19 propusieron MalFSCIL, un marco novedoso que utiliza un enfoque de entrenamiento desacoplado con un autocodificador variacional para reducir el olvido catastrófico y una técnica de delimitación dinámica de límites basada en prototipos de clases para la delimitación exacta de límites de decisión. Este enfoque supera a otros métodos de detección y clasificación de malware en conjuntos de datos de código abierto y corporativos. La Tabla 1 9,7,20,21,22,23,24,25,26,27,28,29,30,31,32 ofrece un breve repaso del trabajo existente.

Tabla 1: Literatura de trabajos existentes sobre detección de ataques IoT usando ML/DL. La tabla ofrece un breve repaso de los trabajos existentes. Por favor, haz clic aquí para descargar esta tabla.

El modelo propuesto CNN-Transformer ofrece seguridad completa para las redes IoT porque aborda directamente las posibilidades de ataque limitadas y las capacidades limitadas de aprendizaje de características de métodos anteriores. Combinar la codificación convolucional con mecanismos de auto-atención elimina los límites bajos de detección de métodos anteriores solo CNN 10,13 o soloTransformer-33. Además, los cambios específicos que hicimos en cada capa de codificación CNN hacen que la transferencia de dominio sea más efectiva, reduciendo el tiempo de entrenamiento y la sobrecarga computacional. Estas mejoras permiten el uso de análisis de seguridad en tiempo real en entornos operativos de IoT. El modelo propuesto supone un gran paso para proteger los ecosistemas IoT frente a nuevas amenazas más complejas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta sección analiza materiales y métodos de investigación relacionados con sistemas de detección de ataques en el entorno IoT. Para replicar los experimentos en el conjunto de datos CIC-IoT-2023, este protocolo describe procedimientos específicos. La siguiente Tabla de Materiales contiene una lista de todo el hardware y software utilizado. Python (pandas, scikit-learn y TensorFlow Keras) se utiliza para implementar la pipeline, que se ejecuta en Google Colab con PySpark disponible para preprocesamiento de archivos grandes. Se ha proporcionado una descripción detallada de los procedimientos de preprocesamiento de datos.

Conjunto de datos
El conjunto de datos CIC-IoT-2023, que fue publicado por el Instituto Canadiense de Ciberseguridad de la Universidad de Nuevo Brunswick. "CIC IoT dataset 2023" (página de datasets UNB CIC) y el artículo34 del conjunto de datos son la página y el artículo oficial del CIC. El conjunto de datos puede descargarse desde la página web del CIC y es accesible al público general. En lugar de usar PCAPs en bruto, en esta investigación se utilizan los archivos CSV de características preextraídos (flujos/características). Wireshark/mergecap y CICFlowMeter se utilizan en los experimentos en bruto que generaron el conjunto de datos; en esta obra se utilizan CSVs destacados. Este conjunto de datos, derivado de dispositivos IoT reales, se utiliza en esta investigación. Incluido en el conjunto de datos se incluyen registros de 33 ataques conocidos a 105 dispositivos IoT diferentes. A diferencia de conjuntos de datos IoT anteriores, CIC-IoT-2023 incluye una amplia variedad de tipos de ataques. La cantidad de cada etiqueta vinculada al tráfico benigno se muestra en la Figura 1. Un total de 46 atributos y 1 etiqueta conforman este conjunto de datos. En comparación con CSE-CIC-IDS 2018, que tenía 84 características, CIC-IoT-2023 tiene 37 menos de funcionalidades.

figure-protocol-1
Figura 1: Recuento de ataques en el conjunto de datos CICIoT2023. Se describen los nombres de conteo de diferentes tipos de ataques y registros benignos en el conjunto de datos CICIot2023. Estos diferentes tipos de ataques se clasifican ampliamente en 7 clases de ataque. Así que hay un total de 8 clases, incluyendo benigna en la clasificación multiclase. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Preprocesamiento de datos
No se deben utilizar conjuntos de datos en algoritmos de aprendizaje profundo sin un preprocesamiento suficiente. El preprocesamiento se realiza para proporcionar al algoritmo datos más finos, haciendo que el modelo sea finalmente más eficiente. La salida de la tubería de preprocesamiento—tras la codificación de etiquetas, el escalado de características y la selección de características—se denomina "Datos Finales" y sirve como entrada tanto para los componentes CNN como para los de Transformer. Los siguientes pasos están en Google Colab usando Python. Esta investigación utilizó Python 3.8.10, pandas 1.3.4, NumPy 1.21.4, scikit-learn 1.0.2, matplotlib 3.4.3 y TensorFlow/Keras 2.6.0. La semilla aleatoria se estableció en 42 para todas las partidas.

Adquisición de datos
Este paso incluye limpiar los datos adquiridos en contextos reales, ya que a menudo contienen muchos errores e inconsistencias. Si el conjunto de datos contiene valores de texto, por ejemplo, es imposible utilizar dichos valores en el entrenamiento de aprendizaje profundo sin convertirlos primero a forma numérica. Al trabajar con el conjunto de datos, lo primero que se hace es eliminar los valores en blanco y eliminar celdas sin datos. Se eliminaron las filas con datos faltantes para evitar cualquier efecto adverso en el modelo.

El conjunto de datos CIC-IoT-2023 se carga usando pd.read_csv('ciciot2023_features_part.csv'). Esta investigación utilizó Google Colab para el entrenamiento de modelos y PySpark para la limpieza inicial. Para detectar ausencias, se utilizan los siguientes métodos: df.shape, df.info(), df.isnull().sum() y df.duplicated().sum() para duplicados. Los duplicados se eliminan usando df.drop_duplicates(inplace=True). El tipo numérico de columna se verifica usando la fórmula df[col] = pd.to_numeric(df[col], errors='coerce'). Si aparecen nuevos NaN, se vuelve a aplicar el manejo de valor faltante. Las características que son constantes o casi constantes también se eliminan usando df.drop(columns=low_variance_cols, inplace=True).

Codificación de etiquetas
El siguiente paso es transformar las etiquetas de texto en una representación numérica para que el modelo pueda entenderlas. Para la clasificación binaria, existen dos tipos separados de etiquetas. Hay 46.686.579 registros, de los cuales 45.588.384 están catalogados como ataques maliciosos. Con 1.098.195 discos incluidos, la etiqueta benigna está fijada en 0. Existen siete tipos distintos de ataques en la clasificación multiclase. Hay ocho etiquetas en total, incluyendo el tráfico benigno. La Figura 2 muestra el recuento de cada categoría de estas etiquetas. El mapeo multiclase usado en esta investigación es: 0 para Benigno, 1 para DoS, 2 para DDoS, 3 para reconocimiento, 4 para ataque web, 5 para suplantación, 6 para fuerza bruta y 7 para ataque mirai.

figure-protocol-2
Figura 2: El porcentaje de clases de ataque incluyendo tráfico benigno. Existen siete tipos distintos de ataques en la clasificación multiclase. Hay ocho etiquetas en total, incluyendo el tráfico benigno. La figura muestra el recuento de cada categoría de estas etiquetas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Escalado de características
El escalado de características es un método común para mejorar el rendimiento general de los modelos de aprendizaje profundo. El escalado de características en este estudio se realiza utilizando tecnologías Min Max Scaler y Standard Scaler. La investigación no los utilizó para las pruebas; en su lugar, solo utilizaba el escalador del conjunto de entrenamiento para evitar fugas de datos. Los datos pueden normalizarse a una distribución de media cero y una desviación estándar con la ayuda del método Standard Scaler. Una forma de hacerlo es dividir el número original por la desviación estándar. Para esto, la función StandardScaler() se llama importando StandardScaler desde sklearn.preprocessing. Al aplicar un rango, a menudo entre 0 y 1, el Min Max Scaler normaliza los datos. Se utilizó la función MinMaxScaler() de scikit-learn para implementar esto.

Como se indica en la Ecuación (1), la fórmula de normalización es:

figure-protocol-3(1)

Donde X representa el valor original en puntos y X normalizado su forma transformada, Xmin representa el valor más bajo de la variable, mientras que Xmax denota el valor más alto de la variable dentro del conjunto de datos.

Selección de características
Incorporar todas las características de grandes conjuntos de datos en el entrenamiento no siempre es útil. Las características dentro del conjunto de datos pueden mostrar correlación y no mejorar el resultado. Además, un número excesivo de valores incrementa el coste de la formación. Para encontrar características que no son necesarias, calculamos sus matrices de correlación y excluimos aquellas con correlaciones fuertes del conjunto de datos. El coeficiente de correlación de Pearson, que cuantifica la relación lineal entre dos características, se utiliza para calcular la correlación. Se obtiene un valor entre -1 y +1 dividiendo la covarianza de las dos variables por el producto de sus desviaciones estándar. Esto es opcional y se realiza en la tubería con la Eliminación de Características Recursivas (RFE) para la selección de características con un clasificador de árbol de decisión. La eliminación de características recursivas encuentra repetidamente las características más relevantes entrenando el modelo clasificador y descartando las menos significativas. El código utiliza RFE de sklearn.feature_selection con un clasificador de árbol de decisión como estimador. Tras la implementación de la eliminación recursiva de características, se han seleccionado 30 de las 46 características para cada una de las siete categorías de ataque, como se muestra en la Tabla 2. Una característica puede categorizarse bajo muchas clasificaciones de ataque. Tras completar el proceso descrito en la Figura 3, se lleva a cabo el proceso de selección de las clases de ataque incluidas en el conjunto de datos. Las CNN modernas destacan en el aprendizaje de representaciones jerárquicas a partir de datos en bruto, pero preseleccionar un conjunto de características pequeño y de alta calidad usando RFE tiene ventajas significativas. Primero, RFE con un clasificador de árbol de decisión elimina rápidamente datos ruidosos o redundantes que podrían retrasar la convergencia durante los primeros ciclos de entrenamiento. En segundo lugar, centrar la CNN en un grupo más pequeño de señales realmente valiosas reduce el sobreajuste, lo cual es crucial en conjuntos de datos de tráfico IoT con patrones benignos y dañinos muy sesgados. El método de eliminación recursiva del árbol de decisión clasifica las características para una mejor explicabilidad del modelo y para identificar sesgos específicos de dominio antes del entrenamiento profundo. Finalmente, inicializar el CNN-Transformer en este conjunto de características podado produce una convergencia más rápida y un menor uso de memoria GPU, demostrando que RFE acelera y estabiliza activamente el aprendizaje de características de extremo a extremo.

Tabla 2: Las características seleccionadas del conjunto de datos "CIC-IoT-2023". Se han seleccionado 30 de las 46 características para cada una de las siete categorías de ataque en esta investigación utilizando RFE. La tabla describe las 30 características seleccionadas. Por favor, haz clic aquí para descargar esta tabla.

figure-protocol-4
Figura 3: Funcionamiento del modelo híbrido propuesto. La finalización del proceso se detalla en la figura. Se lleva a cabo el proceso de selección de las clases de ataque incluidas en el conjunto de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Divide el conjunto de datos en un conjunto de 80% de tren y otro de prueba del 20% siguiendo el paso: train_test_split (X_train, y_train, test_size=0,20, random_state=42). El 80% del conjunto de entrenamiento se divide además usando train_test_split(X_train, y_train, test_size=0,20,random_state=42). Toda la selección de modelos y el ajuste de hiperparámetros se realizan utilizando estas divisiones precisas. La técnica de sobremuestreo de minorías sintéticas (SMOTE) se utiliza cuando existe un problema de desequilibrio de clases. Solo el set de entrenamiento fue sometido a SMOTE tras la división y escalado. El efecto de la SMOTE se presenta en los resultados. Tras RFE, el estudio sigue en paralelo las ramas CNN y Transformer utilizando las mismas 30 características que se eligieron para cada muestra. Los detalles adicionales sobre el procesamiento de estas 30 características se mencionan en la sección de metodología propuesta.

Metodología propuesta
Se construirá un marco de seguridad eficaz para sistemas IoT que pueda detectar ataques con mayor precisión con la ayuda de un modelo de aprendizaje profundo. Se propone una estrategia de seguridad híbrida que combine redes neuronales convolucionales (CNN) con modelos transformadores. Este método consiste en entrenar la arquitectura CNN usando pesos de un conjunto de datos mayor y luego afinar los parámetros del modelo usando un conjunto de datos más pequeño como objetivo. El objetivo principal de este modelo es mejorar la eficiencia de la detección de intrusiones en el IoT.

Esta investigación utilizó PySpark, una plataforma de Google Colab que permite a los usuarios ejecutar programas en Python en Apache Spark. Utilizando los paquetes Scikit-learn y Keras, se han desarrollado algoritmos de aprendizaje profundo. Para entrenar y probar el modelo, se utilizó la siguiente configuración: Sistema operativo: Mac OS v12.6; - M2 Apple Silicon; - Pantalla de 13,3 pulgadas; - CPU de 8 núcleos; - GPU de 8 núcleos; - 32 GB de RAM; - SSD de 256 GB.

El Instituto Canadiense de Ciberseguridad (CIC) ha creado un conjunto de datos completo de amenazas IoT para avanzar en aplicaciones de análisis de seguridad en entornos prácticosde IoT 34. Hubo un total de 33 ataques a una red de 105 dispositivos conectados en un sistema IoT. Con un total de 46.179.314 incidentes, los ataques se dividen en siete grupos: DDoS, Recon, DoS, basados en la web, suplantación y fuerza bruta, además de Mirai. Hay 37.349.263 instancias en el conjunto de entrenamiento, 8.830.051 instancias en el conjunto de pruebas y un total de 46 características en el conjunto de datos. En todos los casos, dispositivos IoT malintencionados lanzan ataques a otros dispositivos IoT. Un total de 67 dispositivos IoT y 38 dispositivos Zigbee y Z-Wave conectados a 5 hubs se vieron afectados por los ataques. Se puede configurar una red de sensores, cámaras, microcontroladores y dispositivos inteligentes para el hogar que ejecuten diferentes tipos de ataques y registren el tráfico que resulta de ellos. Wireshark captura el tráfico de red en formato PCAP para su análisis más profundo. Como cada experimento almacena dos flujos de datos, se utiliza mergecap para combinar los archivos PCAP. Se utilizaron varios dispositivos IoT para compilar el conjunto de datos, incluyendo reproductores de audio, grabadoras de vídeo, hubs, enchufes, sistemas de domótica, iluminación, sensores y dispositivos de nueva generación.

Esta sección ofrece una metodología de investigación detallada que consta de muchas fases secuenciales utilizadas en el estudio. Además, la parte define el algoritmo propuesto de forma secuencial y proporciona un diagrama de flujo detallado del proceso de investigación.

CNN
El algoritmo CNN utiliza una red neuronal artificial, un enfoque de aprendizaje profundo. La Figura 4 ilustra el algoritmo subyacente que utiliza CNN: capas totalmente conectadas, pooling, aplanamiento y convolución forman parte de él. Una CNN no puede funcionar sin la capa de convolución. Los datos de las celdas receptoras se procesan mediante la capa convolucional.

En la Ecuación (2), el volumen de salida (Vo) está determinado por P (zancada), Vi (volumen de entrada), S (tamaño del núcleo de neuronas de la capa convolucional) y M (relleno cero).

figure-protocol-5(2)

Después, se utiliza un filtro para extraer las propiedades del valor de entrada durante la convolución. Esta capa crea un mapa de características. Reducir el tamaño de los datos de entrada mediante agrupación simplifica el entrenamiento y reduce el número de parámetros a calcular. La capa de agrupación puede elegirse utilizando el valor más grande dentro del tamaño dado o la media de los valores. La técnica desarrollada incluye dos capas de convolución y dos niveles de agrupación. Aquí comienza el proceso de extracción de características. Los datos de características obtenidos están disponibles para su cálculo. Los algoritmos CNN están disponibles en una, dos o tres dimensiones. El modelo empleaba una red neuronal convolucional con solo una dimensión. Las capas en el área clasificadora se conocen como aplanadas, completamente conectadas. Los datos deben aplanarse tras la fase convolucional para que puedan usarse en la fase completamente conectada. La capa de aplanamiento es donde se realiza este proceso. Dentro de la capa totalmente enlazada, se utiliza el paradigma convencional de las redes neuronales artificiales. Para aplicar CNN a los datos que no son basados en imágenes, las dimensiones de entrada deben transformarse. Como resultado, CNN puede usar capas convolucionales unidimensionales que sonunidimensionales de 35 dimensiones.

figure-protocol-6
Figura 4: Algoritmo básico de CNN. Se describen el funcionamiento básico y los componentes del modelo CNN. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Aprendizaje con transformadores
Además, para realizar más experimentos, utilizamos el marco de modelado de transformadores. El modelo puede manejar simultáneamente todos los puntos de la secuencia gracias al mecanismo de auto-atención del transformador. El resultado es un tiempo de entrenamiento más rápido para el modelo y un mejor uso de los recursos informáticos por parte del transformador durante la inferencia y el entrenamiento. El transformador está compuesto principalmente por una serie de codificadores y decodificadores apilados. El proceso de codificación implica cambiar un lenguaje por otro, pero el proceso de decodificación implica determinar la probabilidad de que otro lenguaje se utilice con resultados previos. Dado que los codificadores son principalmente responsables de la extracción de características, el modelo sugerido utiliza exclusivamente componentes codificadores. El codificador transformador consta de incrustación de entrada/posición, una red neuronal de avance, normalización de capas, autoatención multicabeza y una red residual.

Para preparar los datos de entrada para su procesamiento por el transformador, se utiliza una capa de incrustación para convertir las características categóricas en representaciones vectoriales densas. La incrustación de posición muestra cómo las características se conectan secuencialmente, mientras que la incrustación de entradas muestra cómo diferentes entradas están relacionadas en un espacio común. Antes de que el transformador procese características categóricas, esta investigación utiliza incrustación de entrada para transformarlas en vectores densos.

Una expansión del mecanismo de atención, el mecanismo de autoatención multicabezal, es la base de la arquitectura del transformador. Utilizando un producto escalar escalar, esta investigación emplea el mecanismo de autoatención multicabezal.

figure-protocol-7(3)

donde se denotan respectivamente la matriz de consulta (Q), la matriz clave (K), la matriz de valores (V) y la dimensión de la matriz clave (dk). Al permitir que el modelo se concentre en datos de diversas características mapeadas a subespacios separados, resultando en valores de atención distintos, un mecanismo de atención a escala de producto escalar con múltiples cabezas difiere del mecanismo de atención escalar escalar a escala. El sobreajuste es menos probable cuando los niveles de atención se calculan de forma independiente para cada cabeza. La formulación específica es la siguiente:

figure-protocol-8(4)

figure-protocol-9 (5)

Donde h es el número de cabezas de atención, d,v yd representan la dimensión de v y el modelo. Además

figure-protocol-10

A continuación, se utiliza la normalización de capas para estabilizar el proceso de entrenamiento. Para evitar la explosión de gradiente, la normalización de capas limita la salida de cada capa a un cierto rango. Tanto la convergencia como la velocidad de entrenamiento del modelo pueden mejorar con esto. Mientras que la normalización por lotes tiene en cuenta los datos por lotes, la normalización por capas no lo hace.

Modelo propuesto CNN-Transformer
Esta investigación ofrece una técnica híbrida CNN-Transformer para detectar intrusiones en redes IoT, considerando los beneficios distintivos de ambas arquitecturas. La Figura 5 muestra los componentes principales de la técnica híbrida propuesta CNN-Transformador. Tras realizar todas las etapas de preprocesamiento, incluyendo limpieza, normalización, codificación de etiquetas y selección de características, cada muestra del conjunto de datos se representa mediante un vector de características de 30 dimensiones, llamado Datos Finales. Los mismos Datos Finales se duplican y se alimentan en paralelo a ambas ramas del modelo híbrido. Luego, estos Datos Finales se envían simultáneamente a los bloques CNN y Transformer. CNN y Transformer no dependen en absoluto el uno del otro; Ambos pueden trabajar con los mismos datos de entrada al mismo tiempo. Las salidas aplanadas de las dos ramas, CNN y Transformer, se concatenan para producir un vector de características fusionadas, que se pasa a las capas densas, que las clasifican. El bloque CNN cambia la forma de entrada a (num_features, 1) para que se puedan realizar operaciones convolucionales entre dimensiones de características para encontrar patrones espaciales locales. Al mismo tiempo, la rama Transformer cambia la misma entrada a un formato secuencial y la envía a un espacio de incrustación de dimensión superior, seguido de la codificación posicional. Esto permite al transformador prestar atención a sí mismo en el espacio de características y encontrar relaciones contextuales globales. El diseño único del transformador se utiliza para la extracción de características, mientras que la función sigmoide y las capas completamente enlazadas proporcionan la conexión de mapeo entre características y etiquetas. El modelo CNN-Transformador está representado estructuralmente por la Figura 5. El resultado es un sistema de ocho categorías para clasificar ataques, con DDoS, Reconocimiento, DoS, Benigno, Web-based, Suplantación, Brute Force y Mirai como partes componentes. El proceso de evaluación del transformador CNN propuesto se muestra en la Figura 5.

figure-protocol-11
Figura 5: Arquitectura del modelo propuesto. La figura muestra la forma de entrada y el proceso de evaluación del CNN-Transformer propuesto. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Dos redes neuronales convolucionales unidimensionales (CNN) con filtros de 64 y 128 unidades y un tamaño de 3 núcleos, dos capas de max-pooling, un escalón de aplanamiento, tres capas densas con 256, 128 y 64 unidades, y tres capas de dropout conforman la capa de red neuronal convolucional (CNN).

Los datos de entrada se procesan mediante una capa convolucional 1D con una función de activación de ReLU, 64 filtros, un núcleo 3x3 y un paso 1x1 en la primera capa. Tras la capa anterior hay una capa MaxPooling1D con un tamaño de pool de 2. Para hacer el modelo más flexible y disminuir su coste computacional, esta capa disminuye las dimensiones espaciales del área de salida. La tercera capa es otra capa convolucional 1D; tiene 128 filtros, un núcleo de tres tamaños, una escala de uno y una función de activación llamada ReLU. Usando más filtros para extraer las características de entrada, esta capa es similar a la primera capa de max pooling. La salida de la primera capa se procesa entonces usando la técnica. Después, se añadió una capa máxima de pooling después de la segunda capa de convolución, y su tamaño de pool también fue 2. Una vez más, esta capa se utiliza para reducir el muestreo de los mapas de características. La quinta capa es una capa de aplanamiento, y toma la salida de la capa anterior y la convierte en un vector unidimensional.

Los subconjuntos de características obtenidos se incrustan como último paso antes de convertirse en la entrada del transformador. Además, se utiliza la atención multi-cabeza —un vector unidimensional de ocho cabezas con una dimensión de 32 claves— para evaluar la importancia de cada cabeza. La capa de atención multi-cabeza es el componente principal del transformador. Esta capa permite al modelo aprender de las representaciones incrustadas de diferentes características de forma adaptativa. La capa de atención de múltiples cabezas está compuesta por varios cabezales de autoatención, que también se denominan "atención escalada en producto escalar". Tras aplicar la normalización de capas con la épsilon ajustada a 1e-6, el objetivo es eliminar discrepancias de escala entre diversas características y garantizar la estabilidad de la salida. Al mantener la salida de cada capa dentro de un rango predeterminado, la normalización de capas reduce la probabilidad de explosión del gradiente. Tras la salida del transformador hay una capa de aplanamiento, que simplifica su combinación con la CNN al reducirla a un solo vector.

El siguiente paso es combinar las salidas aplanadas de CNN y Transformer usando una capa de concatenación. La función de activación "relu", regularización L2 y una capa densa con 256 unidades siguen a la capa de aplanamiento. A esto le sigue una capa de dropout con una tasa de 0,5, que ayuda a evitar el sobreajuste. A continuación se sigue una capa densa adicional de 128 unidades usando regularización L2 y la función de activación "relu". La tasa de abandono en una capa adicional es 0,3. La función de activación de ReLU, la regularización L2 y una capa densa de 64 unidades conforman la capa siguiente. La siguiente capa adopta la forma de una capa de dropout de 0,2 tasas, eliminando aleatoriamente el 20% de las unidades en su interior. Una capa densa con una función de activación softmax crea una distribución de probabilidad para las clases de salida de la última capa. Hay exactamente tantas unidades en esta capa como clases de salida.

El modelo sugerido puede expresarse numéricamente de la siguiente manera:
Sea X los datos de entrada CNN, donde X figure-protocol-12 R(n×1), tras remodelar, y n es el número de características seleccionadas, respectivamente. X se coloca en un espacio de incrustación de dimensión superior de forma R(n × d_model) para el bloque Transformer. Antes de entrar en el mecanismo de autoatención, se utiliza codificación posicional.

A continuación se muestra la expresión de la operación en la capa Conv1D, que utiliza 64 filtros y un tamaño de núcleo de 3:

figure-protocol-13(6)

donde Yi,j es la salida en la posición j deli-ésimo filtro, k es el núcleo de tamaño 3, b1figure-protocol-14 R64 es el término de sesgo para cada filtro, Wk representa los pesos del filtro y ReLU es la función de activación. A continuación, se aplica la capa MaxPooling con un tamaño de pool de 2, dando una salidaZ 1,j.

figure-protocol-15(7)

Se incluye una capa adicional de convolución ID con un tamaño de núcleo de 3 y 128 filtros como tercera capa del modelo; su expresión es:

figure-protocol-16(8)

Donde k es el núcleo de tamaño 3, b2 figure-protocol-17 R128 es el término de sesgo para cada filtro, y ReLU es la función de activación. Se aplica otra capa de pool máximo, recibiendo la entrada de la segunda capa de convolución con un tamaño de pool de 2. La salida Z2,j viene dada por:

figure-protocol-18(9)

La quinta capa es una capa de aplanamiento expresada como:

figure-protocol-19(10)

A continuación están las capas transformadoras, que incluyen una capa de incrustación, una capa de atención multicabeza y normalización de capas

figure-protocol-20(11)

E es el vector de incrustación para la etiqueta de clase de entrada c, y We es la matriz de pesos que contiene los vectores de incrustación para todas las categorías. Esto asigna cada entero en c a un vector denso de 32 componentes reales. A continuación viene una capa de atención multicabeza, como se formula en las Ecuaciones (3),(4) y (5).

La matriz clave tiene un tamaño ded k = 32 y una dimensión de h=8. D,V yD Modelo representan las dimensiones respectivas de V y modelo. Además figure-protocol-21

Para una salida x = MultiHead(Q,K,V), la normalización de capas proporciona:

figure-protocol-22(12)

Donde y es la salida normalizada, γ y β son los parámetros aprendibles, y μ y σ2 denotan la media y la varianza para x, respectivamente. A continuación está la capa de aplanamiento para el transformador, definida como

figure-protocol-23

Al final de todas las capas, la expresión resultante se muestra como

figure-protocol-24

figure-protocol-25

figure-protocol-26

figure-protocol-27

figure-protocol-28

figure-protocol-29

figure-protocol-30

figure-protocol-31

donde Z1figure-protocol-32R256, Z2figure-protocol-33R128, Z3figure-protocol-34R 64 e Yfigure-protocol-35R 8. Este modelo híbrido también calcula la función de pérdida para la clasificación multiclase, que puede expresarse como

figure-protocol-36

Dónde:
Yc representa la etiqueta verdadera (codificada con un solo hot) para la clase cc,
Y'c es la probabilidad predicha para la clase c
El algoritmo propuesto se explica en detalle en la Tabla 3 .

Tabla 3: El algoritmo propuesto CNN-Transformer. El algoritmo propuesto se explica paso a paso en la Tabla 3. Por favor, haz clic aquí para descargar esta tabla.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta sección presenta los parámetros de evaluación junto con los resultados de las pruebas.

Métricas de evaluación del rendimiento
La efectividad de los modelos puede evaluarse utilizando varios criterios definidos para su evaluación. La precisión, la memoria, la precisión, la puntuación F1, la ROC, la matriz de confusión y otras métricas estadísticas se muestran en la Tabla 4. Las métricas proporcionan información sobre el...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El modelo CNN-Transformer se probó en los conjuntos de datos CICIoT2023, reservando un 80% para entrenamiento y un 20% para pruebas. El modelo alcanzó una precisión del 99,97%, una puntuación F1 del 99,96%, una memoria del 99,97%, una precisión del 99,96% y una pérdida de 0,0123, lo que confirma su eficacia para la detección de intrusiones en IoT. Los enfoques basados en CNN, similares a loshallazgos 13, son competentes en detectar pequeños patrones espaciales den...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Quiero expresar mi especial agradecimiento y agradecimiento a mi guía, la Dra. Sima, por compartir su conocimiento y experiencia en este estudio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Apple M2 (CPU de 8 núcleos)ManzanaN/A(OS) proporciona el entorno en el que operan los marcos y herramientas de aprendizaje profundo.
Conjunto de datos CICIoT2023UNBhttps://www.unb.ca/cic/datasets/iot2023.htmlDaset de IoT disponibles públicamente
Keras 2.6.0Kerashttps://keras.io/Una API que se ejecuta sobre TensorFlow, proporcionando una interfaz fácil de usar.
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Biblioteca de visualización para Python.
NumPy 1.21.4Entumecidohttps://numpy.org/Paquete fundamental para la computación científica con Python
NVIDIA Tesla P100 GPU (16 GB VRAM)Google Colab ProN/AMaterial de entrenamiento
Pandas 1.3.4Pandashttps://pandas.pydata.org/Herramienta de análisis y manipulación de datos.
Python 3.8.10Fundación de Software Pythonhttps://www.python.org/downloads/release/python-3810/El lenguaje más popular para el aprendizaje profundo debido a sus extensas bibliotecas y apoyo comunitario.
scikit-learn 1.0.2Scikit Learnhttps://scikit-learn.org/Biblioteca de aprendizaje automático para Python.
Seaborn 0.11.2Seabornhttps://seaborn.pydata.org/Biblioteca de visualización estadística de datos.
RAM del sistemaN/AN/A32 GB de RAM
TensorFlow 2.6.0Googlehttps://www.tensorflow.org/Ampliamente utilizado por sus herramientas y bibliotecas completas.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abbas, S., et al. A novel federated edge learning approach for detecting cyberattacks in IoT infrastructures. IEEE Access. 11, 112189-112198 (2023).
  2. Asharf, J., et al. A review of intrusion detection systems using machine and deep learning in internet of things: challenges, solutions and future directions. Electronics. 9 (7), 1177(2020).
  3. Qiu, J., Tian, Z., Du, C., Zuo, Q., Su, S., Fang, B. A survey on access control in the age of internet of things. IEEE Internet Things J. 7 (6), 4682-4696 (2020).
  4. Zhang, K., et al. Compacting deep neural networks for internet of things: methods and applications. IEEE Internet Things J. 8 (15), 11935-11959 (2021).
  5. Farooq, U., Tariq, N., Asim, M., Baker, T., Al-Shamma'a, A. Machine learning and the internet of things security: solutions and open challenges. J Parallel Distrib Comput. 162, 89-104 (2022).
  6. Regan, C., et al. Federated IoT attack detection using decentralized edge data. Mach Learn Appl. 8, 100263(2022).
  7. Sarhan, M., Layeghy, S., Moustafa, N., Portmann, M. Cyber threat intelligence sharing scheme based on federated learning for network intrusion detection. J Netw Syst Manage. 31 (1), (2023).
  8. Verma, P., et al. A novel intrusion detection approach using machine learning ensemble for IoT environments. Appl Sci. 11 (21), 10268(2021).
  9. Rajagopal, S., Kundapur, P. P., Hareesha, K. S. A stacking ensemble for network intrusion detection using heterogeneous datasets. Secur Commun Netw. 2020, 4586875(2020).
  10. Enhancing IoT security with CNN and LSTM-based intrusion detection systems. Gueriani, A., Kheddar, H., Mazari, A. C. Proc Int Conf Pattern Anal Intell Syst, 6, 1-7 (2024).
  11. Nandanwar, H., Katarya, R. Deep learning enabled intrusion detection system for industrial IoT environment. Expert Syst Appl. 249, 123808(2024).
  12. Jony, A. I., Arnob, A. K. B. A long short-term memory based approach for detecting cyber attacks in IoT using CIC-IoT2023 dataset. J Edge Comput. 3 (1), 28-42 (2024).
  13. de Caldas Filho, F. L., et al. Botnet detection and mitigation model for IoT networks using federated learning. Sensors. 23 (14), 6305(2023).
  14. Wang, Z., et al. ThreatInsight: innovating early threat detection through threat-intelligence-driven analysis and attribution. IEEE Trans Knowl Data Eng. 36 (12), 9388-9402 (2024).
  15. Chai, Y., Du, L., Qiu, J., Yin, L., Tian, Z. Dynamic prototype network based on sample adaptation for few-shot malware detection. IEEE Trans Knowl Data Eng. 35 (5), 4754-4766 (2023).
  16. Shah, H., et al. Deep learning-based malicious smart contract and intrusion detection system for IoT environment. Mathematics. 11 (2), 418(2023).
  17. Luo, C., et al. A novel web attack detection system for internet of things via ensemble classification. IEEE Trans Ind Inform. 17 (8), 5810-5818 (2021).
  18. Tian, Z., et al. A distributed deep learning system for web attack detection on edge devices. IEEE Trans Ind Inform. 16 (3), 1963-1971 (2020).
  19. Chai, Y., et al. MalFSCIL: a few-shot class-incremental learning approach for malware detection. IEEE Trans Inf Forensics Secur. 20, 2999-3014 (2025).
  20. Maghrabi, L. A. Automated network intrusion detection for internet of things: security enhancements. IEEE Access. 12, 30839-30851 (2024).
  21. He, M., et al. Reinforcement learning meets network intrusion detection: a transferable and adaptable framework for anomaly behavior identification. IEEE Trans Netw Serv Manage. 21 (2), 2477-2492 (2024).
  22. Oseni, A., et al. An explainable deep learning framework for resilient intrusion detection in IoT-enabled transportation networks. IEEE Trans Intell Transp Syst. 24 (1), 1000-1014 (2023).
  23. Khan, F., et al. Trustworthy and reliable deep-learning-based cyberattack detection in industrial IoT. IEEE Trans Ind Inform. 19 (1), 1030-1038 (2023).
  24. IoT anomaly detection using a multitude of machine learning algorithms. Balega, M., et al. Proc IEEE Appl Imagery Pattern Recognit Workshop, 2022, 1-7 (2022).
  25. A hybrid machine learning approach to anomaly detection in industrial IoT. Jayesh, T. P., et al. Proc Int Conf Adv Comput Commun Embedded Syst, 3, 32-36 (2023).
  26. Mezina, A., Burget, R., Travieso-Gonzalez, C. M. Network anomaly detection with temporal convolutional network and U-Net model. IEEE Access. 9, 143608-143622 (2021).
  27. Ahmad, Z., et al. Anomaly detection using deep neural network for IoT architecture. Appl Sci. 11 (15), 7050(2021).
  28. Raman, M., et al. An efficient intrusion detection technique based on support vector machine and improved binary gravitational search algorithm. Artif Intell Rev. 53, (2020).
  29. Thaseen, I. S., et al. A hadoop based framework integrating machine learning classifiers for anomaly detection in the internet of things. Electronics. 10 (16), 1955(2021).
  30. Almiani, M., et al. Deep recurrent neural network for IoT intrusion detection system. Simul Model Pract Theory. 101, 102031(2020).
  31. A novel approach to detect IoT malware by system calls using deep learning techniques. Shobana, M., Poonkuzhali, S. Proc Int Conf Innovative Trends Inf Technol, 2020, 1-5 (2020).
  32. Farsi, M. Application of ensemble RNN deep neural network to the fall detection through IoT environment. Alex Eng J. 60 (1), 199-211 (2021).
  33. Tseng, S. M., Wang, Y. Q., Wang, Y. C. Multiclass intrusion detection based on transformer for IoT networks using CIC-IoT-2023 dataset. Future Internet. 16 (8), 284(2024).
  34. Neto, E. C. P., et al. CICIoT2023: a real-time dataset and benchmark for large-scale attacks in IoT environment. Sensors. 23 (13), 5941(2023).
  35. Tsimenidis, S., Lagkas, T., Rantos, K. Deep learning in IoT intrusion detection. J Netw Syst Manage. 30 (1), 8(2021).
  36. Kamal, H. Advanced hybrid transformer-CNN deep learning model for effective intrusion detection systems with class imbalance mitigation using resampling techniques. Future Internet. 16 (12), 481(2024).
  37. Alghieth, M. DeepECG-Net: a hybrid transformer-based deep learning model for real-time ECG anomaly detection. Sci Rep. 15 (1), 20714(2025).
  38. Kethineni, K., Pradeepini, G. Intrusion detection in internet of things-based smart farming using hybrid deep learning framework. Clust Comput. 27 (2), 1719-1732 (2024).
  39. Alharbi, A., et al. Botnet attack detection using local global best bat algorithm for industrial internet of things. Electronics. 10 (11), 1341(2021).
  40. Kunang, Y. N., et al. Attack classification of an intrusion detection system using deep learning and hyperparameter optimization. J Inf Secur Appl. 58, 102804(2021).
  41. Han, W., et al. Heterogeneous data-aware federated learning for intrusion detection systems via meta-sampling in artificial intelligence of things. IEEE Internet Things J. 11 (8), 13340-13354 (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Seguridad de IoTmodelo h bridomodelo Transformerdetecci n de anomal as de redclasificaci n de amenazas de IoTmonitoreo en tiempo realconjunto de datos CIC IoT 2023

Artículos relacionados