Research Article

Strategia di apprendimento proxy basata sulla diffusione con interazioni sicure tra pari per l'intelligenza generativa nel sistema cyber-fisico

DOI:

10.3791/68383

June 27th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Qui presentiamo il Generative Proxy Learning Framework (GPLF) che porta l'apprendimento federato basato su proxy (ProxyFL) per migliorare le soluzioni di intelligenza artificiale generativa nei sistemi cyber-fisici (CPS). Integrando funzionalità di privacy differenziali e metodi di crittografia, la GPLF migliora la protezione della privacy, riducendo la perdita di privacy, rendendo così le operazioni del sistema cyber-fisico più intelligenti e sicure.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il Cyber-Physical System (CPS) combina l'intelligenza computazionale con i processi fisici, consentendo il monitoraggio istantaneo, la capacità decisionale e i servizi di automazione in vari domini vitali. Inoltre, l'intelligenza artificiale generativa (AI) deve affrontare notevoli ostacoli all'implementazione all'interno di CPS perché gli ambienti distribuiti con dati sensibili presentano serie sfide per la gestione della privacy e della sicurezza. Le tecniche attuali, come il Federated Learning (FL), incontrano difficoltà sia nella diversità dei modelli che nel rischio che la privacy possa essere compromessa. Il Generative Proxy Learning Framework (GPLF) è la nostra soluzione innovativa che utilizza l'apprendimento federato basato su proxy (ProxyFL) specificamente adattato per applicazioni di intelligenza artificiale generativa all'interno di sistemi cyber-fisici (CPS). Nella GPLF, ogni partecipante mantiene due modelli: i partecipanti gestiscono un modello privato dedicato all'analisi dei dati locali insieme a un modello proxy condiviso che consente la collaborazione protetta dei nodi. Come base essenziale dei meccanismi di intelligenza artificiale generativa, i modelli di diffusione avanzati forniscono dati sintetici ad alta fedeltà insieme alla conservazione delle caratteristiche chiave dei dati. I modelli generano dati sintetici dei sensori, che consentono un migliore rilevamento delle anomalie e supportano la modellazione predittiva attraverso rappresentazioni autentiche del comportamento CPS in vari scenari. Il sistema raggiunge una protezione avanzata della privacy con meccanismi di privacy differenziali negli aggiornamenti dei dati proxy, mentre la comunicazione peer diretta nella rete beneficia di protezioni di crittografia avanzate. La GPLF serve le piattaforme CPS collegandosi a sensori in tempo reale e dispositivi IoT che supportano processi generativi sicuri, tra cui il rilevamento delle anomalie, la creazione di dati sintetici e la modellazione predittiva. I risultati dei test dei set di dati CPS di benchmark mostrano notevoli miglioramenti delle prestazioni con il 25% in meno di perdita di privacy e il 25% in più di capacità di scambio dati, insieme a un miglioramento del 18% nell'accuratezza delle attività generative per supportare il suo potenziale di trasformazione per operazioni CPS sicure e intelligenti.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La ricerca indaga i sistemi cyber-fisici (CPS) combinando l'intelligenza computazionale con i processi del mondo reale per consentire la sorveglianza in tempo reale insieme a capacità decisionali rapide e automazione del sistema1. Le tecnologie emergenti dell'Internet delle cose (IoT) e dell'intelligenza artificiale (AI) stanno ampliando in modo significativo la gamma di applicazioni in cui i sistemi CPS gestiscono funzioni essenziali per lo sviluppo di reti intelligenti e processi di automazione industriale, nonché per i servizi di erogazione dell'assistenza sanitaria2. Le organizzazioni che implementano CPS utilizzano sempre più modelli di intelligenza artificiale generativa, che forniscono la capacità di imitare il comportamento del sistema e di abilitare la modellazione predittiva insieme al rilevamento avanzato delle anomalie. Il formato distribuito dei dati CPS, combinato con i suoi attributi sensibili, porta a gravi vulnerabilità della privacy insieme a problemi di sicurezza e scalabilità nelle implementazioni di intelligenza artificiale generativa.

Le tecniche esistenti, come il Federated Learning (FL), si concentrano sulla protezione della privacy dei dati, ma devono affrontare limitazioni, che includono la minaccia di perdita di privacy degli aggiornamenti del modello, insieme a un supporto ridotto per l'IA generativa e una gestione inadeguata di diverse condizioni CPS3. Gli approcci attuali mancano dell'integrazione essenziale di meccanismi avanzati progettati sia per la generazione dei dati che per le misure di protezione quando si lavora in CPS distribuito durante il funzionamento in tempo reale. Poiché i framework attuali non sono all'altezza di diverse aree, la ricerca esistente dimostra esigenze significative che possono essere soddisfatte solo creando una nuova soluzione che offra modelli sicuri, scalabili e generativi insieme a una chiara protezione della privacy4.

Il nuovo studio Generative Proxy Learning Framework (GPLF) delinea un metodo appositamente realizzato per facilitare l'implementazione di funzioni di Generative AI all'interno di CPS. La GPLF implementauno schema FL 5 basato su proxy, in modo che gli utenti possano funzionare con modelli privati per l'esame dei dati individuali e modelli proxy per sostenere attività di apprendimento cooperativo protette. Questa ricerca mira al miglioramento della privacy dei dati attraverso l'applicazione di approcci di privacy differenziale combinati con crittografia omomorfica sicura e impiega modelli di diffusione avanzati per la produzione di dati sintetici di alta qualità. Il sistema supporta il rilevamento sicuro delle anomalie e le funzioni di modellazione predittiva, consentendo al contempo un trasferimento efficiente delle informazioni tra le operazioni CPS distribuite.

GPLF risolve le sfide esistenti della FL attraverso il suo design a framework a doppio modello, che offre protezione dei dati e flessibilità del sistema6. Ogni partecipante al CPS utilizza sia modelli privati che proxy, che stabiliscono due sistemi separati per ottenere la protezione della privacy locale e abilitare le capacità di apprendimento del team. Il modello privato utilizza operazioni localizzate per apprendere dai dati riservati di un partecipante e mantiene la privacy completa dei dati memorizzando le informazioni sensibili all'interno dei parametri di ciascun partecipante. Il sistema raggiunge le massime prestazioni nel rilevamento di anomalie e nel riconoscimento di modelli a livello locale7. Il modello proxy funge da meccanismo di apprendimento collettivo congiunto a disposizione di tutti i partecipanti per una condivisione sicura delle conoscenze. Il modello proxy si addestra con riservatezza tramite l'elaborazione di dati sintetici sterilizzati da modelli di diffusione e la comunicazione degli aggiornamenti attraverso la privacy differenziale e la crittografia omomorfica perché ciò consente un FL privato ma funzionale.

La strategia di diffusione consente la creazione di set di dati sintetici di qualità superiore che mantengono le caratteristiche essenziali nascondendo i dettagli personali. Questa ricerca ha rivelato progressi sostanziali, che si sono manifestati in un importante calo della perdita di privacy con funzioni di scambio dati aggiornate e migliori prestazioni delle attività generative, consentendo operazioni di sistema cyber-fisiche più resilienti. GPLF crea una nuova metodologia per il CPS intelligente unendo l'apprendimento che preserva la privacy con le capacità di intelligenza artificiale generativa8.

La GPLF presenta nuove funzionalità attraverso il suo design a doppio modello specificamente mirato alla gestione dei problemi di privacy nell'implementazione dell'IA generativa in CPS. Mentre l'apprendimento federato convenzionale utilizza un modello per tutti i partecipanti, la GPLF implementa sia modelli privati per l'esame dei dati locali che modelli proxy per eseguire attività di apprendimento di gruppo. Attraverso una rigorosa separazione dei dati, i pazienti mantengono le informazioni sensibili localmente, ma utilizzano i dati sintetici sanificati del modello proxy combinati con la privacy differenziale per ottenere una collaborazione sicura. Il modello proxy garantisce un solido rilevamento delle anomalie e una modellazione predittiva, mantenendo al contempo l'adattabilità del sistema attraverso dati sintetici di alta qualità generati da modelli di diffusione, garantendo la protezione della privacy degli utenti. GPLF si distingue come framework innovativo per i sistemi CPS sicuri perché il suo approccio a doppio modello fornisce una protezione della privacy rafforzata insieme a dati sicuri, mantenendo la scalabilità e l'efficienza operativa.

L'obiettivo dello studio è quello di sviluppare un Proxy-Based Federated Learning (ProxyFL), che richiede un'architettura a doppio modello per consentire un adattamento sicuro all'interno di CPS. Inoltre, i modelli di diffusione avanzati sono essenziali per fungere da punto di integrazione per la produzione di dati sintetici per mantenere le caratteristiche essenziali dei dati durante la salvaguardia della privacy. Infine, è necessario implementare metodi di privacy differenziale accanto a protocolli di crittografia omomorfica per garantire la sicurezza dei dati e proteggere la privacy durante l'aggregazione a gradiente.

La Tabella 1 9,10,11,12,13,14,15,16,17,18,19 evidenzia i processi fondamentali dei metodi esistenti e i loro risultati con alcune limitazioni critiche.

Tabella 1: Panoramica degli obiettivi chiave della ricerca esistente, dei componenti principali, dei risultati e dei limiti. Clicca qui per scaricare questa tabella.

Gli approcci esistenti per l'integrazione dell'IA generativa nei sistemi CPS dimostrano problemi critici con l'espansione a grandi implementazioni, mantenendo al contempo le normative sulla privacy e raggiungendo la flessibilità del sistema20. Gli attuali metodi di FL mostrano vincoli a causa di un'insufficiente varietà di modelli, dimostrando anche prestazioni deboli in sistemi dispersi e mutevoli ed esponendo i dati degli utenti a causa di pratiche di trasmissione dei dati vulnerabili. Le rappresentazioni dei dati ad alta fedeltà necessarie per il rilevamento delle anomalie, la generazione di dati sintetici e la modellazione predittiva in CPS spesso sfuggono a molte soluzioni di modellazione generativa, che possono compromettere la privacy e l'efficienza computazionale nei tentativi di raggiungere questi standard. Le attuali carenze di sistema confermano il requisito del framework per supportare processi di intelligenza artificiale generativa scalabili, sicuri ed efficienti.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il Generative Proxy Learning Framework (GPLF) rappresenta una nuova tecnologia che integra l'IA generativa con CPS e risolve importanti problemi di privacy dei dati insieme a metriche di sicurezza e prestazioni all'interno di sistemi di rete distribuiti. La funzionalità delle piattaforme CPS dipende da un monitoraggio aggiornato e da operazioni automatizzate che estraggono input di dati sensibili da un numero crescente di dispositivi e sensori IoT. È stato riscontrato che l'adozione di tecnologie di intelligenza artificiale generativa nei sistemi CPS introduce rischi speciali come le vulnerabilità della privacy combinate con sfide di sicurezza nelle configurazioni di rete distribuite. GPLF lancia un innovativo framework di apprendimento federato basato su proxy (ProxyFL) che supporta l'apprendimento collaborativo sicuro specificamente pensato per le attività generative per mitigare i problemi esistenti. Una valutazione approfondita del framework GPLF ha avuto luogo su una piattaforma CPS il cui banco di prova ha combinato diverse tecnologie di rete di sensori con dispositivi IoT e streaming di dati in tempo reale.

I partecipanti alla GPLF eseguono due modelli separati durante la loro partecipazione.
Un esclusivo modello privato funziona per l'esame dei dati locali, mantenendo i dati protetti dall'accesso esterno.
Il Shared Proxy Model5 del sistema consente una cooperazione sicura tra i partecipanti attraverso la tecnologia di crittografia abbinata a metodi di privacy differenziali.

Il framework utilizza modelli di diffusione per creare elaborati set di dati sintetici che guidano le capacità di rilevamento delle anomalie, mostrando al contempo la modellazione predittiva e il monitoraggio del comportamento del sistema durante diverse simulazioni di scenari. I set di dati sintetizzati mantengono importanti caratteristiche grazie a metodi efficaci di conservazione della privacy. Il framework gestisce scambi peer-to-peer sicuri tramite tecniche di crittografia avanzate che proteggono i canali di comunicazione da attacchi dannosi. Le valutazioni effettuate con GPLF su piattaforme CPS del mondo reale hanno mostrato come potrebbe apportare progressi sostanziali alle capacità operative sicure e intelligenti nonostante i limiti di scalabilità. Miglioramenti significativi alle misure di perdita di privacy, insieme a miglioramenti complementari nelle capacità di scambio di dati e nella precisione generativa delle attività, ne hanno dimostrato il valore funzionale e i risultati concreti in termini di prestazioni. Le fasi principali della GPLF includono l'inizializzazione basata su proxy dell'apprendimento federato insieme all'addestramento locale dei dati privati, che costituisce la spina dorsale della GPLF e integra gli aggiornamenti del modello proxy protetti con privacy differenziale. Sono inclusi anche metodi di generazione di dati sintetici a modello diffuso con tecniche di scambio dati peer-to-peer sicure e moduli per il rilevamento delle anomalie e la modellazione predittiva. La struttura organizzata nella Figura 1 mostra gli elementi essenziali della GPLF, che hanno il potenziale per ottimizzare le operazioni di base di CPS.

figure-protocol-1
Figura 1: Struttura architetturale della GPLF per operazioni CPS sicure e intelligenti. Progettato per consentire operazioni sicure e intelligenti nei sistemi cyber-fisici. Clicca qui per visualizzare una versione più grande di questa figura.

Le sezioni seguenti elaborano le sei fasi del framework per la comunicazione sicura tra dispositivi eterogenei in una piattaforma CPS.

1. Inizializzazione dell'apprendimento federato basato su proxy

La Fase-1 è l'inizializzazione dell'apprendimento federato basata su proxy, in cui la GPLF utilizza il processo di inizializzazione FL basato su proxy per configurare il sistema (N) di ciascun partecipante CPS con due modelli che garantiscono la privacy ma consentono ai partecipanti di collaborare in modo sicuro attraverso la funzionalità di apprendimento. I singoli partecipanti al CPS (i) ricevono un modello figure-protocol-2 privato per funzionare con i loro dati locali (di) per la protezione della privacy insieme a un modello figure-protocol-3 proxy condiviso per consentire un comportamento cooperativo sicuro tra i partecipanti. I modelli iniziano il loro addestramento con pesi creati da voci casuali di una distribuzione gaussiana21 per condizioni iniziali normalizzate, che è espressa come nell'equazione (1),
figure-protocol-4(1)
I partecipanti elaborano autonomamente i loro dati mentre scambiano informazioni attraverso modelli condivisi che supportano l'apprendimento generativo distribuito che preserva la privacy nei sistemi CPS.

2. Formazione locale sui dati privati

La fase 2 è la formazione locale sui dati privati; qui, si svolge la formazione sui dati, in cui i partecipanti al CPS sviluppano modelli privati dai dati locali memorizzati per mantenere la piena protezione dei dati in loco sigillandoli dall'esposizione esterna. I partecipanti ricevono una formazione sull'ottimizzazione dei modelli basati sui dati utilizzando la discesa del gradiente stocastico (SGD)22 , che avviene attraverso una funzione di perdita localizzata (llocale) e supporta sia l'estrazione di informazioni significative che gli adattamenti localizzati, mantenendo al contempo la privacy dei dati.
figure-protocol-5(2)
figure-protocol-6(3)
Da (2) e (3), I e O indicano l'input del campione e il valore target corrispondente. L indica la perdita con un tasso di apprendimento (). Questa fase sviluppa sistemi di intelligenza dei singoli partecipanti, che fungono da base per futuri processi educativi collaborativi sicuri.
L'Independent Recurrent Neural Network (IndRNN) funziona come modello ML dello stadio 2 perché la sua architettura consente l'indipendenza dei neuroni durante ogni fase temporale per gestire specifiche attività CPS, mitigando al contempo i tradizionali problemi di gradiente RNN. Ogni neurone all'interno della configurazione IndRNN viene fornito con un peso ricorrente individuale, consentendo una migliore cattura delle dipendenze a lungo termine. Il modello operativo separato migliora la trasmissione del gradiente, che scala efficacemente le strutture di rete profonde mantenendo efficienti i processi computazionali. L'elaborazione sequenziale dei dati sulle piattaforme CPS funziona meglio con IndRNN grazie alla sua capacità di elaborare lunghe sequenze utilizzando modelli di apprendimento forti, mantenendo bassa la complessità della rete.
Il calcolo nell'equazione (4) mostra che la soluzione al problema del gradiente di scomparsa ed esplosione all'interno di IndRNN deriva dal suo approccio distintivo alla progettazione di connessioni ricorrenti.
figure-protocol-7(4)
Da (4), ω e Ht indicano rispettivamente il peso e lo stato nascosto in t. figure-protocol-8 rappresentano il vettore di significatività ricorrente indipendente (pesi), uno per ogni punto dati, consentendo l'indipendenza in diverse fasi temporali. ʘ denota che il design presenta un supporto di moltiplicazione a livello di elemento, che mantiene la completa indipendenza tra le connessioni ricorrenti di ciascun neurone, e ä indica la funzione di attivazione. La progettazione dell'architettura neurale evita l'espansione o la contrazione del gradiente durante la sequenza di calcoli, il che supporta l'addestramento stabile del modello di apprendimento e il successo nell'apprendimento di modelli estesi.
L'IndRNN diventa l'approccio preferito per il rilevamento delle anomalie CPS perché previene con successo le esplosioni e le sparizioni del gradiente RNN tradizionale. Le dipendenze a lungo termine diventano facili da tracciare attraverso l'architettura IndRNN poiché opera con meno complessità rispetto ai modelli Transformer e raggiunge sia una rapida convergenza che un funzionamento in tempo reale. La natura efficace di IndRNN lo rende eccezionalmente adatto a rappresentare le caratteristiche operative limitate di CPS, fornendo al contempo un riconoscimento esatto delle anomalie senza un eccessivo sforzo computazionale.

3. Modello di diffusione per la generazione di dati sintetici

Stage-3 è il modello di diffusione per la generazione di dati sintetici. Questa fase utilizza modelli di diffusione avanzati per produrre dati sintetici, che replicano le principali caratteristiche dei dati privati acquisiti. I modelli apprendono la distribuzione originale dei dati sensibili alla privacy attraverso l'aggiunta di rumore controllato per raccogliere le caratteristiche, il che aiuta a creare dati sintetici con alta fedeltà che mantengono caratteristiche importanti proteggendo al contempo le salvaguardie della privacy. La procedura iterativa di denoising genera dati sintetici, mantenendo le proprietà statistiche essenziali e gli elementi strutturali dei dati reali.
Inizialmente, il processo di addestramento del modello di diffusione generativa (Υ) si concentra sulla creazione di dati sintetici ad alta fedeltà, pur mantenendo le caratteristiche cruciali dei dati privati (di), e il calcolo di base di tale generazione comporta,
figure-protocol-9(5)
Da (5), figure-protocol-10 indicare l'incorporazione del rumore gaussiano nei campioni di dati. I dati sintetici appena generati sono espressi come segue:
figure-protocol-11(6)

4. Aggiornamenti del modello proxy con privacy differenziale

La fase 4 è costituita da aggiornamenti del modello proxy con privacy differenziale. In questa fase, ogni partecipante comunicativo utilizza i dati sintetici creati dal modello di diffusione durante questa fase per addestrare il proprio modello figure-protocol-12 proxy in questa fase.
figure-protocol-13(7)
I gradienti degli aggiornamenti del modello proxy rimangono privati a causa di meccanismi di privacy differenziali che aggiungono rumore figure-protocol-14 ai loro valori.
figure-protocol-15(8)
Per proteggere la privacy dei dati, i metodi di crittografia avanzati (crittografia omomorfica) trasformano (ξ) gli aggiornamenti sanificati (U) in dati sicuri, distribuiti tramite un server centrale o più nodi peer.
figure-protocol-16(9)
Da (9), ҟ indica la chiave di crittografia. Attraverso l'aggregazione collaborativa di aggiornamenti crittografati, i sistemi mantengono la sicurezza delle informazioni locali sensibili durante l'esecuzione sicura di operazioni di apprendimento distribuito.
La crittografia omomorfica23crea piattaforme sicure per eseguire calcoli su dati crittografati senza decrittografia prima di consentire l'ottenimento dei risultati finali da input crittografati come i gradienti aggregati. I dati rimangono crittografati per tutta la loro durata operativa (end-to-end), il che impedisce di conseguenza violazioni esterne durante i processi computazionali. La piattaforma consente ai partecipanti al CPS in diverse sedi di scambiare aggiornamenti crittografati dei dati per operazioni di apprendimento collaborativo senza divulgare informazioni private. Secondo gli obiettivi dello studio, questa tecnica mantiene la protezione completa della privacy come richiesto e mostra prestazioni superiori rispetto ad altri metodi di crittografia, che richiedono la decrittografia dei dati per il calcolo, esponendoli così a potenziali minacce. La crittografia omomorfica si rivela il metodo di sicurezza più adatto per i sistemi proxyFL perché supporta sia calcoli sicuri sui dati che operazioni di crittografia standalone.

5. Proteggi le interazioni peer-to-peer

  1. La fase 5 è costituita da interazioni peer-to-peer sicure. Durante questa fase, i partecipanti trasmettono in modo sicuro gli aggiornamenti del modello proxy sanificato crittografato, creati nella fase 4. I partecipanti (i) mantengono la riservatezza durante la trasmissione degli aggiornamenti grazie alla crittografia omomorfica, che facilita calcoli come l'aggregazione a gradiente sui dati crittografati direttamente senza la necessità di decrittografare. I partecipanti esprimono la comunicazione peer-to-peer attraverso metodi computazionali come,
    figure-protocol-17(10)
    Da (10), è evidente che l'interazione/comunicazione peer-to-peer sicura all'interno delle piattaforme CPS è assicurata tramite crittografia omomorfica, (ξ(·)).
    Attraverso l'aggregazione del gradiente (Ψ), i contributi crittografati del gradiente da più utenti consentono l'aggiornamento collaborativo del modello proxy comune. Questo studio mostra l'accumulo sicuro dei gradienti crittografati di ciascun partecipante attraverso la crittografia omomorfica.
    figure-protocol-18(11)
    Da (11), N rappresenta il conteggio del partecipante. Il metodo consente anche calcoli diretti su gradienti crittografati e protegge i dati sensibili durante l'aggregazione. I partecipanti aggiornano il modello proxy attraverso la decrittografia dei gradienti aggregati, che consente l'apprendimento collaborativo attento alla privacy in tutta la rete CPS. I metodi di decrittografia sicuri preservano l'accesso privato ai singoli gradienti per tutti gli utenti durante l'intero processo.
    figure-protocol-19(12)
    Pertanto, le restrizioni di autorizzazione sicure impediscono ai singoli partecipanti di accedere agli aggiornamenti dei dati di proprietà di fattori esterni. La rete utilizza aggiornamenti aggregati per il miglioramento collaborativo dei modelli proxy condivisi per ottenere un apprendimento distribuito sicuro con solide protezioni della privacy nei sistemi CPS.

6. Rilevamento delle anomalie e modellazione predittiva

  1. Infine, la fase 6 è il rilevamento delle anomalie e la modellazione predittiva. In questa fase, vengono stabiliti i modelli proxy aggiornati che servono per l'analisi dei dati CPS effettivi all'interno di un ambiente di test configurato. I modelli proxy identificano le anomalie (Ф) confrontando i nuovi dati (I) con modelli provenienti dalla sintesi e da input storici per generare un punteggio di anomalia (Å) che segnala gli elementi che superano un limite/soglia predeterminato (τ), che è espresso computazionalmente come,
    figure-protocol-20(13)
    figure-protocol-21(14)
    Sia (13) che (14) assicurano che fornisca un metodo per riconoscere comportamenti anomali del sistema e guasti nelle fasi iniziali.
    La modellazione predittiva con modelli proxy comporta l'apprendimento di rappresentazioni che producono previsioni sui comportamenti o sugli stati del sistema da sequenze di dati di input dinamici/futuri (IF), che si esprime come segue:
    figure-protocol-22(15)
    Il flusso di lavoro operativo GPLF dimostrato in Figura 2 integra circuiti di feedback adattivi, che sostengono sia l'affidabilità del sistema CPS che la pertinenza continua. I rilevamenti di anomalie o deviazioni del sistema della fase 6 portano la procedura a ripercorrere i suoi passaggi fino alla fase 3, in cui vengono creati nuovi dati sintetici utilizzando voci private aggiornate per aiutare i modelli ad adattarsi ai modelli mutevoli. Una divergenza significativa dai risultati attesi o dalle previsioni e la scarsa accuratezza identificata durante la Fase 6 costringono a tornare alla Fase 2, in cui i partecipanti devono riaddestrare i loro modelli utilizzando i dati più accurati e aggiornati disponibili. Durante le valutazioni del sistema della Fase 5, se la convergenza del modello si rivela inadeguata o diventano evidenti incoerenze, il sistema torna alla Fase 4 per applicare i perfezionamenti attraverso dati sintetici migliorati e tecniche di privacy ottimizzate. I meccanismi di looping stabiliscono la prontezza all'apprendimento adattivo, che mantiene elevate prestazioni e sicurezza del sistema durante le operazioni del sistema di controllo e di processo.
    Una forte combinazione di componenti hardware e software ha convalidato le funzioni GPLF per l'implementazione di CPS attraverso operazioni scalabili e sicure. I requisiti specifici della piattaforma per la GPLF prevedevano Ubuntu 20.04 LTS con implementazione Python v3.9 e i framework di deep learning PyTorch v1.12 e TensorFlow v2.9 per condurre corsi di formazione per modelli privati, proxy e di diffusione. La valutazione delle prestazioni del sistema ha combinato il software di visualizzazione Matplotlib v3.5 con la visualizzazione statistica Seaborn v0.11 e il benchmarking Scikit-learn v1.1 insieme alle misure di privacy di PySyft v0.6.0 per la privacy differenziale e TenSEAL v0.3 per la crittografia omomorfica. I requisiti hardware includevano un processore AMD EPYC-7502P insieme a una GPU A100 con CUDA v11.6 per l'efficienza di calcolo e richieste di memoria di 256 GB di RAM per supportare ampi set di dati CPS, nonché un SSD da 1 TB seguito da una rete Gigabit Ethernet progettata per lo scambio sicuro di informazioni per condurre esperimenti di ricerca efficienti. Gli algoritmi GPLF hanno ricevuto la convalida attraverso questa configurazione di sistema, che ha protetto i dati dimostrando i principi di scalabilità per le implementazioni CPS del mondo reale. La selezione della versione consente di ottenere la compatibilità con la crittografia avanzata, nonché con l'apprendimento federato e le tecniche di modellazione generativa, consentendo una scalabilità di convalida affidabile su più applicazioni CPS.
    Durante la ricerca, lo studio ha optato per alcuni iperparametri vitali che bilanciavano la massimizzazione delle prestazioni con la protezione della privacy e la scalabilità in tutte le fasi GPLF. Per bilanciare l'apprendimento locale con quello collaborativo, i ricercatori hanno impostato tassi di apprendimento unici a 0,001 e 0,01 per i modelli privati e proxy, ma hanno mantenuto pesi inizializzati gaussiani per garantire una convergenza stabile. Per evitare l'overfitting durante l'elaborazione dei dati CPS, il processo di addestramento locale ha utilizzato batch di 32 istanze, ciascuna di oltre dieci epoche. La generazione di dati sintetici richiedeva che il modello di diffusione impiegasse un processo di 1000 passi con una deviazione standard del rumore di 0,05 per mantenere l'accuratezza delle caratteristiche critiche. L'anonimizzazione dei dati attraverso la privacy differenziale è stata ottenuta implementando il clipping del gradiente a 1,0 con una scala di rumore regolata a 0,1, preservando l'utilità del set di dati. Per la crittografia omomorfica, il sistema crittografico Paillier24 viene impiegato per elaborare i gradienti attraverso operazioni puramente additive nell'ambito dell'apprendimento federato. Il sistema crittografico Paillier consente operazioni dirette su informazioni crittografate, eliminando i requisiti di comunicazione estesi nei sistemi di calcolo sicuri multi-party. Questa tecnica consente un'aggregazione più rapida insieme a requisiti di comunicazione ridotti che portano a una soluzione scalabile ed efficiente per calcoli sicuri in sistemi CPS con risorse limitate. Il rilevamento delle anomalie ha predeterminato il limite/soglia e un orizzonte di previsione di dieci fasi hanno garantito un monitoraggio accurato e un processo decisionale proattivo nel CPS. Attraverso la messa a punto degli iperparametri, si ottiene un perfetto equilibrio tra le metriche delle prestazioni e l'adattabilità del sistema con la protezione della privacy nelle applicazioni CPS pratiche.
    Tabella 2 documenta gli iperparametri necessari per ogni fase della ricerca GPLF e i valori ottimali per ottenere le migliori prestazioni nell'intera metodologia.
    Due importanti set di dati sono presi in considerazione per l'addestramento e la valutazione dell'approccio proposto sotto vari aspetti. Sono TON_IoT25,26,27,28,29,30,31 e UNSW-NB1532,33,34,35,36 presso l'Università del Nuovo Galles del Sud (UNSW) di Canberra. Entrambi i set di dati TON_IoT e UNSW-NB15 sono stati selezionati perché contengono una gamma completa di condizioni CPS. Questi set di dati hanno scopi diversi perché TON_IoT presentano diverse letture dei sensori IoT combinate con modelli di situazione industriale e UNSW-NB15 offre test approfonditi dei dati sulle intrusioni di rete per i sistemi di sicurezza. La combinazione di set di dati TON_IoT e UNSW-NB15 consente una valutazione completa delle prestazioni della GPLF in diversi contesti operativi. L'inclusione di nuovi set di dati aumenterà l'affidabilità operativa del framework, poiché abbiamo identificato questa lacuna come un obiettivo di sviluppo futuro.
    I set di dati TON_IoT rappresentano un ampio repository di dati sviluppato per testare le prestazioni delle applicazioni di sicurezza informatica utilizzando sistemi basati su algoritmi di intelligenza artificiale e ML. Presso l'accademia militare australiana sotto l'UNSW, dove i ricercatori hanno generato questi set di dati da fonti eterogenee che utilizzano le informazioni di telemetria di oltre 10 sensori IoT indigeni e industriali, inclusi lettori meteorologici e sensori Modbus insieme a registri del sistema operativo e pacchetti di rete acquisiti con ZEEK (Bro) in formato pcap in combinazione con file di registro e file con valori separati da virgole (CSV). Questo set di dati proviene da una rete reale che combina componenti IoT con funzioni cloud e capacità di edge/fog computing, gestite su più host che eseguono macchine virtuali e vari sistemi operativi. Il sistema costruito ha permesso ai ricercatori di eseguire test di attacchi informatici, che includono attacchi DDoS (Distributed Denial of Service) e DoS, nonché attacchi ransomware contro applicazioni IoT e reti informatiche all'interno del quadro combinato Internet of Things / Industrial IoT. TON_IoT set di dati includono componenti di dati grezzi e dati elaborati con caratteristiche ed etichette standard, campioni di formazione e test, descrizioni delle funzionalità, riepiloghi statistici ed eventi di sicurezza, insieme a etichette di verità sul campo. Le soluzioni di sicurezza informatica basate sull'intelligenza artificiale per i meccanismi di rilevamento del malware, l'IDS, i metodi di rilevamento delle frodi e le piattaforme di intelligence sulle minacce, insieme ai processi di conservazione della privacy e all'analisi forense digitale, traggono vantaggio dai set di dati TON_IoT grazie al loro design organizzativo strutturato, che aiuta anche i modelli di ML avversari e i metodi di ricerca delle minacce.
    Il Cyber Range Lab dell'UNSW Canberra ha sviluppato il set di dati UNSW-NB15 come standard completo per la valutazione del sistema di rilevamento delle intrusioni di rete. Attraverso lo strumento IXIA PerfectStorm, la creazione del set di dati UNSW-NB15 unisce le normali attività moderne con dimostrazioni di attacchi sintetici, che producono circa 100 GB di traffico di rete catturato in formato pcap. Il set di dati comprende nove varianti di attacco univoche: Analisi, DoS, Fuzzer, Backdoor, Shellcode, Exploit, Worm, Generico e Ricognizione. Sfruttando gli strumenti Argus e Bro-IDS insieme a dodici algoritmi progettati, i ricercatori hanno estratto e taggato 49 funzionalità, consentendo un'analisi esaustiva. Più di 2,5 milioni di record popolano il set di dati, che si estende su quattro workstation CSV ed è suddiviso in 175.341 record per scopi di formazione e 82.332 record per la funzionalità di test. La disposizione sistematica dei dati all'interno di questo framework guida sia i processi di sviluppo che di test per i modelli di rilevamento delle intrusioni.

figure-protocol-23
Figura 2: Flusso di lavoro operativo della GPLF. Il flusso di lavoro operativo sequenziale della GPLF evidenzia ogni fase chiave del processo. Clicca qui per visualizzare una versione più grande di questa figura.

Tabella 2: Specifiche dei parametri della GPLF. Clicca qui per scaricare questa tabella.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La metrica PLRI (Privacy Leakage Reduction Index) misura la riduzione delle perdite di privacy rispetto ai modelli di base standard. La valutazione si concentra sul modo in cui la privacy differenziale e la crittografia omomorfica si comportano come approcci di conservazione della privacy.

Il punteggio di perdita di privacy valuta il numero di punti dati esposti rispetto agli aggiornamenti totali nei modelli, insieme alle attività di distribuzione dei dati sintetici. Valuta l'efficacia delle s...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli elementi di progettazione della GPLF non solo supportano le sue funzioni di privacy, ma offrono anche vantaggi supplementari che ne migliorano la capacità di implementazione. Utilizzando modelli di diffusione per produrre dati sintetici ad alta fedeltà, il framework fornisce livelli essenziali di protezione della privacy per settori essenziali come l'assistenza sanitaria, oltre al monitoraggio delle infrastrutture critiche, mantenendo al contempo precise capacità di modellazione gene...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano che non vi è alcun conflitto di interessi per quanto riguarda la pubblicazione di questo manoscritto. Nessuna affiliazione finanziaria o personale ha influenzato la ricerca, i risultati o le conclusioni presentate in questo lavoro.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato sostenuto dai ricercatori dell'Università Principessa Nourah bint Abdulrahman che sostengono il progetto numero (PNURSP2025R432), Università Principessa Nourah bint Abdulrahman, Riyadh, Arabia Saudita.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
GPU A100 (CUDA)Accelerazione GPU NVIDIACUDA versione 11.6per l'addestramento e la valutazione dei modelli.
AMD EPYC-7502P CPUAMDN/AProcessore utilizzato per il calcolo ad alte prestazioni.
Gigabit EthernetIntelN/ANetworking per comunicazioni sicure peer-to-peer in CPS.
MatplotlibPython Software FoundationVersione 3.5Libreria di visualizzazione per la rappresentazione grafica dei risultati.
Paillier CryptosystemOpen Source (implementato tramite TenSEAL)N/AAbilita la crittografia omomorfica additiva sui gradienti.
PySyftOpenMinedversione 0.6.0Privacy differenziale e libreria di apprendimento federato.
Python (Anaconda Distribution)Anaconda IncVersione 3.9Include pacchetti preinstallati e strumenti di gestione dell'ambiente, utilizzati per lo scripting e lo sviluppo di framework.
PyTorchMeta AIVersione 1.12Framework di deep learning per modelli di addestramento.
RAMCorsair256 GigaByte (GB) Elevato supporto di memoria per un allenamento intensivo.
Scikit-learnPython Software Foundationversione 1.1Strumenti di apprendimento automatico per la valutazione delle prestazioni.
SeabornPython Software Foundationversione 0.11Libreria di visualizzazione dei dati statistici.
Archiviazione SSDSeagate1 TeraByte (TB)Per l'archiviazione e il recupero rapidi dei dati.
TenSEALOpenMinedversione 0.3per un'aggregazione sicura.
TensorFlowGoogleversione 2.9Framework di deep learning per modelli di diffusione.
Ubuntu OSCanonicalVersione 20.04 LTSSistema operativo utilizzato per tutti gli esperimenti.
Libreria di crittografia omomorfica

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Lu, Y. Cyber physical system (CPS)-based industry 4.0: a survey. J Ind Integr Manage. 2 (03), 1750014(2017).
  2. Jayadatta, S. A study on latest developments in artificial intelligence (AI) and internet of things (IoT) in current context. J Appl Inf Syst. 11 (2), 21-28 (2023).
  3. Li, X., et al. A survey on federated learning systems: vision, hype and reality for data privacy and protection. IEEE Trans Knowl Data Eng. 35 (4), 3347-3366 (2021).
  4. Hathaliya, J. J., Tanwar, S., Sharma, P. Adversarial learning techniques for security and privacy preservation: a comprehensive review. Secur Privacy. 5 (3), e209(2022).
  5. Kalra, S., et al. Decentralized federated learning through proxy model sharing. Nat Commun. 14 (1), 2899(2023).
  6. Dalhues, M., et al. Research and practice of flexibility in distribution systems: a review. CSEE J Power Energy Syst. 5 (3), 285-294 (2019).
  7. Bhuyan, M. H., Bhattacharyya, D. K., Kalita, J. K. Network anomaly detection: methods, systems and tools. IEEE Commun Surv Tutorials. 16 (1), 303-336 (2013).
  8. Du, Y., et al. The age of generative AI and AI-generated everything. IEEE Network. 38 (6), 501-512 (2024).
  9. Tyagi, A. K., Aswathy, S. U., Aghila, G., Sreenath, N. AARIN: affordable, accurate, reliable and innovative mechanism to protect a medical cyber-physical system using blockchain technology. Int J Intell Networks. 2, 175-183 (2021).
  10. Zhang, L., Zhang, Z., Guan, C. Accelerating privacy-preserving momentum federated learning for industrial cyber-physical systems. Complex Intell Syst. 7, 3289-3301 (2021).
  11. Latif, S., et al. AI-empowered, blockchain and SDN integrated security architecture for IoT network of cyber physical systems. Comput Commun. 181, 274-283 (2022).
  12. Nagarajan, S. M., et al. IADF-CPS: intelligent anomaly detection framework towards cyber physical systems. Comput Commun. 188, 81-89 (2022).
  13. Shamshad, S., et al. An efficient privacy-preserving authenticated key establishment protocol for health monitoring in industrial cyber-physical systems. IEEE Internet Things J. 9 (7), 5142-5149 (2022).
  14. Sheikh, Z. A., et al. Defending the defender: adversarial learning based defending strategy for learning based security methods in cyber-physical systems (CPS). Sensors. 23 (12), 5459(2023).
  15. Suhail, S., et al. ENIGMA: an explainable digital twin security solution for cyber-physical systems. Comput Ind. 151, 103961(2023).
  16. Islam, S., et al. Generative AI and cognitive computing-driven intrusion detection system in industrial CPS. Cognit Comput. 16 (5), 2611-2625 (2024).
  17. Namakshenas, D., et al. IP2FL: interpretation-based privacy-preserving federated learning for industrial cyber-physical systems. IEEE Trans Ind Cyber-Phys Syst. 2, 321-330 (2024).
  18. Rivadeneira, J. E., et al. A unified privacy preserving model with AI at the edge for human-in-the-loop cyber-physical systems. Internet Things. 25, 101034(2024).
  19. Wen, J., et al. Sustainable diffusion-based incentive mechanism for generative AI-driven digital twins in industrial cyber-physical systems. IEEE Trans Ind Cyber-Phys Syst. 3, 139-149 (2024).
  20. Chae, J., et al. A survey and perspective on industrial cyber-physical systems (ICPS): from ICPS to AI-augmented ICPS. IEEE Trans Ind Cyber-Phys Syst. 1, 257-272 (2023).
  21. Thomas, D. B., Luk, W., Leong, P. H., Villasenor, J. D. Gaussian random number generators. ACM Comput Surv. 39 (4), 11(2007).
  22. Yazan, E., Talu, M. F. Comparison of the stochastic gradient descent based optimization techniques. 2017 International Artificial Intelligence and Data Processing Symposium (IDAP). , Malatya, Turkey. (2017).
  23. Acar, A., et al. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput Surv. 51 (4), 1-35 (2018).
  24. The homomorphic other property of Paillier cryptosystem. Sridokmai, T., Prakancharoen, S. 2015 International Conference on Science and Technology (TICST), Pathum Thani, Thailand, , (2015).
  25. Moustafa, N. A new distributed architecture for evaluating AI-based security systems at the edge: network TON_IoT datasets. Sustainable Cities Soc. 72, 102994(2021).
  26. Booij, T. M., et al. ToN_IoT: the role of heterogeneity and the need for standardization of features and attack types in IoT network intrusion data sets. IEEE Internet Things J. 9 (1), 485-496 (2021).
  27. Federated TON_IoT Windows datasets for evaluating AI-based security applications. Moustafa, N., et al. 2020 IEEE 19th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom), Guangzhou, China, , (2020).
  28. Data analytics-enabled intrusion detection: evaluations of ToN_IoT linux datasets. Moustafa, N., Ahmed, M., Ahmed, S. 2020 IEEE 19th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom), Guangzhou, China, , (1109).
  29. Moustafa, N. New generations of internet of things datasets for cybersecurity applications based machine learning: TON_IoT datasets. Proceedings of the eResearch Australasia Conference, Brisbane, Australia, , (2019).
  30. Moustafa, N. A systemic IoT-fog-cloud architecture for big-data analytics and cyber security systems: a review of fog computing. Secur Edge Comput. , 41-50 (2021).
  31. Ashraf, S., et al. IoTBoT-IDS: a novel statistical learning-enabled botnet detection framework for protecting networks of smart cities. Sustainable Cities Soc. 72, 103041(2021).
  32. UNSW-NB15: a comprehensive data set for network intrusion detection systems (UNSW-NB15 network data set). Moustafa, N., Slay, J. 2015 Military Communications and Information Systems Conference (MilCIS), Canberra, ACT, Australia, , (2015).
  33. Moustafa, N., Slay, J. The evaluation of network anomaly detection systems: statistical analysis of the UNSW-NB15 data set and the comparison with the KDD99 data set. Inf Secur J Global Perspect. 25 (1-3), 18-31 (2016).
  34. Moustafa, N., Slay, J., Creech, G. Novel geometric area analysis technique for anomaly detection using trapezoidal area estimation on large-scale networks. IEEE Trans Big Data. 5 (4), 481-494 (2017).
  35. Moustafa, N., Creech, G., Slay, J. Big Data Analytics for Intrusion Detection System: Statistical Decision-Making Using Finite Dirichlet Mixture Models. Data Analytics and Decision Support for Cybersecurity. Data Analytics. , Springer. Cham. (2017).
  36. Sarhan, M., et al. NetFlow Datasets for Machine Learning-Based Network Intrusion Detection Systems. Big Data Technologies and Applications. BDTA WiCON 2020. Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering. , Springer. Cham. (2021).
  37. Alberts, P., et al. Development and implementation of a multi-disciplinary technology enhanced care pathway for youth and adults with concussion. J Vis Exp. (143), e58962(2019).
  38. Yeh, C., et al. An application for pairing with wearable devices to monitor personal health status. J Vis Exp. (180), e63169(2022).
  39. Nogales, A., et al. Integration of 5G experimentation infrastructures into a multi-site NFV ecosystem. J Vis Exp. (168), e61946(2021).
  40. Chen, J. Large scale energy efficient sensor network routing using a quantum processor unit. J Vis Exp. (199), e64930(2023).
  41. Wang, Y., Wang, Z. End-to-end deep neural network for salient object detection in complex environments. J Vis Exp. (202), e65554(2023).
  42. Zhu, E., et al. PHEE: identifying influential nodes in social networks with a phased evaluation-enhanced search. Neurocomputing. 572, 127195(2024).
  43. Liu, Y., et al. Resilient formation tracking for networked swarm systems under malicious data deception attacks. Int J Robust Nonlinear Control. 35 (6), 2043-2052 (2025).
  44. Xu, G., et al. CBRFL: a framework for committee-based byzantine-resilient federated learning. J Network Comput Appl. 238, 104165(2025).
  45. Zhou, W., et al. Hidim: a novel framework of network intrusion detection for hierarchical dependency and class imbalance. Comput Secur. 148, 104155(2025).
  46. Shi, J., Liu, C., Liu, J. Hypergraph-based model for modeling multi-agent Q-learning dynamics in public goods games. IEEE Trans Network Sci Eng. 11 (6), 6169-6179 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cyber Physical SystemGenerative Artificial IntelligenceProxy LearningFederated LearningDiffusion ModelsSynthetic Sensor DataAnomaly DetectionDifferential PrivacySecure Peer CommunicationPredictive Modeling
Video Coming Soon

Related Articles