Research Article

Diffusie-gedreven proxy-leerstrategie met veilige peer-interacties voor generatieve intelligentie in cyber-fysiek systeem

DOI:

10.3791/68383

June 27th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier presenteren we het Generative Proxy Learning Framework (GPLF) dat Proxy-based Federated Learning (ProxyFL) brengt om generatieve AI-oplossingen in cyberfysieke systemen (CPS) te verbeteren. Door differentiële privacyfuncties en coderingsmethoden te integreren, verbetert GPLF de privacybescherming, waardoor privacylekken worden verminderd, waardoor cyberfysieke systeembewerkingen slimmer en veiliger worden.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cyber-Physical System (CPS) combineert computationele intelligentie met fysieke processen, waardoor onmiddellijke monitoring, besluitvormingscapaciteit en automatiseringsdiensten in verschillende vitale domeinen mogelijk zijn. Bovendien wordt generatieve kunstmatige intelligentie (AI) geconfronteerd met aanzienlijke barrières voor implementatie binnen CPS, omdat gedistribueerde omgevingen met gevoelige gegevens ernstige uitdagingen op het gebied van privacy en beveiligingsonderhoud met zich meebrengen. De huidige technieken, zoals Federated Learning (FL), ondervinden problemen in zowel hun modeldiversiteit als het risico dat de privacy in het gedrang komt. Het Generative Proxy Learning Framework (GPLF) dient als onze innovatieve oplossing die gebruikmaakt van Proxy-based Federated Learning (ProxyFL) dat specifiek is aangepast voor generatieve AI-toepassingen binnen Cyber-Physical Systems (CPS). In GPLF onderhoudt elke deelnemer twee modellen: Deelnemers gebruiken een privémodel dat is bedoeld voor lokale gegevensanalyse, samen met een gedeeld proxymodel dat beveiligde samenwerking tussen knooppunten mogelijk maakt. Als de essentiële basis van generatieve AI-mechanismen leveren geavanceerde diffusiemodellen high-fidelity synthetische gegevens in combinatie met behoud van belangrijke gegevensfuncties. De modellen genereren synthetische sensorgegevens, die een verbeterde anomaliedetectie mogelijk maken en voorspellende modellering ondersteunen door middel van authentieke CPS-gedragsrepresentaties in verschillende scenario's. Het systeem bereikt geavanceerde privacybescherming met differentiële privacymechanismen in proxy-gegevensupdates, terwijl directe peer-communicatie in het netwerk profiteert van geavanceerde versleutelingsbeveiligingen. GPLF bedient CPS-platforms door verbinding te maken met realtime sensoren en IoT-apparaten die veilige generatieve processen ondersteunen, waaronder anomaliedetectie, het creëren van synthetische gegevens en voorspellende modellering. Testresultaten van benchmark CPS-datasets laten aanzienlijke prestatieverbeteringen zien met 25% minder privacylekken en 25% betere mogelijkheden voor gegevensuitwisseling, samen met een verbetering van 18% in de nauwkeurigheid van generatieve taken ter ondersteuning van het transformatieve potentieel voor veilige, intelligente CPS-operaties.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het onderzoek onderzoekt cyberfysieke systemen (CPS) door computationele intelligentie te combineren met real-world processen om real-time surveillance mogelijk te maken, naast snelle besluitvormingsmogelijkheden en systeemautomatisering1. Opkomende Internet-of-Things (IoT) en kunstmatige intelligentie (AI)-technologieën breiden het scala aan toepassingen aanzienlijk uit waarbij CPS-systemen essentiële functies vervullen in de ontwikkeling van slimme netwerken en industriële automatiseringsprocessen, evenals in de levering van gezondheidszorg2. Organisaties die CPS inzetten, maken steeds vaker gebruik van generatieve AI-modellen, die de mogelijkheid bieden om systeemgedrag te imiteren en voorspellende modellering mogelijk te maken naast verbeterde anomaliedetectie. Het gedistribueerde formaat van CPS-gegevens, in combinatie met de gevoelige kenmerken ervan, leidt tot grote privacykwetsbaarheden naast beveiligingsproblemen en schaalbaarheidsproblemen in generatieve AI-implementaties.

Bestaande technieken, zoals Federated Learning (FL), zijn gericht op de bescherming van gegevensprivacy, maar hebben te maken met beperkingen, waaronder de dreiging van privacylekken bij modelupdates, samen met verminderde ondersteuning voor generatieve AI en ontoereikende afhandeling van diverse CPS-voorwaarden3. De huidige benaderingen missen de essentiële integratie van geavanceerde mechanismen die zijn ontworpen voor zowel het genereren van gegevens als beschermingsmaatregelen bij het werken in gedistribueerde CPS tijdens real-time werking. Aangezien de huidige kaders op meerdere gebieden tekortschieten, toont bestaand onderzoek aan dat er aanzienlijke behoeften zijn die alleen kunnen worden vervuld door een nieuwe oplossing te creëren die veilige, schaalbare, generatieve modellen levert naast duidelijke privacybescherming4.

De nieuwe Generative Proxy Learning Framework (GPLF)-studie schetst een speciaal vervaardigde methode om de inzet van generatieve AI-functies binnen CPS te vergemakkelijken. GPLF implementeert een proxy-gebaseerd FL-schema5, zodat gebruikers kunnen functioneren met privémodellen voor individueel gegevensonderzoek en proxymodellen om beschermde coöperatieve leeractiviteiten te ondersteunen. Dit onderzoek richt zich op het verbeteren van de privacy van gegevens door de toepassing van differentiële privacybenaderingen in combinatie met veilige homomorfe encryptie en maakt gebruik van geavanceerde diffusiemodellen voor de productie van synthetische gegevens van hoge kwaliteit. Het systeem ondersteunt veilige anomaliedetectie en voorspellende modelleringsfuncties, terwijl het een efficiënte informatieoverdracht tussen gedistribueerde CPS-bewerkingen mogelijk maakt.

GPLF lost bestaande FL-uitdagingen op door middel van het dual-model framework-ontwerp, dat gegevensbescherming en systeemflexibiliteit biedt6. Elke CPS-deelnemer gebruikt zowel privé- als proxymodellen, die twee afzonderlijke systemen opzetten om lokale privacybescherming te bereiken en teamleermogelijkheden mogelijk te maken. Het privémodel maakt gebruik van gelokaliseerde bewerkingen om te leren van de vertrouwelijke gegevens van een deelnemer en handhaaft volledige gegevensprivacy door gevoelige informatie op te slaan binnen de parameters van elke deelnemer. Het systeem behaalt maximale prestaties bij het detecteren van afwijkingen en het herkennen van patronen op lokaal niveau7. Het proxymodel dient als een gezamenlijk collectief leermechanisme dat beschikbaar is voor alle deelnemers voor veilige kennisdeling. Het proxymodel traint met vertrouwelijkheid via opgeschoonde synthetische gegevensverwerking van diffusiemodellen en het communiceren van updates via zowel differentiële privacy als homomorfe codering, omdat dit privé maar functionele FL mogelijk maakt.

De diffusiestrategie maakt het mogelijk om superieure synthetische datasets te creëren die essentiële kenmerken behouden terwijl persoonlijke details worden verborgen. Dit onderzoek bracht substantiële vooruitgang aan het licht, die zich manifesteerde als een grote daling van het lekken van privacy met verbeterde gegevensuitwisselingsfuncties en betere prestaties van generatieve taken, waardoor veerkrachtigere cyber-fysieke systeemoperaties mogelijk werden. GPLF creëert een nieuwe methodologie voor intelligente CPS door privacybeschermend leren te combineren met generatieve AI-mogelijkheden8.

De GPLF biedt nieuwe mogelijkheden door middel van zijn ontwerp met twee modellen dat specifiek is gericht op het omgaan met privacyproblemen bij de implementatie van generatieve AI in CPS. Terwijl conventioneel federated learning één model gebruikt voor alle deelnemers, implementeert GPLF zowel privémodellen voor lokaal gegevensonderzoek als proxymodellen om groepsleertaken uit te voeren. Door strikte gegevensscheiding bewaren patiënten gevoelige informatie lokaal, maar gebruiken ze de opgeschoonde synthetische gegevens van het proxymodel in combinatie met differentiële privacy om veilige samenwerking te bereiken. Het proxymodel zorgt voor robuuste anomaliedetectie en voorspellende modellering, terwijl het aanpassingsvermogen van het systeem behouden blijft door middel van hoogwaardige synthetische gegevens die worden gegenereerd door diffusiemodellen, waardoor de privacy van de gebruiker wordt beschermd. GPLF onderscheidt zich als een innovatief raamwerk voor veilige CPS-systemen omdat de dual-model aanpak een versterkte privacybescherming biedt in combinatie met veilige gegevens, terwijl de schaalbaarheid en operationele efficiëntie behouden blijven.

Het doel van de studie is het ontwikkelen van een Proxy-Based Federated Learning (ProxyFL), die een dual-model architectuur vereist om veilige aanpassing binnen CPS mogelijk te maken. Bovendien zijn geavanceerde diffusiemodellen essentieel om te dienen als integratiepunt voor de productie van synthetische gegevens om essentiële gegevenskenmerken te behouden tijdens privacywaarborgen. Ten slotte is het noodzakelijk om differentiële privacymethoden te implementeren naast homomorfe coderingsprotocollen om de gegevensbeveiliging te waarborgen en de privacy te beschermen tijdens gradiëntaggregatie.

Tabel 1 9,10,11,12,13,14,15,16,17,18,19 belicht de kernprocessen van bestaande methoden en hun verworvenheden, met enkele kritische beperkingen.

Tabel 1: Overzicht van de belangrijkste aandachtspunten, kerncomponenten, prestaties en beperkingen van bestaand onderzoek. Klik hier om deze tabel te downloaden.

De bestaande benaderingen voor het samenvoegen van generatieve AI in CPS-systemen vertonen kritieke problemen bij het uitbreiden naar grote implementaties met behoud van privacyregelgeving en het bereiken van systeemflexibiliteit20. De huidige methoden van FL vertonen beperkingen door onvoldoende modelvariatie, terwijl ze ook zwakke prestaties vertonen in verspreide en verschuivende systemen en gebruikersgegevens blootstellen vanwege kwetsbare gegevensoverdrachtspraktijken. High-fidelity gegevensrepresentaties die nodig zijn voor het detecteren van anomalieën, het genereren van synthetische gegevens en voorspellende modellering in CPS ontsnappen vaak aan veel generatieve modelleringsoplossingen, die de privacy en rekenefficiëntie in gevaar kunnen brengen bij hun pogingen om deze normen te bereiken. De huidige tekortkomingen in het systeem bevestigen de frameworkvereiste om schaalbare, veilige en efficiënte generatieve AI-processen te ondersteunen.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het Generative Proxy Learning Framework (GPLF) vertegenwoordigt een nieuwe technologie die generatieve AI integreert met CPS en belangrijke problemen op het gebied van gegevensprivacy oplost, naast beveiligings- en prestatiestatistieken binnen gedistribueerde netwerksystemen. De functionaliteit van CPS-platforms is afhankelijk van up-to-date monitoring naast geautomatiseerde bewerkingen die gevoelige gegevensinvoer extraheren uit een groeiend aantal IoT-apparaten en sensoren. Het is gebleken dat de toepassing van generatieve AI-technologieën in CPS-systemen speciale gevaren met zich meebrengt, zoals privacykwetsbaarheden in combinatie met beveiligingsuitdagingen in gedistribueerde netwerkopstellingen. GPLF rolt een innovatief Proxy-Based Federated Learning (ProxyFL)-framework uit dat veilig samenwerkend leren ondersteunt, specifiek bedoeld voor generatieve taken om bestaande problemen te verminderen. Een grondige beoordeling van het GPLF-framework vond plaats op een CPS-platform waarvan het testbed verschillende sensornetwerktechnologieën combineerde met IoT-apparaten en live datastreaming.

Deelnemers aan GPLF draaien tijdens hun deelname twee aparte modellen.
Een exclusief privémodel functioneert voor lokaal gegevensonderzoek, terwijl de gegevens worden beschermd tegen toegang van buitenaf.
Het Shared Proxy Model5 van het systeem maakt veilige samenwerking tussen deelnemers mogelijk door middel van coderingstechnologie in combinatie met differentiële privacymethoden.

Het framework maakt gebruik van diffusiemodellen om uitgebreide synthetische datasets te creëren die anomaliedetectiemogelijkheden stimuleren, terwijl voorspellende modellering en het volgen van systeemgedrag worden getoond tijdens diverse scenariosimulaties. Gesynthetiseerde datasets behouden belangrijke functiekenmerken door middel van effectieve methoden voor privacybehoud. Het framework werkt met veilige peer-to-peer-uitwisselingen via sterke versleutelingstechnieken die communicatiekanalen beschermen tegen kwaadaardige aanvallen. De beoordelingen die met GPLF op real-world CPS-platforms zijn uitgevoerd, toonden aan hoe het substantiële verbeteringen kon brengen in veilige en intelligente operationele capaciteiten over de schaalbaarheidslimieten heen. Aanzienlijke verbeteringen in de maatregelen voor privacylekken, naast aanvullende verbeteringen in de mogelijkheden voor gegevensuitwisseling en generatieve taakprecisie hebben de functionele waarde en concrete prestatieresultaten bewezen. De kernfasen van GPLF omvatten proxy-gebaseerde initialisatie van federated learning, samen met lokale training voor privégegevens, die de ruggengraat vormt van GPLF en proxymodelupdates integreert die worden beschermd met differentiële privacy. Diffuse modelmethoden voor het genereren van synthetische gegevens met veilige peer-to-peer gegevensuitwisselingstechnieken en modules voor anomaliedetectie en voorspellende modellering zijn ook inbegrepen. De georganiseerde structuur in Figuur 1 toont de essentiële elementen van GPLF, die het potentieel hebben om de basisbewerkingen van CPS te optimaliseren.

figure-protocol-1
Figuur 1: Architectonisch raamwerk van GPLF voor veilige en slimme CPS-operaties. Ontworpen om veilige en slimme operaties in cyber-fysieke systemen mogelijk te maken. Klik hier om een grotere versie van deze figuur te bekijken.

In de volgende paragrafen wordt dieper ingegaan op de zes fasen van het raamwerk voor veilige communicatie tussen heterogene apparaten in een CPS-platform.

1. Proxy-gebaseerde federated learning-initialisatie

Fase-1 is Proxy-Based Federated Learning Initialization, waarbij GPLF het proxy-gebaseerde FL-initialisatieproces gebruikt om het systeem van elke CPS-deelnemer (N) in te stellen met twee modellen die privacy garanderen en deelnemers toch in staat stellen veilig samen te werken via leerfunctionaliteit. Individuele CPS-deelnemers (i) ontvangen een privémodel figure-protocol-2 om te functioneren met hun lokale gegevens (di) voor privacybescherming, naast een gedeeld proxymodel figure-protocol-3 om veilig coöperatief gedrag tussen deelnemers mogelijk te maken. De modellen beginnen hun training met gewichten die zijn gemaakt op basis van gerandomiseerde invoer van een Gauss-verdeling21 voor genormaliseerde begincondities, die wordt uitgedrukt als in vergelijking (1),
figure-protocol-4(1)
Deelnemers verwerken autonoom hun gegevens terwijl ze inzichten uitwisselen via gedeelde modellen die privacybeschermend gedistribueerd generatief leren in CPS-systemen ondersteunen.

2. Lokale training over privégegevens

Fase-2 is Lokale training over privégegevens; hier vindt datatraining plaats, waarbij CPS-deelnemers privémodellen ontwikkelen op basis van hun opgeslagen lokale gegevens om volledige gegevensbescherming ter plaatse te behouden door deze af te schermen van externe blootstelling. Deelnemers krijgen training in op gegevens gebaseerde modeloptimalisatie met behulp van stochastische gradiëntafdaling (SGD)22 die optreedt via een gelokaliseerde verliesfunctie (llokaal) en zowel zinvolle inzichtextractie als gelokaliseerde aanpassingen ondersteunt met behoud van gegevensprivacy.
figure-protocol-5(2)
figure-protocol-6(3)
Vanaf (2) en (3) geven I en O de steekproefinvoer en de bijbehorende doelwaarde aan. L geeft het verlies aan met een leersnelheid (). Deze stap ontwikkelt intelligentiesystemen voor individuele deelnemers, die als basis dienen voor toekomstige veilige collaboratieve onderwijsprocessen.
Het Independent Recurrent Neural Network (IndRNN) functioneert als het ML-model van fase 2 omdat de architectuur neuronenonafhankelijkheid tijdens elke tijdstap mogelijk maakt om specifieke CPS-taken uit te voeren en tegelijkertijd traditionele RNN-gradiëntproblemen te verminderen. Elk neuron in de IndRNN-opstelling wordt geleverd met een individueel terugkerend gewicht, waardoor langdurige afhankelijkheden beter kunnen worden vastgelegd. Het afzonderlijke bedieningsmodel verbetert de gradiënttransmissie, waardoor diepe netwerkstructuren effectief worden geschaald terwijl de rekenprocessen efficiënt blijven. Sequentiële gegevensverwerking op CPS-platforms presteert het beste met IndRNN vanwege het vermogen om lange sequenties te verwerken met behulp van sterke leerpatronen, terwijl de netwerkcomplexiteit laag blijft.
Berekening in vergelijking (4) toont aan dat de oplossing voor het verdwijnende en exploderende gradiëntprobleem binnen IndRNN voortkomt uit de kenmerkende benadering van het ontwerp van terugkerende verbindingen.
figure-protocol-7(4)
Vanaf (4) geven ω en Ht respectievelijk het gewicht en de verborgen toestand bij t aan. figure-protocol-8 Vertegenwoordig de vector van onafhankelijke terugkerende significantie (gewichten), één voor elk gegevenspunt, waardoor onafhankelijkheid in verschillende tijdstappen mogelijk is. ʘ geeft aan dat het ontwerp is voorzien van elementgewijze vermenigvuldigingsondersteuning, die volledige onafhankelijkheid behoudt tussen de terugkerende verbindingen van elk neuron, en ä staat voor de activeringsfunctie. Het ontwerp van de neurale architectuur vermijdt gradiëntuitbreiding of -inkrimping tijdens de reeks berekeningen, wat stabiele training van het leermodel en succes bij het leren van uitgebreide patronen ondersteunt.
De IndRNN wordt de voorkeursbenadering voor CPS-anomaliedetectie omdat het met succes traditionele RNN-gradiëntexplosies en verdwijningen voorkomt. Langetermijnafhankelijkheden worden gemakkelijk te volgen via de IndRNN-architectuur, omdat deze met minder complexiteit werkt dan Transformer-modellen en zowel snelle convergentie als realtime werking bereikt. De effectieve aard van IndRNN maakt het uitzonderlijk geschikt om de beperkte operationele kenmerken van CPS weer te geven en tegelijkertijd exacte anomalieherkenning te bieden zonder overmatige rekenkracht.

3. Diffusiemodel voor het genereren van synthetische data

Fase-3 is het diffusiemodel voor het genereren van synthetische gegevens. In deze fase worden geavanceerde diffusiemodellen gebruikt om synthetische gegevens te produceren, die de belangrijkste kenmerken van de verkregen privégegevens repliceren. De modellen leren de distributie van de oorspronkelijke privacygevoelige gegevens door de toevoeging van gecontroleerde ruis om kenmerken te verzamelen, wat helpt bij het creëren van synthetische gegevens met hoge getrouwheid die belangrijke functies behouden terwijl de privacywaarborgen worden beschermd. De iteratieve denoisingprocedure genereert synthetische gegevens, waarbij essentiële statistische eigenschappen en structurele elementen van de werkelijke gegevens behouden blijven.
In eerste instantie richt het trainingsproces van het generatieve diffusiemodel (Υ) zich op het creëren van synthetische gegevens met een hoge getrouwheid met behoud van cruciale kenmerken van privégegevens (di), en de kernberekening van een dergelijke generatie omvat:
figure-protocol-9(5)
Geef vanaf (5) figure-protocol-10 de opname van Gaussiaanse ruis in de gegevensmonsters aan. De nieuw gegenereerde synthetische gegevens worden uitgedrukt als:
figure-protocol-11(6)

4. Proxymodelupdates met differentiële privacy

Fase-4 is proxymodelupdates met differentiële privacy. In deze fase gebruikt elke communicatieve deelnemer synthetische gegevens die in deze fase door het diffusiemodel zijn gemaakt om hun proxymodel figure-protocol-12 in deze fase te trainen.
figure-protocol-13(7)
Gradiënten van proxy-modelupdates blijven privé vanwege differentiële privacymechanismen die ruis figure-protocol-14 toevoegen aan hun waarden.
figure-protocol-15(8)
Om de privacy van gegevens te beschermen, transformeren geavanceerde versleutelingsmethoden (homomorfe versleuteling) (ξ) opgeschoonde updates (U) in veilige gegevens, die worden gedistribueerd via een centrale server of meerdere peer-knooppunten.
figure-protocol-16(9)
Vanaf (9) betekent ҟ de coderingssleutel. Door gezamenlijke aggregatie van versleutelde updates handhaven systemen de beveiliging van gevoelige lokale informatie bij het veilig uitvoeren van gedistribueerde leerbewerkingen.
Homomorfe versleuteling23creëert veilige platforms om berekeningen uit te voeren op versleutelde gegevens zonder decodering voordat definitieve resultaten kunnen worden verkregen uit versleutelde invoer zoals geaggregeerde gradiënten. Gegevens blijven versleuteld voor de gehele operationele duur (end-to-end), wat zo inbreuken van buitenaf tijdens rekenprocessen voorkomt. Het platform stelt CPS-deelnemers op verschillende locaties in staat om versleutelde gegevensupdates uit te wisselen voor samenwerkende leeractiviteiten zonder privé-informatie vrij te geven. Volgens de onderzoeksdoelen handhaaft deze techniek volledige privacybescherming zoals vereist en vertoont het superieure prestaties in vergelijking met andere coderingsmethoden, die gegevensdecodering vereisen voor berekening, waardoor deze worden blootgesteld aan potentiële bedreigingen. Homomorfe versleuteling blijkt de meest geschikte beveiligingsmethode te zijn voor proxyFL-systemen, omdat het zowel veilige berekeningen van gegevens als standalone versleutelingsbewerkingen ondersteunt.

5. Veilige peer-to-peer interacties

  1. Fase-5 is veilige peer-to-peer-interacties. Tijdens deze fase verzenden deelnemers veilig hun versleutelde, opgeschoonde proxymodelupdates, die ze in fase 4 hebben gemaakt. Deelnemers (i) behouden de vertrouwelijkheid tijdens het verzenden van updates dankzij homomorfe codering, die berekeningen zoals gradiëntaggregatie op versleutelde gegevens rechtstreeks mogelijk maakt zonder dat ze hoeven te worden ontcijferd. Deelnemers drukken peer-to-peer communicatie uit door middel van computationele methoden als,
    figure-protocol-17(10)
    Uit (10) blijkt duidelijk dat de veilige peer-to-peer interactie/communicatie binnen CPS-platforms wordt gewaarborgd via homomorfe encryptie, (ξ(·)).
    Door middel van gradiëntaggregatie (Ψ) maken versleutelde gradiëntbijdragen van meerdere gebruikers het mogelijk om het gemeenschappelijke proxymodel gezamenlijk bij te werken. Deze studie toont de veilige accumulatie van de gecodeerde gradiënten van elke deelnemer door middel van homomorfe codering.
    figure-protocol-18(11)
    Van (11) staat N voor de telling van de deelnemer. De methode maakt ook directe berekeningen op versleutelde gradiënten mogelijk en beschermt gevoelige gegevens tijdens het aggregeren. Deelnemers werken het proxymodel bij door middel van decodering van geaggregeerde gradiënten, waardoor privacybewust samenwerkend leren in het hele CPS-netwerk mogelijk wordt. Veilige decoderingsmethoden behouden privétoegang tot individuele gradiënten voor alle gebruikers tijdens het volledige proces.
    figure-protocol-19(12)
    Veilige autorisatiebeperkingen zorgen er dus voor dat individuele deelnemers geen toegang hebben tot gegevensupdates die eigendom zijn van externe factoren. Het netwerk maakt gebruik van geaggregeerde updates voor gezamenlijke verbetering van gedeelde proxymodellen om veilig gedistribueerd leren te bereiken met sterke privacybescherming in CPS-systemen.

6. Detectie van afwijkingen en voorspellende modellering

  1. Ten slotte is fase 6 Anomaly Detection and Predictive Modeling. In deze fase worden de bijgewerkte proxymodellen opgesteld om te dienen voor het analyseren van werkelijke CPS-gegevens binnen een geconfigureerde testbedomgeving. De proxymodellen identificeren afwijkingen (Ф) door nieuwe gegevens te vergelijken (I) met patronen die afkomstig zijn van synthese en historische input om een anomaliescore (Å) te genereren die elementen markeert die een vooraf bepaalde limiet/drempel overschrijden (τ), die computationeel wordt uitgedrukt als,
    figure-protocol-20(13)
    figure-protocol-21(14)
    Zowel (13) als (14) zorgen ervoor dat het een methode biedt om abnormaal systeemgedrag en fouten in een vroeg stadium te herkennen.
    Voorspellende modellering met proxymodellen omvat het leren van representaties die voorspellingen produceren over systeemgedrag of -toestanden op basis van dynamische/toekomstige invoergegevensreeksen (IF), die wordt uitgedrukt als:
    figure-protocol-22(15)
    De operationele workflow van de GPLF gedemonstreerd in Figuur 2 integreert adaptieve feedbackloops, die zowel de betrouwbaarheid van het CPS-systeem als de continue relevantie ondersteunen. Fase 6-detecties van anomalieën of systeemdrift leiden de procedure om terug te keren naar fase 3, waar nieuwe synthetische gegevens worden gecreëerd met behulp van bijgewerkte privé-invoer om modellen te helpen zich aan te passen aan veranderende patronen. Aanzienlijke afwijking van verwachte output of voorspellingen en slechte nauwkeurigheid die tijdens fase 6 zijn vastgesteld, dwingen een terugkeer naar fase 2, waar deelnemers hun modellen opnieuw moeten trainen met behulp van de meest nauwkeurige, up-to-date gegevens die beschikbaar zijn. Als tijdens fase 5-systeembeoordelingen de modelconvergentie ontoereikend blijkt te zijn of er inconsistenties aan het licht komen, gaat het systeem terug naar fase 4 om verfijningen toe te passen door middel van verbeterde synthetische gegevens en geoptimaliseerde privacytechnieken. De looping-mechanismen zorgen voor adaptieve leergereedheid, waardoor sterke systeemprestaties en beveiliging in alle besturings- en processysteembewerkingen behouden blijven.
    Een sterke mix van hardware- en softwarecomponenten valideerde de GPLF-functies voor CPS-implementatie door middel van schaalbare, veilige operaties. De specifieke platformvereisten voor GPLF omvatten Ubuntu 20.04 LTS met Python v3.9-implementatie plus deep learning-frameworks PyTorch v1.12 en TensorFlow v2.9 om training te geven voor privé-, proxy- en diffusiemodellen. Evaluatie van de systeemprestaties combineerde Matplotlib v3.5 visualisatiesoftware met Seaborn v0.11 statistische visualisatie en Scikit-learn v1.1 benchmarking naast privacymaatregelen van PySyft v0.6.0 voor differentiële privacy en TenSEAL v0.3 voor homomorfe encryptie. Hardwarevereisten omvatten een AMD EPYC-7502P-processor samen met een A100 GPU met CUDA v11.6 voor rekenefficiëntie en geheugenvereisten van 256 GB RAM ter ondersteuning van uitgebreide CPS-datasets, evenals een SSD van 1 TB gevolgd door een Gigabit Ethernet-netwerk dat is ontworpen voor veilige informatie-uitwisseling, zijn inbegrepen om de efficiënte onderzoeksexperimenten uit te voeren. GPLF-algoritmen werden gevalideerd via deze systeemconfiguratie, die gegevens beschermde en tegelijkertijd schaalbaarheidsprincipes bewees voor real-world CPS-implementaties. Versieselectie zorgt voor compatibiliteit met geavanceerde versleuteling, gefedereerd leren en generatieve modeltechnieken, waardoor betrouwbare validatieschaalbaarheid in meerdere CPS-toepassingen mogelijk is.
    Tijdens het onderzoek koos de studie voor een paar essentiële hyperparameters die een evenwicht vonden tussen prestatiemaximalisatie en privacybescherming en schaalbaarheid in alle GPLF-fasen. Om lokaal en samenwerkend leren in evenwicht te brengen, stelden onderzoekers unieke leersnelheden in op 0,001 en 0,01 voor privé- en proxymodellen, maar handhaafden ze Gaussiaans geïnitialiseerde gewichten om stabiele convergentie te garanderen. Om overfitting te voorkomen tijdens het verwerken van CPS-gegevens, gebruikte het lokale trainingsproces batches van 32 instanties, elk meer dan tien tijdperken. Voor het genereren van synthetische gegevens moest het diffusiemodel een proces van 1000 stappen bij een standaarddeviatie van 0,05 ruis toepassen om de nauwkeurigheid van kritieke kenmerken te behouden. Anonimisering van gegevens door middel van differentiële privacy werd bereikt door gradiëntclipping te implementeren op 1,0 met een ruisschaal die is aangepast aan 0,1 met behoud van het nut van de dataset. Voor homomorfe versleuteling is het Paillier Cryptosystem24 wordt gebruikt om gradiënten te verwerken door middel van puur additieve bewerkingen binnen federated learning. Het Paillier-cryptosysteem maakt directe bewerkingen op versleutelde informatie mogelijk, waardoor uitgebreide communicatievereisten in veilige computersystemen met meerdere partijen worden geëlimineerd. Deze techniek maakt snellere aggregatie mogelijk in combinatie met verminderde communicatievereisten, wat leidt tot een schaalbare en efficiënte oplossing voor veilige berekeningen in CPS-systemen met beperkte middelen. De anomaliedetectie, een vooraf bepaalde limiet/drempel en een voorspellingshorizon van tien stappen zorgden voor nauwkeurige monitoring en proactieve besluitvorming in CPS. Door middel van hyperparameter-finetuning wordt een perfecte balans bereikt tussen prestatiestatistieken en aanpasbaarheid van het systeem met privacybescherming in praktische CPS-toepassingen.
    Tabel 2 documenteert de noodzakelijke hyperparameters voor elke fase van GPLF-onderzoek en optimale waarden om de beste prestaties te bereiken over de gehele methodologie.
    Twee prominente datasets worden overwogen voor de training en evaluatie van de voorgestelde aanpak op verschillende aspecten. Ze zijn TON_IoT25,26,27,28,29,30,31 en UNSW-NB1532,33,34,35,36 van de Universiteit van New South Wales (UNSW) Canberra. Zowel TON_IoT als UNSW-NB15-datasets zijn geselecteerd omdat ze een uitgebreide reeks CPS-aandoeningen bevatten. Deze datasets dienen verschillende doelen, omdat TON_IoT diverse IoT-sensormetingen presenteert in combinatie met modellen voor industriële situaties, en UNSW-NB15 uitgebreide gegevenstests voor netwerkinbraakgegevens voor beveiligingssystemen biedt. De combinatie van TON_IoT- en UNSW-NB15-datasets maakt een volledige prestatiebeoordeling van GPLF in verschillende operationele omgevingen mogelijk. De opname van nieuwe datasets zal de operationele betrouwbaarheid van het raamwerk vergroten, aangezien we deze tekortkoming als een toekomstige ontwikkelingsdoelstelling hebben geïdentificeerd.
    De TON_IoT datasets vertegenwoordigen een uitgebreide gegevensopslagplaats die is ontwikkeld om de prestaties van cyberbeveiligingstoepassingen te testen met behulp van op AI en ML-algoritmen gebaseerde systemen. Op de Australische militaire academie onder de UNSW, waar onderzoekers deze datasets genereerden uit heterogene bronnen die telemetrie-informatie gebruiken van meer dan 10 inheemse en industriële IoT-sensoren, waaronder weerlezers en Modbus-sensoren, samen met logboeken van het besturingssysteem en netwerkpakketten die zijn vastgelegd met ZEEK (Bro) in pcap-formaat in combinatie met logbestanden en Comma-Separated Values (CSV) -bestanden. Deze dataset is afkomstig van een real-world netwerk dat IoT-componenten combineert met zowel cloudfuncties als edge/fog computing-mogelijkheden, die werden beheerd op meerdere hosts met virtuele machines en verschillende besturingssystemen. Het geconstrueerde systeem stelde onderzoekers in staat om tests uit te voeren van cyberaanvallen, waaronder Distributed Denial of Service (DDoS) en DoS-aanvallen, evenals ransomware-aanvallen op IoT-applicaties en computernetwerken binnen het gecombineerde Internet of Things/Industrial IoT-framework. TON_IoT datasets bevatten onbewerkte gegevenscomponenten en verwerkte gegevens met standaardfuncties en labels, trainings- en testmonsters, functiebeschrijvingen, statistische samenvattingen en beveiligingsgebeurtenissen, samen met grondwaarheidslabels. AI-gestuurde cyberbeveiligingsoplossingen voor malwaredetectiemechanismen, IDS, fraudedetectiemethoden en bedreigingsinformatieplatforms, samen met processen voor privacybehoud en digitaal forensisch onderzoek, profiteren van TON_IoT datasets vanwege hun gestructureerde organisatieontwerp, dat ook helpt bij vijandige ML-modellen en methoden voor het opsporen van bedreigingen.
    Het Cyber Range Lab van UNSW Canberra heeft de UNSW-NB15-dataset ontwikkeld als een uitgebreide standaard voor de evaluatie van het detectiesysteem voor indringers op het netwerk. Via de IXIA PerfectStorm-tool combineert de creatie van de UNSW-NB15-dataset zowel echte normale moderne activiteiten als demonstraties van synthetische aanvallen, wat naar schatting 100 GB aan netwerkverkeer produceert dat is vastgelegd in pcap-formaat. De dataset bestaat uit negen unieke aanvalsvarianten: Analysis, DoS, Fuzzers, Backdoors, Shellcode, Exploits, Worms, Generic en Reconnaissance. Door gebruik te maken van Argus- en Bro-IDS-tools in combinatie met twaalf ontworpen algoritmen, hebben onderzoekers 49 functies geëxtraheerd en getagd, waardoor een uitgebreide analyse mogelijk is. Meer dan 2,5 miljoen records vullen de dataset, die zich uitstrekt over vier CSV-werkstations en is onderverdeeld in 175.341 records voor trainingsdoeleinden en 82.332 records voor testfunctionaliteit. De systematische rangschikking van gegevens binnen dit raamwerk stimuleert zowel ontwikkelings- als testprocessen voor inbraakdetectiemodellen.

figure-protocol-23
Figuur 2: Operationele workflow van GPLF. De sequentiële bedieningsworkflow van GPLF markeert elke belangrijke processtap. Klik hier om een grotere versie van deze figuur te bekijken.

Tabel 2: Parameterspecificaties van GPLF. Klik hier om deze tabel te downloaden.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De Privacy Leakage Reduction Index (PLRI) meet de vermindering van privacylekken in vergelijking met standaard basismodellen. De evaluatie richt zich op hoe differentiële privacy en homomorfe encryptie presteren naarmate privacybehoud nadert.

De privacylekscore beoordeelt het aantal blootgestelde datapunten ten opzichte van het totale aantal updates in modellen, samen met activiteiten voor de distributie van synthetische gegevens. Het evalueert de effectivitei...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De ontwerpelementen van GPLF ondersteunen niet alleen de privacyfuncties, maar bieden ook aanvullende voordelen die de implementatiecapaciteit vergroten. Door diffusiemodellen te gebruiken om high-fidelity synthetische gegevens te produceren, biedt het raamwerk essentiële privacybeschermingslagen voor essentiële gebieden zoals de gezondheidszorg, naast monitoring van kritieke infrastructuur, met behoud van nauwkeurige generatieve modelleringsmogelijkheden. GPLF bereikt zowel verbeterde p...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat er geen sprake is van belangenverstrengeling met betrekking tot de publicatie van dit manuscript. Geen enkele financiële of persoonlijke band heeft invloed gehad op het onderzoek, de resultaten of de conclusies die in dit werk worden gepresenteerd.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk werd ondersteund door Princess Nourah bint Abdulrahman University Researchers Supporting Project number(PNURSP2025R432), Princess Nourah bint Abdulrahman University, Riyadh, Saoedi-Arabië.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
A100 GPU (CUDA)NVIDIACUDA Version 11.6GPU-versnelling voor modeltraining en evaluatie.
AMD EPYC-7502P CPUAMDN/AProcessor gebruikt voor high-performance computing.
Gigabit EthernetIntelN/ANetwerkvoorzieningen voor beveiligde peer-to-peer communicatie in CPS.
MatplotlibPython Software FoundationVersie 3.5Visualisatiebibliotheek voor het plotten van resultaten.
Paillier CryptosystemOpen Source (geïmplementeerd via TenSEAL)N/AMaakt additieve homomorfe encryptie op gradiënten mogelijk.
PySyftOpenMinedVersie 0.6.0Bibliotheek voor differentiële privacy en gefedereerd leren.
Python (Anaconda Distribution)Anaconda IncVersie 3.9Bevat vooraf geïnstalleerde pakketten en omgevingsbeheertools, gebruikt voor scripting en frameworkontwikkeling.
PyTorchMeta AIVersie 1.12Deep learning framework voor het trainen van modellen.
RAMCorsair256 GigaByte (GB) Hoge geheugenondersteuning voor intensieve training.
Scikit-learnPython Software FoundationVersie 1.1Machine learning tools voor prestatie-evaluatie.
SeabornPython Software FoundationVersie 0.11Statistische datavisualisatiebibliotheek.
SSD-opslagSeagate1 TeraByte (TB)Voor snelle gegevensopslag en -opvragen.
TenSEALOpenMinedVersie 0.3Homomorfe encryptiebibliotheek voor veilige aggregatie.
TensorFlowGoogleVersie 2.9Deep learning framework voor diffusiemodellen.
Ubuntu OSCanonicalVersie 20.04 LTSBesturingssysteem gebruikt voor alle experimenten.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Lu, Y. Cyber physical system (CPS)-based industry 4.0: a survey. J Ind Integr Manage. 2 (03), 1750014(2017).
  2. Jayadatta, S. A study on latest developments in artificial intelligence (AI) and internet of things (IoT) in current context. J Appl Inf Syst. 11 (2), 21-28 (2023).
  3. Li, X., et al. A survey on federated learning systems: vision, hype and reality for data privacy and protection. IEEE Trans Knowl Data Eng. 35 (4), 3347-3366 (2021).
  4. Hathaliya, J. J., Tanwar, S., Sharma, P. Adversarial learning techniques for security and privacy preservation: a comprehensive review. Secur Privacy. 5 (3), e209(2022).
  5. Kalra, S., et al. Decentralized federated learning through proxy model sharing. Nat Commun. 14 (1), 2899(2023).
  6. Dalhues, M., et al. Research and practice of flexibility in distribution systems: a review. CSEE J Power Energy Syst. 5 (3), 285-294 (2019).
  7. Bhuyan, M. H., Bhattacharyya, D. K., Kalita, J. K. Network anomaly detection: methods, systems and tools. IEEE Commun Surv Tutorials. 16 (1), 303-336 (2013).
  8. Du, Y., et al. The age of generative AI and AI-generated everything. IEEE Network. 38 (6), 501-512 (2024).
  9. Tyagi, A. K., Aswathy, S. U., Aghila, G., Sreenath, N. AARIN: affordable, accurate, reliable and innovative mechanism to protect a medical cyber-physical system using blockchain technology. Int J Intell Networks. 2, 175-183 (2021).
  10. Zhang, L., Zhang, Z., Guan, C. Accelerating privacy-preserving momentum federated learning for industrial cyber-physical systems. Complex Intell Syst. 7, 3289-3301 (2021).
  11. Latif, S., et al. AI-empowered, blockchain and SDN integrated security architecture for IoT network of cyber physical systems. Comput Commun. 181, 274-283 (2022).
  12. Nagarajan, S. M., et al. IADF-CPS: intelligent anomaly detection framework towards cyber physical systems. Comput Commun. 188, 81-89 (2022).
  13. Shamshad, S., et al. An efficient privacy-preserving authenticated key establishment protocol for health monitoring in industrial cyber-physical systems. IEEE Internet Things J. 9 (7), 5142-5149 (2022).
  14. Sheikh, Z. A., et al. Defending the defender: adversarial learning based defending strategy for learning based security methods in cyber-physical systems (CPS). Sensors. 23 (12), 5459(2023).
  15. Suhail, S., et al. ENIGMA: an explainable digital twin security solution for cyber-physical systems. Comput Ind. 151, 103961(2023).
  16. Islam, S., et al. Generative AI and cognitive computing-driven intrusion detection system in industrial CPS. Cognit Comput. 16 (5), 2611-2625 (2024).
  17. Namakshenas, D., et al. IP2FL: interpretation-based privacy-preserving federated learning for industrial cyber-physical systems. IEEE Trans Ind Cyber-Phys Syst. 2, 321-330 (2024).
  18. Rivadeneira, J. E., et al. A unified privacy preserving model with AI at the edge for human-in-the-loop cyber-physical systems. Internet Things. 25, 101034(2024).
  19. Wen, J., et al. Sustainable diffusion-based incentive mechanism for generative AI-driven digital twins in industrial cyber-physical systems. IEEE Trans Ind Cyber-Phys Syst. 3, 139-149 (2024).
  20. Chae, J., et al. A survey and perspective on industrial cyber-physical systems (ICPS): from ICPS to AI-augmented ICPS. IEEE Trans Ind Cyber-Phys Syst. 1, 257-272 (2023).
  21. Thomas, D. B., Luk, W., Leong, P. H., Villasenor, J. D. Gaussian random number generators. ACM Comput Surv. 39 (4), 11(2007).
  22. Yazan, E., Talu, M. F. Comparison of the stochastic gradient descent based optimization techniques. 2017 International Artificial Intelligence and Data Processing Symposium (IDAP). , Malatya, Turkey. (2017).
  23. Acar, A., et al. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput Surv. 51 (4), 1-35 (2018).
  24. The homomorphic other property of Paillier cryptosystem. Sridokmai, T., Prakancharoen, S. 2015 International Conference on Science and Technology (TICST), Pathum Thani, Thailand, , (2015).
  25. Moustafa, N. A new distributed architecture for evaluating AI-based security systems at the edge: network TON_IoT datasets. Sustainable Cities Soc. 72, 102994(2021).
  26. Booij, T. M., et al. ToN_IoT: the role of heterogeneity and the need for standardization of features and attack types in IoT network intrusion data sets. IEEE Internet Things J. 9 (1), 485-496 (2021).
  27. Federated TON_IoT Windows datasets for evaluating AI-based security applications. Moustafa, N., et al. 2020 IEEE 19th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom), Guangzhou, China, , (2020).
  28. Data analytics-enabled intrusion detection: evaluations of ToN_IoT linux datasets. Moustafa, N., Ahmed, M., Ahmed, S. 2020 IEEE 19th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom), Guangzhou, China, , (1109).
  29. Moustafa, N. New generations of internet of things datasets for cybersecurity applications based machine learning: TON_IoT datasets. Proceedings of the eResearch Australasia Conference, Brisbane, Australia, , (2019).
  30. Moustafa, N. A systemic IoT-fog-cloud architecture for big-data analytics and cyber security systems: a review of fog computing. Secur Edge Comput. , 41-50 (2021).
  31. Ashraf, S., et al. IoTBoT-IDS: a novel statistical learning-enabled botnet detection framework for protecting networks of smart cities. Sustainable Cities Soc. 72, 103041(2021).
  32. UNSW-NB15: a comprehensive data set for network intrusion detection systems (UNSW-NB15 network data set). Moustafa, N., Slay, J. 2015 Military Communications and Information Systems Conference (MilCIS), Canberra, ACT, Australia, , (2015).
  33. Moustafa, N., Slay, J. The evaluation of network anomaly detection systems: statistical analysis of the UNSW-NB15 data set and the comparison with the KDD99 data set. Inf Secur J Global Perspect. 25 (1-3), 18-31 (2016).
  34. Moustafa, N., Slay, J., Creech, G. Novel geometric area analysis technique for anomaly detection using trapezoidal area estimation on large-scale networks. IEEE Trans Big Data. 5 (4), 481-494 (2017).
  35. Moustafa, N., Creech, G., Slay, J. Big Data Analytics for Intrusion Detection System: Statistical Decision-Making Using Finite Dirichlet Mixture Models. Data Analytics and Decision Support for Cybersecurity. Data Analytics. , Springer. Cham. (2017).
  36. Sarhan, M., et al. NetFlow Datasets for Machine Learning-Based Network Intrusion Detection Systems. Big Data Technologies and Applications. BDTA WiCON 2020. Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering. , Springer. Cham. (2021).
  37. Alberts, P., et al. Development and implementation of a multi-disciplinary technology enhanced care pathway for youth and adults with concussion. J Vis Exp. (143), e58962(2019).
  38. Yeh, C., et al. An application for pairing with wearable devices to monitor personal health status. J Vis Exp. (180), e63169(2022).
  39. Nogales, A., et al. Integration of 5G experimentation infrastructures into a multi-site NFV ecosystem. J Vis Exp. (168), e61946(2021).
  40. Chen, J. Large scale energy efficient sensor network routing using a quantum processor unit. J Vis Exp. (199), e64930(2023).
  41. Wang, Y., Wang, Z. End-to-end deep neural network for salient object detection in complex environments. J Vis Exp. (202), e65554(2023).
  42. Zhu, E., et al. PHEE: identifying influential nodes in social networks with a phased evaluation-enhanced search. Neurocomputing. 572, 127195(2024).
  43. Liu, Y., et al. Resilient formation tracking for networked swarm systems under malicious data deception attacks. Int J Robust Nonlinear Control. 35 (6), 2043-2052 (2025).
  44. Xu, G., et al. CBRFL: a framework for committee-based byzantine-resilient federated learning. J Network Comput Appl. 238, 104165(2025).
  45. Zhou, W., et al. Hidim: a novel framework of network intrusion detection for hierarchical dependency and class imbalance. Comput Secur. 148, 104155(2025).
  46. Shi, J., Liu, C., Liu, J. Hypergraph-based model for modeling multi-agent Q-learning dynamics in public goods games. IEEE Trans Network Sci Eng. 11 (6), 6169-6179 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cyber Physical SystemGenerative Artificial IntelligenceProxy LearningFederated LearningDiffusion ModelsSynthetic Sensor DataAnomaly DetectionDifferential PrivacySecure Peer CommunicationPredictive Modeling
Video Coming Soon

Related Articles