在这里,我们介绍了生成式代理学习框架 (GPLF),它引入了基于代理的联邦学习 (ProxyFL) 来改进信息物理系统 (CPS) 中的生成式 AI 解决方案。通过集成差分隐私功能和加密方法,GPLF 增强了隐私保护,从而减少了隐私泄露,从而使信息物理系统的作更智能、更安全。
Research Article
在这里,我们介绍了生成式代理学习框架 (GPLF),它引入了基于代理的联邦学习 (ProxyFL) 来改进信息物理系统 (CPS) 中的生成式 AI 解决方案。通过集成差分隐私功能和加密方法,GPLF 增强了隐私保护,从而减少了隐私泄露,从而使信息物理系统的作更智能、更安全。
信息物理系统 (CPS) 将计算智能与物理流程相结合,从而在各个重要领域实现即时监控、决策能力和自动化服务。此外,生成式人工智能 (AI) 在 CPS 中部署面临相当大的障碍,因为包含敏感数据的分布式环境带来了严重的隐私和安全维护挑战。当前的技术,如联邦学习 (FL),在模型多样性和隐私可能受到损害的风险方面都遇到了困难。生成式代理学习框架 (GPLF) 是我们的创新解决方案,它利用基于代理的联合学习 (ProxyFL),专门适用于信息物理系统 (CPS) 中的生成式 AI 应用程序。在 GPLF 中,每个参与者都维护两个模型:参与者作一个专门用于本地数据分析的私有模型和一个支持受保护节点协作的共享代理模型。作为生成式 AI 机制的重要基础,高级 Diffusion Models 提供高保真合成数据以及关键数据特征保留。这些模型生成合成传感器数据,从而改进异常检测,并通过各种场景下的真实 CPS 行为表示支持预测建模。该系统在代理数据更新中通过差分隐私机制实现高级隐私保护,而网络中的直接对等通信则受益于高级加密保护。GPLF 通过连接到支持安全生成过程(包括异常检测、合成数据创建和预测建模)的实时传感器和 IoT 设备来为 CPS 平台提供服务。基准 CPS 数据集的测试结果显示,性能有了相当大的提升,隐私泄露减少了 25%,数据交换能力提高了 25%,生成任务的准确性提高了 18%,以支持其安全、智能 CPS作的变革潜力。
该研究通过将计算智能与现实世界的流程相结合来研究信息物理系统 (CPS),以实现实时监控以及快速决策能力和系统自动化1。新兴的物联网 (IoT) 和人工智能 (AI) 技术正在显著扩大 CPS 系统在智能电网开发和工业自动化流程以及医疗保健服务中执行基本功能的应用范围2。部署 CPS 的组织越来越多地使用生成式 AI 模型,这些模型提供了模拟系统行为的能力,并支持预测建模和增强的异常检测。CPS 数据的分布式格式与其敏感属性相结合,导致生成式 AI 实施中存在重大隐私漏洞以及安全问题和可扩展性问题。
现有技术,如联邦学习 (FL),专注于数据隐私保护,但面临限制,其中包括模型更新隐私泄露的威胁,以及对生成式 AI 的支持减少和对各种 CPS 条件的处理不足3。目前的方法缺乏为实时作期间在分布式 CPS 中工作时为数据生成和保护措施而设计的高级机制的基本集成。由于当前框架在多个领域存在不足,现有研究表明,只有通过创建新的解决方案来满足这些需求,该解决方案提供安全、可扩展、生成的模型以及明确的隐私保护4。
新的生成代理学习框架 (GPLF) 研究概述了一种特制的方法,以促进生成式 AI 功能在 CPS 中的部署。GPLF 实现了基于代理的 FL 方案5,因此用户可以使用私有模型进行个人数据检查,并使用代理模型来维持受保护的合作学习活动。本研究通过应用差分隐私方法和安全同态加密来增强数据隐私,并采用先进的扩散模型来生成高质量的合成数据。该系统支持安全的异常检测和预测建模功能,同时允许在分布式 CPS作之间高效传输信息。
GPLF 通过其双模型框架设计解决了现有的 FL 挑战,该框架设计提供了数据保护和系统灵活性6。每个 CPS 参与者都使用私有和代理模型,建立两个独立的系统来实现本地隐私保护并启用团队学习能力。私有模型使用本地化作从参与者的机密数据中学习,并通过在每个参与者的参数中存储敏感信息来维护完整的数据隐私。该系统在检测异常和识别本地模式时实现最佳性能7。代理模型充当一个联合集体学习机制,可供所有参与者使用,以实现安全的知识共享。代理模型通过来自扩散模型的经过净化的合成数据处理以及通过差分隐私和同态加密来传达更新,从而进行机密性训练,因为这实现了私有但功能性的 FL。
扩散策略可以创建卓越的合成数据集,这些数据集在隐藏个人详细信息的同时保持基本特征。这项研究揭示了重大进展,表现为通过升级数据交换功能和更好的生成任务性能,隐私泄露大幅下降,从而实现更具弹性的信息物理系统作。GPLF 通过将隐私保护学习与生成式 AI 功能相结合,为智能 CPS 创造了一种新的方法8。
GPLF 通过其双模型设计提供了新功能,专门用于处理跨 CPS 的生成式 AI 部署中的隐私问题。传统的联邦学习对所有参与者使用一个模型,而 GPLF 则部署用于本地数据检查的私有模型和用于执行小组学习任务的代理模型。通过严格的数据分离,患者在本地维护敏感信息,但使用代理模型的净化合成数据与差分隐私相结合来实现安全协作。代理模型通过扩散模型生成的高质量合成数据,在保持系统适应性的同时,确保稳健的异常检测和预测建模,确保用户隐私保护。GPLF 作为安全 CPS 系统的创新框架脱颖而出,因为它的双模型方法提供了增强的隐私保护和安全数据,同时保持了可扩展性和运营效率。
该研究的目标是开发一种基于代理的联邦学习 (ProxyFL),它需要双模型架构来实现 CPS 中的安全适应。此外,高级扩散模型对于作为生成合成数据的集成点以在隐私保护期间保持基本数据特征至关重要。最后,有必要在同态加密协议的同时实现差分隐私方法,以确保数据安全并在梯度聚合过程中保护隐私。
表 19、10、11、12、13、14、15、16、17、18、19 突出了现有方法的核心过程及其成就,但有一些关键的局限性。
表 1:现有研究重点、核心组成部分、成就和局限性概述。请点击此处下载此表格。
将生成式 AI 合并到 CPS 系统的现有方法表明,在维护隐私法规和实现系统灵活性的同时,扩展到大型部署存在关键问题20。目前的 FL 方法通过模型多样性不足显示出限制,同时在分散和移动的系统中也表现出较弱的性能,并且由于易受攻击的数据传输实践而暴露了用户数据。CPS 中的异常检测、合成数据生成和预测建模所需的高保真数据表示通常无法实现许多生成建模解决方案,这可能会损害他们尝试实现这些标准的隐私和计算效率。当前的系统缺陷证实了支持可扩展、安全和高效的生成式 AI 流程的框架要求。
Access restricted. Please log in or start a trial to view this content.
生成式代理学习框架 (GPLF) 代表了一种将生成式 AI 与 CPS 集成的新技术,并解决了分布式网络系统中数据隐私以及安全和性能指标的重要问题。CPS 平台的功能取决于最新的监控以及从越来越多的 IoT 设备和传感器中提取敏感数据输入的自动化作。已发现在 CPS 系统中采用生成式 AI 技术会带来特殊危害,例如隐私漏洞以及整个分布式网络设置中的安全挑战。GPLF 推出了一个创新的基于代理的联邦学习 (ProxyFL) 框架,该框架支持安全的协作学习,专门用于生成任务,以缓解现有问题。在 CPS 平台上对 GPLF 框架进行了全面评估,该平台的测试台将不同的传感器网络技术与 IoT 设备和实时数据流相结合。
GPLF 的参与者在参与期间运行两个独立的模型。
独有的私有模型用于本地数据检查,同时保护数据免受外部访问。
该系统的共享代理模型5 通过加密技术与差分隐私方法相结合,实现安全的参与者合作。
该框架利用扩散模型创建精心设计的合成数据集,以驱动异常检测功能,同时在各种场景模拟期间显示预测建模和系统行为跟踪。合成的数据集通过有效的隐私保护方法保持重要的特征。该框架通过强大的加密技术运行安全的点对点交换,以保护通信通道免受恶意攻击。使用 GPLF 在实际 CPS 平台上进行的评估表明,它如何在整个可扩展性限制下为安全和智能的运营能力带来实质性进步。隐私泄露措施的重大改进以及数据交换能力和生成任务精度的补充增强证明了其功能价值和具体性能结果。GPLF 的核心阶段包括基于代理的联合学习初始化以及私有数据本地训练,这构成了 GPLF 的主干,并集成了受差分隐私保护的代理模型更新。还包括扩散模型合成数据生成方法,具有安全的点对点数据交换技术以及用于异常检测和预测建模的模块。 图 1 中的组织结构显示了 GPLF 的基本元素,这些元素有可能优化 CPS 的基本作。

图 1:用于安全和智能 CPS作的 GPLF 架构框架。 旨在实现信息物理系统中的安全和智能作。 请单击此处查看此图的较大版本。
以下部分详细介绍了 CPS 平台中异构设备之间安全通信的框架的六个阶段。
1. 基于代理的联邦学习初始化
第一阶段是基于代理的联邦学习初始化,其中 GPLF 使用基于代理的 FL 初始化过程为每个 CPS 参与者 (N) 的系统设置两个模型,这些模型确保隐私,同时允许参与者通过学习功能安全地协作。个人 CPS 参与者 (i) 收到一个私有模型
,以使用他们的本地数据 (di) 进行隐私保护,以及一个共享代理模型
,以实现参与者之间的安全合作行为。对于归一化初始条件,模型从高斯分布21 的随机条目创建的权重开始训练,该权重表示为等式 (1),
(1)
参与者自主处理他们的数据,同时通过支持 CPS 系统中保护隐私的分布式生成式学习的共享模型交换见解。
2. 私人数据的本地训练
第 2 阶段是私人数据的本地培训;在这里,进行数据训练,CPS 参与者从他们存储的本地数据中开发私有模型,通过将其密封起来,使其免受外部暴露,从而保持完整的现场数据保护。参与者接受使用随机梯度下降 (SGD)22 的基于数据的模型优化培训,该培训通过局部损失函数 (llocal) 进行,并支持有意义的洞察提取和局部适应,同时保持数据隐私。
(2)
(3)
从 (2) 和 (3) 开始, I 和 O 表示样本输入和相应的目标值。 L 表示具有学习率 (Ɽ) 的损失。此步骤开发了个人参与者智能系统,作为未来安全协作教育过程的基础。
独立递归神经网络 (IndRNN) 用作第 2 阶段的 ML 模型,因为它的架构允许神经元在每个时间步长中独立处理特定的 CPS 任务,同时缓解传统的 RNN 梯度问题。IndRNN 设置中的每个神经元都有一个单独的递归权重,可以更好地捕获长期依赖性。单独的作模型增强了梯度传输,从而有效地扩展了深度网络结构,同时保持了计算过程的高效。CPS 平台上的顺序数据处理使用 IndRNN 时性能最佳,因为它能够使用强大的学习模式处理长序列,同时保持较低的网络复杂性。
等式 (4) 中的计算表明,IndRNN 中梯度消失和爆炸问题的解决方案源于其独特的递归连接设计方法。
(4)
从 (4) 中, ω 和 Ht 分别表示 t 处的权重和隐藏状态。
表示独立循环显著性(权重)的向量,每个数据点一个,从而在不同时间步长之间实现独立性。 ʘ 表示设计特点元素乘法支持,在每个神经元的循环连接之间保持完全独立, ä 表示激活函数。神经架构设计避免了整个计算序列中的梯度扩展或收缩,从而支持稳定的学习模型训练和成功学习扩展模式。
IndRNN 成为 CPS 异常检测的首选方法,因为它成功地防止了传统的 RNN 梯度爆炸和消失。通过 IndRNN 架构可以轻松跟踪长期依赖关系,因为它的运行比 Transformer 模型复杂,并且实现了快速收敛和实时运行。IndRNN 的有效性质使其特别适合表示 CPS 的资源有限作特征,同时提供精确的异常识别,而不会产生过多的计算压力。
3. 用于合成数据生成的扩散模型
阶段 3 是合成数据生成的扩散模型。此阶段利用高级扩散模型生成合成数据,该数据复制了所获取的私有数据的主要特征。这些模型通过添加受控噪声来收集特征,从而学习原始隐私敏感数据的分布,这有助于创建具有高保真度的合成数据,在保护隐私保护措施的同时保留重要特征。迭代降噪程序生成合成数据,保持实际数据的基本统计特性和结构元素。
最初,生成扩散模型 (Υ) 训练过程侧重于创建具有高保真度的合成数据,同时保持私有数据 (di) 的关键特征,这种生成的核心计算包括:
(5)
从 (5) 中,
表示将高斯噪声合并到数据样本中。新生成的合成数据表示为,
(6)
4. 具有差分隐私的代理模型更新
第 4 阶段是具有差分隐私的代理模型更新。在这个阶段,每个交际参与者都利用扩散模型在此阶段创建的合成数据来训练他们在这个阶段的代理模型
。
(7)
代理模型更新的梯度仍然是私有的,因为差分隐私机制会向其值添加噪声
。
(8)
为了保护数据隐私,高级加密方法(同态加密)将 (ξ) 已清理的更新 (U) 转换为安全数据,这些数据通过中央服务器或多个对等节点分发。
(9)
从 (9) 开始, ҟ 表示加密密钥。通过加密更新的协作聚合,系统在安全地执行分布式学习作时维护敏感本地信息的安全。
同态加密23创建了安全的平台,可以在允许从聚合梯度等加密输入获得最终结果之前对加密数据运行计算,而无需解密。数据在其整个作持续时间(端到端)内保持加密状态,从而防止计算过程中出现外部漏洞。该平台允许不同地点的 CPS 参与者在不泄露私人信息的情况下交换加密数据更新以进行协作学习作。根据研究目标,该技术根据需要保持完整的隐私保护,并且与其他加密方法相比显示出卓越的性能,其他加密方法需要数据解密进行计算,从而使其面临潜在威胁。同态加密被证明是最适合 proxyFL 系统的安全方法,因为它支持对数据的安全计算和独立的加密作。
5. 安全的点对点交互
(10)
(11)
(12)6. 异常检测和预测建模
(13)
(14)
(15)
图 2:GPLF 的作工作流程。 GPLF 的顺序作工作流程突出显示了每个关键工艺步骤。 请单击此处查看此图的较大版本。
表 2:GPLF 的参数规格。请点击此处下载此表格。
Access restricted. Please log in or start a trial to view this content.
隐私泄漏减少指数 (PLRI) 指标衡量与标准基线模型相比的隐私泄漏减少。评估的重点是差分隐私和同态加密作为隐私保护方法的性能。
隐私泄漏分数评估相对于模型中总更新量的公开数据点的数量,以及合成数据分发活动。它评估隐私保护策略的有效性。当系统的 PLRI 值较高时,系统可实现卓越的隐私保护。
根据 表 3 中的 PLRI 评估,与现有的 FL 技术相比,新颖的 GPLF 架构表现出卓越的隐私保留能力。评估方法,如 PMFL、HDSCNN-KF、IP2FL、FL-UPM 和 GAI-CIDS,揭示了 35% 到 40% 不等的隐私泄露,这表明在适用作期间暴露的敏感数据水平不同。根据基准,其他数据保存方法显示隐私泄露率为 36.4%,而 GPLF 将泄露值降低到 30%,这意味着提高了 16%。获得的 PLRI 测量值为 0.17,验证了 GPLF 实现的重大隐私保护进步。通过将先进的差分隐私技术与安全的同态加密相结合,这种方法实现了代理模型更新的有效匿名化,同时实现了持续的系统性能。结果表明,G...
Access restricted. Please log in or start a trial to view this content.
GPLF 的设计元素不仅支持其隐私功能,而且还提供补充优势,增强其部署能力。通过采用扩散模型生成高保真合成数据,该框架为医疗保健等重要领域提供必要的隐私保护层以及关键基础设施监控,同时保持精确的生成建模功能。GPLF 通过其双模型结构在异构系统中实现了增强的隐私保护和更高的协作学习效率,同时解决了与参与者差异和数据差异相关的问题。现有系统发现很难将强大的隐私保护与可扩展的功能融合在一起,但 GPLF 脱颖而出,因为它保持了这种平衡,并展示了对即将到来的 CPS作的适应性。GPLF 展示了有助于创建安全系统(可智能适应不同作环境)的变革性功能。
GPLF 通过创新功能展示其功能,使其能够在多个 CPS 环境中运行。GPLF 通过生成高保真合成数据的扩散模型,通过异构数据设置保持安全的协作学习。平台内的双模型结构既能实现高效的本地化洞察管理,又能在分布式 CPS 节点之间实现持续、无缝的通信。GPLF 对加密方法的关注使系统能够满足严格的数据隐私要求,使其有资格用于重要领域,包括医疗保健防御和智能基础设施。GPLF 通...
Access restricted. Please log in or start a trial to view this content.
作者声明,本手稿的出版不存在利益冲突。任何财务或个人关系均未影响本研究中提出的研究、结果或结论。
这项工作得到了沙特阿拉伯利雅得 Nourah bint Abdulrahman 公主大学研究人员支持项目编号 (PNURSP2025R432) 的支持。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| A100 GPU (CUDA) | NVIDIA | CUDA 11.6 版 | GPU 加速,用于模型训练和评估。 |
| AMD EPYC-7502P CPU | AMD | N/A | 处理器,用于高性能计算。 |
| 千兆以太网 | Intel | N/A | 网络,用于 CPS 中的点对点安全通信。 |
| Matplotlib | Python Software Foundation | Version 3.5 | 用于绘制结果的可视化库。 |
| Paillier Cryptosystem | Open Source (通过 TenSEAL 实现) | N/A | 启用梯度上的加法同态加密。 |
| PySyft | OpenMined | 版本 0.6.0 | 差分隐私和联合学习库。 |
| Python (Anaconda Distribution) | Anaconda Inc | 版本 3.9 | 包括预装的软件包和环境管理工具,用于脚本和框架开发。 |
| PyTorch | Meta AI | 版本 1.12 | 用于训练模型的深度学习框架。 |
| RAM | Corsair | 256 GB (GB) | 高内存支持,适合强化训练。 |
| Scikit-learn | Python Software Foundation | Version 1.1 | 用于性能评估的机器学习工具。 |
| Seaborn | Python Software Foundation | 版本 0.11 | 统计数据可视化库。 |
| SSD 存储 | Seagate | 1 TB | 用于快速数据存储和检索。 |
| TenSEAL | OpenMined | Version 0.3 | 同态加密库,用于安全聚合。 |
| TensorFlow | Version 2.9 | 扩散模型的深度学习框架。 | |
| Ubuntu OS | Canonical | Version 20.04 LTS | 用于所有实验的作系统。 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission