本文提出了一种基于区块链的不可学习样本生成框架,将动态扰动与访问控制相结合。该框架通过确保未授权用户只能获取扰动后的数据,从而加强隐私保护,在保护敏感信息的同时,利用智能合约实现高效的数据管理和访问。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文提出了一种基于区块链的不可学习样本生成框架,将动态扰动与访问控制相结合。该框架通过确保未授权用户只能获取扰动后的数据,从而加强隐私保护,在保护敏感信息的同时,利用智能合约实现高效的数据管理和访问。
在大语言模型(LLMs)快速发展的背景下,对比学习因其能够利用海量网络数据进行模型训练,从而规避高昂的数据标注成本,已被广泛采用。然而,这种广泛应用引发了人们对数据隐私保护的严重关切。不可学习样本(Unlearnable Examples, UEs)是一种通过扰动数据来干扰模型学习的技术,可有效防止未经授权的模型滥用敏感数据。然而,现有的UE生成方法面临两个主要挑战:第一,扰动可能被逆转,例如通过反向净化或去噪技术(包括能够去除图像UE中保护性扰动的扩散模型);第二,数据一旦发布,数据可追溯性的确保和访问控制的管理将变得困难。为解决上述问题,本文提出了一种区块链集成的不可学习样本生成与管理框架(Blockchain-Integrated Unlearnable Example Generation and Management Framework, B-UEGMF),用于UE的生成与管理。该框架利用区块链的去中心化和不可篡改特性,将样本哈希值存储于区块链上,并通过智能合约动态管理数据访问权限。此外,采用一种多目标扰动技术——动态误差最小化噪声(Dynamic Error-Minimizing Noise, DEM)生成UE,以增强对逆转方法的鲁棒性。本文还对所生成样本的隐私保护能力进行了定量评估。实验结果表明,所提出的框架在确保高效数据隐私管理的同时,显著提升了UE对逆向攻击的防御能力。
近年来,随着深度学习和大语言模型的快速发展,对比学习因其不依赖昂贵的人工标注而成为一种高效的无监督学习方法1,2。然而,公共数据集的广泛使用引发了人们对隐私泄露和数据滥用的严重担忧。未经授权使用公开数据进行模型训练的情况日益普遍3。例如,2017年,未经授权的公开照片被用于训练人脸识别模型4。类似地,亚马逊在未获得所有用户明确同意的情况下,利用消费者的公开评论数据训练其推荐系统,暴露出隐私保护机制中的漏洞5。
为解决这些问题,不可学习样本(Unlearnable Examples, UEs)作为一种新型数据隐私保护技术应运而生。UEs 通过对数据样本添加难以察觉的扰动,引入一种捷径机制,使模型无法学习到敏感信息,同时保持人类对数据的可感知性6,7,8。目前生成 UEs 的主要方法包括误差最小化噪声(Error-Minimizing noise, EM)扰动9、基于生成对抗网络(gener....
访问受限。请登录或开始试用以查看此内容。
设置
我们考虑了一个具有数据集的有监督分类任务
,其中
表示输入特征和
表示对应的类别标签 K-类问题。该数据集 D
访问受限。请登录或开始试用以查看此内容。
区块链与智能合约框架
实验结果表明,所提出的集成区块链的不可学习样本生成与管理框架(B-UEGMF)结合智能合约,能够有效实现对特定客户端数据访问的动态管理。对于授权用户,检索到的干净数据在基于CIFAR-10数据集评估的ResNet-18代理模型上达到了90.2%的测试准确率。相比之下,未授权用户访问由DEM生成的不可学习样本(UEs),其测试准确率显著降低至13.0%。这些结果验证了B-UEGMF在通过强健的不可学习样本保护数据隐私的同时,有效实施访问控制的能力,如图2所示。更多实验结果见表1。
对恢复攻击的抵抗能力
所提出的动态误差最小化噪声(DEM)在抵抗基于恢复的对抗性攻击方面,相较于现有方法表现出更优的鲁棒性。不同方法之间的训练损失比较如图4所示。在涉及扩散模型及其他去噪技术的实验场景中,DEM生成的UEs始终能够抵御逆向工程尝试。与E.......
访问受限。请登录或开始试用以查看此内容。
区块链与UEs的结合通过提供一种透明且去中心化的数据访问管理方案,推动了数据隐私保护领域的发展。与传统隐私保护方法通常仅依赖扰动技术31不同,本研究弥合了数据保护与责任追溯之间的鸿沟。在联邦学习场景中,所提出的框架确保在去中心化数据集上进行安全且私密的模型训练,降低了未经授权恢复数据的风险。此外,DEM中嵌入的注意力机制提升了模型的适应性和鲁棒性,为其在复杂现实场景中的应用奠定了基础。
尽管本研究具有诸多贡献,但仍存在若干局限性。首先,当前框架主要针对图像分类任务中的隐私保护,其在其他下游任务中的表现尚未得到探索。其次,区块链集成的计算开销,包括存储和交易成本,可能限制其在大规模应用中的可扩展性。第三,动态扰动生成方法依赖于客户端元数据和时间戳,可能无法充分捕捉生成最优噪声所需的所有相关上下文因素。解决这些局限性需要对区块链框架和扰动生成策略进一步优化。
该框架在需要严格隐私保护和可追溯数据访问的场景中具有重要意义。例如,在医疗领域,患者数据必须在保密的同时支持协作研究
访问受限。请登录或开始试用以查看此内容。
作者无任何与本出版物相关的内容需要披露。
本工作得到了郑州大学网络空间安全学院的支持,该学院提供了优良的研究环境和学术资源。我们衷心感谢导师张子蛟教授在本研究过程中给予的宝贵指导、深刻建议和持续不断的鼓励。同时,我们诚挚感谢郑州大学网络管理中心提供了实验服务器、高性能计算资源以及区块链测试平台基础设施,这些条件对本研究的顺利实施至关重要。
作者贡献:
Ruijia Li 构思了本研究,开发了研究方法,开展了实验,进行了数据分析,并撰写了初稿。Zijiao Zhang 提供了研究监督、方法学验证以及对稿件的关键性审阅。Shouli Fu 为区块链的实现提供了指导。Lin Zhu 协助完成了数据整理与验证。Qunpeng Lei 参与了理论框架的构建。Buwei Wang 提供了技术支持。所有作者均审阅并批准了最终稿件。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA 12.1 | NVIDIA | 用于提升深度学习应用的性能 | |
| NVIDIA A800 80GB PCIe A800 80GB PCIe | NVIDIA | 用于深度学习模型训练 | |
| Python 3.10 | Python Software Foundation | 用于数据预处理与分析 | |
| PyTorch 2.5.1 | 用于模型训练的深度学习框架 | ||
| Ubuntu 22.04 | Canonical | 用于环境搭建的操作系统 |
访问受限。请登录或开始试用以查看此内容。