本文提出了一种基于区块链的框架,用于生成不可学习的示例,将动态扰动与访问控制相结合。它通过确保未经授权的用户接收受干扰的数据来增强隐私保护,保护敏感信息,同时通过智能合约实现高效的数据管理和访问。
Research Article
本文提出了一种基于区块链的框架,用于生成不可学习的示例,将动态扰动与访问控制相结合。它通过确保未经授权的用户接收受干扰的数据来增强隐私保护,保护敏感信息,同时通过智能合约实现高效的数据管理和访问。
在大型语言模型(LLM)快速发展的背景下,对比学习因其能够利用大量网络数据进行模型训练来绕过昂贵的数据标注而被广泛采用。然而,这种广泛使用引起了人们对数据隐私保护的严重担忧。不可学习示例 (UE) 是一种通过扰动数据来破坏模型学习的技术,可有效防止未经授权的模型滥用敏感数据。然而,现有的生成UE的方法面临着两个主要挑战:首先,可以使用反向纯化或去噪等技术来逆转扰动,包括消除图像UE中保护性扰动的扩散模型;其次,数据一旦发布,确保数据可追溯性和管理访问控制就变得困难。针对这些问题,本文提出了一种区块链集成不可学习示例生成和管理框架(B-UEGMF)来生成和管理UE。通过利用区块链的去中心化和不可变属性,我们将示例哈希值存储在区块链上,并通过智能合约动态管理数据访问权限。此外,UE 是使用多目标扰动技术动态误差最小化噪声 (DEM) 生成的,这增强了对反转方法的鲁棒性。我们还对生成的示例的隐私保护能力进行了定量评估。实验结果表明,所提框架在保证高效数据隐私管理的同时,显著提高了UE对反向攻击的防御能力。
近年来,随着深度学习和大型语言模型的快速发展,对比学习由于独立于昂贵的手动注释而成为一种高效的无监督学习方法1,2。然而,公共数据集的广泛使用引起了人们对隐私泄露和数据滥用的严重担忧。未经授权使用公开数据进行模型训练的情况变得越来越普遍3.例如,2017 年,未经授权的公共照片被用来训练面部识别模型4。同样,亚马逊在未获得所有用户明确同意的情况下利用消费者公开评论数据来训练其推荐系统,暴露了隐私保护机制的漏洞5.
为了解决这些问题,不可学习示例 (UE) 应运而生,成为一种新颖的数据隐私保护技术。UE为数据样本添加了难以察觉的扰动,引入了一种快捷方式,防止模型学习敏感信息,同时保留人类对数据的感知6,7,8。现有的生成UE的方法主要包括误差最小化噪声(EM)扰动9、生成对抗网络(GAN)10的扰动生成、鲁棒误差最小化噪声(REM)和通过对抗训练优化的稳定误差最小化噪声(SEM)11,12。此外,最近还应用了扩散模型来产生不正确的标签噪声,进一步增强了隐私保护13。
尽管在UE生成方面取得了重大进展,但仍存在一些挑战,特别是在这些方法的隐私保护效果尚未得到充分验证的实际应用中。具体来说,主要挑战包括:
恢复问题:扩散模型可以通过预测和消除数据中嵌入的扰动来部分恢复不可学习的示例,从而恢复可学习性并损害隐私保护14,15。即使在训练过程中数据受到干扰,恢复后敏感信息仍可能被泄露。
数据可追溯性和访问控制:一旦发布不可学习的示例,追踪其来源和实施访问限制的有效机制在技术上仍然具有挑战性16.
平衡隐私保护和模型性能:虽然现有方法侧重于生成不可学习的示例以保护隐私,但在隐私保护和模型训练性能之间保持平衡仍未解决 17,18,19。目前大多数研究都优先考虑隐私保护,但对减轻模型训练期间的性能下降的关注有限20,21。因此,数据访问和利用已成为隐私保护中的关键问题22。
虽然集中式解决方案和可信执行环境 (TEE) 提供了数据访问控制的替代方法,但它们在医疗/法律场景中面临固有的局限性:(1) 集中式系统引入单点故障和审计依赖性23;(2)TEE 需要专门的硬件,缺乏去中心化共识24.区块链成为最佳解决方案,因为其不可变的账本属性直接满足了 UE 管理的三个关键要求:可证明符合数据治理法规(例如 HIPAA 审计跟踪)、多机构环境中的抗审查访问控制以及通过带时间戳的交易进行精细的来源跟踪25、26、27。
我们的框架在具有GPU加速的中等规模数据集中展示了最佳性能,实现了实时扰动生成。虽然区块链运营引入了可衡量的开销,但在需要不可变访问日志的场景中,例如多机构医学研究或受监管的数据市场,这种权衡是合理的。该系统随数据集大小线性扩展,但需要 ≥16 GB RAM 和 4 核 CPU 才能稳定运行,因此不太适合资源受限的边缘设备。
为了应对这些挑战,本文提出了一种区块链集成不可学习示例生成和管理框架(B-UEGMF)。区块链作为一种去中心化、不可篡改的分布式账本技术,通过智能合约有效记录数据访问哈希值并动态管理访问权限,从而增强了不可学习示例28,29的隐私保护能力。在这个框架下,授权用户可以访问干净的数据,而未经授权的用户只能访问动态生成的不可学习示例。针对现有问题,本文引入了一种新的动态误差最小化噪声(DEM)生成方法。通过合并特定于客户端的信息和时间参数,DEM 将扰动动态嵌入到数据中,为每个数据请求生成独特的扰动,并确保数据隐私和不可学习性。DEM 生成过程如图 1 所示。本文的主要贡献如下:
动态可追溯性和访问管理:本文通过提出 B-UEGMF 框架来解决与 Unlearnable Examples 发布相关的可追溯性和访问控制问题。区块链的去中心化特性解决了传统系统中可信的第三方问题,而其透明度则可以在不暴露原始数据的情况下实现可验证的访问日志。通过利用区块链的透明度和不可篡改性,结合智能合约实现的动态访问控制,该框架确保未经授权的用户无法恢复或传播干净的数据,从而显着增强数据安全性。
动态扰动生成机制:引入了动态的不可学习示例生成方案,其中智能合约管理来自不同客户端的请求。DEM 扰动是根据客户端特定信息和时间参数为未经授权的客户端请求动态生成的。这确保了扰动效应因请求而异,从而增强了对基于扩散的噪声消除方法的抵抗力,并限制未经授权的用户一次访问大规模数据集。
在CIFAR-10、CIFAR-100和ImageNet数据集上进行的实验表明,DEM在隐私保护和抗逆向工程攻击方面优于现有方法(例如EM、TAP和SEM),如 图2所示,同时与EM相比,对噪声消除攻击的抵抗力提高了57%,与SEM相比提高了25%,如 图3所示, 强调其在现实场景中的潜在适用性。
Access restricted. Please log in or start a trial to view this content.
设置
我们考虑了一个带有数据集
的监督分类任务,其中
表示输入特征并
表示 K 类问题的相应类标签。数据集 D 分为干净的训练数据集和测试数据集。
目标是通过引入小的、难以察觉的扰动来修改干净的训练数据集,δ创建一个不可学习的数据集
,其中
+ δ。扰动δ以 为
界,确保它不会显着改变数据的正常效用。关键目标是通过迫使在 Du 上训练的模型 fθ 专注于噪声引起的不相关模式而不是有意义的特征来破坏学习,从而导致在干净的测试数据集上泛化能力很差:

模拟区块链环境
为了安装区块链工具,Hardhat 框架用于在本地环境中模拟以太坊网络,以部署智能合约并测试 Unlearnable Examples 的生成。为了启动本地网络,需要初始化一个具有多个节点和账户的模拟区块链网络。每个节点都分配了以太币等资源,以促进交易模拟。为了开发智能合约,它们被实现为动态管理用户权限。授权用户可以访问干净的数据,而未经授权的用户只能访问不可学习的示例。首先,配置基于 Node.js v16.x 和 Hardhat 2.8.4 的开发环境,使用 Solidity 0.8.17 编译器完成智能合约的编译和优化。编译过程由命令行使用 npx hardhat compile 执行,以生成包含 ABI 和字节码的构建工件。随后,通过运行部署脚本 npx hardhat run scripts/deploy.js --network sepolia 将合约部署到 Sepolia 测试网,并记录输出的合约地址和部署交易哈希。在性能测试阶段,依次执行三个核心测试:交易成本测试通过循环调用合约的 grantAccess 方法来记录 gas 消耗;吞吐量测试使用炮兵工具模拟负载递增的用户请求;进行测试和验证交易,包括数据存储和检索,以验证智能合约的功能。
构建链上用户和权限机制
唯一的用户帐户是使用区块链钱包(例如 MetaMask)生成的,每个钱包都包含一个私钥和一个公钥。原型实现采用模拟区块链环境,其中合成用户实体将公开可用的数据集上传到去中心化系统,仅将加密哈希值存储在分布式账本上。这确保了数据完整性,而无需将实际数据存储在链上,这将是低效且成本高昂的。实际数据存储在链下,通常使用 IPFS 等去中心化存储系统,确保高效的数据管理,同时维护安全和隐私。对于不可替代代币(NFT)和访问控制,本研究使用符合ERC-721标准的NFT实现了细粒度的访问控制机制。每个不可学习示例的数据集都与一个唯一的 tokenId 相关联,该 tokenId 充当访问数据的键。用户通过提交 Merkle 证明来请求访问。这些证明以安全、去中心化的方式验证用户的身份。证明验证成功后,合约会铸造一个唯一的 NFT 并将其转移到用户的钱包中。该 NFT 代表用户访问与该特定不可学习示例相关的数据的权利。NFT 的使用确保只有授权用户才能基于去中心化、不可变的记录访问数据。这与传统的基于角色的访问控制 (RBAC) 形成鲜明对比,传统的基于角色的访问控制 (RBAC) 通常在组级别运行,可能无法提供高安全性应用程序所需的粒度30。
智能合约通过ownerOf 函数不断验证访问权限,检查 NFT 的所有权,确保只有授权用户才能访问干净的数据。管理员可以通过 revokeAccess 函数销毁 NFT 来撤销访问权限,从而确保随着时间的推移灵活地管理用户访问。作工作流程包括四个关键步骤:(1)用户提交包含 Merkle 证明的访问请求;(2)合约验证这些证明的有效性;(3)验证成功后,合约铸造相应的 NFT;(4) 用户使用 NFT 元数据中嵌入的 IPFS 内容标识符 (CID) 检索加密数据。通过利用 NFT,我们实现了与传统访问控制机制相比的多项优势,例如细粒度的权限控制(数据级与组级)、更好的审计能力(不可变的链上记录)和权限可转移性(NFT 市场交易)。
实施多重签名合约以更新 Merkle 根哈希,防止未经授权的数据篡改。该系统通过将每个数据集绑定到唯一的 tokenId 来整合反女巫机制,确保恶意行为者无法生成欺诈性令牌来访问未经授权的数据。UE 在上传到星际文件系统 (IPFS) 网络之前使用 AES-256 进行加密。加密的数据哈希存储在链上,而完整的数据集保留在 IPFS 上,从而减少了区块链存储开销。结合链上和链下存储的混合方法在确保数据可用性和降低存储成本之间取得了平衡,这是基于区块链的应用程序中普遍关注的问题。
智能合约用于动态管理用户权限。每个用户只有持有适当的 NFT(作为他们的授权令牌)时才被授予对干净数据的访问权限。智能合约将所有数据访问记录在事件日志中,提供完全的可追溯性。这些日志是不可变的,可以进行审计,从而提供透明度和问责制。智能合约使用 grantAccess 函数来验证访问请求。合约检查用户是否持有适当的 NFT,如果有效,则授予对请求数据的访问权限。每个访问事件都记录在区块链上,确保所有数据检索活动都是可验证的。每个数据访问事件都由智能合约实时记录,从而触发 AccessGranted 事件。该事件包含用户的钱包地址、访问时间戳以及相应的 NFT tokenId 等重要信息。智能合约的动态特性允许实时管理权限。这在去中心化应用程序中特别有用,因为访问控制需要高度灵活并适应不断变化的条件。
为了解决公共区块链环境中的隐私问题,系统将低分辨率缩略图(例如 64 x 64 像素)存储在区块链上,而原始高分辨率图像则被加密并存储在 IPFS 的链下。只有拥有相应 NFT 的授权用户才能检索解密密钥以访问高分辨率数据。未经授权的用户会收到具有实时 DEM 扰动的数据版本,确保他们无法访问原始数据。
生成图像扰动
加载 CIFAR10、CIFAR100 和 ImageNet 数据集。数据集中的图像被统一调整大小并转换为 PyTorch 张量,并使用均值和标准差对图像张量进行归一化。初始化随机噪声δ1,使用高斯分布生成初始扰动。对每个图像x施加随机噪声,并根据交叉熵损失计算目标标签与模型预测之间的损失。在C类的数据集中,对于样本i,yi是目标标签值,pi是模型预测概率,量化了模型预测的概率分布与实际标签之间的差异,使损失最大化,使模型产生错误预测。交叉熵损失为:

根据损失函数计算图像扰动对预测的影响,反向传播更新扰动,通过多次迭代不断更新扰动范围和扰动值。对于学习率η,扰动的更新公式为:

生成文本扰动
加载预训练的 BERT 模型以生成文本嵌入。由两个 Transformer 块和一个全连接层组成的自定义 TextFeatureExtractor 网络用于从 BERT 模型生成的文本嵌入中提取特征。将访问用户的用户信息和时间戳输入到预训练的BERT模型中,通过定制的TextFeatureExtractor网络动态生成文本噪声。
输入图像I被输入到Qwen2.5-VL-7B-Instruct多模态模型中。在结构化提示的指导下,模型生成简洁的文本描述 Tq。将生成的文本 Tq 输入到预训练的 BERT 基础无大小写语言模型中。通过特定于任务的重写提示,系统生成扰动文本
,在改变表达式的同时保留语义。TextFeatureExtractor 网络将扰动文本
映射到高维语义嵌入向量 Eg。
生成多目标扰动
为了确保文本嵌入和图像扰动之间的兼容性,我们调整文本嵌入的形状以匹配图像扰动的维度。令 ET 和 Eq 表示文本嵌入, PL 表示图像扰动。重塑过程确保 ET 和 Eq 转换为与 PL 相同的维数:
,其中 C、H、W 是 PL 的维数。定义一个注意力机制融合模块,融合文本嵌入扰动和图像扰动,根据文本的注意力权重动态调整扰动。融合是:

其中α是注意力机制参数的动态调整。δT 是 Eq 和 ET 产生的文本干扰。在训练过程中添加正则化项以防止过度拟合。正则化项是文本嵌入的 L2 范数,它惩罚扰动。多目标损失函数结合了交叉熵损失和融合扰动,多目标损失函数如下:

损失函数的目标是:

其中 λ 是正则化系数,用于控制扰动的惩罚力,目的是抑制过度扰动或过度拟合。在对抗性攻击的研究中,发现
人眼可感知的扰动极限。定义了训练和评估过程,包括扰动生成、损耗计算、模型训练等。
对比实验
我们对所提出的动态误差最小化噪声(DEM)与现有的三种方法进行了综合评估:误差最小化噪声(EM)、可转移对抗扰动(TAP)和稳定误差最小化噪声(SEM)。这些方法在三个基准数据集上进行了测试:CIFAR-10、CIFAR-100 和 ImageNet 的一个子集,使用四种广泛采用的神经网络架构:VGG-16、ResNet-18、ResNet-50 和 DenseNet-121,以确保多样化的实验条件。
此外,我们还通过应用基于扩散的去噪模型来消除防御性噪声并测量测试数据集上去噪示例的准确性,从而检查了这些方法的鲁棒性。此步骤旨在评估每种方法在对抗条件下抵抗恢复攻击和维护数据隐私完整性的能力。结果表明,我们的 DEM 在所有数据集和架构的鲁棒性和准确性方面都优于其他方法,证明了其作为隐私保护框架的功效。
Access restricted. Please log in or start a trial to view this content.
区块链和智能合约框架
实验结果表明,所提出的区块链集成不可学习示例生成和管理框架(B-UEGMF)与智能合约相结合,能够对特定于客户端的数据访问进行有效的动态管理。对于授权用户,在CIFAR-10数据集上评估的ResNet-18代理模型上,检索到的干净数据的测试准确率为90.2%。相比之下,未经授权的用户访问DEM生成的UE获得了明显较低的13.0%的测试准确率。这些结果验证了 B-UEGMF 通过强大的不可学习示例有效实施访问控制的能力,同时保护数据隐私,如 图 2 所示。更多实验结果见 表1。
抵抗恢复攻击
与现有方法相比,所提出的动态误差最小化噪声(DEM)对基于恢复的对抗性攻击表现出卓越的鲁棒性。 图 4 显示了不同方法的训练损失比较。在涉及扩散模型和其他去噪技术的实验场景中,DEM 生成的 UE 始终抵制逆向工程尝试。与 EM 和 SEM 的...
Access restricted. Please log in or start a trial to view this content.
区块链和 UE 的集成通过提供透明且去中心化的数据访问管理解决方案,推动了数据隐私保护领域的发展。与通常仅依赖扰动技术的传统隐私保护方法不同31,这项研究弥合了数据保护和责任追踪之间的差距。在联合学习场景中,所提出的框架可确保跨去中心化数据集进行安全和私密的模型训练,从而降低未经授权的数据恢复的风险。此外,DEM 中嵌入的注意力机制提高了适应性和鲁棒性,为其在复杂的现实场景中的应用铺平了道路。
尽管有其贡献,但这项研究有几个局限性。首先,当前框架主要针对图像分类任务中的隐私保护,其在其他下游任务上的性能仍有待探索。其次,区块链集成的计算开销,包括存储和交易成本,可能会限制其在大规模应用程序中的可扩展性。第三,动态扰动生成方法依赖于客户端元数据和时间戳,它们可能无法捕获所有相关的上下文因素来生成最佳噪声。解决这些限制需要进一步优化区块链框架和扰动生成策略。
所提出的框架在需要严格隐私保护和可追溯数据访问的场景中具有...
Access restricted. Please log in or start a trial to view this content.
作者没有任何与本出版物相关的信息可以披露。
这项工作得到了郑州大学网络空间安全学院的支持,提供了良好的研究环境和学术资源。我们非常感谢导师张子佼教授在整个研究过程中给予的宝贵指导、富有洞察力的建议和不断的鼓励。我们也衷心感谢郑州大学网络管理中心提供的实验服务器、高性能计算资源和区块链测试平台基础设施,这些对于本研究的成功实施至关重要。
作者贡献:
李瑞佳构思了这项研究,制定了方法,进行了实验,进行了数据分析,并撰写了原始手稿。张子佼提供监督、方法论验证和批判性稿件审稿。Shouli Fu 为区块链实施指导做出了贡献。Lin Zhu 协助进行数据管理和验证。雷群鹏对理论框架的制定做出了贡献。王步伟提供技术支持。所有作者都审阅并批准了最终稿件。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| CUDA 12.1 | 英伟达 | 用于增强深度学习应用程序的性能 | |
| 英伟达 A800 80GB PCIe A800 80GB PCIe | 英伟达 | 用于深度学习模型训练 | |
| Python 3.10 中文文档 | Python 软件基础 | 用于数据预处理和分析 | |
| PyTorch 2.5.1 | 脸书 | 用于模型训练的深度学习框架 | |
| Ubuntu 22.04 的 | 规范 | 用于设置环境的作系统 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission