$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Arreglo
Consideramos una tarea de clasificación supervisada con un conjunto de datos
, donde
representa las características de entrada y
denota las etiquetas de clase correspondientes para un problema de clase K. El conjunto de datos D se divide en un conjunto de datos de entrenamiento limpio y un conjunto de datos de prueba.
El objetivo es modificar el conjunto de datos de entrenamiento limpio introduciendo pequeñas perturbaciones imperceptibles δ crear un conjunto de datos
que no se pueda aprender, donde
+ δ. La perturbación δ está limitada por
, lo que garantiza que no altere significativamente la utilidad normal de los datos. El objetivo clave es interrumpir el aprendizaje forzando al modelo fθ, entrenado en Du, a centrarse en patrones irrelevantes inducidos por el ruido en lugar de las características significativas, lo que resulta en una generalización deficiente en un conjunto de datos de prueba limpio:

Simulación de un entorno blockchain
Para instalar herramientas de blockchain, el marco Hardhat se utiliza para simular una red Ethereum en un entorno local para implementar contratos inteligentes y probar la generación de ejemplos inaprendibles. Para lanzar una red local, se inicializa una red de cadena de bloques simulada con múltiples nodos y cuentas. A cada nodo se le asignan recursos como Ether para facilitar las simulaciones de transacciones. Para desarrollar contratos inteligentes, se implementan para administrar dinámicamente los permisos de los usuarios. Los usuarios autorizados pueden acceder a datos limpios, mientras que los usuarios no autorizados están restringidos a acceder a ejemplos que no se pueden aprender. Primero, configure un entorno de desarrollo basado en Node.js v16.x y Hardhat 2.8.4, y use el compilador Solidity 0.8.17 para completar la compilación y optimización del contrato inteligente. El proceso de compilación se ejecuta mediante la línea de comandos mediante npx hardhat compile para generar artefactos de compilación que contienen la ABI y el código de bytes. Posteriormente, implemente el contrato en la red de prueba de Sepolia ejecutando el script de implementación npx hardhat run scripts/deploy.js --network sepolia y registre la dirección del contrato de salida y el hash de la transacción de implementación. Durante la fase de prueba de rendimiento, se ejecutan secuencialmente tres pruebas básicas: la prueba de costos de transacción registra el consumo de gas invocando cíclicamente el método grantAccess del contrato; la prueba de rendimiento utiliza la herramienta Artillery para simular las solicitudes de los usuarios con una carga que aumenta gradualmente; Las transacciones de prueba y validación, incluido el almacenamiento y la recuperación de datos, se llevan a cabo para validar la funcionalidad del contrato inteligente.
Construcción de usuarios en cadena y mecanismos de permisos
Las cuentas de usuario únicas se generan utilizando billeteras blockchain (por ejemplo, MetaMask), cada una de las cuales comprende una clave privada y una clave pública. La implementación del prototipo emplea un entorno de cadena de bloques simulado donde las entidades de usuario sintéticas cargan conjuntos de datos disponibles públicamente en el sistema descentralizado, almacenando solo valores hash criptográficos en el libro mayor distribuido. Esto garantiza la integridad de los datos sin almacenar los datos reales en la cadena, lo que sería ineficiente y costoso. Los datos reales se almacenan fuera de la cadena, generalmente utilizando sistemas de almacenamiento descentralizados como IPFS, lo que garantiza una gestión eficiente de los datos mientras se mantiene la seguridad y la privacidad. Para tokens no fungibles (NFT) y control de acceso, este estudio implementa un mecanismo de control de acceso detallado utilizando NFT que cumplen con el estándar ERC-721. Cada conjunto de datos de ejemplos que no se pueden aprender está asociado a un tokenId único, que actúa como clave para acceder a los datos. Los usuarios solicitan acceso enviando pruebas de Merkle. Estas pruebas verifican la identidad del usuario de forma segura y descentralizada. Tras la validación exitosa de la prueba, el contrato acuña un NFT único y lo transfiere a la billetera del usuario. Este NFT representa el derecho del usuario a acceder a los datos asociados con ese ejemplo específico que no se puede aprender. El uso de NFT garantiza que solo los usuarios autorizados puedan acceder a los datos, basándose en un registro descentralizado e inmutable. Esto contrasta con el control de acceso basado en roles (RBAC) tradicional, que normalmente opera a nivel de grupo y puede no proporcionar la granularidad necesaria para aplicaciones de alta seguridad30.
El contrato inteligente verifica continuamente los permisos de acceso a través de la función ownerOf, verificando la propiedad del NFT para garantizar que solo los usuarios autorizados puedan acceder a los datos limpios. Los administradores pueden revocar el acceso destruyendo el NFT a través de la función revokeAccess, lo que garantiza la flexibilidad en la gestión del acceso de los usuarios a lo largo del tiempo. El flujo de trabajo operativo consta de cuatro pasos críticos: (1) los usuarios envían solicitudes de acceso que contienen pruebas de Merkle; (2) el contrato verifica la validez de estas pruebas; (3) tras la validación exitosa, el contrato acuña el NFT correspondiente; (4) los usuarios recuperan datos cifrados utilizando el identificador de contenido (CID) de IPFS incrustado en los metadatos del NFT. Al aprovechar los NFT, logramos varios beneficios sobre los mecanismos tradicionales de control de acceso, como el control de permisos detallado (a nivel de datos frente a nivel de grupo), una mejor capacidad de auditoría (registros inmutables en cadena) y la transferibilidad de permisos (transacciones de mercado NFT).
Se implementan contratos de firma múltiple para actualizar el hash raíz de Merkle, evitando la manipulación no autorizada de datos. El sistema incorpora mecanismos anti-Sybil al vincular cada conjunto de datos a un tokenId único, lo que garantiza que los actores maliciosos no puedan generar tokens fraudulentos para acceder a datos no autorizados. Los UE se cifran mediante AES-256 antes de cargarse en la red InterPlanetary File System (IPFS). Los hashes de datos cifrados se almacenan en la cadena, mientras que los conjuntos de datos completos permanecen en IPFS, lo que reduce la sobrecarga de almacenamiento de blockchain. El enfoque híbrido de combinar el almacenamiento dentro y fuera de la cadena logra un equilibrio entre garantizar la disponibilidad de datos y reducir los costos de almacenamiento, una preocupación común en las aplicaciones basadas en blockchain.
Los contratos inteligentes se emplean para administrar dinámicamente los permisos de los usuarios. A cada usuario se le otorga acceso a datos limpios solo si posee el NFT apropiado, que sirve como su token de autorización. Los contratos inteligentes registran todos los datos de acceso en registros de eventos, lo que proporciona una trazabilidad completa. Estos registros son inmutables y pueden ser auditados, ofreciendo transparencia y responsabilidad. El contrato inteligente emplea la función grantAccess para validar las solicitudes de acceso. El contrato comprueba si el usuario posee el NFT adecuado y, si es válido, concede acceso a los datos solicitados. Cada evento de acceso se registra en la cadena de bloques, lo que garantiza que todas las actividades de recuperación de datos sean verificables. Cada evento de acceso a datos es registrado en tiempo real por el contrato inteligente, que desencadena un evento AccessGranted. Este evento contiene información importante como la dirección de la billetera del usuario, la marca de tiempo del acceso y el tokenId de NFT correspondiente. La naturaleza dinámica de los contratos inteligentes permite la gestión en tiempo real de los permisos. Esto es particularmente útil en aplicaciones descentralizadas, donde el control de acceso debe ser altamente flexible y adaptable a las condiciones cambiantes.
Para abordar las preocupaciones de privacidad en entornos públicos de blockchain, el sistema almacena miniaturas de baja resolución (por ejemplo, 64 x 64 píxeles) en la cadena de bloques, mientras que las imágenes originales de alta resolución se cifran y almacenan fuera de la cadena en IPFS. Solo los usuarios autorizados que poseen el NFT correspondiente pueden recuperar las claves de descifrado para acceder a los datos de alta resolución. Los usuarios no autorizados reciben versiones de los datos con perturbaciones DEM en tiempo real, lo que garantiza que no puedan acceder a los datos originales.
Generar perturbación de imagen
Cargue conjuntos de datos CIFAR10, CIFAR100 e ImageNet. Las imágenes de los conjuntos de datos se redimensionan uniformemente y se convierten en tensor de PyTorch, y el tensor de imagen se normaliza utilizando la media y la desviación estándar. Inicialice un ruido aleatorio δ1, utilizando una distribución gaussiana para generar la perturbación inicial. Se aplica ruido aleatorio a cada imagen x, y la pérdida entre la etiqueta de destino y la predicción del modelo se calcula en función de la pérdida de entropía cruzada. En un conjunto de datos de clase C, para una muestra i, yi es el valor de la etiqueta objetivo, pi es la probabilidad de predicción del modelo, que cuantifica la diferencia entre la distribución de probabilidad predicha por el modelo y la etiqueta real, maximizando la pérdida para que el modelo produzca predicciones falsas. La pérdida de entropía cruzada es:

La influencia de la perturbación de la imagen en la predicción calculada de acuerdo con la función de pérdida, la propagación inversa actualiza la perturbación, y el rango de perturbación y el valor de perturbación se actualizan constantemente a través de múltiples iteraciones. Para la tasa de aprendizaje η, la fórmula de actualización para la perturbación es:

Generar perturbaciones de texto
Cargue modelos BERT previamente entrenados para generar incrustaciones de texto. Se utiliza una red TextFeatureExtractor personalizada que consta de dos bloques Transformer y una capa totalmente conectada para extraer entidades de incrustaciones de texto generadas por modelos BERT. Ingrese la información del usuario y la marca de tiempo del usuario de acceso en el modelo BERT previamente entrenado y genere dinámicamente ruido de texto a través de la red TextFeatureExtractor personalizada.
La imagen de entrada I se introduce en el modelo multimodal Qwen2.5-VL-7B-Instruct. Guiado por un mensaje estructurado, el modelo genera una descripción textual concisa Tq. Este texto generado Tq se ingresa en el modelo de lenguaje sin mayúsculas y minúsculas base BERT previamente entrenado. A través de indicaciones de reescritura específicas de la tarea, el sistema genera texto
perturbado que conserva la semántica mientras altera la expresión. Una red TextFeatureExtractor asigna el texto
perturbado a un vector de incrustación semántica de alta dimensión Eg.
Generar perturbaciones multiobjetivo
Para garantizar la compatibilidad entre las incrustaciones de texto y las perturbaciones de la imagen, ajustamos la forma de la incrustación de texto para que coincida con las dimensiones de la perturbación de la imagen. Sea E T y Eq representan las incrustaciones de texto, y PL la perturbación de la imagen. El proceso de remodelación asegura que ET y Eq se transformen a la misma dimensionalidad que PL:
, donde C, H, W son las dimensiones de PL. Defina un módulo de fusión de mecanismo de atención que fusione las perturbaciones de incrustación de texto y las perturbaciones de imagen, ajustando dinámicamente las perturbaciones de acuerdo con los pesos de atención del texto. La fusión es:

donde α es el ajuste dinámico de los parámetros del mecanismo de atención. δT es la perturbación del texto generada por Eq y ET. Agregue un término de regularización al proceso de capacitación para evitar el sobreajuste. El término de regularización es la norma L2 de la incrustación de texto, que penaliza las perturbaciones. La función de pérdida multiobjetivo combina la pérdida de entropía cruzada y la perturbación de fusión, y la función de pérdida multiobjetivo es la siguiente:

Los objetivos de la función de pérdida son:

donde λ es un coeficiente de regularización utilizado para controlar la fuerza de penalización de la perturbación, con el propósito de inhibir la perturbación excesiva o el sobreajuste. En el estudio de los ataques adversarios, se ha encontrado que
es el límite de perturbación perceptible para el ojo humano. Se define el proceso de entrenamiento y evaluación, incluida la generación de perturbaciones, el cálculo de pérdidas, el entrenamiento del modelo, etc.
Experimentos comparativos
Realizamos una evaluación exhaustiva del ruido dinámico de minimización de errores (DEM) propuesto frente a tres métodos existentes: ruido de minimización de errores (EM), perturbaciones adversarias transferibles (TAP) y ruido estable de minimización de errores (SEM). Estos métodos se probaron en tres conjuntos de datos de referencia: CIFAR-10, CIFAR-100 y un subconjunto de ImageNet, utilizando cuatro arquitecturas de redes neuronales ampliamente adoptadas: VGG-16, ResNet-18, ResNet-50 y DenseNet-121, para garantizar diversas condiciones experimentales.
Además, examinamos la solidez de estos métodos mediante la aplicación de modelos de eliminación de ruido basados en difusión para eliminar el ruido defensivo y medir la precisión de los ejemplos sin ruido en los conjuntos de datos de prueba. Este paso tuvo como objetivo evaluar la capacidad de cada método para resistir los ataques de recuperación y mantener la integridad de la privacidad de los datos en condiciones adversas. Los resultados indican que nuestro DEM supera a otros métodos tanto en robustez como en precisión en todos los conjuntos de datos y arquitecturas, lo que demuestra su eficacia como marco de preservación de la privacidad.