$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Настройка
Мы рассмотрели задачу классификации с учителем и набором данных
, где
представлены входные признаки и
обозначены соответствующие метки классов для задачи K-класса. Набор данных D разбивается на чистый обучающий набор данных и тестовый набор данных.
Цель состоит в том, чтобы изменить чистый обучающий набор данных путем введения небольших, незаметных возмущений δ создания необучаемого набора данных
, где
+ δ. Возмущение δ ограничено значением
, что гарантирует, что оно существенно не изменяет нормальную полезность данных. Ключевая цель состоит в том, чтобы нарушить процесс обучения, заставив модель fθ, обученную на Du, сосредоточиться на нерелевантных паттернах, вызванных шумом, а не на значимых признаках, что приведет к плохому обобщению на чистом тестовом наборе данных:

Моделирование среды блокчейна
Для установки инструментов блокчейна используется фреймворк Hardhat для моделирования сети Ethereum в локальной среде для развертывания смарт-контрактов и тестирования генерации необучаемых примеров. Для запуска локальной сети инициализируется симулированная блокчейн-сеть с несколькими узлами и учетными записями. Каждому узлу выделяются ресурсы, такие как эфир, для облегчения моделирования транзакций. Для разработки смарт-контрактов они реализуются для динамического управления разрешениями пользователей. Авторизованные пользователи могут получить доступ к чистым данным, в то время как неавторизованные пользователи могут получить доступ к неизучаемым примерам. Во-первых, настройте среду разработки на базе Node.js v16.x и Hardhat 2.8.4, а для завершения компиляции и оптимизации смарт-контракта используйте компилятор Solidity 0.8.17. Процесс компиляции выполняется из командной строки с использованием npx hardhat compile для генерации артефактов сборки, содержащих ABI и байт-код. Затем разверните контракт в тестовой сети Sepolia, запустив скрипт развертывания npx hardhat run scripts/deploy.js --network sepolia, и запишите адрес выходного контракта и хэш транзакции развертывания. На этапе тестирования производительности последовательно выполняются три основных теста: тест транзакционных затрат регистрирует потребление газа путем циклического вызова метода grantAccess контракта; при тестировании пропускной способности используется инструмент Artillery для имитации запросов пользователей с постепенно увеличивающейся нагрузкой; Для проверки функциональности смарт-контракта проводятся транзакции тестирования и проверки, включая хранение и извлечение данных.
Создание ончейн-пользователей и механизмов разрешений
Уникальные учетные записи пользователей генерируются с помощью кошельков блокчейна (например, MetaMask), каждый из которых состоит из приватного ключа и публичного ключа. В реализации прототипа используется смоделированная среда блокчейна, в которой синтетические пользовательские сущности загружают общедоступные наборы данных в децентрализованную систему, сохраняя в распределенном реестре только криптографические хеш-значения. Это обеспечивает целостность данных без хранения фактических данных в цепочке, что было бы неэффективно и дорого. Фактические данные хранятся вне сети, как правило, с использованием децентрализованных систем хранения, таких как IPFS, что обеспечивает эффективное управление данными при сохранении безопасности и конфиденциальности. Что касается невзаимозаменяемых токенов (NFT) и контроля доступа, в этом исследовании реализован детальный механизм контроля доступа с использованием NFT, соответствующих стандарту ERC-721. Каждый набор данных неизучаемых примеров связан с уникальным идентификатором tokenId, который выступает в качестве ключа для доступа к данным. Пользователи запрашивают доступ, отправляя доказательства Меркла. Эти доказательства проверяют личность пользователя безопасным и децентрализованным способом. После успешной проверки доказательства контракт чеканит уникальный NFT и переводит его на кошелек пользователя. Этот NFT представляет собой право пользователя на доступ к данным, связанным с этим конкретным неизучаемым примером. Использование NFT гарантирует, что только авторизованные пользователи могут получить доступ к данным на основе децентрализованной, неизменяемой записи. В этом заключается отличие от традиционного управления доступом на основе ролей (RBAC), которое обычно работает на уровне группы и может не обеспечивать детализации, необходимой для приложений с высоким уровнембезопасности30.
Смарт-контракт постоянно проверяет права доступа с помощью функции ownerOf, проверяя право собственности на NFT, чтобы гарантировать, что только авторизованные пользователи могут получить доступ к чистым данным. Администраторы могут отозвать доступ, уничтожив NFT с помощью функции revokeAccess, что обеспечивает гибкость в управлении доступом пользователей с течением времени. Рабочий процесс состоит из четырех важнейших этапов: (1) пользователи отправляют запросы на доступ, содержащие доказательства Меркла; (2) договор проверяет действительность этих доказательств; (3) после успешной проверки контракт чеканит соответствующий NFT; (4) пользователи извлекают зашифрованные данные с помощью идентификатора содержимого IPFS (CID), встроенного в метаданные NFT. Используя NFT, мы получаем ряд преимуществ по сравнению с традиционными механизмами контроля доступа, таких как детальный контроль разрешений (на уровне данных и на уровне группы), улучшенные возможности аудита (неизменяемые записи в сети) и возможность передачи разрешений (транзакции на торговой площадке NFT).
Контракты с мультиподписью реализованы для обновления корневого хэша Меркла, предотвращая несанкционированное вмешательство в данные. Система включает в себя механизмы защиты от Сивиллы, связывая каждый набор данных с уникальным идентификатором tokenId, гарантируя, что злоумышленники не смогут генерировать мошеннические токены для доступа к несанкционированным данным. UE шифруются с помощью AES-256 перед загрузкой в сеть InterPlanetary File System (IPFS). Зашифрованные хеши данных хранятся в блокчейне, в то время как полные наборы данных остаются в IPFS, что снижает накладные расходы на хранение блокчейна. Гибридный подход к сочетанию ончейн-хранилища и офлайн-хранилища обеспечивает баланс между обеспечением доступности данных и снижением затрат на хранение, что является общей проблемой в приложениях на основе блокчейна.
Смарт-контракты используются для динамического управления разрешениями пользователей. Каждому пользователю предоставляется доступ к чистым данным только в том случае, если он владеет соответствующим NFT, который служит его токеном авторизации. Смарт-контракты регистрируют весь доступ к данным в журналах событий, обеспечивая полную отслеживаемость. Эти журналы являются неизменяемыми и могут быть проверены, что обеспечивает прозрачность и подотчетность. Смарт-контракт использует функцию grantAccess для проверки запросов на доступ. Контракт проверяет, есть ли у пользователя соответствующий NFT и, если он действителен, предоставляет доступ к запрашиваемым данным. Каждое событие доступа записывается в блокчейн, что гарантирует, что все действия по извлечению данных могут быть проверены. Каждое событие доступа к данным регистрируется смарт-контрактом в режиме реального времени, который запускает событие AccessGranted. Это событие содержит важную информацию, такую как адрес кошелька пользователя, временная метка доступа и соответствующий идентификатор токена NFT. Динамический характер смарт-контрактов позволяет управлять разрешениями в режиме реального времени. Это особенно полезно в децентрализованных приложениях, где контроль доступа должен быть очень гибким и адаптируемым к изменяющимся условиям.
Чтобы решить проблемы конфиденциальности в публичных блокчейн-средах, система хранит миниатюры с низким разрешением (например, 64 x 64 пикселя) в блокчейне, в то время как исходные изображения с высоким разрешением шифруются и хранятся вне блокчейна в IPFS. Только авторизованные пользователи, владеющие соответствующими NFT, могут получить ключи дешифрования для доступа к данным с высоким разрешением. Неавторизованные пользователи получают версии данных с возмущениями ЦМР в режиме реального времени, гарантируя, что они не смогут получить доступ к исходным данным.
Создание возмущения изображения
Загрузка наборов данных CIFAR10, CIFAR100 и ImageNet. Размеры изображений в наборах данных равномерно изменяются и преобразуются в тензор PyTorch, а тензор изображения нормализуется с использованием среднего значения и стандартного отклонения. Инициализируем случайный шум δ1, используя распределение Гаусса для генерации начального возмущения. Случайный шум применяется к каждому изображению x, а потери между целевой меткой и прогнозом модели вычисляются на основе потерь перекрестной энтропии. В наборе данных класса C для выборки i, yi — целевое значение метки, pi — вероятность предсказания модели, которая количественно определяет разницу между распределением вероятностей, предсказанным моделью, и фактической меткой, максимизируя потери, чтобы модель выдавала ложные прогнозы. Потери кросс-энтропии равны:

Влияние возмущения изображения на прогноз вычисляется в соответствии с функцией потерь, обратное распространение обновляет возмущение, а диапазон возмущения и значение возмущения постоянно обновляются через несколько итераций. Для η скорости обучения формула обновления для возмущения выглядит следующим образом:

Генерация возмущений текста
Загрузка предварительно обученных моделей BERT для создания встраиваемых текстов. Пользовательская сеть TextFeatureExtractor, состоящая из двух блоков Transformer и полностью подключенного слоя, используется для извлечения признаков из текстовых вложений, созданных моделями BERT. Введите сведения о пользователе и метку времени пользователя доступа в предварительно обученную модель BERT и динамически генерируйте текстовый шум через настраиваемую сеть TextFeatureExtractor.
Входное изображение I подается в мультимодальную модель Qwen2.5-VL-7B-Instruct. Руководствуясь структурированной подсказкой, модель генерирует краткое текстовое описание Tq. Этот сгенерированный текст Tq вводится в предварительно обученную языковую модель BERT-base-uncased. С помощью запросов на переписывание для конкретной задачи система генерирует возмущенный текст
, который сохраняет семантику при изменении выражения. Сеть TextFeatureExtractor отображает возмущенный текст
в высокоразмерный семантический вектор встраивания Eg.
Генерация многоцелевых возмущений
Чтобы обеспечить совместимость между вложениями текста и возмущениями изображения, мы корректируем форму встраиваемого текста в соответствии с размерами возмущения изображения. Пусть ET и Eq представляют вложения текста, а PL — возмущение изображения. Процесс изменения формы гарантирует, что ET и Eq преобразуются в ту же размерность, что и PL:
, где C, H, W — размерности PL. Определите модуль слияния механизма внимания, который объединяет возмущения встраивания текста и возмущения изображения, динамически корректируя возмущения в соответствии с весом внимания текста. Слияние это:

где α — динамическая регулировка параметров механизма внимания. δT — это нарушение текста, вызванное Eq и ET. Добавьте в процесс обучения термин регуляризации, чтобы не допустить переобучения. Термин регуляризации — это норма L2 встраивания текста, которая наказывает за возмущения. Многокритериальная функция потерь сочетает в себе перекрестные энтропийные потери и термоядерное возмущение, а многокритериальная функция потерь выглядит следующим образом:

Целями функции потерь являются:

где λ — коэффициент регуляризации, используемый для управления штрафной силой возмущения с целью подавления чрезмерного возмущения или переобучения. При изучении состязательных атак было установлено, что
это предел возмущения, воспринимаемый человеческим глазом. Определен процесс обучения и оценки, включая генерацию возмущений, расчет потерь, обучение модели и т. д.
Сравнительные эксперименты
Мы провели всестороннюю оценку предложенного динамического шума, минимизирующего ошибки (DEM), по трем существующим методам: шум, минимизирующий ошибки (EM), передаваемые состязательные возмущения (TAP) и стабильный шум, минимизирующий ошибки (SEM). Эти методы были протестированы на трех эталонных наборах данных: CIFAR-10, CIFAR-100 и подмножестве ImageNet с использованием четырех широко распространенных архитектур нейронных сетей: VGG-16, ResNet-18, ResNet-50 и DenseNet-121, чтобы обеспечить различные экспериментальные условия.
Кроме того, мы изучили надежность этих методов, применив модели шумоподавления на основе диффузии для устранения защитного шума и измерив точность примеров шумоподавления на тестовых наборах данных. Этот шаг был направлен на оценку способности каждого метода противостоять атакам восстановления и поддерживать целостность конфиденциальности данных в неблагоприятных условиях. Результаты показывают, что наша ЦМР превосходит другие методы как по надежности, так и по точности во всех наборах данных и архитектурах, демонстрируя свою эффективность в качестве платформы, сохраняющей конфиденциальность.