Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Oparta na blockchainie platforma do generowania i zarządzania niezrozumiałymi przykładami w celu zwiększenia prywatności danych i kontroli dostępu

491 wyświetleń

DOI:

10.3791/68338

22 sierpnia 2025

W tym artykule

Podsumowanie

W niniejszym artykule zaproponowano opartą na blockchainie strukturę do generowania niemożliwych do nauczenia się przykładów, integrującą dynamiczne perturbacje z kontrolą dostępu. Zwiększa ochronę prywatności, zapewniając, że nieautoryzowani użytkownicy otrzymują zakłócone dane, chroniąc poufne informacje, a jednocześnie umożliwiając efektywne zarządzanie danymi i dostęp za pośrednictwem inteligentnych kontraktów.

Streszczenie

W kontekście szybkiego rozwoju dużych modeli językowych (LLM), uczenie kontrastywne stało się szeroko stosowane ze względu na jego zdolność do omijania kosztownych adnotacji danych poprzez wykorzystanie ogromnych ilości danych sieciowych do trenowania modeli. To powszechne stosowanie budzi jednak poważne obawy dotyczące ochrony prywatności danych. Nieuczące się przykłady (UE), technika, która zakłóca uczenie się modelu poprzez zakłócanie danych, skutecznie zapobiega niewłaściwemu wykorzystaniu poufnych danych przez nieautoryzowane modele. Jednak istniejące metody generowania UEs stoją przed dwoma podstawowymi wyzwaniami: po pierwsze, perturbacje można odwrócić za pomocą technik takich jak odwrotne oczyszczanie lub odszumianie, w tym modeli dyfuzyjnych, które usuwają ochronne perturbacje w obrazowych UE; Po drugie, po opublikowaniu danych zapewnienie identyfikowalności danych i zarządzanie kontrolą dostępu staje się trudne. Aby rozwiązać te problemy, w niniejszym dokumencie zaproponowano Blockchain-Integrated Unlearnable Example Generation and Management Framework (B-UEGMF) do generowania i zarządzania interfejsami UE. Wykorzystując zdecentralizowane i niezmienne właściwości blockchaina, przechowujemy przykładowe wartości skrótu w łańcuchu bloków i dynamicznie zarządzamy prawami dostępu do danych za pośrednictwem inteligentnych kontraktów. Dodatkowo, UEs są generowane przy użyciu wieloobiektywowej techniki perturbacji, Dynamic Error-Minimizing Noise (DEM), która zwiększa odporność na metody odwrócenia. Zapewniamy również ilościową ocenę możliwości ochrony prywatności wygenerowanych przykładów. Wyniki eksperymentalne pokazują, że zaproponowana struktura znacznie poprawiła ochronę UEs przed atakami odwrotnymi, zapewniając jednocześnie efektywne zarządzanie prywatnością danych.

Wprowadzenie

W ostatnich latach, wraz z szybkim postępem głębokiego uczenia i dużych modeli językowych, uczenie kontrastywne stało się skutecznym podejściem do uczenia się bez nadzoru ze względu na jego niezależność od kosztownych ręcznych adnotacji 1,2. Jednak szerokie wykorzystanie publicznych zbiorów danych wzbudziło poważne obawy dotyczące naruszeń prywatności i niewłaściwego wykorzystania danych. Przypadki nieautoryzowanego wykorzystania publicznie dostępnych danych do trenowania modelu stają się coraz częstsze3. Na przykład w 2017 r. nieautoryzowane zdjęcia publiczne zostały wykorzystane do trenowania modeli rozpoznawania twarzy4. Podobnie Amazon wykorzystał dane z opinii publicznej konsumentów do przeszkolenia swoich systemów rekomendacji bez uzyskania wyraźnej zgody od wszystkich użytkowników, co ujawniło luki w mechanizmach ochrony prywatności5.

Aby rozwiązać te problemy, pojawiły się nieuczące się przykłady (UE), które stały się nowatorską techniką ochrony prywatności danych. Interfejsy użytkownika dodają niezauważalne perturbacje do próbek danych, wprowadzając skrót, który uniemożliwia modelom uczenie się poufnych informacji, zachowując jednocześnie ludzką percepcję danych 6,7,8. Istniejące metody generowania interfejsów użytkownika obejmują przede wszystkim perturbacje minimalizujące błędy (EM)9, generowanie zakłóceń przez generatywne sieci przeciwstawne (GAN)10, solidny szum minimalizujący błędy (REM) i stabilny szum minimalizujący błędy (SEM) zoptymalizowany przez szkolenie przeciwstawne11,12. Ponadto modele dyfuzyjne zostały ostatnio zastosowane do generowania nieprawidłowego szumu na etykiecie, co jeszcze bardziej zwiększa ochronę prywatności13.

Pomimo znacznego postępu w generowaniu interfejsów UE, nadal istnieje kilka wyzwań, szczególnie w rzeczywistych zastosowaniach, w których efekty ochrony prywatności tych metod nie zostały w pełni zweryfikowane. Do najważniejszych wyzwań należą:
Problemy z przywracaniem: Modele dyfuzji mogą częściowo odzyskać nieuczące się przykłady, przewidując i usuwając perturbacje wbudowane w dane, przywracając w ten sposób zdolność uczenia się i naruszając ochronę prywatności14,15. Nawet jeśli dane zostaną zakłócone podczas trenowania, poufne informacje mogą zostać ujawnione po przywróceniu.
Identyfikowalność danych i kontrola dostępu: Po opublikowaniu niemożliwych do nauczenia się przykładów skuteczne mechanizmy śledzenia ich pochodzenia i egzekwowania ograniczeń dostępu pozostają technicznie trudne16.
Równoważenie ochrony prywatności i wydajności modelu: Podczas gdy istniejące metody koncentrują się na generowaniu nieuczących się przykładów w celu ochrony prywatności, utrzymanie równowagi między ochroną prywatności a wydajnością trenowania modelu pozostaje nierozwiązane 17,18,19. Większość aktualnych badań traktuje priorytetowo ochronę prywatności, ale zwraca ograniczoną uwagę na łagodzenie spadku wydajności podczas trenowania modelu20,21. W związku z tym dostęp do danych i ich wykorzystanie stały się krytycznymi kwestiami w zakresie ochrony prywatności22.

Podczas gdy scentralizowane rozwiązania i zaufane środowiska wykonawcze (TEE) oferują alternatywne podejścia do kontroli dostępu do danych, napotykają nieodłączne ograniczenia w scenariuszach medycznych/prawnych: (1) Scentralizowane systemy wprowadzają pojedyncze punkty awarii i zależność od audytu23; (2) TEE wymagają specjalistycznego sprzętu i brakuje im zdecentralizowanego konsensusu24. Blockchain jawi się jako optymalne rozwiązanie, ponieważ jego niezmienne właściwości księgi bezpośrednio odnoszą się do trzech krytycznych wymagań dotyczących zarządzania UE: możliwej do udowodnienia zgodności z przepisami dotyczącymi zarządzania danymi (np. ścieżek audytu HIPAA), odpornej na cenzurę kontroli dostępu w wielu instytucjach oraz szczegółowego śledzenia pochodzenia za pomocą transakcji oznaczonych znacznikiem czasu 25,26,27.

Nasza platforma wykazała optymalną wydajność dla zbiorów danych średniej skali z akceleracją GPU, osiągając generowanie perturbacji w czasie rzeczywistym. Podczas gdy operacje oparte na łańcuchu bloków wprowadzają mierzalne koszty ogólne, ten kompromis jest uzasadniony w scenariuszach wymagających niezmiennych dzienników dostępu, takich jak wieloinstytucjonalne badania medyczne lub regulowane rynki danych. System skaluje się liniowo wraz z rozmiarem zestawu danych, ale wymaga ≥16 GB pamięci RAM i 4-rdzeniowych procesorów do stabilnego działania, co czyni go mniej odpowiednim dla urządzeń brzegowych o ograniczonych zasobach.

Aby sprostać tym wyzwaniom, w niniejszym dokumencie zaproponowano Blockchain-Integrated Unlearnable Example Generation and Management Framework (B-UEGMF). Blockchain, jako zdecentralizowana i niezmienna technologia rozproszonej księgi, skutecznie rejestruje skróty dostępu do danych i dynamicznie zarządza uprawnieniami dostępu za pomocą inteligentnych kontraktów, zwiększając w ten sposób możliwości ochrony prywatności Nieuczących się Przykładów28,29. W ramach tej struktury autoryzowani użytkownicy mogą uzyskać dostęp do czystych danych, podczas gdy nieautoryzowani użytkownicy mogą uzyskać dostęp tylko do dynamicznie generowanych nieuczących się przykładów. Aby rozwiązać istniejące problemy, w niniejszym artykule przedstawiono nowatorską metodę generowania dynamicznego szumu minimalizującego błędy (DEM). Poprzez włączenie informacji specyficznych dla klienta i parametrów czasowych, DEM dynamicznie osadza perturbacje w danych, generując unikalne perturbacje dla każdego żądania danych i zapewniając zarówno prywatność danych, jak i możliwość uczenia się. Proces generowania DEM przedstawiono na rysunku 1. Główne założenia tego artykułu są następujące:
Dynamiczna identyfikowalność i zarządzanie dostępem: W tym dokumencie omówiono kwestie związane z identyfikowalnością i kontrolą dostępu związane z wydaniem nieuczących się przykładów, proponując ramy B-UEGMF. Zdecentralizowany charakter blockchaina rozwiązuje problem zaufanych stron trzecich w tradycyjnych systemach, a jego przejrzystość umożliwia weryfikowalne dzienniki dostępu bez ujawniania surowych danych. Wykorzystując przejrzystość i niezmienność łańcucha bloków, w połączeniu z dynamiczną kontrolą dostępu umożliwianą przez inteligentne kontrakty, ramy zapewniają, że nieautoryzowani użytkownicy nie mogą odzyskać ani rozpowszechnić czystych danych, co znacznie zwiększa bezpieczeństwo danych.

Dynamiczny mechanizm generowania perturbacji: Wprowadzono dynamiczny schemat generowania nieuczących się przykładów, w którym inteligentne kontrakty zarządzają żądaniami od różnych klientów. Perturbacje DEM są generowane dynamicznie dla nieautoryzowanych żądań klientów na podstawie informacji specyficznych dla klienta i parametrów czasowych. Gwarantuje to, że efekty perturbacji różnią się w zależności od żądania, zwiększając w ten sposób odporność na metody usuwania szumów oparte na dyfuzji i ograniczając nieautoryzowanym użytkownikom dostęp do dużych zbiorów danych jednocześnie.

Eksperymenty przeprowadzone na zbiorach danych CIFAR-10, CIFAR-100 i ImageNet pokazują, że DEM przewyższa istniejące metody (np. EM, TAP i SEM) pod względem ochrony prywatności i odporności na ataki inżynierii wstecznej, jak pokazano na rysunku 2, jednocześnie zwiększając odporność na ataki usuwania szumów o 57% w porównaniu z EM i 25% w porównaniu z SEM, jak pokazano na rysunku 3. podkreślając jego potencjalną przydatność w rzeczywistych scenariuszach.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Konfiguracja
Rozważono zadanie klasyfikacji nadzorowanej z zestawem danych Równanie statycznego zestawu danych, D={(xi,yi)} od i=1 do n, opisujące zbiór punktów danych., gdzie Równanie z notacją zbiorów matematycznych, xi ∈ X ⊆ R^d, przedstawiające relację podzbioru w analizie wymiarowej. reprezentuje cechy wejściowe, a Notacja zbiorów matematycznych, yi element Y od 1 do K, analiza równania. oznacza odpowiadające im etykiety klas dla problemu K-klasowego. Zestaw danych D został podzielony na czysty zestaw treningowy oraz zestaw testowy.

Celem jest zmodyfikowanie czystego zbioru treningowego poprzez wprowadzenie niewielkich, niezauważalnych perturbacji δ w celu stworzenia nienaukowalnego zbioru danych Notacja zbioru danych \(D_u = \{(x_i',y_i)\}_{i=1}^n\), formuła analizy statystycznej., gdzie Równanie matematyczne xi'=xi, skupiające się na koncepcjach transformacji zmiennych. + δ. Perturbacja δ jest ograniczona przez Nierówność matematyczna \(||\delta||_p \leq \epsilon\), schemat koncepcji abstrakcyjnych., co gwarantuje, że nie zmieni ona znacząco normalnej użyteczności danych. Głównym celem jest zakłócenie procesu uczenia poprzez zmuszenie modelu fθ, trenowanego na Du, do skupienia się na nieistotnych wzorcach wywołanych przez szum zamiast na istotnych cechach, co skutkuje słabą generalizacją na czystym zbiorze testowym:

Równanie optymalizacji uczenia maszynowego, arg min oczekiwania, funkcja straty, wzór matematyczny.

Symulowanie środowiska blockchain
W celu instalacji narzędzi blockchain wykorzystuje się framework Hardhat do symulacji sieci Ethereum w środowisku lokalnym w celu wdrożenia inteligentnych kontraktów oraz testowania generowania przykładów nieuczalnych (Unlearnable Examples). Aby uruchomić lokalną sieć, inicjalizuje się symulowaną sieć blockchain z wieloma węzłami i kontami. Każdemu węzłowi przydzielane są zasoby, takie jak Ether, aby ułatwić symulacje transakcji. W celu opracowania inteligentnych kontraktów implementuje się je tak, aby dynamicznie zarządzały uprawnieniami użytkowników. Uprawnieni użytkownicy mogą uzyskiwać dostęp do czystych danych, podczas gdy użytkownicy nieuprawnieni są ograniczeni do dostępu do przykładów nieuczalnych. Najpierw należy skonfigurować środowisko programistyczne w oparciu o Node.js v16.x oraz Hardhat 2.8.4, a następnie użyć kompilatora Solidity 0.8.17, aby przeprowadzić kompilację i optymalizację inteligentnego kontraktu. Proces kompilacji jest wykonywany w wierszu poleceń za pomocą komendy npx hardhat compile, co pozwala na wygenerowanie artefaktów budowania zawierających ABI i kod bajtowy. Następnie wdraża się kontrakt w sieci testowej Sepolia poprzez uruchomienie skryptu wdrożeniowego npx hardhat run scripts/deploy.js --network sepolia, a następnie zapisuje się wynikowy adres kontraktu oraz skrót (hash) transakcji wdrożenia. W fazie testów wydajnościowych sekwencyjnie wykonuje się trzy główne testy: test kosztów transakcyjnych rejestruje zużycie gazu poprzez cykliczne wywoływanie metody grantAccess kontraktu; test przepustowości wykorzystuje narzędzie Artillery do symulowania żądań użytkowników przy stopniowo zwiększanym obciążeniu; przeprowadzane są również testowe i walidacyjne transakcje, w tym zapisywanie i odzyskiwanie danych, w celu zweryfikowania funkcjonalności inteligentnego kontraktu.

Konstrukcja użytkowników on-chain i mechanizmów uprawnień
Unikalne konta użytkowników są generowane przy użyciu portfeli blockchain (np. MetaMask), z których każdy składa się z klucza prywatnego i klucza publicznego. Implementacja prototypu wykorzystuje symulowane środowisko blockchain, w którym syntetyczne encje użytkowników przesyłają publicznie dostępne zestawy danych do zdecentralizowanego systemu, przechowując w rozproszonym rejestrze jedynie kryptograficzne wartości skrótu (hash). Zapewnia to integralność danych bez konieczności przechowywania samych danych on-chain, co byłoby nieefektywne i kosztowne. Właściwe dane są przechowywane off-chain, zazwyczaj z wykorzystaniem zdecentralizowanych systemów przechowywania, takich jak IPFS, co zapewnia efektywne zarządzanie danymi przy zachowaniu bezpieczeństwa i prywatności. W przypadku niezamiennych tokenów (NFT) i kontroli dostępu, w niniejszym badaniu zaimplementowano mechanizm precyzyjnej kontroli dostępu z wykorzystaniem NFT zgodnych ze standardem ERC-721. Każdy zestaw danych przykładów nieuczalnych (unlearnable examples) jest powiązany z unikalnym tokenId, który pełni rolę klucza dostępu do danych. Użytkownicy wnioskują o dostęp, przesyłając dowody Merkle'a (Merkle proofs). Dowody te weryfikują tożsamość użytkownika w bezpieczny, zdecentralizowany sposób. Po pomyślnej walidacji dowodu, kontrakt emituje unikalny NFT i przesyła go do portfela użytkownika. NFT ten reprezentuje prawo użytkownika do dostępu do danych powiązanych z konkretnym przykładem nieuczalnym. Wykorzystanie NFT gwarantuje, że tylko uprawnieni użytkownicy mogą uzyskać dostęp do danych w oparciu o zdecentralizowany, niezmienny zapis. Stanowi to kontrast do tradycyjnej kontroli dostępu opartej na rolach (RBAC), która zazwyczaj działa na poziomie grupy i może nie zapewniać ziarnistości niezbędnej w aplikacjach o wysokim poziomie bezpieczeństwa30.

Inteligentny kontrakt nieustannie weryfikuje uprawnienia dostępu za pomocą funkcji ownerOf, sprawdzając własność NFT, aby zapewnić, że tylko upoważnieni użytkownicy mają dostęp do oczyszczonych danych. Administratorzy mogą cofnąć dostęp poprzez zniszczenie NFT za pomocą funkcji revokeAccess, co zapewnia elastyczność w zarządzaniu dostępem użytkowników w czasie. Przepływ operacyjny składa się z czterech krytycznych kroków: (1) użytkownicy przesyłają żądania dostępu zawierające dowody Merkle'a; (2) kontrakt weryfikuje poprawność tych dowodów; (3) po pomyślnej walidacji kontrakt emituje odpowiedni NFT; (4) użytkownicy pobierają zaszyfrowane dane, korzystając z identyfikatora treści (CID) IPFS osadzonego w metadanych NFT. Wykorzystując NFT, osiągamy szereg korzyści w porównaniu do tradycyjnych mechanizmów kontroli dostępu, takich jak precyzyjne sterowanie uprawnieniami (na poziomie danych zamiast na poziomie grupy), lepsze możliwości audytu (niezmienialne zapisy on-chain) oraz przenaszalność uprawnień (transakcje na rynku NFT).

Kontrakty wielopodpisowe są implementowane w celu aktualizacji hasza korzenia drzewa Merkle'a, co zapobiega nieautoryzowanym manipulacjom danymi. System zawiera mechanizmy anty-Sybil poprzez powiązanie każdego zestawu danych z unikalnym tokenId, co gwarantuje, że złośliwi aktorzy nie mogą generować fałszywych tokenów w celu uzyskania dostępu do nieautoryzowanych danych. Jednostki UE są szyfrowane przy użyciu AES-256 przed przesłaniem do sieci InterPlanetary File System (IPFS). Hasze zaszyfrowanych danych są przechowywane on-chain, podczas gdy kompletne zestawy danych pozostają w IPFS, co redukuje narzut pamięciowy blockchaina. Hybrydowe podejście łączące przechowywanie on-chain i off-chain zapewnia równowagę między dostępnością danych a redukcją kosztów przechowywania, co jest powszechnym problemem w aplikacjach opartych na blockchainie.

Inteligentne kontrakty są wykorzystywane do dynamicznego zarządzania uprawnieniami użytkowników. Każdy użytkownik otrzymuje dostęp do oczyszczonych danych tylko wtedy, gdy posiada odpowiedni NFT, który służy jako token autoryzacyjny. Inteligentne kontrakty rejestrują każdy dostęp do danych w logach zdarzeń, zapewniając pełną identyfikowalność. Logi te są niezmienne i mogą zostać poddane audytowi, co zapewnia przejrzystość i odpowiedzialność. Inteligentny kontrakt wykorzystuje funkcję grantAccess do weryfikacji żądań dostępu. Kontrakt sprawdza, czy użytkownik posiada odpowiedni NFT i, w przypadku pozytywnej weryfikacji, przyznaje dostęp do żądanych danych. Każde zdarzenie dostępu jest zapisywane w blockchainie, co gwarantuje, że wszystkie czynności pobierania danych są weryfikowalne. Każde zdarzenie dostępu do danych jest rejestrowane w czasie rzeczywistym przez inteligentny kontrakt, który wyzwala zdarzenie AccessGranted. Zdarzenie to zawiera istotne informacje, takie jak adres portfela użytkownika, znacznik czasu dostępu oraz odpowiadający mu tokenId NFT. Dynamiczny charakter inteligentnych kontraktów umożliwia zarządzanie uprawnieniami w czasie rzeczywistym. Jest to szczególnie przydatne w aplikacjach zdecentralizowanych, w których kontrola dostępu musi być wysoce elastyczna i dostosowywalna do zmieniających się warunków.

Aby rozwiązać problemy z prywatnością w publicznych środowiskach blockchain, system przechowuje w blockchainie miniatury o niskiej rozdzielczości (np. 64 x 64 pikseli), natomiast oryginalne obrazy o wysokiej rozdzielczości są szyfrowane i przechowywane poza łańcuchem w IPFS. Tylko uprawnieni użytkownicy posiadający odpowiedni NFT mogą pobrać klucze deszyfrujące w celu uzyskania dostępu do danych o wysokiej rozdzielczości. Użytkownicy nieuprawnieni otrzymują wersje danych z perturbacjami DEM w czasie rzeczywistym, co gwarantuje brak dostępu do oryginalnych danych.

Generowanie perturbacji obrazu
Wczytaj zestawy danych CIFAR10, CIFAR100 oraz ImageNet. Obrazy w zestawach danych są jednolicie zmieniane pod kątem rozmiaru i konwertowane na tensory PyTorch, a tensor obrazu jest normalizowany z użyciem średniej i odchylenia standardowego. Zainicjuj losowy szum δ1, wykorzystując rozkład Gaussa do wygenerowania początkowej perturbacji. Losowy szum jest nakładany na każdy obraz x, a strata pomiędzy etykietą docelową a predykcją modelu jest obliczana na podstawie funkcji straty entropii krzyżowej. W zbiorze danych klasy C, dla próbki i, yi jest wartością etykiety docelowej, a pi jest prawdopodobieństwem predykcji modelu, co pozwala określić różnicę między rozkładem prawdopodobieństwa przewidzianym przez model a rzeczywistą etykietą, maksymalizując stratę w taki sposób, aby model generował błędne predykcje. Strata entropii krzyżowej wynosi:

Wzór na stratę entropii krzyżowej, L(pi,yi), stosowany w zadaniach klasyfikacji, reprezentacja równania.

Wpływ perturbacji obrazu na predykcję obliczaną zgodnie z funkcją straty; propagacja wsteczna aktualizuje perturbację, a zakres i wartość perturbacji są stale aktualizowane w wielu iteracjach. Dla współczynnika uczenia η wzór aktualizacji perturbacji jest następujący:

Wzór aktualizacji metody spadku gradientu, δ' = δ + η ∇L(p, y), równanie; metoda optymalizacji.

Generowanie perturbacji tekstu
Załaduj wstępnie wytrenowane modele BERT w celu generowania osadzeń tekstu (text embeddings). Do wyodrębniania cech z osadzeń tekstu wygenerowanych przez modele BERT wykorzystywana jest niestandardowa sieć TextFeatureExtractor, składająca się z dwóch bloków Transformera i warstwy w pełni połączonej. Wprowadź informacje o użytkowniku oraz znacznik czasu dostępu użytkownika do wstępnie wytrenowanego modelu BERT, a następnie dynamicznie wygeneruj szum tekstowy za pomocą spersonalizowanej sieci TextFeatureExtractor.

Obraz wejściowy I jest przekazywany do multimodalnego modelu Qwen2.5-VL-7B-Instruct. Kierowany przez ustrukturyzowany prompt, model generuje zwięzły opis tekstowy Tq. Wygenerowany tekst Tq zostaje wprowadzony do wstępnie wytrenowanego modelu językowego BERT-base-uncased. Poprzez prompty do przepisywania specyficzne dla danego zadania, system generuje tekst zmodyfikowany równowaga statyczna, wzór T'g, koncepcja fizyczna, reprezentacja równania, który zachowuje semantykę przy jednoczesnej zmianie sformułowania. Sieć TextFeatureExtractor mapuje zmodyfikowany tekst równowaga statyczna, wzór T'g, koncepcja fizyczna, reprezentacja równania na wysokowymiarowy wektor osadzenia semantycznego Eg.

Generowanie perturbacji wielocelowych
Aby zapewnić kompatybilność między osadzeniami tekstowymi a perturbacjami obrazu, dostosowujemy kształt osadzenia tekstu do wymiarów perturbacji obrazu. Niech ET i Eq reprezentują osadzenia tekstowe, a PL perturbację obrazu. Proces zmiany kształtu zapewnia, że ET i Eq zostaną przekształcone do tej samej wymiarowości co PL: Wzór matematyczny: Eₜ, E₍g₎ ∈ Rᴰˣᴴˣᵂ - reprezentacja macierzy, użytek edukacyjny., gdzie C, H, W to wymiary PL. Definiujemy moduł fuzji oparty na mechanizmie uwagi, który łączy perturbacje osadzeń tekstowych i perturbacje obrazu, dynamicznie dostosowując perturbacje zgodnie z wagami uwagi tekstu. Fuzja jest następująca:

Wzór matematyczny dla analizy równowagi, pokazujący δu = α · δT + δl.

gdzie α jest dynamiczną korektą parametrów mechanizmu uwagi. δT to zakłócenie tekstu generowane przez Eq i ET. Aby zapobiec przeuczeniu, do procesu trenowania dodaje się człon regularyzacyjny. Członem regularyzacyjnym jest norma L2 osadzenia tekstu, która penalizuje perturbacje. Wielokryterialna funkcja straty łączy stratę entropii krzyżowej i perturbację fuzji, a wielokryterialna funkcja straty przedstawia się następująco:

Równanie funkcji Lagrange'a Lmul z członem regularyzacyjnym na schemacie optymalizacji matematycznej.

Celami funkcji straty są:

Wzór optymalizacji dla modelu uczenia maszynowego, arg min, funkcja straty, ustawienie ograniczeń.

gdzie λ jest współczynnikiem regularyzacji służącym do kontrolowania siły kary za perturbację w celu zapobiegania nadmiernym zaburzeniom lub przeuczeniu. W badaniach nad atakami adwersarialnymi ustalono, że Równowaga statyczna, wzór ε ≤ 8/255; równanie do analizy naprężeń materiałowych; treści edukacyjne. jest granicą perturbacji dostrzegalną dla ludzkiego oka. Zdefiniowano proces trenowania i oceny, obejmujący generowanie perturbacji, obliczanie funkcji straty, trenowanie modelu itp.

Eksperymenty porównawcze
Przeprowadzono kompleksową ocenę proponowanego Dynamicznego Szumu Minimalizującego Błąd (Dynamic Error-Minimizing Noise, DEM) w odniesieniu do trzech istniejących metod: Szumu Minimalizującego Błąd (Error-Minimizing Noise, EM), Transferowalnych Perturbacji Adversarialnych (Transferable Adversarial Perturbations, TAP) oraz Stabilnego Szumu Minimalizującego Błąd (Stable Error-Minimizing Noise, SEM). Metody te przetestowano na trzech zbiorach danych referencyjnych: CIFAR-10, CIFAR-100 oraz podzbiorze ImageNet, wykorzystując cztery powszechnie stosowane architektury sieci neuronowych: VGG-16, ResNet-18, ResNet-50 oraz DenseNet-121, aby zapewnić zróżnicowane warunki eksperymentalne.

Dodatkowo zbadaliśmy odporność tych metod, stosując modele odszumiania oparte na dyfuzji w celu usunięcia szumu obronnego i mierząc dokładność odszumionych przykładów na zbiorach testowych. Krok ten miał na celu ocenę zdolności każdej metody do przeciwstawiania się atakom odzyskiwania danych oraz utrzymania integralności prywatności danych w warunkach kontradyktoryjnych. Wyniki wskazują, że nasz model DEM przewyższa inne metody zarówno pod względem odporności, jak i dokładności we wszystkich zbiorach danych i architekturach, co demonstruje jego skuteczność jako struktury chroniącej prywatność.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Struktura blockchain i inteligentnych kontraktów
Wyniki eksperymentalne wykazały, że zaproponowana struktura generowania i zarządzania przykładami nieuczalnymi zintegrowana z blockchainem (B-UEGMF), w połączeniu z inteligentnymi kontraktami, umożliwiła efektywne dynamiczne zarządzanie dostępem klientów do danych. W przypadku uprawnionych użytkowników, pobrane czyste dane pozwoliły osiągnąć dokładność testową na poziomie 90,2% w modelu zastępczym ResNet-18 ocenianym na zbiorze danych CIFAR-10. Z kolei...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Integracja blockchaina i UEs posunęła naprzód dziedzinę ochrony prywatności danych, zapewniając przejrzyste i zdecentralizowane rozwiązanie do zarządzania dostępem do danych. W przeciwieństwie do konwencjonalnych metod ochrony prywatności, które często opierają się wyłącznie na technikach perturbacji31, badanie to wypełnia lukę między ochroną danych a śledzeniem odpowiedzialności. W scenariuszach uczenia federacyjnego proponowana struktura zapewnia bezpieczne i prywatne trenowanie modelu w zdecent...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają nic istotnego dla tej publikacji do ujawnienia.

Podziękowania

Prace te były wspierane przez Szkołę Bezpieczeństwa Cyberprzestrzeni Uniwersytetu w Zhengzhou, która zapewniła doskonałe środowisko badawcze i zasoby akademickie. Jesteśmy głęboko wdzięczni naszemu promotorowi, prof. Zijiao Zhangowi, za jego nieocenione wskazówki, wnikliwe sugestie i ciągłą zachętę podczas tych badań. Składamy również serdeczne podziękowania Centrum Zarządzania Siecią Uniwersytetu w Zhengzhou za dostarczenie eksperymentalnych serwerów, wysokowydajnych zasobów obliczeniowych i infrastruktury testowej blockchain, które były niezbędne do pomyślnego wdrożenia tego badania.

Wkład autora:
Ruijia Li wymyśliła badanie, opracowała metodologię, przeprowadziła eksperymenty, przeprowadziła analizę danych i napisała oryginalny rękopis. Zijiao Zhang zapewnił nadzór, walidację metodologii i krytyczną recenzję manuskryptu. Shouli Fu przyczynił się do opracowania wytycznych dotyczących wdrażania blockchain. Lin Zhu pomagał w selekcji i walidacji danych. Qunpeng Lei przyczynił się do opracowania ram teoretycznych. Buwei Wang zapewnił wsparcie techniczne. Wszyscy autorzy zrecenzowali i zatwierdzili ostateczną wersję manuskryptu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CUDA 12.1Technologia NVIDIASłuży do zwiększania wydajności aplikacji głębokiego uczenia
NVIDIA A800 80 GB PCIe A800 80 GB PCIeTechnologia NVIDIASłuży do trenowania modelu uczenia głębokiego
Język Python 3.10Fundacja oprogramowania PythonSłuży do wstępnego przetwarzania i analizy danych
PyTorch 2.5.1AktualnościStruktura uczenia głębokiego używana do trenowania modelu
Ubuntownik 22.04KanonicznySystem operacyjny używany do konfigurowania środowiska

Bibliografia

  1. Multi-level Cross-view Contrastive Learning for Knowledge-aware Recommender System. Zou, D., Chen, Y., Wang, X. Proc 45th Int ACM SIGIR Conf Res Dev Info Retrieval, , 1358-1368 (2022).
  2. A simple framework for contrastive learning of visual representations. Chen, T., Kornblith, S., Norouzi, M., Hinton, G. Proc 37th Int Conf Mach Learn, 119, 1597-1607 (2020).
  3. Guo, J., et al. Domain watermark: Effective and harmless dataset copyright protection is closed at hand. arXiv. , (2023).
  4. Hill, K. The Secretive Company That Might End Privacy as We Know It. , The New York Times. (2020).
  5. Prabhu, V. U., Birhane, A. Large Image Datasets: A Pyrrhic Win for Computer Vision. arXiv. , (2020).
  6. Unlearnable examples detection via iterative filtering. Yu, Y., Jiang, X., Wang, Y. Proc Int Conf Artificial Neural Net, , 241-256 (2024).
  7. Jiang, Y., Ma, X., Erfani, S. M., Bailey, J. Unlearnable examples for time series. Adv Knowledge Disc Data Mining. , 213-225 (2024).
  8. Unlearnable clusters: Towards label-agnostic unlearnable examples. Zhang, J., Liu, Y., Zhou, Q. Proc IEEE/CVF Conf Comput Vision Pattern Recognit, , 3984-3993 (2023).
  9. Unlearnable examples: Making personal data unexploitable. Huang, H., Ma, X., Erfani, S. M., Bailey, J., Wang, Y. Int Conf Learning Representat, , 1-17 (2021).
  10. Game-theoretic unlearnable example generator. Liu, S., Wang, Y., Gao, X. S. Proc AAAI Conf Artificial Intellig, 38, 21349-21358 (2024).
  11. Robust unlearnable examples: Protecting data privacy against adversarial learning. Fu, S., He, F., Liu, Y., Shen, L., Tao, D. ICLR 2022 Proc Int Conf Learning Representat, , 1-22 (2022).
  12. Stable unlearnable example: Enhancing the robustness of unlearnable examples via stable error-minimizing noise. Liu, S., Xu, K., Sun, L. Proc AAAI Conf Artificial Intellig, 37, 2473-2481 (2023).
  13. Defensive unlearning with adversarial training for robust concept erasure in diffusion models. Zhang, Y., et al. NeurIPS 2024 Proc 38th Conf Neural Informat Process Syst, , 1-29 (2024).
  14. Unlearnable examples give a false sense of security: Piercing through unexploitable data with learnable examples. Jiang, W., et al. MM 2023 Proc 31st ACM Int Conf Multimedia, , 8910-8921 (2023).
  15. VQUNet: Vector quantization U-Net for defending adversarial attacks by regularizing unwanted noise. He, Z., Singhal, M. ICMVA 2024 Proc 2024 7th Int Conf Machine Vis Applicat, , 69-76 (2024).
  16. Li, Z., et al. UnGANable: Defending Against GAN-based Face Manipulation. 32nd USENIX Secur Sympos. , 7213-7230 (2023).
  17. Narcissus: A Practical Clean-Label Backdoor Attack with Limited Information. Zeng, Y., et al. Proc 2023 ACM SIGSAC Conf Comput Communicat Secur, , 771-785 (2023).
  18. Meng, R., Chen, J., Liu, Z. Semantic deep hiding for robust unlearnable examples. IEEE Transact Info Forens Secur. 19 (12), 6545-6558 (2024).
  19. Detection and defense of unlearnable examples. Zhu, Y., Yu, L., Gao, X. S. Proc AAAI Conf Artif Intellig, 38 (15), 17211-17219 (2024).
  20. Unlearnable examples: Protecting open-source software from unauthorized neural code learning. Ji, Z., Ma, P., Wang, S. Proc Int Conf Software Eng Knowledge Eng, , 525-530 (2022).
  21. Purify unlearnable examples via rate-constrained variational autoencoders. Yu, Y., et al. ICML 2024 Proc 41st Int Conf Mach Learn, 2379, 57678-57702 (2024).
  22. Triggerless backdoor attack for NLP tasks with clean labels. Gan, L., Zhang, W., Li, X. Proc 2022 Conf North Am Chapter Associat Computat Linguist Human Lang Technol, , 2942-2952 (2022).
  23. Punia, A., et al. A systematic review on blockchain-based access control systems in cloud environment. J Cloud Comput. 13, 146(2024).
  24. SoK: Understanding Design Choices and Pitfalls of Trusted Execution Environments. Li, M., Yang, Y., Chen, G., Yan, M., Zhang, Y. Proc 19th ACM Asia Conf Comput Commun Secur, , 1600-1616 (2024).
  25. Kayikci, S., Khoshgoftaar, T. M. Blockchain meets machine learning: a survey. J Big Data. 11, 9(2024).
  26. Ullah, F., et al. Blockchain-enabled EHR access auditing: Enhancing healthcare data security. Heliyon. 10 (16), e34407(2024).
  27. Tripathi, G., Ahad, M. A., Casalino, G. A comprehensive review of blockchain technology: Underlying principles and historical background with future challenges. Dec Anal J. 9, 100344(2023).
  28. Saleh, A. M. S. Blockchain for secure and decentralized artificial intelligence in cybersecurity: A comprehensive review. Blockchain Res Appl. 5 (3), 100193(2024).
  29. Badra, M., Borghol, R. An efficient blockchain-based privacy preservation scheme for smart grids. Front Communicat Net. 6, 1584152(2025).
  30. Fine-Grained Access Control in the Era of Cloud Computing: An Analytical Review. Albulayhi, K., Abuhussein, A., Alsubaei, F., Sheldon, F. T. 2020 10th Ann Comput Communicat Workshop Conf, , 0748-0755 (2020).
  31. Turgay, S., İlter, İ Perturbation Methods for Protecting Data Privacy: A Review of Techniques and Applications. Automat Machine Learning. 4, 31-41 (2023).
  32. Williamson, S. M., Prybutok, V. Balancing Privacy and Progress: A Review of Privacy Challenges, Systemic Oversight, and Patient Perceptions in AI-Driven Healthcare. Appl Sci. 14 (2), 675(2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Prywatno danych w blockchainieuczenie kontrastoweidentyfikowalno danychinteligentne kontraktyperturbacja danychochrona prywatno ciobrona przed atakami odwracalnymidynamiczny szum minimalizuj cy b d