Research Article

Hybrydowa konwolucyjna sieć neuronowa i generatywna sieć przeciwstawna do niezawodnego wykrywania deepfake: zwiększenie dokładności, skalowalności i integracji multimodalnej

DOI:

10.3791/68426

August 19th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W niniejszym artykule zaproponowano hybrydową strukturę konwolucyjnej sieci neuronowej i generatywnej sieci przeciwstawnej (CNN-GAN) do wykrywania deepfake, integrując szkolenie przeciwników, analizę czasową i metody multimodalne. Podejście to osiąga dokładność wykrywania na poziomie 98,5%, demonstruje solidną generalizację w różnych zestawach danych i obsługuje optymalizację w czasie rzeczywistym w celu zapewnienia skalowalności, odporności na działania niepożądane i łagodzenia skutków błędnych informacji.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deepfake'i stanowią poważne zagrożenie dla integralności mediów cyfrowych i zaufania społecznego. W tym artykule przedstawiono hybrydową strukturę wykrywania deepfake, łączącą konwolucyjne sieci neuronowe (CNN) i generatywne sieci przeciwstawne (GAN) w celu sprostania wyzwaniom związanym ze skalowalnością, możliwością uogólnienia i odpornością na działania przeciwstawne. Struktura integruje szkolenie przeciwstawne, model analizy zaniku czasowego i wykrywanie multimodalne w domenach audio, wideo i tekstowych. Hybrydowy model CNN-GAN, oceniony na zestawie danych porównawczych FaceForensics++, osiągnął najnowocześniejszą wydajność z 98,5% dokładnością, 99,1% precyzją, 97,9% kompletnością i krzywą obszaru charakterystyki operacyjnej odbiornika wynoszącą 0,995, przewyższając konwencjonalne modele, takie jak ResNet50, XceptionNet i EfficientNet. Komponent analizy czasowej modeluje zanik wykrywalności deepfake'ów w czasie, kierując proaktywnym ponownym szkoleniem, podczas gdy moduł multimodalny zidentyfikował 97,8% niespójności międzymodalnych. Symulacja rozprzestrzeniania się deepfake w sieciach społecznościowych ujawniła znaczące skutki społeczno-techniczne, podkreślając potrzebę systemów wczesnego wykrywania i kampanii uświadamiających społeczeństwo w celu ograniczenia rozprzestrzeniania się dezinformacji. Zoptymalizowana pod kątem wdrażania w czasie rzeczywistym platforma równoważy wysoką skalowalność z względami etycznymi. Badanie to podkreśla znaczenie interdyscyplinarnego podejścia do wykrywania deepfake'ów w rozwijaniu zabezpieczeń ekosystemów cyfrowych opartych na sztucznej inteligencji. Przyszłe prace będą koncentrować się na opracowywaniu lekkich modeli wykrywania, ulepszaniu obrony przed przeciwnikami i rozszerzaniu aplikacji specyficznych dla domeny w celu zwiększenia możliwości zastosowania i odporności struktury.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Postępy w dziedzinie sztucznej inteligencji (AI) i głębokiego uczenia się w ostatnich latach przekształciły różne dziedziny, umożliwiając takie zastosowania, jak przetwarzanie języka naturalnego, widzenie komputerowe i systemy autonomiczne1. Jednym z najbardziej znaczących przełomów było modelowanie generatywne, w szczególności w przypadku generatywnych sieci przeciwstawnych (GANs)2. Modele te umożliwiły stworzenie hiperrealistycznych mediów syntetycznych znanych jako deepfakes, które polegają na manipulowaniu dźwiękiem, wideo lub obrazami w celu przekonującego naśladowania rzeczywistych obiektów. Chociaż technologia ta oferuje kreatywne możliwości w takich dziedzinach jak produkcja filmowa, rzeczywistość wirtualna i tworzenie treści cyfrowych, budzi również poważne obawy etyczne, prawne i społeczne. Deepfake'i stanowią poważne zagrożenie w kilku dziedzinach, w tym w zakresie autentyczności mediów, cyberbezpieczeństwa i procesów demokratycznych. Na przykład deepfake'i zostały wykorzystane w kampaniach dezinformacyjnych mających na celu rozpowszechnianie fałszywych narracji i wpływanie na opinię publiczną3. Co więcej, były one wykorzystywane do złośliwych celów, takich jak kradzież tożsamości, szantaż i nękanie, bezpośrednio zagrażając prywatności i bezpieczeństwu jednostki4. Zdolność deepfake'ów do podważania zaufania do mediów cyfrowych i siania zamieszania podczas krytycznych wydarzeń (np. wyborów lub sytuacji nadzwyczajnych) podkreśla pilną potrzebę opracowania rozwiązań mających na celu przeciwdziałanie nadużyciom i lukom w zabezpieczeniach tej technologii5.

Z technicznego punktu widzenia rozprzestrzenianie się technologii deepfake jest napędzane przez jej dostępność. Narzędzia typu open source, wstępnie wytrenowane modele i intuicyjne interfejsy umożliwiają teraz tworzenie wyrafinowanych deepfake'ów nawet osobom niebędącym ekspertami6. Jednak wraz z poprawą wierności mediów syntetycznych wykrywanie ich autentyczności staje się coraz trudniejsze. Zaawansowane generatory deepfake, w tym nowoczesne architektury, takie jak StyleGAN i CycleGAN, wykorzystują zdolność sieci neuronowych do modelowania wielowymiarowych rozkładów danych, dzięki czemu są biegłe w tworzeniu fałszerstw, które często są nie do odróżnienia od rzeczywistej treści7. Opracowanie ram wykrywania przeszkód jest utrudnione pomimo znacznych prac badawczo-rozwojowych. Dokładność istniejących algorytmów wykrywania pogarsza się, gdy napotykają one różne zestawy danych i rozległe środowiska rzeczywiste, mimo że działają prawidłowo w kontrolowanych laboratoriach. Skuteczność wykrywania systemów znacznie się pogarsza, gdy rozdzielczość, jakość kompresji lub format różnią się w zależności od przykładu. Proces trenowania systemów detekcji zwykle odbywa się na określonych zbiorach danych, co utrudnia im wykrywanie deepfake'ów wygenerowanych z nowych metod i nieznanych danych. W rzeczywistych sytuacjach detektory te stają się mniej skuteczne ze względu na ich ograniczone możliwości uogólniania. Generatory deepfake są opracowywane przez przeciwników poprzez wdrażanie metod, które działają specjalnie w celu ukrycia systemów wykrywania. Te środki zaradcze skutkują pokonaniem nawet najnowszych modeli z powodu obejścia8. Nieprzejrzysty charakter modeli uczenia głębokiego budzi powszechną krytykę, ponieważ ich procesy decyzyjne nie zapewniają wytłumaczalnych wyników, szczególnie w kluczowych obszarach, takich jak działania organów ścigania i sądownictwa9.

Poszczególne badania z zakresu badań nad deepfake'ami działają niezależnie od siebie, ponieważ koncentrują się na niezależnych problemach bez integracji. Badacze zdecydowali się zająć trzema głównymi obszarami wyzwań związanych z deepfake'ami oddzielnie: dokładnością wykrywania, odpornością na działania niepożądane i eksploracją etyczną10. W związku z tym tradycyjne mechanizmy wykrywania, które opierają się na artefaktach heurystycznych lub specyficznych dla domeny, często stają się przestarzałe przez te rozwijające się techniki generowania.

Wyzwania związane z wykrywaniem i ograniczaniem deepfake'ów

Skalowalność: Wiele istniejących algorytmów wykrywania działa dobrze w kontrolowanych warunkach eksperymentalnych, ale ma trudności z utrzymaniem dokładności na dużą skalę w przypadku zastosowania do różnorodnych, rzeczywistych zestawów danych. Na przykład różnice w rozdzielczości, jakości kompresji lub formacie pliku mogą znacząco wpłynąć na skuteczność wykrywania11.

Możliwość uogólnienia: Systemy wykrywania są często szkolone na określonych zestawach danych, co ogranicza ich zdolność do rozpoznawania deepfake'ów generowanych nowymi metodami lub na podstawie nieznanych danych. Ten brak uogólnienia utrudnia ich skuteczność w rzeczywistych zastosowaniach, ponieważ modele mogą zawieść w obliczu deepfake'ów, które różnią się od ich przykładów treningowych.

Odporność na działania niepożądane: Generatory deepfake wciąż ewoluują, wprowadzając wrogie techniki zaprojektowane w celu uniknięcia wykrycia. Takie środki zaradcze wykorzystują luki w zabezpieczeniach modeli wykrywania, sprawiając, że nawet najnowocześniejsze systemy stają się nieskuteczne. Na przykład Khan i in. wykazali, że zoptymalizowane pod kątem przeciwników deepfake'i mogą zmniejszyć dokładność wykrywania nawet o 30%12.

Wytłumaczalność: Detektory oparte na głębokim uczeniu są często krytykowane za ich "czarną skrzynkę"; Brak możliwości interpretacji w ich procesach decyzyjnych budzi obawy co do niezawodności w scenariuszach o wysokiej stawce, takich jak egzekwowanie prawa lub sądownictwo. Aby rozwiązać ten problem, naukowcy, tacy jak Domenteanu i in. oraz Verdoliva, opowiadają się za integracją technik wytłumaczalnej sztucznej inteligencji (XAI) z modelami wykrywania w celu zwiększenia przejrzystości i wiarygodności 7,9.

Kwestie etyczne i społeczne: Poza przeszkodami technicznymi, deepfake'i stwarzają ogromne ryzyko etyczne i społeczne. Według Naitali i in., deepfake'i są coraz częściej nadużywane w politycznych kampaniach dezinformacyjnych, kradzieży tożsamości i nękaniu. Jak stwierdzili również Chesney i Citron, może to doprowadzić do znacznej erozji zaufania do mediów i zagrozić procesom demokratycznym8.

Potrzeba ujednoliconych ram i pojawiających się rozwiązań

Obecny krajobraz badań nad deepfake'ami jest fragmentaryczny, a badania często dotyczą tych wyzwań w izolacji. Aby skutecznie zwalczać deepfake'i, niezbędne są ujednolicone ramy, które integrują różne podejścia. Ostatnie analizy bibliometryczne wskazują na roczną stopę wzrostu publikacji związanych z deepfake na poziomie ponad 50%, co podkreśla intensywne zainteresowanie środowiskiem akademickim i przemysłowym. Odzwierciedlają to trendy w finansowaniu, a rządy i organizacje prywatne przeznaczają znaczne zasoby na elastyczne rozwiązania, szczególnie w przypadku projektów, które łączą architektury hybrydowe, takie jak CNN-GAN, w celu zwiększenia dokładności wykrywania.

Skuteczne ramy muszą wykorzystywać spostrzeżenia z wielu dziedzin i uwzględniać kluczowe innowacje algorytmiczne, które niedawno zaproponowali naukowcy:

Ramy hybrydowe: Jako obiecujące rozwiązanie, modele hybrydowe, które integrują CNN do ekstrakcji cech i GAN do szkolenia przeciwników, osiągnęły najnowocześniejszą dokładność 98,5% i ROC-AUC na poziomie 0,995 w zestawach danych porównawczych.

Analiza multimodalna: Opierając się na ustaleniach badaczy, takich jak Nguyen i wsp., połączenie analizy audio, wideo i tekstu zwiększa możliwości wykrywania5. Takie podejście jest skuteczne w identyfikowaniu niespójności między strumieniami danych (np. niezgodności synchronizacji ruchu warg), których często brakuje w systemach jednomodalności.

Zaawansowane wykrywanie tekstu: Techniki przetwarzania języka naturalnego (NLP), wykorzystujące modele takie jak RoBERTa, wykazały znaczną poprawę w wykrywaniu niespójności semantycznych w tekście typu deepfake, takich jak zmanipulowane tweety.

Trening przeciwstawny: Aby zabezpieczyć systemy przed unikaniem opodatkowania, techniki szkolenia przeciwników zostały włączone do potoków wykrywania, co okazało się skuteczne w zmniejszaniu wpływu deepfake'ów generowanych przez przeciwników.

Opracowywanie zestawów danych: Naukowcy podkreślili potrzebę kompleksowych i zróżnicowanych zestawów danych, aby skutecznie trenować i oceniać modele. Chociaż publiczne zestawy danych, takie jak FaceForensics++, odegrały kluczową rolę, aby sprostać rzeczywistym wyzwaniom, potrzebna jest większa różnorodność.

Wkład tych badań:

Opierając się na powyższych motywacjach, w niniejszym badaniu zaproponowano kompleksowe ramy, które łączą wglądy bibliometryczne, modelowanie matematyczne i zaawansowane techniki algorytmiczne, aby całościowo stawić czoła wyzwaniom związanym z deepfake. Do najważniejszych wkładów należą:

Analiza bibliometryczna: Przeanalizowaliśmy publikacje w wiodących akademickich bazach danych, aby zidentyfikować kluczowe obszary, na których się skupiamy, takie jak wzrost detekcji multimodalnej i rosnące zainteresowanie wytłumaczalną sztuczną inteligencją, które kierowały naszymi celami badawczymi.

Matematyczny model podatności: Opracowaliśmy model oparty na regresji logistycznej, aby określić ilościowo prawdopodobieństwo prawidłowej klasyfikacji poprzez uwzględnienie takich czynników, jak jakość nośników, architektura GAN i różnorodność zbiorów danych.

Hybrydowe ramy wykrywania CNN-GAN: Zaproponowano nowatorski mechanizm wykrywania, który łączy mocne strony CNN i GAN. Model jest trenowany w sposób przeciwstawny i osiągnął znacznie lepszą dokładność, precyzję i kompletność w porównaniu z detektorami linii bazowej.

Symulacje socjotechniczne: Przeprowadziliśmy symulacje w celu zbadania rozprzestrzeniania się i wpływu deepfake'ów na portale społecznościowe. Wyniki dostarczają informacji na temat ich potencjalnego wpływu społecznego i dostarczają informacji na temat strategii łagodzenia zmian klimatu zorientowanych na politykę. Zestaw danych FaceForensics++ został wykorzystany w tym badaniu ze względu na jego kompleksowe pokrycie rzeczywistych i zmanipulowanych multimediów z różnych architektur GAN.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W badaniu tym nie uczestniczyły ludzie ani eksperymenty na zwierzętach. Wszystkie wykorzystane dane typu deepfake zostały uzyskane z publicznie dostępnych zestawów danych i nie wykorzystano żadnych danych osobowych. W związku z tym formalna zgoda etyczna nie była wymagana. Badania zostały przeprowadzone zgodnie z wytycznymi instytucjonalnymi i standardami etycznymi dla badań z zakresu sztucznej inteligencji i analizy danych. Jednym z głównych wyzwań jest zapewnienie efektywnego skalowania algorytmów wykrywania w celu obsługi różnorodnych zestawów danych i rzeczywistych scenariuszy. Większość istniejących metod jest zoptymalizowana pod kątem określonych testów porównawczych, takich jak FaceForensics++ 7, ale działa słabo, gdy jest stosowana do danych rzeczywistych.

Matematyczne ramy wykrywania i analizy deepfake służą jako podstawowy element zrozumienia podatności, skuteczności algorytmów wykrywania oraz socjotechnicznej dynamiki rozpowszechniania deepfake. W tej sekcji przedstawiono modele analizy podatności, wykrywalności czasowej i wglądu w sieć, oparte na najnowszych badaniach i sformułowaniach teoretycznych. Wykrywanie deepfake'ów polega na ocenie cech mediów w celu określenia prawdopodobieństwa ich autentyczności. Model regresji logistycznej jest solidnym narzędziem do modelowania podatności systemów wykrywania deepfake. Prawdopodobieństwo dokładnej klasyfikacji P(C) można wyrazić jak w równaniu 1:

figure-protocol-1(1)

Gdzie:

P(C): Prawdopodobieństwo dokładnej klasyfikacji (ograniczone od 0 do 1).

β0: Przechwycenie modelu regresji logistycznej.

βi : Współczynniki reprezentujące wpływ każdej cechy.

Xi: Cechy wpływające na podatność, takie jak rozdzielczość, jakość kompresji, architektura GAN i artefakty.

Model ten można wytrenować przy użyciu oznaczonego zestawu danych autentycznych i fałszywych mediów, co pozwala na empiryczne poznanie współczynników (βi)13.

Skuteczność systemów detekcji nie jest statyczna; Ewoluuje z biegiem czasu wraz z ulepszaniem technik generowania deepfake'ów. Analiza czasowa jest niezbędna do zrozumienia tej dynamiki. Wykrywalność deepfake'ów w czasie można modelować za pomocą funkcji rozpadu wykładniczego, jak pokazano w równaniu 2:

figure-protocol-2(2)

Gdzie:

Pt: Prawdopodobieństwo wykrycia w czasie t.

P0: Początkowe prawdopodobieństwo wykrycia.

λ: Stała rozpadu, reprezentująca tempo spadku wykrywalności.

t: Czas, jaki upłynął od wprowadzenia deepfake'a.

Stała zaniku λ jest wyznaczana empirycznie poprzez monitorowanie wydajności systemów detekcji w czasie. Badania przeprowadzone przez Liu i in. pokazują, że najnowocześniejsze modele detekcji wykazują szybki spadek wydajności w obliczu nowszych architektur GAN, co odzwierciedla znaczenie λ w ocenie niezawodności systemu14. Aby zrozumieć rozprzestrzenianie się deepfake'ów w sieciach społecznościowych i trendy badawcze, analiza sieci jest cennym narzędziem. Macierze współwystępowania słów kluczowych i struktury wykresów społecznych są wykorzystywane do modelowania relacji i wzorców rozpowszechniania15.

Sieć współsłów kluczowych przechwytuje relacje między badanymi słowami kluczowymi. Macierz współwystępowania jest zdefiniowana jak w równaniu 3:

figure-protocol-3(3)

Gdzie Mij oznacza częstość współwystępowania słów kluczowych ki i kj w publikacjach naukowych. Z tej macierzy konstruowany jest graf sieciowy, w którym węzły reprezentują słowa kluczowe, a krawędzie reprezentują relacje współwystępowania.

Miary centralności, takie jak centralność stopnia i centralność między, identyfikują wpływowe słowa kluczowe i pojawiające się tematy. Domenteanu i in. wykorzystali tę technikę, aby podkreślić znaczenie terminów takich jak "GANs", "manipulacja twarzą" i "kryminalistyka" w najnowszej literaturze, jednocześnie przewidując trendy, takie jak wytłumaczalna sztuczna inteligencja i wykrywanie multimodalnych deepfake'ów9.

Symulacja rozprzestrzeniania się deepfake'ów na platformach społecznościowych polega na modelowaniu podatności użytkowników i dynamiki interakcji. Model podatnego zakażenia i wyleczonego (SIR) może przybliżyć rozprzestrzenianie się, jak pokazano w równaniu 4:

figure-protocol-4(4)

Gdzie:

S, I, R: Proporcje użytkowników podatnych, zainfekowanych (pod wpływem) i ozdrowieńców.

β: Szybkość transmisji, reprezentująca prawdopodobieństwo, że użytkownicy udostępnią deepfake.

γ: Współczynnik odzyskiwania, reprezentujący prawdopodobieństwo, że użytkownicy obalą lub zignorują deepfake.

Ramy wykrywania deepfake muszą ewoluować, aby sprostać wyzwaniom stawianym przez coraz bardziej wyrafinowane modele generatywne. W tej sekcji opisano zestawy danych i hybrydową strukturę wykrywania, która integruje konwolucyjne sieci neuronowe (CNN) i generatywne sieci przeciwstawne (GAN) z analizą czasową w celu zwiększenia niezawodności, skalowalności i możliwości uogólnienia. Składniki hybrydowej architektury CNN-GAN są zdefiniowane w tabeli 1 , a ustawienia hiperparametrów w tabeli 2. Zaproponowano hybrydową architekturę CNN-GAN w celu wykorzystania mocnych stron zarówno CNN, jak i GAN. Ramy te składają się z dwóch podstawowych komponentów:

Dyskryminator oparty na CNN: CNN działa jako dyskryminator, wyszkolony do klasyfikowania mediów jako prawdziwych lub fałszywych. Zaawansowane architektury CNN, takie jak ResNet50, są wykorzystywane do wyodrębniania funkcji. Architektury te zostały wybrane ze względu na ich zdolność do przechwytywania skomplikowanych wzorców i artefaktów wprowadzonych podczas deepfakegeneration 16.

Generator oparty na GAN: GAN działa jak generator, którego zadaniem jest tworzenie coraz bardziej realistycznych deepfake'ów, aby rzucić wyzwanie dyskryminatorowi17. Architektury takie jak StyleGAN lub CycleGAN są wykorzystywane ze względu na ich zdolność do generowania obrazów i filmów o wysokiej wierności. Dyskryminator i generator są szkoleni w sposób przeciwstawny, iteracyjnie poprawiając swoją wydajność. Funkcja strat dla tego szkieletu jest zdefiniowana jak w równaniu 5:

figure-protocol-5 (5)

Gdzie:

Dyskryminator L: Binarna strata entropii krzyżowej do klasyfikowania prawdziwych i fałszywych mediów.

Generator L: Niepożądana strata w celu generowania realistycznych deepfake'ów.

α: Współczynnik wagowy równoważący dwa składniki straty.

Ten przeciwstawny paradygmat treningowy zapewnia, że dyskryminator staje się bardziej biegły w wykrywaniu subtelnych artefaktów, podczas gdy generator udoskonala swoją zdolność do tworzenia przekonujących deepfake'ów. Jak wykazali Mathur i wsp., podejście to osiągnęło dokładność wykrywania na poziomie 98,5% i ROC-AUC na poziomie 0,995 w zestawach danych porównawczych, takich jak FaceForensics++4. Rysunek 1 przedstawia architekturę proponowanego modelu.

Systemy wykrywania deepfake muszą dostosować się do rozwijającego się wyrafinowania technik generatywnych. Analiza czasowa jest zintegrowana z ramami w celu modelowania wykrywalności deepfake'ów w czasie. Osiąga się to za pomocą modelu rozkładu wykładniczego, jak podano w równaniu 6:

figure-protocol-6 (6)

Gdzie:

Pt: Prawdopodobieństwo wykrycia w czasie t.

P0: Początkowe prawdopodobieństwo wykrycia.

Stała zaniku, reprezentująca tempo spadku wykrywalności.

t: Czas, jaki upłynął od wprowadzenia deepfake'a.

Dzięki zastosowaniu tego modelu ramy mogą przewidzieć, jak długo system wykrywania pozostaje skuteczny, i określić, kiedy konieczne jest ponowne trenowanie lub uaktualnienie modelu18.

1. Algorytm 1: Hybrydowe ramy wykrywania deepfake CNN-GAN

Wkład: Zbiór danych D={(Xi, Yi)}, wskaźniki uczenia sięη d,,η g, wielkość partii B, waga strat α.

Wyjście: Przeszkolony model wykrywania CNN-GAN.

  1. Przygotowanie danych
    1. Podziel D na zestawy treningowe (pociąg D), walidacyjne (Dval) i testowe (test D).
    2. Normalizuj dane, zmieniaj rozmiar danych wejściowych (224 x 224) i rozszerzaj, aby zwiększyć różnorodność.
  2. Inicjalizacja modelu
    1. Rozróżniacza:
      1. Zainicjuj Dθ, klasyfikator binarny oparty na CNN z parametrami θd.
    2. Generator:
      1. Zainicjuj Gφ, generator oparty na sieci GAN z parametrami φ.
  3. Pętla treningowa
    1. Dla epok N:
      1. Próbkuj partię prawdziwych (Xr) i fałszywych (Xf) danych.
      2. Generuj dane syntetyczne: Xg=Gφ(Z), gdzie Z~N(0,1).
    2. Strata dyskryminatora:
      figure-protocol-7
      Aktualizacja:
      figure-protocol-8
    3. Strata generatora:
      figure-protocol-9
      Aktualizacja:
      figure-protocol-10
    4. Strata łączna:
      figure-protocol-11
  4. Analiza czasowa
    1. Zastosuj model zaniku:
      figure-protocol-12 
      gdzie λ wyprowadza się empirycznie z danych walidacyjnych.
    2. Okresowo ponownie trenuj model na podstawie λ.
  5. Integracja multimodalna
    1. Przewidywania obliczeniowe dla:
      1. Audio: Pa za pośrednictwem anomalii spektrogramu.
      2. Wideo: Pv za pomocą artefaktów klatki.
      3. Tekst: Pt za pomocą kontroli semantycznych opartych na NLP.
    2. Ostateczna prognoza:
      figure-protocol-13
      gdzie W jest wagą.
  6. Ewaluacja modelu
    1. Test nateście D przy użyciu metryk: Dokładność, Precyzja, Kompletność, F1-Score, ROC-AUC.
  7. Wdrażania
    1. Zoptymalizujφ Dθ,G poprzez przycinanie i kwantyzację.
    2. Wdrażaj na platformach chmurowych i brzegowych za pomocą narzędzi do wyjaśniania.

Koniec algorytmu

Aby zaradzić ograniczeniom jednomodalnych systemów wykrywania, proponowane ramy obejmują analizę multimodalną. Łącząc analizę audio, wideo i tekstu, platforma zwiększa niezawodność i zmniejsza prawdopodobieństwo pominiętych wykryć2. Ramy zawierają komponent symulacyjny do analizy rozpowszechniania deepfake'ów w sieciach społecznościowych. Aby zapewnić skuteczność proponowanych ram, stosuje się rygorystyczne wskaźniki oceny, jak pokazano w tabeli 3.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zaproponowana hybrydowa struktura wykrywania została rygorystycznie oceniona w wielu wymiarach, w tym dokładności i precyzji wykrywania, testach skalowalności i uogólnienia, odporności na działania przeciwstawne oraz społeczno-technicznej analizie wpływu. Poniższe sekcje podsumowują najważniejsze wyniki eksperymentu.

Wydajność hybrydowego modelu CNN-GAN

Porównaliśmy nasz model hybrydowy z trzema najnowocześniejszymi...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki eksperymentalne pokazują, że proponowana hybrydowa struktura CNN-GAN, wzbogacona o analizę czasową i integrację multimodalną, skutecznie rozwiązuje kilka podstawowych wyzwań związanych z wykrywaniem deepfake'ów. W tej dyskusji analizujemy implikacje tych ustaleń, mocne i słabe strony naszego podejścia oraz przyszłe kierunki badań i wdrażania.

Wyniki i wkład

Doskonała wydajność platformy we wszystkich kluczowych wskaźnikach (dokładność 98,5%,...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie ma konfliktu interesów związanego z tą pracą.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Klient Google API Google Nie dotyczy Google API Client to biblioteka klienta Pythona dla interfejsów API Google opartych na wykrywaniu. https://github.com/googleapis/ google-api-python-client 
Informacje OtwarteCV Nie dotyczy OpenCV to biblioteka do widzenia komputerowego. Źródło: https://opencv.org 
Język Python Fundacja Oprogramowania Python Nie dotyczy Python to język programowania. Źródło: https://www.python.org 
Pochodnia PyTorch Badania nad sztuczną inteligencją na Facebooku Nie dotyczy PyTorch to platforma uczenia maszynowego. https://pytorch.org

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Emerging threat of deep fake: how to identify and prevent it. Taha, M. A., et al. The 6th International Conference on Future Networks & Distributed Systems (ICFNDS '22, Tashkent, TAS, Uzbekistan, , ACM. New York, NY, USA. (2022).
  2. Deepfake detection: a multialgorithmic and multimodal approach for robust detection and analysis. Nailwal, S., Singhal, S., Singh, N. T., Raza, A. 2023 International Conference on Research Methodologies in Knowledge Management, Artificial Intelligence and Telecommunication Engineering (RMKMATE, , (2023).
  3. Citron, D. K., Chesney, R. Deepfakes and the new disinformation war. Foreign Aff. 98 (1), 147-155 (2019).
  4. Countering deepfakes using an improved advanced CNN and its ensemble with pretrained models. Mathur, A., Bhargava, K., Singh, M., Tejpal, M., Natarajan, K. 2024 Third International Conference on Electrical, Electronics, Information and Communication Technologies (ICEEICT), , (2024).
  5. Nguyen, T. T., et al. Deep learning for deepfakes creation and detection: a survey. Comput Vis Image Underst. 223, 103525(2022).
  6. Bale, D., Ochei, L., Ugwu, C. Deepfake detection and classification of images from video: a review of features, techniques, and challenges. Int J Intell Inf Syst. 13 (2), 20-28 (2024).
  7. FaceForensics++: learning to detect manipulated facial images. Rossler, A., et al. Proc IEEE Int Conf Comput Vis, 1, 1-11 (2019).
  8. Naitali, A., Ridouani, M., Salahdine, F., Kaabouch, N. Deepfake attacks: generation, detection, datasets, challenges, and research directions. Computers. 12 (12), 246(2023).
  9. Domenteanu, A., et al. Living in the age of deepfakes: a bibliometric exploration of trends, challenges, and detection approaches. Information (Switzerland). 15 (9), 525(2024).
  10. Babaei, R., Cheng, S., Duan, R., Zhao, S. Generative artificial intelligence and the evolving challenge of deepfake detection: a systematic analysis. J Sens Actuator Netw. 14 (1), 17(2025).
  11. Jiang, L., Wu, W., Qian, C., Loy, C. C. DeepFakes detection: the DeeperForensics dataset and challenge. In Deepfakes: a new threat to face recognition? assessment and detection. Marcel, S., Fierrez, J., Evans, N., Bourlai, T. 303, Springer. Cham. 303-329 (2022).
  12. Khan, S., Chen, J. C., Liao, W. H., Chen, C. S., et al. Adversarially robust deepfake detection via adversarial feature similarity learning. Advances in multimedia information processin 2023. Hui, P., et al. 1455, 503-516 (2024).
  13. Gadgilwar, J., et al. Exploring deepfake techniques, detection strategies, and emerging challenges: a survey. Int J Res Appl Sci Eng Technol. 11 (5), 1491-1495 (2023).
  14. Liu, F., et al. EvoGAN: An evolutionary computation assisted GAN. Neurocomputing. 16 (469), 81-90 (2022).
  15. Sunkari, V., Nagesh, A. S. Artificial intelligence for deepfake detection: systematic review and impact analysis. IAES Int J Artif Intell. 13 (6), 3786-3792 (2024).
  16. Hughes, R. T., Zhu, L., Bednarz, T. Generative adversarial networks–enabled human–artificial intelligence collaborative applications for creative and design industries: A systematic review of current approaches and trends. Frontiers in artificial intelligence. 28 (4), 604234(2021).
  17. Sharma, P., Kumar, M., Sharma, H. K. Robust GANbased CNN model as generative AI application for deepfake detection. EAI Endorsed Trans Internet Things. 10 (39), e3(2024).
  18. Tribhuvan, P. P., Tribhuvan, A. P. Artificial intelligence for deepfake creation and detection. Futuristic trends in artificial intelligence volum 3. 21, BPB Publications. 21-27 (2024).
  19. Sareen, M. Threats and challenges by DeepFake technology. DeepFakes. , CRC Press. 99(2022).
  20. Yan, Z., Zhang, Y., Yuan, X., Lyu, S., Wu, B. DeepfakeBench: a comprehensive benchmark of deepfake detection. Adv Neural Inf Process Syst. 36, 35687-35703 (2023).
  21. Deepfake detection using CNN and DCGANS to dropout fake multimedia content: a hybrid approach. Bansal, K., Agarwal, S., Vyas, N. Proc Int Conf IoT Commun Autom Technol (ICICAT), 1, 1-6 (2023).
  22. RuleBoost: a neurosymbolic framework for robust deepfake detection. Raza, M. A., Malik, K. M., Haq, I. U. Proc IEEE Int Joint Conf Biometrics (IJCB), 1, 1-10 (2024).
  23. Vidyavathi, B. M., Ahmed, A. F., Lulu, A. T., Fatima, S. M. Deepfake detection using deep learning. Int J Adv Res Sci Commun Technol. 4 (2), 647-651 (2024).
  24. Generative transferable universal adversarial perturbation for combating deepfakes. Guo, Y., et al. Proc 27th Int Conf Comput Support Coop Work Des (CSCWD), , 1986-1991 (2024).
  25. Prasoon, P., Ramakrishnan, P. N. Deepfake dystopia: navigating the landscape of threats and safeguards in multimedia content. Int J Trendy Res Eng Technol. 8 (3), 01-07 (2024).
  26. Altuncu, E., Franqueira, V. N. L., Li, S. Deepfake: definitions, performance metrics and standards, datasets, and a metareview. Front Big Data. 7, 1341168(2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Deepfake DetectionConvolutional Neural NetworksGenerative Adversarial NetworksAdversarial TrainingTemporal Decay AnalysisMultimodal DetectionFaceForensics DatasetCross Modal InconsistenciesReal Time DeploymentAdversarial Robustness
Video Coming Soon

Related Articles