$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
We współczesnej erze cyfrowej, charakteryzowanej szybkim rozwojem internetu i technologii cyfrowych, e-mail pozostaje niezbędnym filarem w dziedzinie transakcji elektronicznych i komunikacji korporacyjnej, pomimo ciągłego pojawiania się i innowacji w zakresie komunikacji natychmiastowej i platform mediów społecznościowych1. Jego zdolność do przekraczania granic czasowych i przestrzennych daje mu unikalne zalety, umożliwiając płynną komunikację na całym świecie w dowolnym momencie. Jednak ta powszechna adopcja doprowadziła do palącego i szkodliwego problemu – powszechnego rozprzestrzeniania się spamu. Złośliwi aktorzy wykorzystywali systemy poczty elektronicznej jako narzędzia do dystrybucji ogromnych ilości niezamówionych reklam komercyjnych, złośliwego oprogramowania i nielegalnych treści. Według badań, w latach 2012–2023 udział globalnego spamu w całkowitym ruchu e-mail gwałtownie wzrósł o 7700%2,3. Ten zalew spamu nie tylko poważnie zakłóca normalne operacje poczty elektronicznej użytkowników, ale także stanowi wielowymiarowe zagrożenia. Podważa prywatność osobistą poprzez potencjalne ujawnianie wrażliwych informacji, zagraża bezpieczeństwu korporacyjnemu poprzez ryzyko wycieków danych i infekcji złośliwym oprogramowaniem, a nawet destabilizuje porządek gospodarczy poprzez ułatwianie działalności oszukańczej 4,5. Skuteczna klasyfikacja spamu zmniejsza straty finansowe związane z phishingiem o 40-60%6, podkreślając praktyczną wartość efektywnych i precyzyjnych metod filtrowania. W związku z tym opracowanie efektywnego i dokładnego modelu wykrywania spamu stało się kluczowym obszarem badań dla zapewnienia bezpieczeństwa sieci i zwiększenia efektywności.
Znaczna część istniejących badań nad wykrywaniem spamu koncentruje się na metodach uczenia maszynowego i głębokiego uczenia. W dziedzinie tradycyjnego uczenia maszynowego badane i stosowane były różnorodne techniki. Metody oparte na regułach, takie jak drzewa decyzyjne7, zostały wykorzystane do podejmowania decyzji klasyfikacyjnych na podstawie wcześniej zdefiniowanych reguł pochodzących z cech danych. Metody wzmacniające8, 9, 10, które łączą wielu słabych uczniów w silny system, oraz teoria zbiorówprzybliżonych 11, która zajmuje się niepewnością i niedokładnością danych, również wykazały potencjał. Dodatkowo szeroko stosowane są metody statystyczne, takie jak regresja logistyczna, K-najbliższych sąsiadów (KNN)12,13, Naivnego Bayesa 14,15,16 oraz SVM 17,18,19. Te podejścia często opierają się na tradycyjnych metodach ekstrakcji cech, takich jak TF-IDF. Choć TF-IDF skutecznie określa znaczenie słów w dokumencie, ma trudności z uchwyceniem złożonych relacji semantycznych i niuansów kontekstowych wpisanych w tekstach e-mailowych. Co więcej, gdy spotykają się z danymi o wysokich wymiarach i rzadkości, co jest typowe dla przestrzeni funkcji e-mailowych, metody te często napotykają wąskie gardła obliczeniowe. Ich ograniczona odporność może prowadzić do utknięcia w lokalnych optymalnych rozwiązaniach podczas procesu treningowego, co poważnie ogranicza dokładność klasyfikacji i zdolność uogólniania modeli.
Deep learning, dzięki swojej niezwykłej zdolności do automatycznego wyodrębniania cech, stał się potężną alternatywą w wykrywaniu spamu. Algorytmy, takie jak sieci konwolucyjne neuronowe (CNN)20,21,22, sieci neuronowe rekurencyjne (RNN)23 oraz sieci pamięci krótkotrwałej (LSTM)24,25, a także nowsze modele oparte na Transformerach, takie jak Word2vec i26,27, poczyniły znaczące postępy w poprawie wyników klasyfikacji. CNN są biegłe w wydobywania lokalnych cech z danych, RNN i LSTM dobrze radzą sobie z danymi sekwencyjnymi, rejestrując zależności czasowe w tekście, a modele oparte na Transformerach doskonale sprawdzają się w eksploracji złożonych relacji semantycznych i informacji kontekstowych. Najnowsze efektywne metody NLP, takie jak klasyfikatory tekstu28 oparte na TinyML, oferują solidne punkty odniesienia do klasyfikacji spamu. Modele TinyML są zoptymalizowane pod urządzenia brzegowe z ograniczoną pamięcią. Porównujemy naszą metodę z tymi podejściami w sekcji Rezultaty, podkreślając kompromisy między dokładnością, efektywnością obliczeniową a elastycznością wdrożenia. Jednak te modele głębokiego uczenia mają swoje własne ograniczenia. Zazwyczaj wymagają one dużej liczby parametrów treningowych, co skutkuje wysokim zapotrzebowaniem na zasoby obliczeniowe i wydłużonym czasem treningu. Modele głębokiego uczenia, takie jak, wymagają 3-5 razy więcej pamięci i 10 razy dłuższego czasu treningu niż tradycyjne SVM29, co czyni je mniej odpowiednimi w środowiskach o ograniczonych zasobach. To sprawia, że są mniej praktyczne do wdrażania w środowiskach o ograniczonych zasobach, takich jak urządzenia mobilne czy serwery o niższej półce. Co więcej, ich złożone architektury często sprawiają, że są mniej interpretowalne, co może być istotną wadą w zastosowaniach, gdzie zrozumienie procesu decyzyjnego modelu jest kluczowe.
Na tym tle nadrzędnym celem tego badania jest opracowanie innowacyjnego podejścia, które pokona ograniczenia istniejących metod i skutecznie sprosta wyzwaniom wynikającym z wysokowymiarowego i rzadkiego charakteru danych spamowych. Proponowany Van der Waerden Rank Score Feature Feature-Enhanced SVM (VWR-Attn-SVM) stanowi nowatorską integrację technik mających na celu zwiększenie wydajności wykrywania spamu (Rysunek 1). Podstawowa zasada stojąca za systemem VWR-Attn-SVM tkwi w unikalnym projektowaniu, które łączy zalety wielu komponentów.

Rysunek 1: Ogólny schemat badań nad klasyfikacją spamu z użyciem VWR-Attn-SVM. Ten schemat blokowy ilustruje proces klasyfikacji spamu na podstawie wyniku rangi Van der Waerdena oraz oferuje zwiększone uwagi SVM, obejmujące przygotowanie danych (ładowanie, rozdzielanie, wstępne przetwarzanie), przygotowanie eksperymentalne, weryfikację korelacji statystycznych TF-IDF z etykietami cech, wykrywanie spamu z uwzględnieniem uwagi SVM oraz porównanie wieloklasyfikatorów. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Podstawowy mechanizm Enhanced Feature Attention przetwarza pojedyncze próbki e-maili z określoną wymiarowością. Stosując transformację rang Van der Waerdena, normalizuje cechy tekstu e-maila zniekształcone przez nieprawidłowe częstotliwości słów do standardowej formy podobnej do rozkładu normalnego. Ta transformacja znacząco zwiększa odporność modelu, umożliwiając mu lepsze radzenie sobie z zmiennością danych e-mail. Oceny rangi van der Waerdena były preferowane nad skalowaniem logaritmicznym i transformacjami kwantylowymi z trzech powodów: (1) Odporność na spamowanie funkcji odstawionych (np. ekstremalne częstotliwości słów), w przeciwieństwie do skalowania logarytmicznego, które wzmacnia szum niskich częstotliwości; (2) Zachowanie relacji porządkowych cech (kluczowe dla hierarchii wskaźników spamu, takich jak "free" vs. "win"), podczas gdy transformacje kwantowe spłaszczają rozkłady; (3) Normalizacja do [0,1], ułatwiając integrację mechanizmów uwagi i zapewniając spójne ważenie (Rysunek 2).

Rysunek 2: Eksperymentalny diagram blokowy. (A-C) Przepływy pracy do klasyfikacji spamu, obejmujące obsługę danych, wybór cech, trening modelu, ocenę oraz porównanie z transformacją wyniku rangi Van der Waerden lub bez niej. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Strukturalnie mechanizm posiada dwuwarstwową w pełni połączoną sieć do nieliniowej transformacji cech (Rysunek 2). Pierwsza warstwa, wyposażona w funkcję aktywacji LeakyReLU, zmniejsza wymiary wejściowe, wprowadzając nieliniowość i wprowadza warstwę Dropout w celu ograniczenia nadmiernego dopasowania. Druga warstwa, wykorzystując funkcję Sigmoidalną, generuje wagi uwagi, które pozwalają precyzyjnie określić znaczenie każdej cechy. Strategia regularizacji L1/L2 jest zintegrowana z modelem, aby zoptymalizować wybór cech, gdzie regularizacja L1 promuje rzadkość, skutecznie eliminując mniej istotne cechy, a regularizacja L2 zapobiega nadmiernemu dopasowaniu poprzez ograniczenie wielkości wag. W fazie treningowej stosuje się wielozadaniowe ramy uczenia, łączące utratę funkcji rekonstrukcji i utratę klasyfikacji w celu optymalizacji parametrów modelu. Pozwala to VWR-Attn-SVM precyzyjnie dostosować się do wysokowymiarowych, rzadkich cech TF-IDF tekstów e-maili, które są charakterystyczne dla złożonego charakteru treści e-maili.
Nasza metoda jest zoptymalizowana dla tekstowych zbiorów danych spamowych liczących od kilku tysięcy do dziesięciu tysięcy (np. Spambase, Indonesian Spam dataset (Supplemental File 1)) i wymaga standardowych zasobów obliczeniowych (procesor Intel Core i7, 16 GB RAM) do treningu; wnioskowanie może być uruchamiane na standardowym laptopie (Intel Core i5, 8 GB RAM) z opóźnieniem poniżej sekundy. Kluczowe ograniczenia obejmują ograniczoną wydajność w przypadku spamu niebędącego tekstem (np. spam osadzony w obrazach) oraz poleganie na strukturyzowanych funkcjach tekstu. W porównaniu z istniejącymi technologiami alternatywnymi, VWR-Attn-SVM ma kilka niezwykłych zalet. W przeciwieństwie do tradycyjnych metod uczenia maszynowego, nie opiera się wyłącznie na podstawowej ekstrakcji cech, lecz aktywnie uczy się ważyć cechy według ich znaczenia dzięki mechanizmowi rozszerzonej uwagi, aby lepiej uchwycić cechy bardziej istotne dla klasyfikacji spamu. W przeciwieństwie do modeli uczenia głębokiego, osiąga korzystną równowagę między wydajnością a efektywnością obliczeniową. Wymaga mniej zasobów obliczeniowych i krótszego czasu treningu, co czyni go bardziej odpowiednim dla szerokiego zakresu zastosowań, zwłaszcza tych o ograniczonych zasobach. To innowacyjne podejście ma zastosowanie nie tylko do konkretnego wykrywania spamu w systemach poczty, ale także ma potencjał do rozszerzenia na inne kanały komunikacji tekstowej, takie jak aplikacje do komunikacji, platformy społecznościowe czy usługi SMS, gdzie występują podobne problemy z rozpowszechnianiem niechcianych i złośliwych treści. Ogólnie rzecz biorąc, VWR-Attn-SVM stanowi znaczący postęp w dziedzinie wykrywania spamu, oferując bardziej praktyczne, efektywne i wszechstronne rozwiązanie do zwalczania uporczywego problemu spamu w cyfrowym krajobrazie komunikacyjnym.