$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
İnternetin ve dijital teknolojilerin hızlı gelişimi ile karakterize edilen çağdaş dijital çağda, anlık mesajlaşma ve sosyal medya platformlarının sürekli ortaya çıkmasına ve yeniliğine rağmen, e-posta elektronik işlemler ve kurumsal iletişim alanlarında vazgeçilmez bir temel taşı olmaya devam etmiştir1. Zamansal ve mekansal sınırları aşma yeteneği, ona benzersiz avantajlar kazandırıyor ve dünya çapında her an kesintisiz iletişime olanak tanıyor. Ancak bu kapsamlı benimseme, acil ve zararlı bir soruna, yani spam'in yaygın yayılmasına yol açtı. Kötü niyetli aktörler, büyük miktarlarda istenmeyen ticari reklamlar, kötü amaçlı yazılımlar ve yasa dışı içerik dağıtmak için e-posta sistemlerini araç olarak kullandılar. Araştırmaya göre, 2012'den 2023'e kadar küresel spam'in toplam e-posta trafiği içindeki oranı %7700 oranında arttı2,3. Bu spam akışı, yalnızca kullanıcıların normal e-posta işlemlerini ciddi şekilde kesintiye uğratmakla kalmıyor, aynı zamanda çok yönlü tehditler de oluşturuyor. Potansiyel olarak hassas bilgileri açığa çıkararak kişisel gizliliği baltalar, veri ihlalleri ve kötü amaçlı yazılım bulaşma riski yoluyla kurumsal güvenliği tehlikeye atar ve hatta dolandırıcılık faaliyetlerini kolaylaştırarak ekonomik düzeni istikrarsızlaştırır 4,5. Etkili spam sınıflandırması, kimlik avıyla ilgili mali kayıpları @-60 oranında azaltır6, etkili, doğru filtreleme yöntemlerinin pratik değerini vurgulayarak. Sonuç olarak, verimli ve doğru bir spam tespit modeli geliştirmek, ağ güvenliğini sağlamak ve verimliliği artırmak için çok önemli bir araştırma alanı olarak ortaya çıkmıştır.
Spam tespitine ilişkin mevcut araştırmaların önemli bir kısmı, makine öğrenimi ve derin öğrenme metodolojilerine odaklanmıştır. Geleneksel makine öğrenimi alanında çok çeşitli teknikler araştırılmış ve uygulanmıştır. Karar ağaçları7 gibi kural tabanlı yöntemler, veri özelliklerinden türetilen önceden tanımlanmış kurallara dayalı olarak sınıflandırma kararları vermek için kullanılmıştır. Birden fazla zayıf öğreniciyi güçlü bir öğrenicide toplayan güçlendirme yöntemleri 8,9,10 ve verilerdeki belirsizlik ve belirsizlikle ilgilenen kaba küme teorisi11 de potansiyel göstermiştir. Ek olarak, lojistik regresyon, K-en yakın komşular (KNN) 12,13, Naive Bayes 14,15,16 ve SVM 17,18,19 gibi istatistiksel yöntemler yaygın olarak kullanılmaktadır. Bu yaklaşımlar genellikle TF-IDF gibi geleneksel özellik çıkarma yöntemlerine dayanır. TF-IDF, bir belgedeki kelimelerin önemini ölçmede etkili olsa da, e-posta metinlerinin doğasında bulunan karmaşık anlamsal ilişkileri ve bağlamsal nüansları yakalamakta zorlanır. Üstelik, e-posta özellik alanlarında tipik olan yüksek boyutlu ve seyrek verilerle karşılaşıldığında, bu yöntemler sıklıkla hesaplama darboğazlarıyla karşılaşır. Sınırlı sağlamlıkları, eğitim süreci sırasında yerel optimal çözümlere takılıp kalmaya yol açabilir ve böylece modellerin sınıflandırma doğruluğunu ve genelleme yeteneğini ciddi şekilde kısıtlayabilir.
Derin öğrenme, otomatik özellik çıkarma konusundaki olağanüstü kapasitesiyle spam tespitinde güçlü bir alternatif olarak ortaya çıktı. Evrişimli Sinir Ağları (CNN) 20,21,22, Tekrarlayan Sinir Ağları (RNN) 23 ve Uzun Kısa Süreli Bellek ağları (LSTM) 24,25 gibi algoritmaların yanı sıra Word2vec ve BERT26,27 gibi daha yeni Transformer tabanlı modeller, sınıflandırma performansını iyileştirmede önemli adımlar atmıştır. CNN'ler verilerden yerel özellikleri çıkarma konusunda ustadır, RNN'ler ve LSTM'ler sıralı verileri iyi işleyebilir, metindeki zamansal bağımlılıkları yakalayabilir ve Transformer tabanlı modeller karmaşık anlamsal ilişkiler ve bağlam bilgileri madenciliğinde mükemmeldir. TinyML tabanlı metin sınıflandırıcıları28 gibi son zamanlardaki verimli NLP yöntemleri, spam sınıflandırması için güçlü temeller sunar. TinyML modelleri, sınırlı belleğe sahip uç cihazlar için optimize edilmiştir. Yöntemimizi Sonuçlar bölümünde bu yaklaşımlarla karşılaştırarak doğruluk, hesaplama verimliliği ve dağıtım esnekliği arasındaki dengeleri vurguluyoruz. Ancak, bu derin öğrenme modelleri kendi sınırlamalarıyla birlikte gelir. Genellikle çok sayıda eğitim parametresi gerektirirler, bu da yüksek hesaplama kaynağı taleplerine ve uzun eğitim sürelerine neden olur. BERT gibi derin öğrenme modelleri, geleneksel SVM'lere göre 3-5 kat daha fazla bellek ve 10 kat daha uzun eğitim süreleri gerektirir29, bu da onları kaynakların kısıtlı olduğu ortamlar için daha az uygun hale getirir. Bu, onları mobil cihazlar veya düşük kaliteli sunucular gibi kaynakların kısıtlı olduğu ortamlarda dağıtım için daha az pratik hale getirir. Ayrıca, karmaşık mimarileri genellikle onları daha az yorumlanabilir hale getirir, bu da modelin karar verme sürecini anlamanın önemli olduğu uygulamalarda önemli bir dezavantaj olabilir.
Bu çerçevede, bu çalışmanın genel amacı, mevcut yöntemlerin sınırlamalarının üstesinden gelebilecek ve spam verilerinin yüksek boyutlu ve seyrek doğasının yarattığı zorlukları etkili bir şekilde ele alabilecek yenilikçi bir yaklaşım geliştirmektir. Önerilen Van der Waerden Sıralama Puanı Özelliği Dikkat Geliştirilmiş SVM (VWR-Attn-SVM), spam tespit performansını artırmayı amaçlayan tekniklerin yeni bir entegrasyonunu temsil etmektedir (Şekil 1). VWR-Attn-SVM'nin arkasındaki temel prensip, birden fazla bileşenin güçlü yönlerini birleştiren benzersiz tasarımında yatmaktadır.

Şekil 1: VWR-Attn-SVM ile spam sınıflandırmasına ilişkin araştırmanın genel akış şeması. Bu akış şeması, veri hazırlama (yükleme, bölme, ön işleme), deneysel hazırlık, TF-IDF özellik etiketi istatistiksel korelasyonlarının doğrulanması, dikkat artırılmış SVM tabanlı spam tespiti ve çoklu sınıflandırıcı karşılaştırmasını kapsayan, Van der Waerden sıralama puanına ve özellik geliştirilmiş SVM'ye dayalı spam sınıflandırmasının iş akışını göstermektedir. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Temel Gelişmiş Özellik Dikkat Mekanizması, bireysel e-posta örneklerini belirli bir boyutlulukla işler. Van der Waerden sıralama dönüşümünü uygulayarak, anormal kelime frekansları tarafından bozulan e-posta metni özelliklerini standart normal dağılım benzeri bir forma normalleştirir. Bu dönüşüm, modelin sağlamlığını önemli ölçüde artırarak e-posta verilerinin değişkenliğini daha iyi ele almasını sağlar. Van der Waerden sıralama puanları, üç nedenden dolayı log ölçeklendirme ve nicelik dönüşümlere göre tercih edildi: (1) Düşük frekanslı gürültüyü artıran log ölçeklendirmenin aksine, özellik aykırı değerlerini (örneğin, aşırı kelime frekansları) spam'e karşı dayanıklı; (2) Özellik sıralı ilişkilerini koruyun ("ücretsiz" ve "kazan" gibi spam göstergesi hiyerarşisi için kritik), oysa nicelik dönüşümleri dağılımları düzleştirir; (3) [0,1]'e normalleştirin, dikkat mekanizması entegrasyonunu kolaylaştırın ve tutarlı ağırlıklandırma sağlayın (Şekil 2).

Şekil 2: Deneysel Akış Şeması. (A-C) Veri işleme, özellik seçimi, model eğitimi, değerlendirme ve Van der Waerden sıralama puanı dönüşümü ile/olmadan karşılaştırmayı kapsayan spam sınıflandırması için iş akışları. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Yapısal olarak mekanizma, doğrusal olmayan özellik dönüşümü için iki katmanlı, tamamen bağlı bir ağa sahiptir (Şekil 2). LeakyReLU aktivasyon fonksiyonuyla donatılmış ilk katman, doğrusal olmama özelliğini getirirken giriş boyutlarını azaltır ve aşırı uyumu azaltmak için bir Bırakma katmanı içerir. Sigmoid işlevini kullanan ikinci katman, her özelliğin önemini tam olarak ölçebilen dikkat ağırlıkları verir. L1 düzenlemesinin seyrekliği teşvik ettiği, daha az alakalı özellikleri etkili bir şekilde taradığı ve L2 düzenlemesinin ağırlıkların büyüklüğünü kısıtlayarak aşırı uyumu önlediği özellik seçimini optimize etmek için modele bir L1/L2 düzenleme stratejisi entegre edilmiştir. Eğitim aşamasında, model parametrelerini optimize etmek için özellik yeniden yapılandırma kaybını ve sınıflandırma kaybını birleştiren çok görevli bir öğrenme çerçevesi benimsenir. Bu, VWR-Attn-SVM'nin, e-posta içeriğinin karmaşık doğasının özelliği olan e-posta metinlerinin yüksek boyutlu, seyrek TF-IDF özelliklerine tam olarak uyum sağlamasına olanak tanır.
Yöntemimiz, birkaç bin ila on bin arasında değişen metin tabanlı spam veri kümeleri için optimize edilmiştir (örneğin, Spambase, Endonezya Spam veri kümesi (Ek Dosya 1)) ve eğitim için standart hesaplama kaynakları (Intel Core i7 işlemci, 16 GB RAM) gerektirir; çıkarım, standart bir dizüstü bilgisayarda (Intel Core i5, 8 GB RAM) saniyenin altında gecikme süresiyle çalıştırılabilir. Temel kısıtlamalar arasında metin dışı spam'de (örneğin, resim gömülü spam) sınırlı performans ve yapılandırılmış metin özelliklerine bağımlılık yer alır. Mevcut alternatif teknolojilerle karşılaştırıldığında, VWR-Attn-SVM'nin birçok dikkate değer avantajı vardır. Geleneksel makine öğrenimi yöntemlerinden farklı olarak, yalnızca temel özellik çıkarımına dayanmaz, aynı zamanda spam sınıflandırmasıyla daha alakalı özellikleri daha iyi yakalamak için gelişmiş dikkat mekanizması aracılığıyla özellikleri önemlerine göre ağırlıklandırmayı aktif olarak öğrenir. Derin öğrenme modellerinin aksine, performans ve hesaplama verimliliği arasında olumlu bir denge sağlar. Daha az hesaplama kaynağı ve daha kısa eğitim süreleri gerektirir, bu da onu özellikle sınırlı kaynaklara sahip olanlar olmak üzere çok çeşitli uygulamalar için daha uygun hale getirir. Bu yenilikçi yaklaşım, yalnızca e-posta sistemlerindeki spam tespiti gibi belirli bir görev için geçerli olmakla kalmaz, aynı zamanda istenmeyen ve kötü amaçlı içerik yayılımına ilişkin benzer sorunların mevcut olduğu anlık mesajlaşma uygulamaları, sosyal medya platformları ve SMS hizmetleri gibi diğer metin tabanlı iletişim kanallarına da yayılma potansiyeline sahiptir. Genel olarak VWR-Attn-SVM, spam tespiti alanında önemli bir ilerlemeyi temsil ediyor ve dijital iletişim ortamındaki kalıcı spam sorunuyla mücadele etmek için daha pratik, verimli ve çok yönlü bir çözüm sunuyor.