需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于Van der Waerden秩得分注意力机制的支持向量机垃圾信息分类

500 次观看

DOI:

10.3791/69082

2025年10月31日

* These authors contributed equally

本文内容

摘要

本研究提出了一种基于支持向量机的创新方法,该方法结合了经范德瓦尔登秩得分增强的特征注意力机制,旨在应对高维稀疏垃圾信息数据带来的挑战,并提升垃圾信息检测的分类性能。

摘要

随着电子邮件的广泛使用,垃圾邮件已成为一个严峻的挑战,威胁着网络安全并降低通信效率。传统的检测方法存在持续性的局限:传统机器学习模型通常难以处理高维稀疏数据,而深度学习则需要大量的计算资源。

本研究提出了一种基于范德瓦尔登秩得分特征注意力增强的支持向量机(VWR-Attn-SVM)方法,以解决上述问题。该方法采用范德瓦尔登秩变换对文本特征进行归一化处理,提高了对异常值的鲁棒性,并保留了特征的序数关系。通过引入增强的注意力机制,结合正则化的非线性处理进一步优化特征选择,突出对垃圾信息检测最为相关的特征。

在UCI Spambase和印度尼西亚垃圾邮件数据集上的实验表明,VWR-Attn-SVM在准确率、精确率、召回率、F1分数和AUC方面均优于传统分类器。该方法在实现高性能的同时降低了计算成本,为垃圾邮件分类提供了高效且可解释的解决方案,并有望扩展至其他基于文本的平台,如即时通讯和社交媒体。

引言

在当今数字时代,互联网和数字技术迅速发展,尽管即时通讯和社交媒体平台不断涌现和创新,电子邮件在电子交易和企业通信领域仍保持着不可或缺的核心地位1。其跨越时空限制的能力赋予了电子邮件独特的优势,使得全球范围内的通信可在任何时间无缝进行。然而,这种广泛使用也引发了一个紧迫且有害的问题——垃圾邮件的泛滥。恶意行为者利用电子邮件系统作为传播渠道,大量发送未经请求的商业广告、恶意软件和非法内容。研究表明,从2012年到2023年,全球垃圾邮件在总电子邮件流量中的比例飙升了7700%2,3。垃圾邮件的泛滥不仅严重干扰用户的正常邮件使用,还带来多方面的威胁:它可能泄露敏感信息,侵犯个人隐私;通过数据泄露和恶意软件感染危及企业安全;甚至通过助长欺诈活动破坏经济秩序4,5。有效的垃圾邮件分类可使与网络钓鱼相关的经济损失减少40%至60%6,凸显了高效、准确过滤方法的实际价值。因此,开发高效且准确的垃圾邮件检测模型已成为保障网络安全、提升通信效率的关键研究方向。

大量现有的垃圾信息检测研究集中于机器学习和深度学习方法。在传统机器学习领域,已探索并应用了多种多样的技术。基....

访问受限。请登录或开始试用以查看此内容。

方案

1. 实验准备(补充文件2和补充文件3)

  1. 数据描述:从 UCI 机器学习仓库加载用于垃圾邮件检测的开源垃圾邮件数据集30。记录该数据集包含 4,601 个实例,具有 57 个连续特征和 1 个类别标签,其中包括 1,813 个垃圾邮件样本(39.4%)和 2,788 个非垃圾邮件样本(60.6%)(表 1)。
  2. 导入库
    1. 导入必要的库(参见材料表)。
    2. 全局随机种子设置为42,以确保结果的可重复性。
  3. 配置绘图设置:英文文本使用Times New Roman 字体,解决负号显示问题,并将字体大小设置为16,以提高可读性。

表1:数据集统计信息和特征定义汇总。 本表列出了用于垃圾邮件分类的变量,包括词频(word_freq_WORD)、字符频率(char_freq_CHAR)、大写字符连续长度指标以及目标类别变量,并对每种变量类型及其含义进行了描述。

访问受限。请登录或开始试用以查看此内容。

结果

首先,根据既定的实验方案,图1 概述了本研究的整体流程图。图2 依次展示了实验2的操作流程图。此外,表1 主要列出了垃圾邮件数据集 spam.csv 中的词频和字符频率。

在模型性能评估方面,采用了五个关键指标:准确率、精确率、召回率、F1分数以及受试者工作特征曲线下面积(AUC)。表2定义了真正例(TP)、假正例(FP)、真反例(TN)和假反例(FN)的概念。F1分数是精确率和召回率的调和平均数,用于平衡分类性能中的这两个关键方面。受试者工作特征(ROC)曲线以假阳性率(FPR)为横轴、真阳性率(TPR)为纵轴,能够全面可视化不同决策阈值下的分类性能。因此,AUC即ROC曲线下面积,成为评估二分类器有效性的关键指标。

表2:分类性能评估指标。 本表定义了用于分类的评估指标:准确率、精确率、召回率、F1分数(.......

访问受限。请登录或开始试用以查看此内容。

讨论

本研究基于Spambase数据集验证了VWR-Attn-SVM的有效性,为应对垃圾邮件数据的高维稀疏特性提供了新思路。实验表明,垃圾邮件数据中仅有少数特征与标签具有强相关性;传统模型对所有特征一视同仁,导致性能不佳,而该模型的注意力机制能够动态加权关键特征。在引入Van der Waerden(VWR)秩变换后,模型实现了更快的损失收敛速度、更强的泛化能力、更均衡的特征权重,并捕获了更多的特征交互信息。在测试集上表现出优异的分类指标,优于传统方法,同时节省了资源。其创新之处在于解决了传统机器学习与深度学习的固有问题,为文本分类提供了新范式,并适用于资源受限场景,且具有良好的可解释性。

实验操作中的关键步骤
本研究实验操作中的若干关键步骤显著影响了垃圾邮件分类的结果。在数据准备阶段,从 UCI 机器学习库中选取 Spam-base 数据集,该数据集包含 4,601 个样本、57 个连续特征以及一个二分类标签,为实验奠定了坚实基础。验证 TF-IDF 特征与标签之间统计关联性的过程至关重要。通过使用卡方检验进行特征筛选,并利用热图可视化相关.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

感谢福建省数学联盟(项目编号:2023SXLMMS10)和福建省自然科学基金(项目编号:2023J05083、2022J011396、2023J011434)对本工作的资助。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
补充文件 2:code_new.py;补充文件 3:code_indonesian.py。
numpyNumPy Developers用于 Python 的数值计算库
pandaspandas Development Team用于数据操作与分析的库
matplotlibMatplotlib Developers 用于创建静态、动画及交互式可视化的库
seabornMichael Waskom 等基于 matplotlib 的统计数据分析可视化库
scikit-learnscikit-learn Developers Team包含多种分类、回归和聚类算法的机器学习库
tensorflowGoogle开源机器学习框架,包含用于构建神经网络的 Keras API
imblearnimbalanced-learn Developers用于处理不平衡数据集的库,包括用于过采样的 SMOTE
warningsPython 标准库用于发出警告消息的模块
补充文件 4:code_compute_time.py
numpyNumPy Developers用于 Python 的数值计算库
pandaspandas Development Team用于数据操作与分析的库
matplotlibMatplotlib Developers用于创建图表和图形的可视化库
seabornMichael Waskom 等基于 matplotlib 构建的统计数据分析可视化库
scikit-learnscikit-learn Developers Team包含分类、回归和数据预处理工具的机器学习库
tensorflowGoogle开源机器学习框架,配备用于神经网络的 Keras API
imblearnimbalanced-learn Developers Team用于处理不平衡数据集的库(包含 SMOTE)
warningsPython 标准库用于发出警告消息的模块
timePython 标准库用于时间相关功能的模块
psutilGiampaolo Rodola用于获取系统信息和监控资源使用情况的库
osPython 标准库用于与操作系统交互的模块
补充文件 5:DNN.py。
pandaspandas Development Team用于数据操作与分析的库
numpyNumPy Developers用于 Python 的数值计算库
timePython 标准库用于时间相关功能的模块
psutilGiampaolo Rodola用于系统信息获取和资源监控的库
matplotlibMatplotlib Developers用于创建图表和图形的可视化库
scikit-learnscikit-learn Developers Team包含数据预处理、模型选择和评估指标工具的机器学习库
imblearnimbalanced-learn Developers Team用于处理不平衡数据集的库(包含 SMOTE)
tensorflowGoogle开源机器学习框架,配备用于构建神经网络的 Keras API

参考文献

  1. Ayo, F. E., Ogundele, L. A., Olakunle, S., Awotunde, J. B., Kasali, F. A. A hybrid correlation-based deep learning model for email spam classification using fuzzy inference system. Decis Anal J. 10, 100390(2024).
  2. Douzi, S., AlShahwan, F. A., Lemoudden, M., Ouahidi, B.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签