本研究提出了一种基于支持向量机的创新方法,该方法结合了经范德瓦尔登秩得分增强的特征注意力机制,旨在应对高维稀疏垃圾信息数据带来的挑战,并提升垃圾信息检测的分类性能。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
方法文章
* These authors contributed equally
本研究提出了一种基于支持向量机的创新方法,该方法结合了经范德瓦尔登秩得分增强的特征注意力机制,旨在应对高维稀疏垃圾信息数据带来的挑战,并提升垃圾信息检测的分类性能。
随着电子邮件的广泛使用,垃圾邮件已成为一个严峻的挑战,威胁着网络安全并降低通信效率。传统的检测方法存在持续性的局限:传统机器学习模型通常难以处理高维稀疏数据,而深度学习则需要大量的计算资源。
本研究提出了一种基于范德瓦尔登秩得分特征注意力增强的支持向量机(VWR-Attn-SVM)方法,以解决上述问题。该方法采用范德瓦尔登秩变换对文本特征进行归一化处理,提高了对异常值的鲁棒性,并保留了特征的序数关系。通过引入增强的注意力机制,结合正则化的非线性处理进一步优化特征选择,突出对垃圾信息检测最为相关的特征。
在UCI Spambase和印度尼西亚垃圾邮件数据集上的实验表明,VWR-Attn-SVM在准确率、精确率、召回率、F1分数和AUC方面均优于传统分类器。该方法在实现高性能的同时降低了计算成本,为垃圾邮件分类提供了高效且可解释的解决方案,并有望扩展至其他基于文本的平台,如即时通讯和社交媒体。
在当今数字时代,互联网和数字技术迅速发展,尽管即时通讯和社交媒体平台不断涌现和创新,电子邮件在电子交易和企业通信领域仍保持着不可或缺的核心地位1。其跨越时空限制的能力赋予了电子邮件独特的优势,使得全球范围内的通信可在任何时间无缝进行。然而,这种广泛使用也引发了一个紧迫且有害的问题——垃圾邮件的泛滥。恶意行为者利用电子邮件系统作为传播渠道,大量发送未经请求的商业广告、恶意软件和非法内容。研究表明,从2012年到2023年,全球垃圾邮件在总电子邮件流量中的比例飙升了7700%2,3。垃圾邮件的泛滥不仅严重干扰用户的正常邮件使用,还带来多方面的威胁:它可能泄露敏感信息,侵犯个人隐私;通过数据泄露和恶意软件感染危及企业安全;甚至通过助长欺诈活动破坏经济秩序4,5。有效的垃圾邮件分类可使与网络钓鱼相关的经济损失减少40%至60%6,凸显了高效、准确过滤方法的实际价值。因此,开发高效且准确的垃圾邮件检测模型已成为保障网络安全、提升通信效率的关键研究方向。
大量现有的垃圾信息检测研究集中于机器学习和深度学习方法。在传统机器学习领域,已探索并应用了多种多样的技术。基....
访问受限。请登录或开始试用以查看此内容。
1. 实验准备(补充文件2和补充文件3)
表1:数据集统计信息和特征定义汇总。 本表列出了用于垃圾邮件分类的变量,包括词频(word_freq_WORD)、字符频率(char_freq_CHAR)、大写字符连续长度指标以及目标类别变量,并对每种变量类型及其含义进行了描述。
访问受限。请登录或开始试用以查看此内容。
首先,根据既定的实验方案,图1 概述了本研究的整体流程图。图2 依次展示了实验2的操作流程图。此外,表1 主要列出了垃圾邮件数据集 spam.csv 中的词频和字符频率。
在模型性能评估方面,采用了五个关键指标:准确率、精确率、召回率、F1分数以及受试者工作特征曲线下面积(AUC)。表2定义了真正例(TP)、假正例(FP)、真反例(TN)和假反例(FN)的概念。F1分数是精确率和召回率的调和平均数,用于平衡分类性能中的这两个关键方面。受试者工作特征(ROC)曲线以假阳性率(FPR)为横轴、真阳性率(TPR)为纵轴,能够全面可视化不同决策阈值下的分类性能。因此,AUC即ROC曲线下面积,成为评估二分类器有效性的关键指标。
表2:分类性能评估指标。 本表定义了用于分类的评估指标:准确率、精确率、召回率、F1分数(.......
访问受限。请登录或开始试用以查看此内容。
本研究基于Spambase数据集验证了VWR-Attn-SVM的有效性,为应对垃圾邮件数据的高维稀疏特性提供了新思路。实验表明,垃圾邮件数据中仅有少数特征与标签具有强相关性;传统模型对所有特征一视同仁,导致性能不佳,而该模型的注意力机制能够动态加权关键特征。在引入Van der Waerden(VWR)秩变换后,模型实现了更快的损失收敛速度、更强的泛化能力、更均衡的特征权重,并捕获了更多的特征交互信息。在测试集上表现出优异的分类指标,优于传统方法,同时节省了资源。其创新之处在于解决了传统机器学习与深度学习的固有问题,为文本分类提供了新范式,并适用于资源受限场景,且具有良好的可解释性。
实验操作中的关键步骤
本研究实验操作中的若干关键步骤显著影响了垃圾邮件分类的结果。在数据准备阶段,从 UCI 机器学习库中选取 Spam-base 数据集,该数据集包含 4,601 个样本、57 个连续特征以及一个二分类标签,为实验奠定了坚实基础。验证 TF-IDF 特征与标签之间统计关联性的过程至关重要。通过使用卡方检验进行特征筛选,并利用热图可视化相关.......
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
感谢福建省数学联盟(项目编号:2023SXLMMS10)和福建省自然科学基金(项目编号:2023J05083、2022J011396、2023J011434)对本工作的资助。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 补充文件 2:code_new.py;补充文件 3:code_indonesian.py。 | |||
| numpy | NumPy Developers | 用于 Python 的数值计算库 | |
| pandas | pandas Development Team | 用于数据操作与分析的库 | |
| matplotlib | Matplotlib Developers | 用于创建静态、动画及交互式可视化的库 | |
| seaborn | Michael Waskom 等 | 基于 matplotlib 的统计数据分析可视化库 | |
| scikit-learn | scikit-learn Developers Team | 包含多种分类、回归和聚类算法的机器学习库 | |
| tensorflow | 开源机器学习框架,包含用于构建神经网络的 Keras API | ||
| imblearn | imbalanced-learn Developers | 用于处理不平衡数据集的库,包括用于过采样的 SMOTE | |
| warnings | Python 标准库 | 用于发出警告消息的模块 | |
| 补充文件 4:code_compute_time.py | |||
| numpy | NumPy Developers | 用于 Python 的数值计算库 | |
| pandas | pandas Development Team | 用于数据操作与分析的库 | |
| matplotlib | Matplotlib Developers | 用于创建图表和图形的可视化库 | |
| seaborn | Michael Waskom 等 | 基于 matplotlib 构建的统计数据分析可视化库 | |
| scikit-learn | scikit-learn Developers Team | 包含分类、回归和数据预处理工具的机器学习库 | |
| tensorflow | 开源机器学习框架,配备用于神经网络的 Keras API | ||
| imblearn | imbalanced-learn Developers Team | 用于处理不平衡数据集的库(包含 SMOTE) | |
| warnings | Python 标准库 | 用于发出警告消息的模块 | |
| time | Python 标准库 | 用于时间相关功能的模块 | |
| psutil | Giampaolo Rodola | 用于获取系统信息和监控资源使用情况的库 | |
| os | Python 标准库 | 用于与操作系统交互的模块 | |
| 补充文件 5:DNN.py。 | |||
| pandas | pandas Development Team | 用于数据操作与分析的库 | |
| numpy | NumPy Developers | 用于 Python 的数值计算库 | |
| time | Python 标准库 | 用于时间相关功能的模块 | |
| psutil | Giampaolo Rodola | 用于系统信息获取和资源监控的库 | |
| matplotlib | Matplotlib Developers | 用于创建图表和图形的可视化库 | |
| scikit-learn | scikit-learn Developers Team | 包含数据预处理、模型选择和评估指标工具的机器学习库 | |
| imblearn | imbalanced-learn Developers Team | 用于处理不平衡数据集的库(包含 SMOTE) | |
| tensorflow | 开源机器学习框架,配备用于构建神经网络的 Keras API |
访问受限。请登录或开始试用以查看此内容。