本研究提出了一个轻量级图神经网络,结合元提炼和元学习,以改进英语文本分类。在低数据和跨域环境中增强泛化性,同时降低计算成本并保持高性能。
研究文章
本研究提出了一个轻量级图神经网络,结合元提炼和元学习,以改进英语文本分类。在低数据和跨域环境中增强泛化性,同时降低计算成本并保持高性能。
全球化和信息技术的发展推动了英语文本数据的激增,亟需高效的分类。为了提升英语文本分类在小样本和跨域场景中的泛化能力并实现轻量级模型,本研究结合复杂系统理论与深度学习,构建了一个完全涵盖文本样本分布特性的图神经网络模型。采用两级元提炼方法,结合元学习策略,动态调整教师模型参数,优化整个知识转移过程。实验结果表明,所提模型在少数样本和跨域文本分类任务中的分类性能显著优于传统图神经网络及其他主流比较模型。在轻量化方面,由两阶段元蒸馏机制生成的SM在多主题文本分类数据集上保持极高的性能保留率,同时显著缩短计算时间。此外,该方法在长文本处理场景下能保持高效率和稳定的分类性能,并且相比传统蒸馏方法及文献中报道的其他方法在计算效率上具有明显优势。该方法有效提升了英语文本在低样本和跨域应用场景下的分类性能,同时显著降低计算成本,从而为资源受限环境下的英语文本分类提供了可行且高效的技术解决方案。
全球化的加速和信息技术的进步,使得英语文本数据在社交媒体、学术研究和商业传播等领域实现了爆炸式增长。高效地分类这些文本以实现信息检索、情感分析、内容管理及其他功能,已成为自然语言处理中的重要任务。英语文本分类(ETC)的目标是根据文本的语义内容将文本分类到预先定义的类别中。然而,自然语言的复杂性,包括其歧义、上下文依赖性和表达多样性,给文本分类任务带来了诸多挑战。目前,深度学习(DL)技术的发展为文本分类创造了新机遇。由Transformers的双向编码器表示(BERT)及其变体表示的预训练语言模型,可以通过对大规模语料库的预训练学习丰富的语义信息,显著提升文本分类3的性能。然而,当前的ETC方法仍面临两个关键局限:首先,它们常常强调单一模型或特征的优化,忽视了语言作为复杂系统的内在属性,如其动态性和涌现行为,导致在低数据或跨域场景下的推广不足;其次,尽管预训练模型性能强大,但其高计算成本和庞大的参数数量严重阻碍了在资源有限环境中的实际部署 4,5。为解决这些问题,本研究提出了一个轻量级文本分类框架,整合复杂系统理论(CST)和两阶段元蒸馏机制(TSMDM)。
在本研究的背景下,CST指的是一种理论框架,将自然语言视为一个典型的复杂系统,具有动态演化、语义涌现以及词汇节点影响的异质分布。它被用来模拟核心词汇在语义传播中的主导作用,以及从局部词汇特征中涌现的整体语义法则,从而增强模型对文本语义的深刻理解以及对少数样本和跨域数据场景的适应性。其核心贡献如下:理论上,据我们所知,CST被系统地引入文本分类任务,模拟语言系统的动态演变和语义涌现,以增强模型对少样本和跨域数据的深度理解和适应能力。在方法论上,设计了一个包含样本分布特征的图神经网络(GNN)。结合创新的TSMDM本质上不同于标准的知识蒸馏。标准知识蒸馏实现了从固定参数教师模型(TM)到轻量级学生模型(SM)的单向知识转移。本研究中的元蒸馏基于蒸馏整合了元学习策略,并可根据SM的学习反馈动态调整图灵机参数。两阶段设计还设置了助教模型作为中间缓冲层,以减轻图灵台与台面之间复杂度差距过大导致的信息丢失,实现显著的模型轻量化同时保持高准确性,从而为资源受限场景提供高效的分类解决方案。
在ETC领域,研究人员进行了广泛探索,提出了整合不同功能和模型架构的多种解决方案,以应对不同场景下的技术挑战。R. Zhang 等人设计了一种多语言预训练多特征融合模型(MP-MFFM),以解决当前 DL 方法在 ETC 中捕捉远程上下文结构信息不足的问题。该方法结合了多语言BERT、BiLSTM和文本CNN,提取深度语义、全局和局部结构信息并将其融合。该方法在三个数据集上提高了准确性、灵敏性和精度,验证了其有效性 6.C. Madhu 等人采用了方言特征型模糊图学习框架(DF-FGLF),以应对社交网络中非结构化和低注释数据的文本分类需求,以及方言差异对国际英语分类的影响。他们结合了语义和方言差分学习特性,构建了优化的模糊图。当只有10个注释样本时,方言识别和文本分类的F1值分别超过93%和80%,优于类似方法,适合实际分类7。B. Shannaq 等人利用英语和阿拉伯语数据集进行了实验,探讨 n-gram 长度对不同书写系统文本分类的影响以及语言特征对最佳 n-gram 长度的影响。英语2克的表现最佳(准确率0.482,回忆0.489,F1值=0.472),而阿拉伯语6克的表现最佳(F1值约0.85)。语言形态和句法特征显著影响了n-gram 模型的性能 8。N. S. Lagutina 等人使用基于字符、词汇和句子结构的文献计量特征构建文本向量,实现了英语短文本的自动分类,用于评估学生学习情况,结合了标准机器学习分类器如 SVM。在欧洲语言共同参考框架语料库中,SVM的F1值为67%,最佳BERT模型(bert基底)的F1值为69%。错误大多出现在相邻层级,分类质量取决于语料库9。
知识蒸馏作为实现模型轻量化、提升小样本场景中模型性能和降低计算成本的有效手段,在相关研究中也取得了显著进展。此前的研究探讨了知识蒸馏在解决关键自然语言处理挑战中的应用,包括:在低标签条件下提升小参数模型的性能,优化多语言文本分类任务,通过混合压缩策略压缩大规模预训练模型,以及在适应硬件的同时,精炼有效的句子表示以缩小大小语言模型之间的性能差距约束10、11、12、13。尽管取得了这些进步,现有的知识蒸馏方法在ETC方面仍存在关键局限:缺乏动态优化机制以实现知识转移过程,在高度复杂的技术机器和轻量级存储器之间蒸馏时常常存在严重的信息丢失,且无法有效整合文本数据的固有分布特性。这些缺点导致在少数样本和跨域场景下泛化性能不理想。通过此类方法获得的轻量级模型在资源受限环境中常常难以平衡分类效率和计算效率。这正是本文研究旨在弥补的关键空白。
本研究检验以下研究假设:首先,将CST整合进ETC可以有效模拟自然语言系统的动态演化和语义涌现特征。这种理论整合相比传统文本分类模型忽视语言复杂系统属性,显著提升了模型在少数样本和跨域场景下的泛化能力。其次,明确考虑文本样本分布特性的GNN模型,可以弥补传统GNN仅专注于实例级关系建模的局限,实现对英语文本中全局和局部语义信息的更深入挖掘。第三,TSMDM结合元学习策略和助教模型,能够实现复杂图谋机向轻量级SM的高效低损耗知识传递。这可以显著降低模型的计算成本和参数规模,同时保持高分类性能。此外,源自该机制的轻量级模型在具有复杂语义结构的长文本处理场景中仍能保持稳定高效的分类性能。
总之,相关研究通过多特征融合、方言特征学习、n-gram优化和风格度量特征,提升了文本分类性能,并通过知识蒸馏实现了模型轻量化。然而,现有方法在长距离信息采集、小样本泛化以及复杂和简单模型的适应性方面仍存在不足。为降低ETC模型的计算成本同时确保其准确性,本研究通过结合CST和TSMDM构建了一个轻量级模型,以提升模型的泛化能力和计算效率。
访问受限。请登录或开始试用以查看此内容。
为提升ETC在小样本和跨域场景下的泛化能力并实现轻量级模型,本研究提出了一个集成CST和TSMDM的文本分类框架。该框架的整体过程如 图1所示。

图1:整合CST和TSMDM的四阶段轻量级英语文本分类框架的可视化。 工作流程分为四个阶段。第一阶段使用基于BERT的动态嵌入,从输入的英文文本中进行文本表示。第二阶段通过构建文本图并计算实例级和分布级关系来应用图神经网络建模。第三阶段通过节点中心性重建和多级原型生成框架来模拟语义涌现,最终获得类别原型。第四阶段进行两阶段元素蒸馏,培训教师模型,并通过元蒸馏传递知识,最终生成学生模型。 请点击此处查看该图的放大版本。
首先,在文本表示和动态嵌入阶段,利用BERT模型动态嵌入输入文本并捕捉上下文语义信息。第二阶段是分布感知GNN建模,考虑样本的分布特性,构建GNN模型,并通过实例级和分布层的双重信息交互增强特征表示。第三阶段是以混合系统理论为指导的语义涌现建模,引入节点中心性重建和三级原型生成机制,以模拟语言系统的动态和涌现。最后,第四阶段进行两级超质蒸馏轻量化操作。通过辅助模型和元学习策略优化知识蒸馏过程,实现高效的模型压缩和加速。
基于分布特性和CST的ETC模型
模型架构概述
所提出的文本分类模型首先使用预训练的BERT对输入文本进行动态上下文编码,生成语义丰富的词嵌入和全局表示。接下来,从这些特征构建实例图和分布图:实例图捕捉两两样本相似性,分布图建模整体数据分布;两张图之间的迭代信息交换促进了单个特征和整体结构的协同增强。随后,CST被集成以深度增强图网络。节点中心性重建利用PageRank量化词汇影响,模拟语言网络中核心元素的主导角色。这是一种被广泛验证的方法,用于测量复杂网络拓扑中节点的全局影响,非常适合捕捉语言系统中核心词汇节点的非对称语义分布。一个三层级的“微-中-宏”原型生成框架模拟了从局部语义到整体范畴表示的涌现过程。最后,增强的特征表示输入分类器,生成最终的类概率。
与分布感知GNN的特征交互
为了优化ETC的泛化能力,有效捕捉文本与样本分布特征(SDF)之间复杂的语义关系,本研究基于分布特征和CST构建了一个ETC模型。它通过集成GNN和动态文本嵌入等机制,实现文本中对全局和局部信息的深度挖掘。GNN 是一种专门设计用于处理图结构化数据的 DL 模型。核心原则是使用消息传递机制(图中的每个节点汇总其邻近节点的特征信息),并将其与自身状态结合。通过多次迭代更新,它逐渐学习包含拓扑结构的高维表示。这一过程使节点能够捕捉局部邻域甚至全局图的结构和特征依赖关系。为了克服传统序列模型在建模长程依赖性和全局关系方面的局限性,本研究利用GNN捕捉样本间复杂的语义关联和结构关系。由于GNN关注单个样本之间的直接相关信息,忽略了样本集14、15、16的整体分布特征。因此,本研究提出了一个考虑SDF的GNN模型。该模型引入了动态文本嵌入的BERT,并结合原型网络计算样本的特征差异。BERT 是一个基于 Transformer 架构的预训练语言模型。核心原则是通过双向编码器同时捕捉语境中每个词的语义信息,并通过“掩蔽语言模型”和“下一句预测”两个任务在大规模语料库上进行预训练。在掩码语言模型中,输入中的一些词是随机遮罩的,模型需要根据上下文预测原始词。下一个预测决定了这两个句子是否连续。经过预训练后,BERT可以通过微调快速适应各种自然语言处理任务,显著提升性能并为后续图结构构建提供高质量的特征表示。本研究构建的ETC模型的具体结构如 图2所示。

图2:CST集成英语文本分类模型的架构设计,考虑样本分布特征。 图中展示了英文文本分类模型的架构设计,结合了复杂系统理论(CST)并考虑了文本样本分布特性。该架构融合了基于BERT的动态上下文嵌入、分布感知图神经网络(GNN)和CST增强机制,并通过多模块协作建模实现了英语文本中对全局和局部语义信息的深入挖掘。 请点击此处查看该图的放大版本。
在该模型中,对于通用数据集,BERT模型中的英文文本输入通过分词器生成一个令牌序列。序列构造方法见方程(1)。
[CLS], 一个1,一个2,...an,[SEP] (1)
在方程(1)中,[CLS] 是位于序列开头的分类标记。BERT将在训练过程中为[CLS]生成一个固定的隐藏位置状态。该状态直接用于整个文本的全局语义表示。一是1,是2,...n 表示文本中的一个词或子词。[SEP] 是用来标记句子结尾的分隔符。在Bert处理上述序列后,得到每个代币的特征,为模型提供结构化的上下文信息。对于包含实体的特殊数据集,如果采用传统的序列构建方法,实体所包含的位置信息将丢失。因此,本研究采用方程(2)所示方法构造该序列。
(2)
在方程(2)中,[E1]、[/E1]、[E2]和[/E2]是用来确定两个实体起始和结束位置的标记。同样,Bert处理后,这些标记的输出特征将携带对应实体的语义信息,从而更好地利用实体位置这一重要信息。随后,本研究采用考虑SDF的GNN模型来增强样本的分布和实例特征。模型结构如 图3所示。

图3:分布感知图神经网络模型的双图特征交互架构。 图中展示了分布感知GNN模型的双图特征交互架构,用于英语文本分类。该架构构建了用于实例级相似性编码的点图和用于分布级相似性编码的分布图,并通过两者图之间的迭代信息交互实现特征增强,完成了实例特征与分布特征的跨层信息循环。 请点击此处查看该图的放大版本。
该模型通过两级交互机制实现特征增强。首先,它从数据样本的实例级关联中解析分布特征,然后通过分布层级的信息交换动态优化实例特征。通过迭代强化实例和分布层级的特征,最终完成了分类任务。具体来说,该模型使用点图和分布图来实现信息交换。点映射以文本样本特征向量(由BERT最后两层更新)作为节点,通过专用编码网络(一个S形层+两个卷积批次归一化层)量化样本特征差异来计算边权重,并使用最小最大归一化法将归一化为[0,1区间]。对于边缘阈值化,经验相似度阈值设为0.2,权重低于该阈值的边会被修剪以消除弱的实例级相关性。分布图以融合文本分布特征为节点,边权重基于分布特征向量的余弦相似度计算,并通过L2归一化确保度量一致性。采用0.15的边阈值,权重低于该值的边被移除,其余有效边权重则由多层感知器进一步映射和标准化,以增强分布层关联的可区分性。本研究定义了l层迭代的点图
,节点
代表样本特征,边
编码实例级相似性。分布映射
,节点
代表样本特征,边
编码分布层级相似性。以第l到第1个轮子为例,实例级关系计算通过特征差异计算点相似性,如方程(3)所示。
(3)
在公式(3)中,
和
是节点i和j之间在点图第l次和第1次迭代中的边权重,反映了样本特征的相似性。
是一个编码网络,用于将节点特征差异转换为边权重尺度,由一层S形态和两层卷积批次规范激活函数组成。当
和
是第 1 次迭代时,节点 i 和 j 的特征向量由 Bert 在最后两层更新。随后,根据实例关系计算分布特性,如方程(4)所示。
(4)
在方程(4)中,
是第l层分布图中节点i的特征向量。MLP1 是一个多层感知器,由激活函数和全连通层组成,能够将连接的复合特征映射为新的分布特征。之后,根据分布特征计算分布关系,再从分布关系计算实例特征,完成跨层信息循环。
复杂系统增强机制
为了进一步提升泛化能力,本研究中对上述模型应用了CST。复杂系统的动态演化表现为节点影响的异质分布。为模拟核心词汇在语言系统语义传播中的主导作用,本研究引入节点中心性指数以重建信息传播机制。为每个场景任务构建的点图 Hp 使用PageRank算法量化节点 C(hi)的中心性,如方程(5)17所示。
(5)
在方程(5)中,α 是阻尼系数,α = 0.85。N(hi) 表示邻居节点的集合,L(hj) 是节点度数。方程(5)取代了模拟语言网络中词汇影响的级联传播过程,使核心词汇(如动词和主题词)获得更高的中心地位。随后,节点中心性与边权重结合,动态调整节点间信息传播强度。耦合函数λij如式(6)所示。
(6)
在方程(6)中,σ 是S形激活函数, WT 是可学习的权重矢量, b 表示偏置项。中心性权重与边缘权重的耦合动态平衡了局部关系与全局重要性,从而增强模型对任务动态变化的适应性。CST的出现在英语中表现为整体语义超越了本地词汇的总和。为在ETC中利用这一特性,本研究设计了一个三级原型生成框架,以模拟从微观特征到宏观类别的涌现过程,如 图4所示。

图4:语言语义涌现的微-中-宏三级原型生成框架的逐步构建。 图示了微-中-宏三级原型生成框架的逐步构建,用于模拟英语文本分类中的语言语义涌现。该框架通过与K均值的微子类聚类、基于分布相似性加权的中子类原型融合以及通过注意力机制进行宏观非线性集成构建层级文本类别表示,模拟语言系统中“整体大于部分之和”的涌现特征。请点击此处查看该图的放大版本。
上述过程逐步构建文本类别表示,从微观到宏观,以提升模型的泛化能力。在微观层面,通过聚类每个文本类别的样本嵌入表示生成K个子类。K-均值用于将类别内的样本划分为子组,每个子组的重心位置作为子类原型19计算。在中观层面,计算每个子类原型的分布相似度,生成相似度矩阵,然后根据相似度权重重组装子类原型,以量化子类间的相关性。子类相似度权重 w_j(ij )的计算见式(7)。
(7)
方程(7)中,
是用于测量两个子类
分布差异的詹森·香农散度,20
。最后,子类原型被加权并融合,得到一组类分布表示
。在宏观层面,每个子类的重要性权重通过注意力机制学习,并引入非线性变换以模拟涌现过程,最终形成最终的类原型c,如方程(8)所示。
(8)
在方程(8)中,α k 表示 k-类的注意力权重。U 表示非线性变换权重矩阵。tanh(·)用于增强非线性表示,并模拟复杂系统特征中部分之和的整体大于总和。每个层级通过子类结构捕捉类别内的多样性,加权分布相似性以减少噪声子类的影响,并通过注意力机制动态聚焦判别特征,增强模型的泛化能力。CST 主要通过两种机制与 GNN 集成。第一是引入节点中心性,重建信息传播过程,并模拟语言系统中词汇影响的异质分布。节点中心性通过PageRank算法量化,并动态与边权重耦合,使核心词汇在语义传播中占据主导地位,增强模型对任务动态变化的适应性。第二是设计一个三级原型生成框架,从微子类聚类到宏范类原型融合,模拟语言系统中“整体大于部分之和”的涌现特征。该框架通过分布、相似度加权和注意力机制实现了从局部特征到全局语义的层级整合。
总之,构建型ETC模型的核心创新在于将CST的理念深度整合进GNN框架。通过节点中心性重构信息传播机制,模型模拟了语言系统核心元素的主导作用,并增强了其对任务动态的适应性。通过三级原型生成框架,模型实现了从局部特征到全局语义的涌现过程,从而增强了模型捕捉类别内多样性和区分特征的能力。这种方法避免了传统GNN仅依赖实例级关系的局限。通过分布层级交互和复杂的系统特性,它为提升模型在少数样本和跨域场景下的泛化能力提供了新的解决方案。
CST的涌现属性对应于三层原型生成框架。在语言系统中,“整体大于部分之和”的原则表现为从局部词义到整体文本类别的语义飞跃。本研究通过“微-中-宏”三级原型生成机制模拟这一过程:在微观层面,样本嵌入被聚类形成子类原型;在中观层面,这些原型基于分布相似性进行权重和融合;在宏观层面,最终类别原型通过注意力机制非线性合成。例如,在情感分类中,多个负面词如“令人失望”、“缓慢”和“昂贵”会非线性地混合和转化,形成强烈的整体“负面评价”情绪。CST中的节点中心性和异构性与基于节点中心性重建的信息传播机制相一致。在语言网络中,词语的影响分布不均,核心词(如动词、主题词)在语义传播中占据主导地位。本研究利用PageRank算法量化节点中心性,并动态将其与边权重结合,以调整节点间信息传播的强度。例如,在新闻分类中,“选举”一词在政治文本中占据高度核心地位,使得“投票”和“竞选”等相邻节点在信息聚合中获得更高权重,从而增强了该话题的语义表征。CST的动态和适应性质对应于分布感知型GNNs以及元蒸馏中的教学实验机制。语言系统会根据上下文和任务需求动态演变。模型通过分布感知GNN捕捉数据集中的整体分布变化。同时,TSMDM引入了由元学习驱动的教学实验机制,允许翻译机根据SM的反馈动态调整参数。例如,在跨域情感分析中,模型可以根据目标域的数据分布快速调整特征权重,并在元蒸馏过程中优化图灵机参数,以提高新域的适应效率。
基于TSMDM的LTC模型
两阶段超萃蒸馏流程
为应对资源受限环境中高计算成本和部署困难的挑战,提出了基于 TSMDM 的轻量级文本分类模型。这种元蒸馏方法按照严格的顺序执行蒸馏过程,分为两个不同阶段。第二阶段仅在第一阶段培训完成并汇聚后启动:1)教师到助教(TA)知识压缩阶段,2)结合元学习参数适应的助教到学生轻量级蒸馏阶段。该方法通过两阶段蒸馏实现了从复杂图灵机到轻量级SM的高效知识转移,同时结合元学习机制,在过程中动态优化知识转移策略21,22。整体管道如图5所示。

图5:采用两级元蒸馏机制的轻量级文本分类模型的流水线设计。 图中设计了采用两级元蒸馏机制(TSMDM)的轻量级文本分类模型的流水线。该流程包括教师模型(高复杂度知识源)、助教模型(中间复杂度缓冲层)和学生模型(轻量级目标模型),并通过两个顺序阶段实现高效的知识转移:教师到助教的知识压缩和与元学习集成的助教对学生的轻量级提炼。 请点击此处查看该图的放大版本。
该方法包含三个角色:图谋学者、助教模型和学生推导,蒸馏过程分为两个阶段:助教-助教蒸馏和助教-学生蒸馏。在教师到TA的第一个知识压缩阶段,图灵机的知识首先被压缩到中复杂度的TA模型中,以减轻直接蒸馏中因容量缺口过大导致的信息丢失。作为知识源的图灵机,将输出的分类概率和中间层特征都转移到TA模型中。TA模型通过将输出和特征表示与教师的对齐进行训练,使用一个整合分类损失和特征比对损失的组合损失函数。在第二阶段的TA到学生轻量级蒸馏阶段,该阶段在TA模型融合后启动,知识进一步提炼至最终的轻量级SM。该阶段还采用双重监督(分类对数和中间特征),并结合元学习机制:图灵台对辅助任务进行“教学实验”以评估学生的学习状态,并动态调整自身参数以提供更具适应性和针对性的指导。SM通过最小化输出差异和相对于TA模型的特征距离来完成训练,从而在最大程度保持分类性能的同时实现显著的参数缩减22。
带教学实验的元学习
在传统知识蒸馏方法中,受过培训的TM通过参与损耗计算来指导SM。然而,固定参数的图灵机难以评估SM的实际学习状态,也无法量化其指导对更新SM参数的具体贡献(见23,24)。因此,本研究将元学习理念引入蒸馏过程,使图灵机能够根据SM的学习反馈调整自身参数。蒸馏过程如图6所示。

图6:结合教学实验机制的元蒸馏迭代参数优化过程。 图中展示了元蒸馏的迭代参数优化过程与英语文本分类模型轻量化的教学实验机制相结合。该过程从学生模型生成临时内在学习者,通过内在学习者的模拟训练表现量化教学效果损失,并使教师模型能够通过反向传播损失调整自身参数,从而优化后续的知识转移策略。 请点击此处查看该图的放大版本。
图灵机在其自身训练阶段通过传统分类任务优化参数,产生反映其原始性能的基本分类损失L T。完成训练后,SM S会被复制,生成内部学习器S1的临时副本。图灵机对S1进行教学实验,S1在模拟训练中表现出的综合性能误差被量化为损失LQ。该信号作为反馈反馈,用于评估教学效果。通过L Q的反向传播,图灵机主动调整自身参数并优化其知识传递方式。完成元学习优化后,图灵机对原始SM S进行形式化知识蒸馏,并利用模型损失LS作为反馈,用于教授图灵机有效性评估。为实现ETC模型的轻量化,本研究将考虑将SDF GNN模型作为图示单元纳入教学实验过程,如图7所示。

图7:教师模型优化中元蒸馏中教学实验机制参数更新流程。 图示了教师模型优化在元蒸馏过程中教学实验机制的参数更新流程。流程首先用均方误差损失函数计算内在学习者预测与教师模型预测之间的软损失,将软损失与硬标签误差结合形成总训练损失,并通过加权总误差的反向传播更新教师模型参数以提升教学效果。 请点击此处查看该图的放大版本。
完成知识蒸馏训练后,SM首先计算图灵机预测结果与真实标签结果之间的差值。随后,MSE损失函数用于测量SM预测(内学习者 S1)与TM预测之间的距离。这个距离值用作软损失25。最终训练目标是硬标签错误和软损失的加权组合。通过反向传播加权总误差,图灵图鉴的参数得以更新,从而提高图灵机的教学效果。内部学习器 S1 的参数计算见方程(9)。
(9)
在方程(9)中,
和
是内部学习者参数及其受图磁机参数γ T影响的初始参数。λ(学习率,λ = 0.005)控制内在学习者(即SM副本)在元蒸馏过程中的参数更新步长。方程(9)通过反向传播计算损失梯度,而λ则更新内在学习者的参数。这一机制反映了SM的学习特性,使TM能够接收反馈并调整教学策略,从而提升后续知识蒸发的效果。元学习中损失LS 的计算见方程(10)。
(10)
在方程(10)中, B 是元学习样本序列。
利用损失设计和辅助模型优化知识转移
为进一步提升知识蒸馏的有效性,本研究通过计算分类损失和特征损失来获得整体损失。其中,特征损失采用回溯机制,利用图灵机的浅层和电流特征输出来引导SM,具体见方程(11)。
(11)
在方程(11)中,I 是特征层索引的集合。D 是用来计算两种特征表示差异的距离函数。
和
是图灵图和图灵图中的目标表示函数,将第 i 和第 j 层的特征输出
和转换为注意力矩阵。分类损耗将SM输出与真实标签之间的交叉熵损失,以及两模型输出之间的MSE合并为软损耗27,28。最终,整体损失是通过权重两者获得的,帮助SM更好地从TM那里获得指导。为了最小化知识蒸发过程中的性能损失,本研究将助教模型置于两个模型之间,如图8所示。

图8:以教学助理模型为中间缓冲层的两阶段知识蒸馏处理流程。 图示了以助教模型为中间缓冲层的两阶段知识蒸馏处理流程。第一阶段融合特征损耗和分类损耗来构建总蒸馏损耗,并用教师模型的知识训练助教模型;第二阶段采用相同的损失融合策略,将助教模型的知识与学生模型提炼,减少师生模型之间复杂度差距导致的信息损失。 请点击此处查看该图的放大版本。
完成元蒸馏阶段后,TA模型和TM进行传统知识蒸馏。在此过程中,两者的特征同步提取,并计算相应的损耗 La 。随后,该特征损失与模型的分类损耗 LM1 融合,形成第一阶段的蒸馏损失函数
,如方程(12)所示。
(12)
在方程(12)中,β 是用于控制特征损失和分类损失在总损失中比例的权重系数。
和
是助教模型和图灵图里学中的客观表示函数,将第 i 和第 j 层的特征输出
和转换为注意力矩阵。zT 和 zM 分别是图灵机和助手模型的输出。从助教模型到SM的提炼过程与上述相同,通过多次迭代将SM的损失降至最低,以完成知识转移。
总之,所提TSMDM的核心贡献在于通过元学习机制优化知识转移过程。与传统蒸馏相比,该方法的核心优势在于其动态教学能力:图灵机可根据SM的实时反馈,通过教学实验机制调整自身参数,从而提供更具针对性的指导。同时,引入助教模型作为缓冲层,有效弥合了翻译机与学生之间的复杂性差距,减少了知识传递中的信息丢失。这种“元学习优化教学策略”和“降低迁移难度的两级缓冲”的协作设计,使最终SM能够在最大程度保留复杂图灵图表中提炼出的核心知识的同时,实现显著的轻量化。
数据可用性
本次研究期间生成和/或分析的数据集载于 补充文件1。
访问受限。请登录或开始试用以查看此内容。
实验设置与数据集:
为全面评估所提模型在小样本跨域分类任务中的表现和轻量化效率,实验包括四个数据集:FewRel(小样本关系分类)、ARSC(跨领域情感分析)、Reuters-21578(多主题新闻分类)和ArXiv(长篇学术摘要)。FewRel是一个广泛使用的小样本关系分类数据集,来源于维基百科,包含100个语义关系类别(例如“企业/公司创始人”和“地点/国家-首都”),每个类别包含700个高质量句子。ARSC 评估模型在现实跨域场景中的表现,涵盖亚马逊 23 个产品类别(如“书籍”、“DVD”、“厨房电器”)的用户评价,构成 69 个二元情感分析任务(正面/负面)。路透社-21578是一个经典的多类别新闻文件分类数据集,包含21,578篇路透社新闻文章,标签跨越90个重叠的主题类别(经济、政治、体育等)。此外,本研究还收集了ArXiv公共API上的计算机科学论文摘要,构建了长格式文本分类数据集,并测试了扩展文本序列处理的计算效率。每个数据集的示例示例见 表1。
访问受限。请登录或开始试用以查看此内容。
为了增强ETC在少数样本和跨域场景下的泛化能力,同时降低计算成本,本研究提出了一个将CST与TSMDM集成的轻量级文本分类框架。将CST与TSMDM框架整合,解决了现有ETC方法的核心局限性(少数样本/跨域推广能力差且计算成本高),通过将语言系统动态和新兴语义特性注入模型设计,实现高效的知识传递以实现轻量级压缩。这种设计协同是该模型在资源有限环境中优于传统方法的关键。
理论上,CST在文本分类中的作用超越了传统模型对局部语义或静态分布的依赖,为理解语言作为具有动态和涌现特征的复杂系统提供了新的计算建模视角。31。从方法论上看,所提出的分布感知GNN和TSMDM为少样本学习、跨域适应和模型压缩提供了协同优化框架。实验结果表明,该模型在FewRel和ARSC等数据集上优于传统GNN、BERT基线和最先进的比较方法(见表3),验证了其在少数样本和跨域环境中的优越泛化性和效率。FewRel 5路5-5-shot任务的分类准确率为95.15%,...
访问受限。请登录或开始试用以查看此内容。
作者没有什么可透露的。
作者们没有什么可承认的。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 中央处理器(CPU) | 商业硬件供应商(英特尔、戴尔、联想) | Intel i5-7300HQ | 硬件规格 |
| 图形处理器(GPU) | 商业硬件供应商(英伟达、华硕) | 英伟达 GeForce RTX 3060,12 GB VRAM | 硬件规格 |
| 随机存取存储器(RAM) | 商业硬件供应商 | 16 GB DDR4 | 硬件规格 |
| 固态硬盘(SSD) | 商业硬件供应商 | 1 TB NVMe SSD | 硬件规格 |
| 操作系统 | 微软官方网站 | Windows 10(64位) | 系统软件 |
| Python | Python 官方网站(python.org) | Python 3.8 | 编程语言 |
| PyTorch | PyTorch 官方网站(pytorch.org) | PyTorch 1.11.0 | 深度学习框架和核心库 |
| CUDA | 英伟达官方网站 | CUDA 11.3 | 深度学习框架和核心库 |
| Hugging Face Transformers | Hugging Face Hub(huggingface.co) | 稳定版本(适应 Python 3.8/PyTorch 1.11.0) | 深度学习框架和核心库 |
| NumPy | PyPI(pypi.org) | 稳定版本(适应 Python 3.8) | 数据处理和统计库 |
| Pandas | PyPI(pypi.org) | 稳定版本(适应 Python 3.8) | 数据处理和统计库 |
| Scikit-learn | PyPI(pypi.org) | 稳定版本(适应 Python 3.8) | 数据处理和统计库 |
| SciPy | PyPI(pypi.org) | 稳定版本(适应 Python 3.8) | 数据处理和统计库 |
| Matplotlib | PyPI(pypi.org) | 稳定版本(适应 Python 3.8) | 可视化库 |
| AdamW | PyTorch 内置 | 集成在 PyTorch 1.11.0 中 | 优化器 |
| BERT | Hugging Face Hub(huggingface.co) | BERT-base(bert-base-cased) | 预训练模型 |
| FewRel | FewRel 官方存储库(GitHub)/ 维基百科 | 100 个语义关系类别,每类别 700 句;训练/验证/测试分割(5:2:3) | 数据集 |
| ARSC | 公共跨域情感分析数据集(GitHub/ACL 文献集) | 23 个亚马逊产品类别,69 个二元情感分析任务;训练/验证/测试分割(4:2:3) | 数据集 |
| Reuters-21578 | UCI 机器学习存储库 / Reuters 官方存档 | 21,578 篇新闻文章,90 个主题类别;ModApte 分区方法 | 数据集 |
| ArXiv | ArXiv 公共 API(arxiv.org) | 计算机科学论文摘要;训练/验证/测试分割(7:2:1) | 数据集 |
| Tokenizer | Hugging Face Hub(huggingface.co) | BERT-base-cased Tokenizer | 其他必要工具 |
| Git | Git 官方网站(git-scm.com) | 最新稳定版本 | 其他必要工具 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可