Research Article

Leichte englische Textklassifikation mit Deep Learning basierend auf komplexer Systemtheorie

DOI:

10.3791/69344

June 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie schlägt ein leichtes neuronales Graphennetzwerk mit Meta-Destillation und Meta-Lernen vor, um die englische Textklassifikation zu verbessern. Verbessert die Verallgemeinerung in Datenarmen und domänenübergreifenden Umgebungen, senkt die Rechenkosten und sorgt für hohe Leistung.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Globalisierung und die Entwicklung der Informationstechnologie haben einen Anstieg englischer Textdaten vorangetrieben, und es besteht ein dringender Bedarf an einer effizienten Klassifikation. Um die Verallgemeinerungsfähigkeit der englischen Textklassifikation in Small-Sample- und Cross-Domain-Szenarien zu verbessern und leichte Modelle zu erreichen, kombiniert diese Studie komplexe Systemtheorie mit Deep Learning, um ein Graphen-Neuralnetzmodell zu konstruieren, das die distributionalen Eigenschaften von Textproben vollständig berücksichtigt. Eine zweistufige Meta-Destillationsmethode, kombiniert mit Meta-Lernstrategien, passt dynamisch die Parameter des Lehrermodells an und optimiert den gesamten Wissenstransferprozess. Die experimentellen Ergebnisse zeigen, dass die Klassifikationsleistung des vorgeschlagenen Modells bei wenigen und domänenübergreifenden Textklassifikationsaufgaben deutlich überlegen ist gegenüber der traditioneller neuronaler Graphen und anderer gängiger vergleichender Modelle. Was die Leichtgewichtung betrifft, so hält das durch den zweistufige Meta-Destillationsmechanismus erzeugte SM ein extrem hohes Maß an Leistungserhaltung bei mehrthemigen Text-Klassifikationsdatensätzen aufrecht, während die Rechenzeit deutlich reduziert wird. Darüber hinaus kann diese Methode eine hohe Effizienz und stabile Klassifikationsleistung in Langtextverarbeitungsszenarien aufrechterhalten und bietet klare Vorteile in der Recheneffizienz gegenüber traditionellen Destillationsmethoden und anderen in der Literatur beschriebenen Methoden. Die vorgeschlagene Methode verbessert effektiv die Klassifikationsleistung englischer Texte in Low-Sample- und Bereichsübergreifenden Anwendungsszenarien und senkt dabei die Rechenkosten erheblich, wodurch eine praktikable und effiziente technische Lösung für die Klassifikation englischer Texte in ressourcenbegrenzten Umgebungen bereitgestellt wird.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Beschleunigung der Globalisierung und Fortschritte in der Informationstechnologie haben zu einem explosiven Wachstum englischsprachiger Textdaten in Bereichen wie sozialen Medien, akademischer Forschung und Geschäftskommunikation geführt. Die effiziente Klassifikation dieser Texte für Informationsabruf, Sentimentanalyse, Inhaltsmanagement und andere Funktionen ist zu einer wichtigen Aufgabe in der Verarbeitung natürlicher Sprache. Das Ziel der English Text Classification (ETC) ist es, Texte basierend auf ihrem semantischen Inhalt in vordefinierte Kategorien zu klassifizieren. Die Komplexität der natürlichen Sprache, einschließlich ihrer Mehrdeutigkeit, Kontextabhängigkeit und Ausdrucksvielfalt, stellt jedoch viele Herausforderungen für Textklassifikationsaufgabenmit sich 2. Derzeit hat das Wachstum der Deep Learning (DL)-Technologie neuartige Möglichkeiten für die Textklassifikation geschaffen. Vortrainierte Sprachmodelle, repräsentiert durch Bidirectional Encoder Representations from Transformers (BERT) und deren Varianten, können durch Vortraining auf groß angelegten Korpora reichhaltige kontextuelle semantische Informationen erlernen und so die Leistung der Textklassifikation3 deutlich verbessern. Allerdings haben die aktuellen ETC-Methoden weiterhin zwei wesentliche Einschränkungen: Erstens betonen sie oft die Optimierung eines einzelnen Modells oder Merkmals, wobei die intrinsischen Eigenschaften der Sprache als komplexes System, wie ihre Dynamik und ihr emergentes Verhalten, vernachlässigbar werden, was zu unzureichender Verallgemeinerung unter Datenarmen oder bereichsübergreifenden Szenarien führt; Zweitens behindern trotz der starken Leistung vortrainierter Modelle deren hohe Rechenaufwand und hohe Parameteranzahl die praktische Implementierung in ressourcenbegrenzten Umgebungenerheblich 4,5. Um diese Probleme zu adressieren, schlägt diese Studie ein leichtes Textklassifikationssystem vor, das Komplexe Systemtheorie (CST) und den Zweistufigen Meta-Destillationsmechanismus (TSMDM) integriert.

Im Kontext dieser Studie bezieht sich CST auf den theoretischen Rahmen, der natürliche Sprache als ein typisches komplexes System mit dynamischer Evolution, semantischer Entstehung und heterogener Verteilung des lexikalischen Knoteneinflusses betrachtet. Es wird angewandt, um die dominante Rolle des Kernvokabulars in der semantischen Ausbreitung und das emergente Gesetz der Gesamtsemantik aus lokalen lexikalischen Merkmalen zu simulieren, wodurch das tiefe Verständnis der Textsemantik und die Anpassungsfähigkeit des Modells an wenige und domänenübergreifende Datenszenarien verbessert werden. Seine Kernbeiträge sind wie folgt: Theoretisch wird CST nach unserem Wissen systematisch in Textklassifikationsaufgaben eingeführt, um die dynamische Entwicklung und semantische Entstehung von Sprachsystemen zu simulieren, um das tiefe Verständnis und die Anpassungsfähigkeit des Modells an wenige und domänenübergreifende Daten zu verbessern. Methodisch wird ein Graph Neural Network (GNN) mit Merkmalen der Probenverteilung entwickelt. Das kombinierte innovative TSMDM unterscheidet sich im Wesentlichen von der Standard-Wissensdestillation. Die Standard-Wissensdestillation realisiert eine einseitige Wissensübertragung von einem festparametrigen Lehrermodell (TM) auf ein leichtes Schülermodell (SM). Die Meta-Destillation in dieser Studie integriert Meta-Lernstrategien auf Basis der Destillation und kann die Parameter des TM dynamisch anhand des Lernfeedbacks des SM anpassen. Das zweistufige Design legt zusätzlich ein Modell des Lehrassistenten als Zwischenpufferschicht fest, um Informationsverluste durch übermäßige Komplexitätslücken zwischen TM und SM zu mindern, wodurch eine erhebliche Modellleichtgewichtung bei hoher Genauigkeit erreicht wird und so eine effiziente Klassifikationslösung für ressourcenbegrenzte Szenarien bereitgestellt wird.

Im Bereich ETC haben Forscher umfangreiche Erkundungen durchgeführt und verschiedene Lösungen vorgeschlagen, die unterschiedliche Funktionen und Modellarchitekturen integrieren, um technische Herausforderungen in unterschiedlichen Szenarien zu bewältigen. R. Zhang et al. entwarfen ein mehrsprachiges vortrainiertes Multi-Feature-Fusionsmodell (MP-MFFM), um das Problem der unzureichenden Erfassung langfristiger kontextueller struktureller Informationen in ETC mit aktuellen DL-Methoden anzugehen. Diese Methode kombinierte mehrsprachige BERT-, BiLSTM- und Text-CNN, um tiefe semantische, globale und lokale strukturelle Informationen zu extrahieren und zu fusionieren. Diese Methode verbesserte Genauigkeit, Empfindlichkeit und Präzision bei drei Datensätzen und bestätigte ihre Wirksamkeit6. C. Madhu et al. haben ein Dialect Feature-Based Fuzzy Graph Learning Framework (DF-FGLF) eingeführt, um die Textklassifikationsbedürfnisse unstrukturierter und wenig annotierter Daten in sozialen Netzwerken sowie die Auswirkungen von Dialektunterschieden auf die internationale englische Klassifikation zu adressieren. Sie kombinierten semantische und Dialektdifferenzlernfunktionen, um einen optimierten Fuzzy-Graphen zu erstellen. Als es nur 10 annotierte Stichproben gab, überstieg der F1-Wert für Dialekterkennung und Textklassifikation 93 % bzw. 80 %, was ähnlichen Methoden überlegen und für die praktische Klassifikation7 geeignet war. B. Shannaq et al. führten Experimente mit englischen und arabischen Datensätzen durch, um den Einfluss der n-Gramm-Länge auf die Textklassifikation in verschiedenen Schriftsystemen sowie die Auswirkungen von Sprachmerkmalen auf die optimale n-Gramm-Länge zu untersuchen. Die Leistung des englischen 2-Gramm-Signals war am besten (Genauigkeit 0,482, Erinnerung 0,489, F1-Wert = 0,472), während arabischer 6-Gramm-Wert am besten war (F1-Wert etwa 0,85). Sprachmorphologie und syntaktische Merkmale beeinflussten die Leistung der n-Gramm-Modelle8 erheblich. N. S. Lagutina et al. verwendeten einen Textvektor, der auf bibliometrischen Eigenschaften von Zeichen, Vokabeln und bibliometrischen Merkmalen basiert, um eine automatische Klassifikation englischer Kurztexte zur Bewertung des Lernens der Schüler zu ermöglichen, kombiniert mit standardisierten maschinellen Lernklassifikatoren wie SVM. Der F1-Wert von SVM im Korpus des Gemeinsamen Europäischen Referenzrahmens für Sprachen betrug 67 %, und der F1-Wert des besten BERT-Modells (bert-Basisfall) lag bei 69 %. Die Fehler lagen meist in benachbarten Ebenen, und die Qualität der Klassifikation hing vom Korpus9 ab.

Wissensdestillation als effektives Mittel zur Modellleichtgewichtung, zur Verbesserung der Modellleistung in kleinen Stichprobenszenarien und zur Senkung der Rechenkosten hat ebenfalls bedeutende Fortschritte in verwandter Forschung erzielt. Frühere Forschungen haben die Anwendung der Wissensdestillation zur Bewältigung wichtiger Herausforderungen in der natürlichen Sprachverarbeitung untersucht, darunter: Steigerung der Leistung von Kleinparametermodellen unter Bedingungen mit niedrigen Labels, Optimierung mehrsprachiger Textklassifikationsaufgaben, Komprimierung groß angelegter vortrainierter Modelle mittels hybrider Kompressionsstrategien sowie das Destillieren effektiver Satzrepräsentationen, um die Leistungslücke zwischen großen und kleinen Sprachmodellen zu verringern und gleichzeitig an Hardware anzupassen Einschränkungen 10,11,12,13. Trotz dieser Fortschritte haben bestehende Wissensdestillationsansätze weiterhin kritische Einschränkungen für ETC: Ihnen fehlen dynamische Optimierungsmechanismen für den Wissenstransferprozess, sie leiden oft unter starkem Informationsverlust beim Destillieren zwischen hochkomplexen TMs und leichten SMs und integrieren sich nicht effektiv in die inhärenten Verteilungsmerkmale von Textdaten. Diese Nachteile führen zu einer suboptimalen Verallgemeinerungsleistung in Few-Shot- und Cross-Domain-Szenarien. Die mit solchen Methoden gewonnenen leichtgewichtigen Modelle haben oft Schwierigkeiten, Klassifikationseffizienz und Recheneffizienz in ressourcenbegrenzten Umgebungen auszubalancieren. Dies ist die entscheidende Lücke, die die Forschung in diesem Papier zu schließen versucht.

Diese Studie testet folgende Forschungshypothese: Erstens kann die Integration von CST in ETC die dynamische Evolution und semantischen Emergenzmerkmale natürlicher Sprachsysteme effektiv simulieren. Diese theoretische Integration kann die Verallgemeinerungsfähigkeit des Modells in wenigen und domänenübergreifenden Szenarien im Vergleich zu traditionellen Textklassifikationsmodellen, die die komplexen Systemeigenschaften der Sprache ignorieren, erheblich verbessern. Zweitens kann ein GNN-Modell, das explizite Berücksichtigung der Textbeispielverteilungsmerkmale entwickelt wurde, die Einschränkungen traditioneller GNNs ausgleichen, die sich ausschließlich auf relationale Modellierung auf Instanzebene konzentrieren, und eine tiefere Auswertung globaler und lokaler semantischer Informationen in englischen Texten ermöglichen. Drittens kann das TSMDM in Kombination mit Meta-Lernstrategien und einem Lehrassistentenmodell eine effiziente und verlustarme Wissensübertragung von komplexen TMs zu leichten SMs ermöglichen. Dies kann die Rechenkosten und die Parameterskalierung des Modells erheblich senken und gleichzeitig eine hohe Klassifikationsleistung erhalten. Darüber hinaus kann das von diesem Mechanismus abgeleitete leichte Modell weiterhin eine stabile und effiziente Klassifikationsleistung in langen Textverarbeitungsszenarien mit komplexen semantischen Strukturen erhalten.

Zusammenfassend hat relevante Forschung die Textklassifikationsleistung durch Multi-Feature-Fusion, Dialekt-Feature-Lernen, N-Gramm-Optimierung und stilistische metrische Features verbessert und zudem Modellleichtgewichtung durch Wissensdestillation erreicht. Bestehende Methoden weisen jedoch weiterhin Schwächen bei der Informationserfassung über große Entfernungen, der Verallgemeinerung kleiner Stichproben und der Anpassung komplexer und einfacher Modelle auf. Um die Rechenkosten des ETC-Modells zu senken und gleichzeitig seine Genauigkeit zu gewährleisten, konstruiert diese Studie ein leichtes Modell durch die Kombination von CST und TSMDM, um die Verallgemeinerungskapazität und Recheneffizienz des Modells zu verbessern.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um die Verallgemeinerungsfähigkeit von ETC in Szenarien kleiner Stichproben und Querschnittsbereiche zu verbessern und ein leichtes Modell zu realisieren, schlägt diese Studie ein Textklassifikationsrahmen vor, das CST und TSMDM integriert. Der Gesamtablauf dieses Rahmens ist in Abbildung 1 dargestellt.

figure-protocol-1
Abbildung 1: Visualisierung des vierstufigen, leichtgewichtigen englischen Textklassifikationsrahmens, der CST und TSMDM integriert. Der Workflow besteht aus vier Stufen. Stufe 1 führt eine Textdarstellung mit BERT-basierten dynamischen Einbettungen aus dem englischen Eingabetext durch. Stufe 2 wendet Graph-Neuralnetz-Modellierung an, indem ein Textgraph konstruiert und Instanz- und Verteilungsbeziehungen berechnet werden. Phase 3 modelliert semantische Entstehung durch Knotenzentralitätsrekonstruktion und ein mehrstufiges Prototypengenerierungsframework, um den endgültigen Kategorie-Prototyp zu erhalten. Stufe 4 führt eine zweistufige Elementardestillation durch, bei der ein Lehrermodell trainiert und Wissen durch Metadestillation übertragen wird, um das endgültige Schülermodell zu erzeugen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Erstens wird in der Textdarstellungs- und dynamischen Einbettungsphase das BERT-Modell genutzt, um den Eingabetext dynamisch einzubetten und die kontextuellen semantischen Informationen zu erfassen. Die zweite Stufe ist die distributionsbewusste GNN-Modellierung, die die Verteilungsmerkmale von Stichproben berücksichtigt, ein GNN-Modell erstellt und die Merkmalsrepräsentation durch duale Informationsinteraktion auf Instanz- und Verteilungsebene verbessert. Die dritte Stufe ist die semantische Emergenzmodellierung, geleitet von der Hybridsystemtheorie, die die Zentralitätsrekonstruktion der Knoten und einen dreistufigen Prototypengenerierungsmechanismus zur Simulation der Dynamik und des Entstehens des Sprachsystems einführt. Abschließend wird in der vierten Stufe eine zweistufige Meta-Destillations-Leichtgewichtsoperation durchgeführt. Der Wissensdestillationsprozess wird durch das Assistentenmodell und die Meta-Lernstrategie optimiert, um eine effiziente Modellkompression und Beschleunigung zu erreichen.

ETC-Modell basierend auf Verteilungsmerkmalen und CST
Überblick über die Modellarchitektur
Das vorgeschlagene Textklassifikationsmodell verwendet zunächst ein vortrainiertes BERT, um eine dynamische kontextuelle Codierung des Eingabetexts durchzuführen, semantisch reichhaltige Worteinbettungen und eine globale Darstellung zu erzeugen. Anschließend werden aus diesen Merkmalen ein Instanzgraph und ein Verteilungsgraph konstruiert: Der Instanzgraph erfasst paarweise Stichprobenähnlichkeiten, während der Verteilungsgraph die Gesamtverteilung der Daten modelliert; Iterativer Informationsaustausch zwischen den beiden Graphen ermöglicht eine synergetische Verbesserung einzelner Merkmale und globaler Struktur. Anschließend wird CST integriert, um das Graphennetzwerk umfassend zu ergänzen. Die Knotenzentralitätsrekonstruktion verwendet PageRank, um lexikalischen Einfluss zu quantifizieren und so die dominante Rolle von Kernelementen in Sprachnetzwerken zu simulieren. Dies ist eine weithin validierte Methode zur Messung des globalen Einflusses von Knoten in komplexen Netzwerktopologien und eignet sich hervorragend, um die asymmetrische semantische Verteilung von Kernlexikalknoten in Sprachsystemen zu erfassen. Ein dreistufiges "Mikro–Meso–Makro"-Prototypen-Generierungsrahmen emuliert den emergenten Prozess von lokaler Semantik zu ganzheitlichen Kategorienrepräsentationen. Schließlich werden die erweiterten Merkmalsrepräsentationen in einen Klassifikator eingespeist, um die endgültigen Klassenwahrscheinlichkeiten zu erzeugen.

Feature-Interaktion mit dem distribution-bewussten GNN
Um die Verallgemeinerungsfähigkeit von ETC zu optimieren und komplexe semantische Beziehungen zwischen Texten und Sample Distribution Features (SDFs) effektiv zu erfassen, konstruiert diese Studie ein ETC-Modell basierend auf Verteilungsmerkmalen und CST. Es erreicht eine tiefe Auswertung globaler und lokaler Informationen im Text, indem Mechanismen wie GNN und dynamische Texteinbettung integriert werden. GNN ist ein DL-Modell, das speziell für die Verarbeitung graphstrukturierter Daten entwickelt wurde. Das Kernprinzip besteht darin, einen Nachrichtenübermittlungsmechanismus zu verwenden (bei dem jeder Knoten im Graphen die Merkmalsinformationen seiner benachbarten Knoten aggregiert) und diesen mit seinem eigenen Zustand zu kombinieren. Durch mehrere Runden iterativer Aktualisierungen lernt es allmählich eine hochdimensionale Darstellung, die die Topologiestruktur einschließt. Dieser Prozess ermöglicht es Knoten, die Struktur- und Merkmalsabhängigkeiten der lokalen Nachbarschaft und sogar des globalen Graphen zu erfassen. Um die Einschränkungen traditioneller Sequenzmodelle bei der Modellierung langfristiger Abhängigkeiten und globaler Beziehungen zu überwinden, nutzt diese Studie GNN, um komplexe semantische Assoziationen und strukturelle Beziehungen zwischen Stichproben zu erfassen. Aufgrund des Fokus von GNN auf den direkten Korrelationsinformationen zwischen einzelnen Stichproben ignoriert es die Gesamtverteilungsmerkmale des Stichprobensets 14,15,16. Daher schlägt diese Studie ein GNN-Modell vor, das SDF berücksichtigt. Dieses Modell führt BERT für dynamische Texteinbettung ein und kombiniert es mit einem Prototypnetzwerk, um die Merkmalsunterschiede der Stichproben zu berechnen. BERT ist ein vortrainiertes Sprachmodell, das auf der Transformer-Architektur basiert. Das Grundprinzip besteht darin, die semantischen Informationen jedes Wortes im Kontext gleichzeitig durch einen bidirektionalen Encoder zu erfassen und sie auf einem groß angelegten Korpus mit zwei Aufgaben vorzutrainieren: "Masked-Language-Modell" und "Next-Sentence Prediction". In maskierten Sprachmodellen sind einige Wörter in der Eingabe zufällig maskiert, und das Modell muss das ursprüngliche Wort anhand des Kontexts vorhersagen. Die nächste Vorhersage bestimmt, ob die beiden Sätze aufeinanderfolgend sind. Nach dem Vortraining kann sich BERT schnell an verschiedene Aufgaben der natürlichen Sprachverarbeitung anpassen, was die Leistung deutlich verbessert und hochwertige Merkmalsrepräsentationen für die anschließende Graphstrukturstruktur bereitstellt. Die spezifische Struktur des in dieser Studie erstellten ETC-Modells ist in Abbildung 2 dargestellt.

figure-protocol-2
Abbildung 2: Architektonisches Design des CST-integrierten englischen Textklassifikationsmodells unter Berücksichtigung von Beispielverteilungsmerkmalen. Die Abbildung zeigt das architektonische Design des englischen Textklassifikationsmodells, integriert mit der komplexen Systemtheorie (CST) und der Berücksichtigung der Textbeispielverteilungsmerkmale. Die Architektur vereint BERT-basierte dynamische kontextuelle Einbettungen, distributionsbewusste Graph-Neural-Netzwerke (GNN) und CST-Verbesserungsmechanismen und realisiert eine tiefgehende Auswertung globaler und lokaler semantischer Informationen in englischen Texten durch mehrmodulige kollaborative Modellierung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

In diesem Modell erzeugt für einen allgemeinen Datensatz der englische Text, der in das BERT-Modell eingegeben wird, eine Token-Sequenz über einen Tokenizer. Die Sequenzkonstruktionsmethode ist in Gleichung (1) dargestellt.

[CLS], eine1, eine2,... an, [SEP] (1)

In Gleichung (1) ist [CLS] der Klassifikationsmarker, der sich am Anfang der Folge befindet. BERT erzeugt während des Trainingsprozesses einen festen versteckten Zustand für [CLS]. Dieser Zustand wird direkt für die globale semantische Darstellung des gesamten Textes verwendet. Eine1, eine2,... EinN steht für ein Wort oder Unterwort im Text. [SEP] ist ein Trennzeichen, das das Ende eines Satzes markiert. Nach Berts Verarbeitung der obigen Sequenz werden die Features jedes Tokens erhalten, was strukturierte kontextuelle Informationen für das Modell liefert. Bei speziellen Datensätzen, die Entitäten enthalten, gehen bei Verwendung konventioneller Sequenzkonstruktionsmethoden die von den Entitäten enthaltenen Positionsinformationen verloren. Daher konstruiert diese Studie die Sequenz mit der in Gleichung (2) gezeigten Methode.

figure-protocol-3(2)

In Gleichung (2) sind [E1], [/E1], [E2] und [/E2] die Token, die die Start- und Endpositionen zweier Entitäten bestimmen. Ähnlich werden nach der Bert-Verarbeitung die Ausgabefunktionen dieser Token semantische Informationen der entsprechenden Entitäten übertragen und so die wichtigen Informationen des Entitätsstandorts besser genutzt. Anschließend verwendet diese Studie ein GNN-Modell, das SDF berücksichtigt, um die Verteilung und Instanzmerkmale der Stichproben zu verbessern. Die Struktur des Modells ist in Abbildung 3 dargestellt.

figure-protocol-4
Abbildung 3: Dual-Graph-Feature-Interaktionsarchitektur des distributionsbewussten Graph-Neuralnetzmodells. Die Abbildung zeigt die Dual-Graph-Feature-Interaktionsarchitektur des distributionsbewussten GNN-Modells für die englische Textklassifikation. Die Architektur erstellt einen Punktgraphen für die Ähnlichkeitskodierung auf Instanzebene und einen Verteilungsgraphen für die Ähnlichkeitskodierung auf Verteilungsebene und erreicht eine Merkmalsverbesserung durch iterative Informationsinteraktion zwischen den beiden Graphen, wodurch der ebenenübergreifende Informationszyklus von Instanz- und Verteilungsmerkmalen abgeschlossen wird. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Das Modell erreicht eine Merkmalsverbesserung durch einen zweistufigen Interaktionsmechanismus. Erstens parst es Verteilungsmerkmale aus Instanzebene-Assoziationen von Datenproben und optimiert diese dann dynamisch durch Informationsaustausch auf Verteilungsebene. Durch iterative Stärkung der Merkmale von Instanzen und Verteilungsniveaus wird letztlich die Klassifikationsaufgabe abgeschlossen. Konkret verwendet das Modell Punktgraphen und Verteilungsgraphen, um den Informationsaustausch zu erreichen. Die Punktabbildung verwendet den Textbeispiel-Merkmalvektor (aktualisiert durch die letzten beiden BERT-Schichten) als Knoten, quantifiziert den Unterschied in den Probenmerkmalen, um das Kantengewicht über ein dediziertes Codiernetzwerk (eine Sigmoid-Schicht + zwei konvolutionale Batch-Normalisierungsschichten) zu berechnen, und verwendet Min-Max-Normalisierung, um auf das [0,1-Intervall] zu normalisieren. Ein empirischer Ähnlichkeitsschwellenwert von 0,2 wird für die Kantengrenze gesetzt, bei der Kanten mit Gewichten unterhalb dieser Schwelle beschnitten werden, um schwache Korrelationen auf Instanzebene zu eliminieren. Der Verteilungsgraph nimmt die verschmolzenen Textverteilungsmerkmale als Knoten, wobei die Kantengewichte auf Basis der Kosinusähnlichkeit der Verteilungsmerkmale berechnet und mittels L2-Normalisierung normalisiert werden, um metrische Konsistenz sicherzustellen. Ein Kantenschwellenwert von 0,15 wird gewählt, und Kanten mit Gewichten unterhalb dieses Werts werden entfernt, während die übrigen gültigen Kantengewichte weiter abgebildet und durch ein mehrschichtiges Perzeptron standardisiert werden, um die Unterscheidbarkeit von Verteilungsebene-Assoziationen zu verbessern. Diese Studie definiert einen Punktgraphen figure-protocol-5 für die L-Schicht-Iteration, bei der der Knoten figure-protocol-6 Beispielmerkmale repräsentiert und die Kantenähnlichkeit figure-protocol-7 auf Instanzebene kodiert. Verteilungskarte figure-protocol-8, der Knoten figure-protocol-9 stellt Stichprobenmerkmale dar und die Kante figure-protocol-10 kodiert die Ähnlichkeit auf Verteilungsebene. Nehmen wir das l-te bis l+1-te Rad als Beispiel, berechnet die Instanz-Beziehungsberechnung die Punktähnlichkeit durch Merkmalsunterschiede, wie in Gleichung (3) gezeigt.

figure-protocol-11 (3)

In Gleichung (3) figure-protocol-12 sind und figure-protocol-13 die Kantengewichte zwischen den Knoten i und j während der l-ten und l-1-ten Iteration des Punktgraphen, was die Ähnlichkeit der Stichprobenmerkmale widerspiegelt. figure-protocol-14 ist ein Kodierungsnetzwerk, das verwendet wird, um Unterschiede in Knotenmerkmale in Kantengewichtskalen umzuwandeln, bestehend aus einer Schicht Sigmoid und zwei Schichten von Aktivierungsfunktionen der Faltungsbatch-Normierung. Wenn figure-protocol-15 und figure-protocol-16 die l-1-te Iteration sind, werden die Eigenvektoren der Knoten i und j von Bert in den letzten beiden Schichten aktualisiert. Anschließend werden die Verteilungsmerkmale anhand der Instanzbeziehungen berechnet, wie in Gleichung (4) gezeigt.

figure-protocol-17(4)

In Gleichung (4) figure-protocol-18 ist der Eigenvektor des Knotens i im l-ten Schichtverteilungsgraphen. MLP1 ist ein mehrschichtiges Perzeptron, das aus Aktivierungsfunktionen und vollständig verbundenen Schichten besteht und die verketteten zusammengesetzten Merkmale in neue Verteilungsmerkmale abbildet. Anschließend wird die Verteilungsbeziehung anhand der Verteilungsmerkmale berechnet, und die Instanzmerkmale werden aus der Verteilungsbeziehung berechnet, um die Ebenen-Informationsschleife abzuschließen.

Mechanismen zur Verbesserung komplexer Systeme
Um die Verallgemeinerungsfähigkeit weiter zu verbessern, wird CST in dieser Studie auf das oben genannte Modell angewendet. Die dynamische Entwicklung komplexer Systeme zeigt sich in der heterogenen Verteilung des Knoteneinflusses. Um die dominante Rolle des Kernvokabulars bei der semantischen Ausbreitung in Sprachsystemen zu simulieren, führt diese Studie den Knotenzentralitätsindex ein, um den Informationspropagationsmechanismus zu rekonstruieren. Der für jede Szenarioaufgabe konstruierte Punktgraph Hp verwendet den PageRank-Algorithmus, um die Zentralität des Knotens C(hi) zu quantifizieren, wie in Gleichung (5)17 gezeigt.

figure-protocol-19(5)

In Gleichung (5) ist α der Dämpfungskoeffizient, α = 0,85. N(hi) stellt die Menge der benachbarten Knoten dar, und L(hj) ist der Knotengrad. Gleichung (5) ersetzt den kaskadierenden Ausbreitungsprozess des Vokabulareinflusses in simulierten Sprachnetzwerken, wodurch der Kernwortschatz (wie Verben und Themenwörter) eine höhere Zentralität erhält. Anschließend wird die Knotenzentralität mit Kantengewichten gekoppelt, um die Ausbreitungsstärke von Informationen zwischen den Knoten dynamisch anzupassen. Die Kopplungsfunktion λij ist in Gleichung (6) dargestellt.

figure-protocol-20(6)

In Gleichung (6) ist σ die Sigmoid-Aktivierungsfunktion, WT der lernbare Gewichtvektor und b steht für den Bias-Term. Die Kopplung von Zentralität und Kantengewichten gleicht dynamische lokale Beziehungen mit globaler Bedeutung aus und verbessert so die Anpassungsfähigkeit des Modells an dynamische Veränderungen in Aufgaben. Das Entstehen von CST zeigt sich in der englischen Sprache als die Gesamtsemantik, die die Summe des lokalen Vokabulars18 übersteigt. Um diese Funktion in ETC zu nutzen, entwirft diese Studie ein dreistufiges Prototypengenerierungsframework, um den Entstehungsprozess von Mikromerkmalen zu Makrokategorien zu simulieren, wie in Abbildung 4 dargestellt.

figure-protocol-21
Abbildung 4: Schrittweise Konstruktion des mikro-meso-makro dreistufigen Prototypengenerierungsrahmens für die linguistische semantische Emergenz. Die Abbildung veranschaulicht den schrittweisen Aufbau des mikro-meso-makro dreistufigen Prototypengenerierungsrahmens zur Simulation der linguistischen semantischen Entstehung in der englischen Textklassifikation. Das Framework erstellt hierarchische Textkategorien-Darstellungen durch Mikro-Unterklassenclustering mit K-Means, Meso-Unterklassen-Prototypfusion basierend auf Verteilungsähnlichkeitsgewichtung und makro-nichtlineare Integration mittels Aufmerksamkeitsmechanismus, wodurch die emergente Eigenschaft "das Ganze ist größer als die Summe seiner Teile" in Sprachsystemen simuliert. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Der obige Prozess konstruiert Textkategorienrepräsentationen Schritt für Schritt von Mikro zu Makro, um die Verallgemeinerungsfähigkeit des Modells zu erhöhen. Auf Mikroebene werden K-Unterklassen erzeugt, indem die Beispiel-Einbettungsrepräsentationen jeder Textkategorie gebündelt werden. K-Means wird verwendet, um die Stichproben innerhalb der Kategorie in Untergruppen zu unterteilen, und die Schwerpunktposition jeder Untergruppe wird als Unterklassenprototyp19 berechnet. Auf mesoskopischer Ebene wird die Verteilungsähnlichkeit jedes Unterklassenprototyps berechnet, eine Ähnlichkeitsmatrix erzeugt, und dann werden die Unterklassenprototypen anhand von Ähnlichkeitsgewichten wieder zusammengesetzt, um die Korrelation zwischen Unterklassen zu quantifizieren. Die Berechnung des Unterklassen-Ähnlichkeitsgewichts wij ist in Gleichung (7) dargestellt.

figure-protocol-22 (7)

In Gleichung (7) figure-protocol-23 ist die Jensen-Shannon-Divergenz verwendet, die zur Messung der Differenz in der Verteilung zwischen zwei Unterklassen figure-protocol-24 und figure-protocol-2520 verwendet wird. Schließlich werden die Unterklassenprototypen gewichtet und fusioniert, um eine Menge von Klassenverteilungsdarstellungen figure-protocol-26zu erhalten. Auf Makroebene werden die Wichtigkeitsgewichte jeder Unterklasse durch Aufmerksamkeitsmechanismen erlernt, und nichtlineare Transformationen werden eingeführt, um den Emergenzprozess zu simulieren, was zum finalen Klassenprototyp cfinal führt, wie in Gleichung (8) gezeigt.

figure-protocol-27(8)

In Gleichung (8) bedeutet αk das Aufmerksamkeitsgewicht der k-Klasse. U bezeichnet die nichtlineare Transformationsgewichtmatrix. tanh(·) wird verwendet, um die nichtlineare Darstellung zu verbessern und die Gesamtdarstellung größer als die Summe der Teile zu simulieren, die für komplexe Systeme charakteristisch ist. Jede Ebene erfasst die Vielfalt innerhalb der Kategorien durch eine Unterklassenstruktur, gewichtet die Verteilungsähnlichkeit, um den Einfluss von verrauschten Unterklassen zu verringern, und konzentriert sich dynamisch auf diskriminierende Merkmale durch Aufmerksamkeitsmechanismen, um die Verallgemeinerungsfähigkeit des Modells zu verbessern. CST ist hauptsächlich durch zwei Mechanismen mit GNN integriert. Die erste besteht darin, Knotenzentralität einzuführen, um den Informationsverbreitungsprozess zu rekonstruieren und die heterogene Verteilung des lexikalischen Einflusses im Sprachsystem zu simulieren. Die Knotenzentralität wird durch den PageRank-Algorithmus quantifiziert und dynamisch mit den Kantengewichten gekoppelt, wodurch das Kernvokabular in der semantischen Ausbreitung dominieren kann und die Anpassungsfähigkeit des Modells an die dynamischen Veränderungen von Aufgaben verbessert wird. Die zweite besteht darin, ein dreistufiges Prototypengenerierungs-Framework zu entwerfen, von Mikro-Subklassen-Clustering bis zur Fusion von Makrokategorien-Prototypen, um die emergente Eigenschaft im Sprachsystem zu simulieren, dass "das Ganze größer ist als die Summe seiner Teile". Dieser Rahmen erreicht hierarchische Integration von lokalen Merkmalen zu globaler Semantik durch Verteilungsähnlichkeitsgewichtung und Aufmerksamkeitsmechanismen.

Zusammenfassend liegt die zentrale Innovation des konstruierten ETC-Modells darin, die Ideen von CST tief in den Rahmen von GNN zu integrieren. Durch die Rekonstruktion des Informationsvermittlungsmechanismus durch Knotenzentralität simuliert das Modell die führende Rolle der Kernelemente im Sprachsystem und verbessert dessen Anpassungsfähigkeit an die Aufgabendynamik. Durch das dreistufige Prototypengenerierungs-Framework realisiert das Modell den Entstehungsprozess von lokalen Merkmalen zur globalen Semantik und verbessert so die Fähigkeit des Modells, die Vielfalt und diskriminierenden Merkmale innerhalb der Kategorie zu erfassen. Diese Methode vermeidet die Einschränkung traditioneller GNNs, die ausschließlich auf Instanzebene-Beziehungen angewiesen sind. Durch Interaktionen auf Verteilungsebene und komplexe Systemeigenschaften bietet es eine neue Lösung zur Verbesserung der Verallgemeinerungsfähigkeit des Modells in wenigen Schuss- und Domänenübergreifenden Szenarien.

Die emergenten Eigenschaften von CST entsprechen einem dreistufigen Prototypengenerierungsrahmen. In Sprachsystemen manifestiert sich das Prinzip, dass "das Ganze größer ist als die Summe seiner Teile", als semantischer Sprung von lokalen Wortbedeutungen zu allgemeinen Textkategorien. Diese Studie simuliert diesen Prozess durch einen "Mikro-Meso-Makro"-Mechanismus zur Prototypengenerierung auf drei Ebenen: Auf Mikroebene werden Probeneinbettungen gruppiert, um Unterklassenprototypen zu bilden; Auf Meso-Ebene werden diese Prototypen auf Basis der Verteilungsähnlichkeit gewichtet und fusioniert; und auf Makroebene werden Prototypen der Endkategorie nichtlinear über einen Aufmerksamkeitsmechanismus synthetisiert. Zum Beispiel vermischen sich in der Stimmungsklassifikation mehrere negative Wörter wie "enttäuschend", "langsam" und "teuer" nicht-linear, um als starke Gesamtstimmung der "negativen Bewertung" zu entstehen. Knotenzentralität und Heterogenität in CST stimmen mit einem auf Basis von Knotenzentralitätsrekonstruktion basierenden Informationspropagationsmechanismus überein. Innerhalb von Sprachnetzwerken ist der Einfluss von Wörtern ungleichmäßig verteilt, wobei Kernwörter (z. B. Verben, thematische Begriffe) eine dominierende Rolle bei der semantischen Ausbreitung spielen. Diese Studie quantifiziert die Knotenzentralität mithilfe des PageRank-Algorithmus und koppelt sie dynamisch mit Kantengewichten, um die Intensität der Informationsverteilung zwischen den Knoten anzupassen. Zum Beispiel hat in der Nachrichtenkategorisierung der Begriff "Wahl" eine hohe Zentralität in politischen Texten, was dazu führt, dass benachbarte Knoten wie "wählen" und "Kampagne" bei der Informationsaggregation höhere Bedeutung erhalten und so die semantische Darstellung dieses Themas verbessern. Die dynamische und adaptive Natur der CST entspricht verteilungsbewussten GNNs und einem Lehrexperimentmechanismus innerhalb der Metadestillation. Sprachsysteme entwickeln sich dynamisch entsprechend Kontext und Aufgabenanforderungen. Modelle erfassen die Gesamtverteilungsänderungen in Datensätzen über verteilungsbewusste GNNs. Gleichzeitig wird in TSMDM ein durch Meta-Lernen gesteuerter Lehrexperimentmechanismus eingeführt, der es TMs ermöglicht, Parameter dynamisch auf Basis von Feedback von SMs anzupassen. Zum Beispiel kann das Modell bei der domänenübergreifenden Sentimentanalyse die Feature-Gewichtungen schnell basierend auf der Datenverteilung der Zieldomäne anpassen und die Parameter des TM während der Metadestillation verfeinern, um die Anpassungseffizienz für neue Domänen zu verbessern.

LTC-Modell basierend auf TSMDM
Zweistufige Meta-Destillationspipeline
Um den Herausforderungen hoher Rechenkosten und Bereitstellungsschwierigkeiten in ressourcenbegrenzten Umgebungen zu begegnen, wird ein leichtgewichtiger Textklassifikationsmodell auf Basis eines TSMDM vorgeschlagen. Diese Meta-Destillationsmethode führt den Destillationsprozess in einer strikt sequentiellen Reihenfolge mit zwei unterschiedlichen Stufen aus. Die zweite Phase wird erst nach Abschluss und Konvergenz der Ausbildung der ersten Stufe eingeleitet: 1) die Wissenskompressionsstufe Teacher-to-Teaching Assistant (TA) und 2) die TA-zu-Schüler leichte Destillationsphase, die mit Meta-Lernparameteranpassung integriert ist. Dieser Ansatz erreicht einen effizienten Wissenstransfer von einem komplexen TM zu einem leichten SM durch zweistufige Destillation und integriert gleichzeitig einen Meta-Lernmechanismus, um die Wissenstransferstrategie während des Prozesses dynamisch zu optimieren21,22. Die gesamte Pipeline ist in Abbildung 5 dargestellt.

figure-protocol-28
Abbildung 5: Pipeline-Design des leichtgewichtigen Textklassifikationsmodells mit zweistufigem Meta-Destillationsmechanismus. Die Abbildung entwirft die Pipeline des leichtgewichtigen Textklassifikationsmodells mit dem zweistufigen Meta-Destillationsmechanismus (TSMDM). Die Pipeline besteht aus einem Lehrermodell (hochkomplexe Wissensquelle), einem Lehrassistenten-Modell (mittlere Komplexitätspufferschicht) und einem Schülermodell (leichtes Zielmodell) und implementiert einen effizienten Wissenstransfer in zwei aufeinanderfolgenden Stufen: Lehrer-zu-Lehrer-Lehrer-Assistenten-Wissenskompression und leichte Destillation von Lehrassistent-zu-Schüler, integriert mit Meta-Lernen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Die Methode umfasst drei Rollen: ein TM, ein TA-Modell und ein SM, wobei der Destillationsprozess in zwei Stufen unterteilt ist: Lehrer-TA-Destillation und TA-Schüler-Destillation. In der ersten Wissenskompressionsstufe von Lehrer zu TA wird das Wissen aus dem TM zunächst in ein TA-Modell mit mittlerer Komplexität komprimiert, um Informationsverluste durch übermäßige Kapazitätslücken in der direkten Destillation zu mindern. Das TM, das als Wissensquelle dient, überträgt sowohl seine Ausgabeklassifikationswahrscheinlichkeiten als auch die Zwischenschichtmerkmale auf das TA-Modell. Das TA-Modell wird trainiert, indem seine Ausgaben und Merkmalsrepräsentationen mit denen des Lehrers ausgerichtet werden, wobei eine kombinierte Verlustfunktion verwendet wird, die Klassifikationsverlust und Merkmalsausrichtungsverlust21 integriert. In der zweiten TA-zu-Student-Leichtgewichtsdestillationsphase, die mit der Konvergenz des TA-Modells beginnt, wird das Wissen vom TA-Modell weiter destilliert bis zum finalen leichten SM. Diese Stufe verwendet außerdem eine doppelte Supervision (Klassifikationsprotokolle und Zwischenfunktionen) und integriert einen Meta-Lernmechanismus: Der TM führt "Lehrexperimente" zu Hilfsaufgaben durch, um den Lernzustand des Schülers zu bewerten, und passt seine eigenen Parameter dynamisch an, um anpassungsfähigere und gezieltere Orientierung zu liefern. Der SM schließt das Training ab, indem sowohl die Ausgabeabweichung als auch der Feature-Abstand relativ zum TA-Modell minimiert werden, wodurch eine signifikante Parameterreduktion erreicht wird, während die Klassifikationsleistung größtmöglichst erhaltenbleibt 22.

Meta-Lernen mit Lehrexperimenten
Bei traditionellen Wissensdestillationsmethoden leitet der geschulte TM den SM, indem er an der Verlustberechnung mitwirkt. Allerdings ist es schwierig, den tatsächlichen Lernstatus von SMs mit festen Parametern zu bewerten, noch können sie den spezifischen Beitrag ihrer Anleitung zur Aktualisierung von SM-Parameternquantifizieren. Daher führt diese Studie Meta-Lernideen in den Destillationsprozess ein, sodass der TM seine eigenen Parameter basierend auf dem Lernfeedback des SM anpassen kann. Der Destillationsprozess ist in Abbildung 6 dargestellt.

figure-protocol-29
Abbildung 6: Iterativer Parameteroptimierungsprozess der Meta-Destillation kombiniert mit dem Lehrexperimentmechanismus. Die Abbildung zeigt den iterativen Parameteroptimierungsprozess der Meta-Destillation in Kombination mit dem Lehrexperimentmechanismus für die Leichtgewichtung des englischen Textklassifikationsmodells. Der Prozess erzeugt einen temporären inneren Lernenden aus dem Schülermodell, quantifiziert den Verlust des Lehreffekts durch die simulierte Trainingsleistung des inneren Lernenden und ermöglicht es dem Lehrermodell, seine eigenen Parameter durch Rückpropagation des Verlusts anzupassen, wodurch die anschließende Wissenstransferstrategie optimiert wird. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Der TM optimiert die Parameter durch konventionelle Klassifikationsaufgaben während seiner eigenen Trainingsphase, was zu einem grundlegenden Klassifikationsverlust LT führt, der seine ursprüngliche Leistung widerspiegelt. Nach Abschluss des Trainings wird das SM S repliziert, um eine temporäre Kopie des internen Lerners S1 zu erzeugen. Der TM führt Lehrexperimente auf S1 durch, und der umfassende Leistungsfehler, der S1 in diesem simulierten Training zeigt, wird als Verlust LQ quantifiziert. Dieses Signal wird als Rückmeldung an den TM verwendet, um die Lehrwirksamkeit zu bewerten. Durch die Rückpropagation von LQ passt das TM aktiv seine eigenen Parameter an und optimiert seine Methode zur Wissensübertragung. Nach Abschluss der Meta-Lernoptimierung führt der TM eine formale Wissensdestillation auf dem ursprünglichen SM S durch und verwendet außerdem den Modellverlust LS als Feedback zur Effektivitätsbewertung an den TM. Um das ETC-Modell leichter zu gewichten, wird diese Studie erwägen, das SDF GNN-Modell als TM in den Lehrexperimentprozess einzubeziehen, wie in Abbildung 7 dargestellt.

figure-protocol-30
Abbildung 7: Parameter-Update-Fluss des Lehrerexperiment-Mechanismus zur Optimierung von Lehrermodellen in der Metadestillation. Die Abbildung zeigt den Parameter-Update-Fluss des Lehrexperimentmechanismus zur Optimierung des Lehrermodells im Meta-Destillationsprozess. Der Fluss berechnet zunächst den weichen Verlust zwischen der Vorhersage des inneren Lernenden und der Vorhersage des Lehrermodells mit der mittleren quadratischen Fehlerverlustfunktion, kombiniert den weichen Verlust mit dem harten Labelfehler, um den Gesamttrainingsverlust zu bilden, und aktualisiert die Parameter des Lehrermodells durch die Backpropagation des gewichteten Gesamtfehlers, um dessen Lehrwirkung zu verbessern. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Nach Abschluss des Wissensdestillationstrainings berechnet der SM zunächst den Unterschied zwischen den vorhergesagten Ergebnissen des TM und den wahren Labels. Anschließend wird die MSE-Verlustfunktion verwendet, um den Abstand zwischen der SM-Vorhersage (innerer Lerner S1) und der TM-Vorhersage zu messen. Dieser Distanzwert wird als weicherVerlust 25 verwendet. Das abschließende Trainingsziel besteht aus einer gewichteten Kombination aus hartem Labelfehler und weichem Verlust. Durch Rückpropagation des gewichteten Gesamtfehlers werden die Parameter des TM aktualisiert, wodurch die Lehreffektivität des TM verbessert wird. Die Parameterberechnung des internen Lernenden S1 ist in Gleichung (9) dargestellt.

figure-protocol-31(9)

In Gleichung (9) figure-protocol-32 sind und figure-protocol-33 die internen Lernparameter und deren Anfangsparameter vom TM-Parameter γT beeinflusst. λ (die Lernrate, λ = 0,005) steuert die Parameteraktualisierungsschrittweite für innere Lernende (d. h. Kopien von SMs) während der Metadestillation26. Gleichung (9) berechnet Verlustgradienten durch Rückpropagation, während λ die Parameter der inneren Lernenden aktualisiert. Dieser Mechanismus spiegelt die Lerneigenschaften von SMs wider, ermöglicht es TMs, Rückmeldungen zu erhalten und ihre Lehrstrategien anzupassen, wodurch die Effektivität der anschließenden Wissensdestillation verbessert wird. Die Berechnung des Verlusts LS im Meta-Lernen ist in Gleichung (10) dargestellt.

figure-protocol-34 (10)

In Gleichung (10) ist B die Meta-Lern-Stichprobensequenz.

Optimierung des Wissenstransfers mit Verlustdesign und Assistenzmodell
Um die Wirksamkeit der Wissensdestillation weiter zu erhöhen, ermittelt diese Studie den Gesamtverlust durch Berechnung des Klassifikationsverlusts und des Merkmalsverlusts. Unter anderem verwendet der Merkmalsverlust einen retrospektiven Mechanismus, bei dem die flachen und aktuellen Merkmalsausgänge des TM zur Steuerung des SM verwendet werden, wie in Gleichung (11) dargestellt.

figure-protocol-35(11)

In Gleichung (11) ist I die Menge der Feature-Layer-Indizes. D ist eine Distanzfunktion, die verwendet wird, um die Differenz zwischen zwei Merkmalsrepräsentationen zu berechnen. figure-protocol-36 und figure-protocol-37 sind Zieldarstellungsfunktionen in TM und SM, die die Merkmalsausgaben figure-protocol-38 und figure-protocol-39 der i-ten und j-ten Schicht in Aufmerksamkeitsmatrizen umwandeln. Der Klassifikationsverlust kombiniert den Kreuzentropieverlust zwischen der SM-Ausgabe und dem wahren Label sowie die MSE zwischen den beiden Modellen als weichenVerlust von 27,28. Letztlich wird der Gesamtverlust durch Gewichtung der beiden ermittelt, sodass der SM besser Anleitung vom TM erhalten kann. Um den Leistungsverlust während des Wissensdestillationsprozesses zu minimieren, platziert diese Studie das Modell des Lehrassistenten zwischen zwei Modelle, wie in Abbildung 8 dargestellt.

figure-protocol-40
Abbildung 8: Zweistufiger Wissensdestillationsprozess mit dem Lehrassistentenmodell als Zwischenpufferschicht. Die Abbildung zeigt den zweistufigen Wissensdestillationsprozess mit dem Lehrassistentenmodell als Zwischenpufferschicht. Die erste Stufe fusioniert Merkmalsverlust und Klassifikationsverlust, um den gesamten Destillationsverlust zu konstruieren, und trainiert das Lehrassistentenmodell mit dem Wissen des Lehrermodells; Die zweite Phase verfolgt dieselbe Verlustfusionsstrategie, um das Wissen des Lehrassistentenmodells auf das Schülermodell zu destillieren und so den Informationsverlust durch übermäßige Komplexitätslücken zwischen Lehrer- und Schülermodellen zu reduzieren. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Nach Abschluss der Meta-Destillationsphase werden das TA-Modell und das TM konventionell Wissensdestillation durchgeführt. Während dieses Prozesses werden die Merkmale beider synchron extrahiert und der entsprechende Verlust La berechnet. Anschließend wird dieser Merkmalsverlust mit dem Klassifikationsverlust LM1 des Modells verschmolzen, um die Destillationsverlustfunktion figure-protocol-41 in der ersten Stufe zu bilden, wie in Gleichung (12) gezeigt.

figure-protocol-42(12)

In Gleichung (12) ist β der Gewichtskoeffizient, der verwendet wird, um den Anteil von Merkmalsverlust und Klassifikationsverlust am Gesamtverlust zu steuern. figure-protocol-43 und figure-protocol-44 sind objektive Darstellungsfunktionen im Lehrassistentenmodell und im TM, die die Merkmalsausgaben figure-protocol-45 der figure-protocol-46 i-ten und j-ten Schicht in Aufmerksamkeitsmatrizen umwandeln. zT und zM sind die Ausgänge des TM- und des Assistenzmodells. Der Destillationsprozess vom Lehrassistenten-Modell zum SM ist derselbe wie der obige Prozess, der den Verlust des SM durch mehrere Iterationen minimiert, um den Wissenstransfer vollständig zu erfüllen.

Zusammenfassend liegt der zentrale Beitrag des vorgeschlagenen TSMDM in der Optimierung des Wissenstransferprozesses durch den Meta-Lernmechanismus. Im Vergleich zur traditionellen Destillation liegt der zentrale Vorteil dieser Methode in ihrer dynamischen Lehrfähigkeit: Der TM kann seine eigenen Parameter durch den Lehrexperimentmechanismus basierend auf dem Echtzeit-Feedback des SM anpassen und so gezieltere Orientierung bieten. Gleichzeitig wird das Lehrassistentenmodell als Pufferschicht eingeführt, die effektiv die Komplexitätslücke zwischen den TMs und SMs überbrückt und den Informationsverlust beim Wissenstransfer reduziert. Das kollaborative Design dieser "Meta-Lernoptimierungs-Lehrstrategie" und des "zweistufigen Pufferns zur Reduzierung der Übertragungsschwierigkeit" ermöglicht es dem finalen SM, eine erhebliche Leichtgewichtung zu erreichen, während das Kernwissen, das aus dem komplexen TM destilliert wurde, größtmöglichst erhalten bleibt.

Datenverfügbarkeit
Die während der aktuellen Studie erstellten und/oder analysierten Datensätze sind in Supplementary File 1 bereitgestellt.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentelle Einrichtung und Datensatz:
Um die Leistung des vorgeschlagenen Modells und die leichte Effizienz in kleinen, domänenübergreifenden Klassifikationsaufgaben umfassend zu bewerten, werden Experimente an vier Datensätzen durchgeführt: FewRel (relationale Klassifikation mit kleinen Stichproben), ARSC (domänenübergreifende Sentimentanalyse), Reuters-21578 (multithematische Nachrichtenkategorisierung) und ArXiv (umfangreiche akademische Abstracts). FewRel, ein...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um die Verallgemeinerungsfähigkeit von ETC unter wenigen Schuss- und Bereichsübergreifenden Szenarien zu verbessern und gleichzeitig die Rechenkosten zu senken, schlägt diese Studie ein leichtes Textklassifikationsframework vor, das CST mit TSMDM integriert. Die Integration von CST mit einem TSMDM-Framework adressiert die Kernbeschränkungen bestehender ETC-Methoden (schlechte Verallgemeinerung von wenigen Schüssen/Bereichsübergreifenden Methoden und hohe Rechenkosten), indem linguistisch...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts anzuerkennen.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Central Processing Unit (CPU)Kommerzielle Hardware-Anbieter (Intel, Dell, Lenovo)Intel i5-7300HQHardware-Spezifikationen
Graphics Processing Unit (GPU)Kommerzielle Hardware-Anbieter (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMHardware-Spezifikationen
Random Access Memory (RAM)Kommerzielle Hardware-Anbieter16 GB DDR4Hardware-Spezifikationen
Solid State Drive (SSD)Kommerzielle Hardware-Anbieter1 TB NVMe SSDHardware-Spezifikationen
BetriebssystemMicrosoft offizielle WebsiteWindows 10 (64-bit)Systemsoftware
PythonPython offizielle Website (python.org)Python 3.8Programmiersprache
PyTorchPyTorch offizielle Website (pytorch.org)PyTorch 1.11.0Deep Learning Frameworks & Core Libraries
CUDANVIDIA offizielle WebsiteCUDA 11.3Deep Learning Frameworks & Core Libraries
Hugging Face TransformersHugging Face Hub (huggingface.co)Stabile Version (angepasst an Python 3.8/PyTorch 1.11.0)Deep Learning Frameworks & Core Libraries
NumPyPyPI (pypi.org)Stabile Version (angepasst an Python 3.8)Datenverarbeitung & Statistische Bibliotheken
PandasPyPI (pypi.org)Stabile Version (angepasst an Python 3.8)Datenverarbeitung & Statistische Bibliotheken
Scikit-learnPyPI (pypi.org)Stabile Version (angepasst an Python 3.8)Datenverarbeitung & Statistische Bibliotheken
SciPyPyPI (pypi.org)Stabile Version (angepasst an Python 3.8)Datenverarbeitung & Statistische Bibliotheken
MatplotlibPyPI (pypi.org)Stabile Version (angepasst an Python 3.8)Visualisierungsbibliothek
AdamWPyTorch eingebautIntegriert in PyTorch 1.11.0Optimizer
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Vorgefertigte Modelle
FewRelFewRel offizielles Repository (GitHub) / Wikipedia100 semantische Beziehungskategorien, 700 Sätze pro Kategorie; Train/Validation/Test Aufteilung (5:2:3)Datensätze
ARSCÖffentliche bereichsübergreifende Sentimentanalyse-Datensätze (GitHub/ACL Anthology)23 Amazon-Produktkategorien, 69 binäre Sentimentanalyse-Aufgaben; Train/Validation/Test Aufteilung (4:2:3)Datensätze
Reuters-21578UCI Machine Learning Repository / Reuters offizielles Archiv21.578 Nachrichtenartikel, 90 thematische Kategorien; ModApte-PartitionierungsmethodeDatensätze
ArXivArXiv öffentliche API (arxiv.org)Computer Science Paper Abstracts; Train/Validation/Test Aufteilung (7:2:1)Datensätze
TokenizerHugging Face Hub (huggingface.co)BERT-base-cased TokenizerAndere wesentliche Tools
GitGit offizielle Website (git-scm.com)Least stable VersionAndere wesentliche Tools

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Related Articles