Article de recherche

Classification légère des textes anglais avec apprentissage profond basé sur la théorie des systèmes complexes

DOI :

10.3791/69344

9 juin 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude propose un réseau neuronal léger à graphes avec méta-distillation et méta-apprentissage pour améliorer la classification du texte anglais. Améliore la généralisation dans des contextes à faible fréquence de données et inter-domaines tout en réduisant les coûts de calcul et en maintenant de hautes performances.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La mondialisation et le développement des technologies de l’information ont entraîné une forte augmentation des données de textes en anglais, et il est urgent de faire preuve d’une classification efficace. Pour améliorer la capacité de généralisation de la classification des textes anglais dans des scénarios à petits échantillons et à domaines inter-domaines, et pour obtenir des modèles légers, cette étude combine la théorie des systèmes complexes avec l’apprentissage profond afin de construire un modèle de réseau de neurones à graphes qui prend pleinement en compte les caractéristiques de distribution des échantillons de texte. Une méthode de méta-distillation à deux niveaux, combinée à des stratégies de méta-apprentissage, ajuste dynamiquement les paramètres du modèle enseignant et optimise l’ensemble du processus de transfert des connaissances. Les résultats expérimentaux montrent que la performance de classification du modèle proposé dans les tâches de classification de texte à peu de coups et à plusieurs domaines est nettement supérieure à celle des réseaux de neurones à graphes traditionnels et d’autres modèles comparatifs courants. En termes d’allégement, le SM généré par le mécanisme de méta-distillation en deux étapes maintient un niveau extrêmement élevé de rétention des performances sur les ensembles de données de classification textuelle multi-sujets, tout en réduisant significativement le temps de calcul. De plus, cette méthode peut maintenir une grande efficacité et une performance de classification stable dans des scénarios de traitement de texte longs et offre des avantages évidents en efficacité computationnelle par rapport aux méthodes traditionnelles de distillation et autres méthodes rapportées dans la littérature. La méthode proposée améliore efficacement la performance de classification du texte anglais dans des scénarios d’application à faible échantillonnage et inter-domaines tout en réduisant significativement le coût de calcul, offrant ainsi une solution technique réalisable et efficace pour la classification du texte anglais dans des environnements à ressources limitées.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’accélération de la mondialisation et les avancées des technologies de l’information ont conduit à une croissance fulgurante des données textuelles en anglais dans des domaines tels que les réseaux sociaux, la recherche académique et la communication commerciale. Classifier efficacement ces textes pour la recherche d’informations, l’analyse de sentiment, la gestion de contenu et d’autres fonctions est devenu une tâche importante dans le traitement du langagenaturel. L’objectif de la classification des textes anglais (ETC) est de classer les textes en catégories prédéfinies selon leur contenu sémantique. Cependant, la complexité du langage naturel, y compris son ambiguïté, sa dépendance au contexte et la diversité des expressions, pose de nombreux défis aux tâches de classificationdes textes 2. Actuellement, la croissance de la technologie de l’apprentissage profond (DL) a créé de nouvelles opportunités pour la classification des textes. Les modèles de langage pré-entraînés représentés par les Représentations Bidirectionnelles de l’Encodeur de Transformers (BERT) et leurs variantes peuvent acquérir des informations sémantiques contextuelles riches grâce à un pré-entraînement sur des corpus à grande échelle, améliorant significativement les performances de la classification dutexte 3. Cependant, les méthodes ETC actuelles rencontrent encore deux limitations clés : premièrement, elles mettent souvent l’accent sur l’optimisation d’un seul modèle ou d’une seule caractéristique, négligeant les propriétés intrinsèques du langage en tant que système complexe, telles que sa dynamique et son comportement émergent, ce qui conduit à une généralisation insuffisante dans des scénarios à faible quantité de données ou inter-domaines ; Deuxièmement, malgré les fortes performances des modèles pré-entraînés, leur coût computationnel élevé et leur important nombre de paramètres entravent gravement le déploiement pratique dans des environnements à ressourceslimitées 4,5. Pour répondre à ces problématiques, cette étude propose un cadre léger de classification des textes intégrant la théorie des systèmes complexes (CST) et le mécanisme de méta-distillation à deux étapes (TSMDM).

Dans le contexte de cette étude, la TCC désigne le cadre théorique qui considère le langage naturel comme un système complexe typique avec évolution dynamique, émergence sémantique et distribution hétérogène de l’influence des nœuds lexicals. Il est appliqué pour simuler le rôle dominant du vocabulaire de base dans la propagation sémantique et la loi émergente de la sémantique globale à partir des caractéristiques lexicales locales, améliorant ainsi la compréhension approfondie de la sémantique textuelle par le modèle et son adaptabilité aux scénarios de données à peu de tirs et inter-domaines. Ses contributions principales sont les suivantes : théoriquement, à notre connaissance, la CST est systématiquement introduite dans les tâches de classification de texte, simulant l’évolution dynamique et l’émergence sémantique des systèmes linguistiques afin d’améliorer la compréhension approfondie du modèle et son adaptabilité aux données peu shots et inter-domaines. Méthodologiquement, un réseau neuronal de graphes (GNN) contenant les caractéristiques de distribution des échantillons est conçu. Le TSMDM innovant combiné est essentiellement différent de la distillation de connaissances standard. La distillation des connaissances standard permet un transfert unidirectionnel des connaissances d’un Modèle d’Enseignant (TM) à paramètres fixes vers un Modèle d’Élève (SM) léger. La méta-distillation dans cette étude intègre des stratégies de méta-apprentissage basées sur la distillation et peut ajuster dynamiquement les paramètres de la MT en fonction du retour d’apprentissage du SM. La conception en deux étapes définit également un modèle d’assistant d’enseignement comme couche tampon intermédiaire pour atténuer la perte d’information causée par des écarts de complexité excessifs entre le MT et le SM, permettant ainsi un allègement significatif du modèle tout en maintenant une grande précision, offrant ainsi une solution de classification efficace pour les scénarios à ressources limitées.

Dans le domaine de l’ETC, les chercheurs ont mené une vaste exploration et proposé diverses solutions intégrant différentes caractéristiques et architectures de modèles pour relever des défis techniques dans différents scénarios. R. Zhang et al. ont conçu un modèle multilingue pré-entraîné Multi-Feature Fusion Model (MP-MFFM) pour traiter le problème de la capture insuffisante des informations structurelles contextuelles à longue portée dans l’ETC en utilisant les méthodes DL actuelles. Cette méthode combinait le BERT, BiLSTM multilingue et le CNN textuel pour extraire des informations sémantiques profondes, globales et locales structurelles et les fusionner. Cette méthode a amélioré la précision, la sensibilité et la précision sur trois ensembles de données, vérifiant sonefficacité 6. C. Madhu et al. ont adopté un cadre d’apprentissage de graphes flous basé sur les caractéristiques dialectales (DF-FGLF) pour répondre aux besoins de classification textuelle des données non structurées et peu annotées dans les réseaux sociaux, ainsi qu’à l’impact des différences dialectales sur la classification internationale de l’anglais. Ils combinaient des caractéristiques d’apprentissage sémantiques et dialectales pour construire un graphe flou optimisé. Lorsqu’il n’y avait que 10 échantillons annotés, la valeur F1 pour la reconnaissance dialectale et la classification des textes dépassait 93 % et 80 %, ce qui était supérieur à des méthodes similaires et adapté à la classificationpratique 7. B. Shannaq et al. ont mené des expériences utilisant des ensembles de données en anglais et en arabe pour étudier l’impact de la longueur des n-grammes sur la classification des textes dans différents systèmes d’écriture et l’effet des caractéristiques linguistiques sur la longueur optimale des n-grammes. La performance de l’anglais 2 grammes était la meilleure (précision 0,482, rappel 0,489, valeur F1 = 0,472), tandis que l’arabe 6 grammes était la meilleure (valeur F1 environ 0,85). La morphologie du langage et les caractéristiques syntaxiques ont significativement influencé la performance des modèlesn-grammes 8. N. S. Lagutina et al. ont utilisé un vecteur de texte construit en fonction des caractéristiques bibliométriques de caractères, de vocabulaire et de structure de phrase pour obtenir une classification automatique des courts textes anglais afin d’évaluer l’apprentissage des élèves, combiné à des classificateurs standards d’apprentissage automatique tels que SVM. La valeur F1 de la SVM dans le corpus du Cadre européen commun de référence pour les langues était de 67 %, et la valeur F1 du modèle best-BERT (en cas de base bert) était de 69 %. Les erreurs concernaient principalement les niveaux adjacents, et la qualité de la classification dépendait ducorpus 9.

La distillation des connaissances, en tant que moyen efficace d’alléger le modèle, d’améliorer la performance du modèle dans des scénarios de petits échantillons et de réduire les coûts de calcul, a également fait des progrès significatifs dans la recherche connexe. Des recherches antérieures ont exploré l’application de la distillation des connaissances pour relever des défis clés du traitement du langage naturel, notamment : améliorer les performances des modèles à petits paramètres dans des conditions de faible étiquette, optimiser les tâches de classification de texte multilingues, compresser des modèles pré-entraînés à grande échelle via des stratégies de compression hybrides, et distiller des représentations efficaces des phrases afin de réduire l’écart de performance entre les grands et petits modèles de langage tout en s’adaptant au matériel contraintes 10, 11, 12, 13. Malgré ces avancées, les approches existantes de distillation de connaissances présentent encore des limites critiques pour l’ETC : elles manquent de mécanismes d’optimisation dynamique pour le processus de transfert de connaissances, souffrent souvent d’une perte d’information importante lors de la distillation entre des MT très complexes et des SM légers, et ne s’intègrent pas efficacement aux caractéristiques de distribution inhérentes des données textuelles. Ces inconvénients entraînent une généralisation sous-optimale dans des scénarios à peu de tirs et inter-domaine. Les modèles légers obtenus via de telles méthodes peinent souvent à équilibrer efficacité de classification et efficacité computationnelle dans des environnements à ressources limitées. C’est la principale lacune que la recherche de cet article vise à combler.

Cette étude teste l’hypothèse de recherche suivante : Premièrement, intégrer la CST dans l’ETC peut simuler efficacement l’évolution dynamique et les caractéristiques d’émergence sémantique des systèmes de langage naturel. Cette intégration théorique peut considérablement améliorer la capacité de généralisation du modèle dans des scénarios à peu de coups et inter-domaines, par rapport aux modèles traditionnels de classification de texte qui ignorent les propriétés complexes du langage des systèmes. Deuxièmement, un modèle GNN conçu en tenant explicitement compte des caractéristiques de distribution des échantillons de texte peut compenser la limitation des GNN traditionnels qui se concentrent uniquement sur la modélisation relationnelle au niveau d’instance, et permettre un exploit plus profond des informations sémantiques globales et locales dans les textes anglais. Troisièmement, le TSMDM, combiné à des stratégies de méta-apprentissage et à un modèle d’assistant d’enseignement, peut permettre un transfert de connaissances efficace et à faible perte des MT complexes vers des SM légers. Cela peut réduire significativement le coût de calcul et l’échelle des paramètres du modèle tout en maintenant une haute performance de classification. De plus, le modèle léger dérivé de ce mécanisme peut conserver des performances de classification stables et efficaces dans des scénarios de traitement de texte long avec des structures sémantiques complexes.

En résumé, des recherches pertinentes ont amélioré les performances de la classification des textes grâce à la fusion multi-caractéristiques, l’apprentissage des caractéristiques dialectales, l’optimisation des n-grammes et les caractéristiques métriques stylistiques, et ont également permis d’alléger les modèles grâce à la distillation des connaissances. Cependant, les méthodes existantes présentent encore des lacunes en matière de capture d’information à longue distance, de généralisation de petits échantillons et d’adaptation de modèles complexes et simples. Pour réduire le coût de calcul du modèle ETC tout en garantissant sa précision, cette étude construit un modèle léger en combinant CST et TSMDM afin d’améliorer la capacité de généralisation et l’efficacité de calcul du modèle.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour améliorer la capacité de généralisation de l’ETC dans des scénarios de petits échantillons et de domaines croisés et réaliser un modèle léger, cette étude propose un cadre de classification de texte intégrant CST et TSMDM. Le processus global de ce cadre est illustré à la Figure 1.

figure-protocol-1
Figure 1 : Visualisation du cadre léger de classification de texte anglais en quatre étapes intégrant CST et TSMDM. Le flux de travail se compose de quatre étapes. L’étape 1 effectue la représentation du texte à l’aide d’embeddings dynamiques basés sur BERT à partir du texte anglais d’entrée. L’étape 2 applique la modélisation de réseaux neuronaux de graphes en construisant un graphe texte et en calculant les relations au niveau de l’instance et au niveau de la distribution. L’étape 3 modélise l’émergence sémantique par reconstruction de centralité des nœuds et un cadre de génération de prototypes multi-niveaux pour obtenir le prototype final de catégorie. L’étape 4 consiste à effectuer une distillation élémentaire en deux étapes, où un modèle enseignant est formé et les connaissances sont transférées par méta-distillation pour produire le modèle final de l’élève. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Premièrement, lors de la représentation du texte et de l’intégration dynamique, le modèle BERT est utilisé pour intégrer dynamiquement le texte d’entrée et capturer les informations sémantiques contextuelles. La deuxième étape est la modélisation GNN consciente de la distribution, qui prend en compte les caractéristiques de distribution des échantillons, construit un modèle GNN et améliore la représentation des caractéristiques grâce à une interaction d’information double au niveau de l’instance et de la distribution. La troisième étape est la modélisation sémantique de l’émergence guidée par la théorie des systèmes hybrides, introduisant la reconstruction de la centralité des nœuds et un mécanisme de génération de prototypes à trois niveaux pour simuler la dynamique et l’émergence du système du langage. Enfin, lors de la quatrième étape, une opération légère de méta-distillation à deux niveaux est réalisée. Le processus de distillation des connaissances est optimisé grâce au modèle assistant et à la stratégie de méta-apprentissage afin d’obtenir une compression et une accélération efficaces du modèle.

Modèle ETC basé sur les caractéristiques de distribution et la CST
Aperçu de l’architecture du modèle
Le modèle de classification de texte proposé utilise d’abord un BERT pré-entraîné pour effectuer un encodage contextuel dynamique du texte d’entrée, générant des embeddings de mots riches sémantiquement et une représentation globale. Ensuite, un graphe d’instance et un graphe de distribution sont construits à partir de ces caractéristiques : le graphe d’instance capture les similarités par paires d’échantillons, tandis que le graphe de distribution modélise la distribution globale des données ; L’échange itératif d’informations entre les deux graphes permet une amélioration synergique des caractéristiques individuelles et de la structure globale. Par la suite, CST est intégré pour renforcer profondément le réseau de graphes. La reconstruction de centralité des nœuds utilise le PageRank pour quantifier l’influence lexicale, simulant le rôle dominant des éléments centraux dans les réseaux linguistiques. Il s’agit d’une méthode largement validée pour mesurer l’influence globale des nœuds dans les topologies de réseaux complexes et bien adaptée pour capturer la dispersion sémantique asymétrique des nœuds lexicaux centraux dans les systèmes de langage. Un cadre de génération de prototypes « micro–meso–macro » à trois niveaux émule le processus émergent de la sémantique locale aux représentations holistiques des catégories. Enfin, les représentations de caractéristiques améliorées sont introduites dans un classificateur pour produire les probabilités finales de la classe.

Interaction des fonctionnalités avec le GNN conscient de la distribution
Pour optimiser la capacité de généralisation de l’ETC et capturer efficacement des relations sémantiques complexes entre les textes et les caractéristiques de distribution d’échantillons (SDF), cette étude construit un modèle ETC basé sur les caractéristiques de distribution et la CST. Il permet d’exploiter en profondeur l’information globale et locale dans le texte en intégrant des mécanismes tels que le GNN et l’intégration dynamique de texte. GNN est un modèle DL spécifiquement conçu pour traiter des données structurées en graphes. Le principe fondamental est d’utiliser un mécanisme de transmission de messages (où chaque nœud du graphe agrège les informations de caractéristiques de ses nœuds voisins) et de les combiner avec son propre état. À travers plusieurs cycles de mises à jour itératives, il apprend progressivement une représentation en haute dimension incluant la structure topologique. Ce processus permet aux nœuds de capturer la structure et les dépendances de caractéristiques du voisinage local et même du graphe global. Pour surmonter les limites des modèles de séquences traditionnels dans la modélisation des dépendances à longue portée et des relations globales, cette étude utilise le GNN pour capturer des associations sémantiques complexes et des relations structurelles entre échantillons. En raison de l’attention portée par GNN sur les informations de corrélation directe entre échantillons individuels, il ignore les caractéristiques globales de distribution de l’ensembled’échantillons 14, 15, 16. Par conséquent, cette étude propose un modèle GNN qui prend en compte la SDF. Ce modèle introduit BERT pour l’intégration dynamique de texte et le combine avec un réseau prototype pour calculer les différences de caractéristiques des échantillons. BERT est un modèle de langage pré-entraîné basé sur l’architecture Transformer. Le principe fondamental est de capturer simultanément l’information sémantique de chaque mot dans le contexte via un encodeur bidirectionnel, puis de l’entraîner à l’avance sur un corpus à grande échelle en utilisant deux tâches : « modèle de langage masqué » et « prédiction de la phrase suivante ». Dans les modèles de langage masqués, certains mots de l’entrée sont masqués aléatoirement, et le modèle doit prédire le mot original en fonction du contexte. La prédiction suivante détermine si les deux phrases sont consécutives. Après pré-entraînement, BERT peut s’adapter rapidement à diverses tâches de traitement du langage naturel grâce à un ajustement fin, améliorant significativement les performances et fournissant des représentations de caractéristiques de haute qualité pour la construction ultérieure de la structure des graphes. La structure spécifique du modèle ETC construit dans cette étude est illustrée à la Figure 2.

figure-protocol-2
Figure 2 : Conception architecturale du modèle de classification de texte anglais intégré à CST en tenant compte des caractéristiques de distribution des échantillons. La figure présente la conception architecturale du modèle anglais de classification des textes, intégrée à la théorie des systèmes complexes (CST) et tenant compte des caractéristiques de distribution des échantillons de texte. L’architecture fusionne l’intégration contextuelle dynamique basée sur BERT, le réseau neuronal de graphes sensible à la distribution (GNN) et les mécanismes d’amélioration des CST, et permet une exploration approfondie d’informations sémantiques globales et locales dans des textes anglais grâce à une modélisation collaborative multi-modules. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Dans ce modèle, pour un ensemble de données général, le texte anglais entré dans le modèle BERT génère une séquence de jetons via un tokeniseur. La méthode de construction de la suite est illustrée dans l’équation (1).

[CLS], un 1, un2,... an, [SEP] (1)

Dans l’équation (1), [CLS] est le marqueur de classification situé au début de la séquence. BERT générera un état caché de position fixe pour [CLS] pendant le processus d’entraînement. Cet état est directement utilisé pour la représentation sémantique globale de l’ensemble du texte. Un1, un2,... Un n représente un mot ou un sous-mot dans le texte. [SEP] est un délimiteur utilisé pour marquer la fin d’une phrase. Après le traitement par Bert de la séquence ci-dessus, les caractéristiques de chaque jeton sont obtenues, fournissant des informations contextuelles structurées pour le modèle. Pour les ensembles de données spéciaux contenant des entités, si des méthodes conventionnelles de construction de séquences sont utilisées, l’information de position contenue par ces entités sera perdue. Par conséquent, cette étude construit la séquence en utilisant la méthode présentée dans l’équation (2).

figure-protocol-3(2)

Dans l’équation (2), [E1], [/E1], [E2] et [/E2] sont les jetons définis pour déterminer les positions de départ et de fin de deux entités. De même, après le traitement Bert, les caractéristiques de sortie de ces jetons transporteront l’information sémantique des entités correspondantes, exploitant ainsi mieux l’information importante de localisation des entités. Par la suite, cette étude utilise un modèle GNN prenant en compte la SDF pour améliorer la distribution et les caractéristiques d’instance des échantillons. La structure du modèle est illustrée à la Figure 3.

figure-protocol-4
Figure 3 : Architecture d’interaction de caractéristiques à double graphe du modèle de réseau de neurones graphiques sensible à la distribution. La figure présente l’architecture d’interaction de caractéristiques à double graphe du modèle GNN sensible à la distribution pour la classification du texte anglais. L’architecture construit un graphe de points pour l’encodage de similarité au niveau des instances et un graphe de distribution pour l’encodage de similarité au niveau distribution, et permet d’améliorer les caractéristiques via l’interaction itérative d’information entre les deux graphes, complétant ainsi le cycle d’information inter-niveaux des caractéristiques d’instance et de distribution. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le modèle améliore les caractéristiques grâce à un mécanisme d’interaction en deux étapes. Premièrement, il analyse les caractéristiques de distribution à partir des associations au niveau de l’instance d’échantillons de données, puis optimise dynamiquement les caractéristiques d’instance par échange d’informations au niveau de la distribution. En renforçant itérativement les caractéristiques des instances et des niveaux de distribution, il aboutit finalement à la tâche de classification. Plus précisément, le modèle utilise des graphes ponctuels et des graphes de distribution pour obtenir un échange d’informations. La carte de points utilise le vecteur de caractéristiques d’échantillon de texte (mis à jour par les deux dernières couches de BERT) comme nœud, quantifie la différence de caractéristiques de l’échantillon pour calculer le poids des arêtes via un réseau d’encodage dédié (une couche sigmoïde + deux couches convolutionnelles de normalisation par lot), et utilise une normalisation min-max pour normaliser à l’intervalle [0,1. Un seuil de similarité empirique de 0,2 est fixé pour le seuil d’arête, où les arêtes dont le poids est inférieur à ce seuil est taillé pour éliminer les corrélations faibles au niveau de l’instance. Le graphe de distribution prend les caractéristiques de distribution du texte fusionné comme des nœuds, avec des poids d’arêtes calculés en fonction de la similarité cosinus des vecteurs de caractéristiques de distribution et normalisés via normalisation L2 pour assurer la cohérence des métriques. Un seuil d’arête de 0,15 est adopté, et les arêtes dont le poids est inférieur à cette valeur sont supprimées, tandis que les poids d’arêtes valides restants sont ensuite cartographiés et standardisés par un perceptron multicouche afin d’améliorer la discriminabilité des associations au niveau de la distribution. Cette étude définit un graphe figure-protocol-5 de points pour l’itération de la couche l, où le nœud figure-protocol-6 représente les caractéristiques d’échantillon et l’arête figure-protocol-7 encode la similarité au niveau de l’instance. Carte figure-protocol-8de distribution , nœud figure-protocol-9 représente les caractéristiques de l’échantillon, et l’arête figure-protocol-10 encode la similarité au niveau de distribution. Prenant la roue l-ième à l+1-ième comme exemple, le calcul de la relation au niveau des instances calcule la similarité des points à partir des différences de caractéristiques, comme montré dans l’équation (3).

figure-protocol-11 (3)

Dans l’équation (3), figure-protocol-12 et figure-protocol-13 sont les poids des arêtes entre les nœuds i et j lors des l-ième et l-1-ième itérations du graphe ponctuel, reflétant la similarité des caractéristiques d’échantillon. figure-protocol-14 est un réseau d’encodage utilisé pour convertir les différences de caractéristiques des nœuds en échelles de poids d’arête, composée d’une couche de sigmoïde et de deux couches de fonctions d’activation par lots de convolution. Lorsque figure-protocol-15 et figure-protocol-16 sont la l-1-ième itération, les vecteurs propres des nœuds i et j sont mis à jour par Bert dans les deux dernières couches. Ensuite, les caractéristiques de distribution sont calculées à partir des relations d’instance, comme montré dans l’équation (4).

figure-protocol-17(4)

Dans l’équation (4), figure-protocol-18 est le vecteur propre du nœud i dans le graphe de distribution de la l-ième couche. MLP1 est un perceptron multi-couches composé de fonctions d’activation et de couches entièrement connectées, qui mappe les caractéristiques composites concaténées en nouvelles caractéristiques de distribution. Ensuite, la relation de distribution est calculée en fonction des caractéristiques de distribution, et les caractéristiques d’instance sont calculées à partir de la relation de distribution pour compléter la boucle d’information inter-niveaux.

Mécanismes d’amélioration des systèmes complexes
Pour améliorer davantage la capacité de généralisation, la CST est appliquée au modèle ci-dessus dans cette étude. L’évolution dynamique des systèmes complexes se manifeste par la répartition hétérogène de l’influence des nœuds. Pour simuler le rôle dominant du vocabulaire de base dans la propagation sémantique des systèmes linguistiques, cette étude introduit l’indice de centralité des nœuds afin de reconstruire le mécanisme de propagation de l’information. Le graphe ponctuel Hp construit pour chaque tâche de scénario utilise l’algorithme PageRank pour quantifier la centralité du nœud C(hi), comme montré dans l’équation (5)17.

figure-protocol-19(5)

Dans l’équation (5), α est le coefficient d’amortissement α = 0,85. N(h i) représente l’ensemble des nœuds voisins, et L(h j) est le degré du nœud. L’équation (5) remplace le processus de propagation en cascade de l’influence du vocabulaire dans les réseaux linguistiques simulés, permettant au vocabulaire de base (comme les verbes et les mots thématiques) de gagner en centralité. Ensuite, la centralité des nœuds est couplée avec des poids d’arêtes pour ajuster dynamiquement la force de propagation de l’information entre les nœuds. La fonction de couplage λij est indiquée dans l’équation (6).

figure-protocol-20(6)

Dans l’équation (6), σ est la fonction d’activation sigmoïde, WT est le vecteur de poids apprenable, et b signifie le terme de polarisation. Le couplage des poids centrals et des arêtes équilibre dynamiquement les relations locales avec l’importance mondiale, améliorant ainsi l’adaptabilité du modèle aux changements dynamiques des tâches. L’émergence de la CST se manifeste dans la langue anglaise par une sémantique globale qui dépasse la somme du vocabulairelocal 18. Pour utiliser cette caractéristique dans l’ETC, cette étude conçoit un cadre de génération de prototypes à trois niveaux pour simuler le processus d’émergence des micro-caractéristiques aux macro-catégories, comme montré à la Figure 4.

figure-protocol-21
Figure 4 : Construction progressive du cadre de génération de prototypes micro-méso-macro à trois niveaux pour l’émergence sémantique linguistique. La figure illustre la construction étape par étape du cadre de génération de prototypes à trois niveaux micro-méso-macro pour simuler l’émergence sémantique linguistique dans la classification des textes anglais. Le cadre construit des représentations hiérarchiques de catégories de textes par regroupement de sous-classes micro avec des moyennes K, fusion de prototypes de sous-classes meso basée sur la pondération par similarité de distribution, et intégration macro non linéaire via un mécanisme d’attention, simulant la caractéristique émergente de « le tout est supérieur à la somme de ses parties » dans les systèmes de langage. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le processus ci-dessus construit des représentations de catégories de texte étape par étape, du micro au macro afin d’améliorer la capacité de généralisation du modèle. Au niveau micro, K sous-classes sont générées en regroupant les représentations d’inclusion d’échantillons de chaque catégorie de texte. K-moyennes sont utilisées pour diviser les échantillons de la catégorie en sous-groupes, et la position du centroïde de chaque sous-groupe est calculée comme le prototype desous-classe 19. Au niveau mésoscopique, la similarité de distribution de chaque prototype de sous-classe est calculée, une matrice de similarité est générée, puis les prototypes de sous-classes sont réassemblés sur la base des poids de similarité pour quantifier la corrélation entre les sous-classes. Le calcul du poids de similarité de sous-classe wij est montré dans l’équation (7).

figure-protocol-22 (7)

Dans l’équation (7), figure-protocol-23 se trouve la divergence de Jensen-Shannon, utilisée pour mesurer la différence de distribution entre deux sous-classes figure-protocol-24 et figure-protocol-2520. Enfin, les prototypes de sous-classes sont pondérés et fusionnés pour obtenir un ensemble de représentations figure-protocol-26de distribution de classes . Au niveau macro, les poids d’importance de chaque sous-classe sont appris via des mécanismes d’attention, et des transformations non linéaires sont introduites pour simuler le processus d’émergence, aboutissant au prototype final de classe c comme montré dans l’équation (8).

figure-protocol-27(8)

Dans l’équation (8), αk signifie le poids d’attention de la classe k. U désigne la matrice de poids par transformation non linéaire. Tanh(·) est utilisé pour améliorer la représentation non linéaire et simuler la somme globale des parties caractéristiques des systèmes complexes. Chaque niveau capture la diversité au sein des catégories via une structure de sous-classes, permet de réduire la similarité de la distribution des poids pour réduire l’influence des sous-classes bruitantes, et se concentre dynamiquement sur les traits discriminants via des mécanismes d’attention pour améliorer la capacité de généralisation du modèle. La CST est principalement intégrée au GNN par deux mecanismes. La première consiste à introduire la centralité des nœuds pour reconstruire le processus de diffusion de l’information et simuler la distribution hétérogène de l’influence lexicale dans le système linguistique. La centralité des nœuds est quantifiée via l’algorithme PageRank et couplée dynamiquement avec les poids des arêtes, permettant au vocabulaire principal de dominer la propagation sémantique et améliorant l’adaptabilité du modèle aux changements dynamiques des tâches. La seconde consiste à concevoir un cadre de génération de prototypes à trois niveaux, allant du clustering de micro-sous-classes à la fusion de prototypes par macro-catégories, afin de simuler la caractéristique émergente dans le système de langage selon laquelle « le tout est supérieur à la somme de ses parties ». Ce cadre permet une intégration hiérarchique des caractéristiques locales à la sémantique globale grâce à la similarité de distribution, la pondération et les mécanismes d’attention.

En résumé, l’innovation centrale du modèle ETC construit réside dans l’intégration profonde des idées de CST dans le cadre du GNN. En reconstruisant le mécanisme de diffusion de l’information via la centralité des nœuds, le modèle simule le rôle principal des éléments fondamentaux dans le système linguistique et améliore son adaptabilité aux dynamiques de tâches. Grâce au cadre de génération de prototypes à trois niveaux, le modèle réalise le processus d’émergence des caractéristiques locales vers la sémantique globale, améliorant ainsi sa capacité à capturer la diversité et les caractéristiques discriminantes au sein de la catégorie. Cette méthode évite la limitation des GNN traditionnels qui ne reposent que sur des relations au niveau des instances. Grâce à l’interaction au niveau de la distribution et aux caractéristiques complexes du système, il offre une nouvelle solution pour améliorer la capacité de généralisation du modèle dans des scénarios à peu de coups et à champs inter-domaines.

Les propriétés émergentes de la CST correspondent à un cadre de génération de prototypes à trois niveaux. Dans les systèmes linguistiques, le principe selon lequel « le tout est supérieur à la somme de ses parties » se manifeste comme un saut sémantique des significations locales des mots vers les catégories textuelles globales. Cette étude simule ce processus à travers un mécanisme de génération de prototypes « micro-méso-macro » à trois niveaux : au niveau micro, les embeddings d’échantillons sont regroupés pour former des prototypes de sous-classe ; Au niveau méso, ces prototypes sont pondérés et fusionnés selon la similarité de distribution ; et au niveau macro, les prototypes finaux de catégorie sont synthétisés de manière non linéaire via un mécanisme d’attention. Par exemple, dans la classification du sentiment, plusieurs mots négatifs comme « décevant », « lent » et « coûteux » se mélangent et se transforment de manière non linéaire pour émerger comme un sentiment global fort d'« évaluation négative ». La centralité et l’hétérogénéité des nœuds dans la CST s’alignent avec un mécanisme de propagation de l’information basé sur la reconstruction de la centralité des nœuds. Dans les réseaux linguistiques, l’influence des mots est répartie de manière inégale, les mots clés (par exemple, verbes, termes thématiques) jouant un rôle dominant dans la propagation sémantique. Cette étude quantifie la centralité des nœuds à l’aide de l’algorithme PageRank et la couple dynamiquement avec des poids d’arête pour ajuster l’intensité de la diffusion de l’information entre les nœuds. Par exemple, dans la catégorisation des actualités, le terme « élection » occupe une grande centralité dans les textes politiques, conduisant des nœuds adjacents comme « vote » et « campagne » à gagner en importance lors de l’agrégation d’informations, renforçant ainsi la représentation sémantique de ce sujet. La nature dynamique et adaptative de la CST correspond aux GNN conscients de la distribution et à un mécanisme d’expérimentation pédagogique au sein de la méta-distillation. Les systèmes linguistiques évoluent dynamiquement selon le contexte et les exigences de la tâche. Les modèles capturent les changements globaux de distribution dans les ensembles de données grâce à des GNN conscients de la distribution. Simultanément, un mécanisme d’expérimentation pédagogique piloté par le méta-apprentissage est introduit dans le TSMDM, permettant aux MT d’ajuster dynamiquement les paramètres en fonction des retours des SM. Par exemple, dans l’analyse de sentiment inter-domaine, le modèle peut rapidement adapter les poids des caractéristiques en fonction de la distribution des données du domaine cible et affiner les paramètres de la MT lors de la méta-distillation pour améliorer l’efficacité d’adaptation aux nouveaux domaines.

Modèle LTC basé sur TSMDM
Pipeline de méta-distillation en deux étapes
Pour relever les défis liés au coût de calcul élevé et aux difficultés de déploiement dans des environnements à ressources limitées, un modèle léger de classification de texte basé sur un TSMDM est proposé. Cette méthode de méta-distillation exécute le processus de distillation dans un ordre séquentiel strict avec deux étapes distinctes. La deuxième étape n’est lancée qu’après l’achèvement et la convergence de la formation de la première étape : 1) l’étape de compression des connaissances de l’assistant enseignant-enseignant (TA) et 2) l’étape de distillation légère de l’assistant à l’élève intégrée à l’adaptation des paramètres de méta-apprentissage. Cette approche permet un transfert efficace des connaissances d’une MT complexe vers une SM légère grâce à une distillation en deux étapes, tout en intégrant un mécanisme de méta-apprentissage pour optimiser dynamiquement la stratégie de transfert de connaissances pendant leprocessus 21,22. L’ensemble du pipeline est illustré à la Figure 5.

figure-protocol-28
Figure 5 : Conception en pipeline du modèle de classification de texte léger avec mécanisme de méta-distillation en deux étapes. La figure conçoit le pipeline du modèle de classification de texte léger avec le mécanisme de méta-distillation en deux étapes (TSMDM). Le pipeline comprend un modèle enseignant (source de connaissances à haute complexité), un modèle d’assistant d’enseignement (couche tampon de complexité intermédiaire) et un modèle élève (modèle cible léger), et met en œuvre un transfert efficace des connaissances à travers deux étapes séquentielles : compression des connaissances enseignant-assistant et distillation légère d’assistant d’enseignement à élève intégrée avec méta-apprentissage. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La méthode comporte trois rôles : un MT, un modèle TA et un SM, le processus de distillation étant divisé en deux étapes : distillation enseignant-TA et distillation TA-élève. Lors de la première étape de compression des connaissances Teacher-to-TA, les connaissances issues de la MT sont d’abord compressées dans un modèle TA à complexité intermédiaire afin de réduire la perte d’information causée par des lacunes de capacité excessives dans la distillation directe. La MT, servant de source de connaissances, transfère à la fois ses probabilités de classification de sortie et ses caractéristiques de couche intermédiaire au modèle TA. Le modèle TA est entraîné en alignant ses sorties et ses représentations de caractéristiques avec celles de l’enseignant, en utilisant une fonction de perte combinée qui intègre la perte de classification et la perte d’alignementdes caractéristiques 21. Lors de la deuxième phase de distillation légère TA-Étudiant, qui est lancée lors de la convergence du modèle TA, les connaissances sont distillées du modèle TA vers le SM léger final. Cette étape utilise également une double supervision (logits de classification et caractéristiques intermédiaires) et intègre un mécanisme de méta-apprentissage : la MT mène des « expériences pédagogiques » sur des tâches auxiliaires pour évaluer l’état d’apprentissage de l’élève et ajuste dynamiquement ses propres paramètres pour fournir des conseils plus adaptatifs et ciblés. Le SM complète l’entraînement en minimisant à la fois l’écart de sortie et la distance des caractéristiques par rapport au modèle TA, réalisant ainsi une réduction significative des paramètres tout en préservant la performance de classification dans la plus grande mesurepossible 22.

Méta-apprentissage avec expériences pédagogiques
Dans les méthodes traditionnelles de distillation du savoir, le TM entraîné guide le SM en participant au calcul des pertes. Cependant, les MT à paramètres fixes sont difficiles à évaluer le niveau d’apprentissage réel des SM, ni à quantifier la contribution spécifique de leurs recommandations à la mise à jour des paramètresSM 23,24. Ainsi, cette étude introduit des idées de méta-apprentissage dans le processus de distillation, permettant à la MT d’ajuster ses propres paramètres en fonction du retour d’information du SM. Le procédé de distillation est illustré à la Figure 6.

figure-protocol-29
Figure 6 : Processus itératif d’optimisation des paramètres de la méta-distillation combiné à l’enseignement du mécanisme expérimental. La figure illustre le processus itératif d’optimisation des paramètres de la méta-distillation combiné au mécanisme d’expérimentation pédagogique pour l’allégement des modèles de classification de texte en anglais. Le processus génère un apprenant intérieur temporaire à partir du modèle de l’élève, quantifie la perte d’effet d’enseignement via la performance simulée de l’apprentissage intérieur, et permet au modèle enseignant d’ajuster ses propres paramètres via la rétropropagation de la perte, optimisant ainsi la stratégie de transfert de connaissances ultérieure. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La MT optimise les paramètres à travers des tâches de classification conventionnelles durant sa propre phase d’entraînement, ce qui entraîne une perte de classification de base LT qui reflète sa performance initiale. Après avoir terminé la formation, le SM S est répliqué pour générer une copie temporaire de l’apprenant interne S1. La MT réalise des expériences d’enseignement sur S1, et l’erreur de performance globale présentée par S1 dans cet entraînement simulé est quantifiée par une perte LQ. Ce signal est utilisé comme retour d’information à la TM pour évaluer l’efficacité de l’enseignement. Grâce à la rétropropagation de LQ, la MT ajuste activement ses propres paramètres et optimise sa méthode de transmission des connaissances. Après avoir terminé l’optimisation du méta-apprentissage, la MT effectue une distillation formelle des connaissances sur le SM S original, et utilise également la perte du modèle LS comme retour pour enseigner l’évaluation de l’efficacité à la MT. Pour alléger le modèle ETC, cette étude envisagera d’intégrer le modèle GNN SDF comme TM dans le processus d’expérience pédagogique, comme montré à la Figure 7.

figure-protocol-30
Figure 7 : Flux de mise à jour des paramètres du mécanisme d’expérimentation pédagogique pour l’optimisation des modèles enseignants en méta-distillation. La figure montre le flux de mise à jour des paramètres du mécanisme d’expérimentation pédagogique pour l’optimisation des modèles enseignants dans le processus de méta-distillation. Le flux calcule d’abord la perte douce entre la prédiction de l’apprenant intérieur et celle du modèle enseignant grâce à la fonction de perte d’erreur quadratique moyenne, combine la perte douce avec l’erreur d’étiquette dure pour former la perte totale de formation, et met à jour les paramètres du modèle enseignant par rétropropagation de l’erreur totale pondérée afin d’améliorer son efficacité pédagogique. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Après avoir terminé la formation à la distillation des connaissances, le SM calcule d’abord la différence entre les résultats prédits de la MT et les véritables marques. Par la suite, la fonction de perte MSE est utilisée pour mesurer la distance entre la prédiction SM (S 1 de l’apprenant intérieur) et la prédiction TM. Cette valeur de distance est utilisée comme la perte douce25. L’objectif final de formation consiste en une combinaison pondérée d’erreur d’inscription dure et de perte douce. En rétropropageant l’erreur totale pondérée, les paramètres de la MT sont mis à jour, améliorant ainsi l’efficacité pédagogique de la MT. Le calcul des paramètres de l’apprenant interne S1 est montré dans l’équation (9).

figure-protocol-31(9)

Dans l’équation (9), figure-protocol-32 et figure-protocol-33 sont les paramètres internes de l’apprenant et leurs paramètres initiaux influencés par le paramètre TM γT. λ (le taux d’apprentissage, λ = 0,005) contrôle la taille de l’étape de mise à jour des paramètres pour les apprenants internes (c’est-à-dire les copies des SM) lors de la méta-distillation26. L’équation (9) calcule les gradients de perte par rétropropagation, tandis que λ met à jour les paramètres des apprenants internes. Ce mécanisme reflète les caractéristiques d’apprentissage des SM, permettant aux MT de recevoir des retours et d’ajuster leurs stratégies d’enseignement, améliorant ainsi l’efficacité de la distillation des connaissances ultérieure. Le calcul de la perte LS en méta-apprentissage est montré dans l’équation (10).

figure-protocol-34 (10)

Dans l’équation (10), B est la séquence d’échantillons de méta-apprentissage.

Optimisation du transfert de connaissances avec la conception des pertes et le modèle assistant
Pour renforcer davantage l’efficacité de la distillation des connaissances, cette étude obtient la perte globale en calculant la perte de classification et la perte de caractéristiques. Parmi elles, la perte de caractéristiques adopte un mécanisme rétrospectif, utilisant les sorties superficielles et courantes de la MT pour guider la SM, telle qu’exprimée dans l’équation (11).

figure-protocol-35(11)

Dans l’équation (11), I est l’ensemble des indices de la couche de caractéristiques. D est une fonction de distance utilisée pour calculer la différence entre deux représentations de caractéristiques. figure-protocol-36 et figure-protocol-37 sont des fonctions de représentation objective dans les TM et SM, qui convertissent les sorties figure-protocol-38 de caractéristiques et figure-protocol-39 des couches i-ème et j-ième en matrices d’attention. La perte de classification combine la perte d’entropie croisée entre la sortie SM et la véritable étiquette, ainsi que la MSE entre la sortie des deux modèles, comme la perte douce27,28. En fin de compte, la perte globale est obtenue en pondérant les deux, aidant ainsi le SM à mieux recevoir des conseils de la MT. Pour minimiser la perte de performance lors du processus de distillation des connaissances, cette étude place le modèle de l’assistant d’enseignement entre deux modèles, comme illustré à la Figure 8.

figure-protocol-40
Figure 8 : Flux de traitement de distillation des connaissances en deux étapes avec modèle d’assistant pédagogique comme couche tampon intermédiaire. La figure illustre le flux de traitement de la distillation des connaissances en deux étapes avec le modèle de l’assistant d’enseignement comme couche tampon intermédiaire. Les fusibles du premier étage comportent des pertes et des pertes de classification pour construire la perte totale de distillation, et entraînent le modèle d’assistant d’enseignement avec les connaissances du modèle enseignant ; La deuxième étape adopte la même stratégie de fusion par perte pour distiller les connaissances du modèle de l’assistant d’enseignement dans le modèle de l’élève, réduisant ainsi la perte d’information causée par des écarts de complexité excessifs entre les modèles enseignant et élève. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Après avoir terminé la phase de méta-distillation, le modèle TA et la TM subissent une distillation conventionnelle de connaissances. Au cours de ce processus, les caractéristiques des deux sont extraites de manière synchrone et la perte correspondante La est calculée. Par la suite, cette perte de caractéristique est fusionnée avec la perte de classification LM1 du modèle pour former la fonction figure-protocol-41 de perte de distillation dans la première étape, comme montré dans l’équation (12).

figure-protocol-42(12)

Dans l’équation (12), β est le coefficient de poids utilisé pour contrôler la proportion de perte de caractéristiques et de perte de classification dans la perte totale. figure-protocol-43 et figure-protocol-44 sont des fonctions de représentation objective dans le modèle de l’assistant d’enseignement et la MT, qui convertissent les sorties figure-protocol-45 des caractéristiques et figure-protocol-46 des couches i-ème et j-ième en matrices d’attention. zT et zM sont les sorties du modèle TM et de l’assistant. Le processus de distillation du modèle de l’assistant d’enseignement vers le SM est le même que le procédé ci-dessus, ce qui minimise la perte du SM à travers plusieurs itérations pour compléter le transfert des connaissances.

En conclusion, la contribution principale du TSMDM proposé réside dans l’optimisation du processus de transfert des connaissances via le mécanisme de méta-apprentissage. Comparée à la distillation traditionnelle, l’avantage principal de cette méthode réside dans sa capacité d’enseignement dynamique : la MT peut ajuster ses propres paramètres via le mécanisme d’expérimentation pédagogique basé sur le retour en temps réel du SM, fournissant ainsi des conseils plus ciblés. Par contre, le modèle de l’assistant d’enseignement est introduit comme une couche tampon, comblant efficacement l’écart de complexité entre les MT et les SM et réduisant la perte d’information lors du transfert de connaissances. La conception collaborative de cette « stratégie d’optimisation du méta-apprentissage » et de « tampon à deux niveaux pour réduire la difficulté de transfert » permet au SM final d’obtenir un allégement significatif tout en conservant au maximum les connaissances fondamentales distillées de la MT complexe.

Disponibilité des données
Les ensembles de données générés pendant et/ou analysés durant l’étude en cours sont fournis dans le Fichier Supplémentaire 1.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mise en place expérimentale et jeu de données :
Pour évaluer de manière exhaustive les performances et l’efficacité légère du modèle proposé dans les tâches de classification inter-domaines à petits échantillons, des expériences sont menées sur quatre ensembles de données : FewRel (classification relationnelle en petits échantillons), ARSC (analyse de sentiment inter-domaine), Reuters-21578 (catégorisation multi-sujets d’actualités) et ArXiv (résumés académiques longs...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour améliorer la capacité de généralisation de l’ETC dans des scénarios à peu de tirs et inter-domaines tout en réduisant les coûts de calcul, cette étude propose un cadre léger de classification de texte intégrant CST avec TSMDM. L’intégration de la CST avec un cadre TSMDM répond aux limites fondamentales des méthodes ETC existantes (mauvaise généralisation en poche photo/cross-domain et coûts computationnels élevés) en intégrant la dynamique des systèmes linguistiques et les propriété...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à divulguer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à reconnaître.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Central Processing Unit (CPU)Vendeurs de matériels commerciaux (Intel, Dell, Lenovo)Intel i5-7300HQSpécifications matérielles
Graphics Processing Unit (GPU)Vendeurs de matériels commerciaux (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 Go VRAMSpécifications matérielles
Random Access Memory (RAM)Vendeurs de matériels commerciaux16 Go DDR4Spécifications matérielles
Solid State Drive (SSD)Vendeurs de matériels commerciaux1 To NVMe SSDSpécifications matérielles
Operating SystemSite officiel de MicrosoftWindows 10 (64 bits)Logiciel système
PythonSite officiel de Python (python.org)Python 3.8Langage de programmation
PyTorchSite officiel de PyTorch (pytorch.org)PyTorch 1.11.0Frameworks d'apprentissage profond & Bibliothèques de base
CUDASite officiel de NVIDIACUDA 11.3Frameworks d'apprentissage profond & Bibliothèques de base
Hugging Face TransformersHugging Face Hub (huggingface.co)Version stable (adaptée à Python 3.8/PyTorch 1.11.0)Frameworks d'apprentissage profond & Bibliothèques de base
NumPyPyPI (pypi.org)Version stable (adaptée à Python 3.8)Traitement de données & Bibliothèques statistiques
PandasPyPI (pypi.org)Version stable (adaptée à Python 3.8)Traitement de données & Bibliothèques statistiques
Scikit-learnPyPI (pypi.org)Version stable (adaptée à Python 3.8)Traitement de données & Bibliothèques statistiques
SciPyPyPI (pypi.org)Version stable (adaptée à Python 3.8)Traitement de données & Bibliothèques statistiques
MatplotlibPyPI (pypi.org)Version stable (adaptée à Python 3.8)Bibliothèque de visualisation
AdamWIntégré à PyTorchIntégré dans PyTorch 1.11.0Optimiseur
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Modèles pré-entraînés
FewRelDépôt officiel FewRel (GitHub) / Wikipedia100 catégories de relations sémantiques, 700 phrases par catégorie; division train/validation/test (5:2:3)Ensembles de données
ARSCEnsembles de données d'analyse de sentiments multi-domaines publics (GitHub/ACL Anthology)23 catégories de produits Amazon, 69 tâches d'analyse de sentiments binaire; division train/validation/test (4:2:3)Ensembles de données
Reuters-21578UCI Machine Learning Repository / Archive officielle de Reuters21 578 articles de presse, 90 catégories thématiques; méthode de partition ModApteEnsembles de données
ArXivAPI publique ArXiv (arxiv.org)Résumés de travaux en informatique; division train/validation/test (7:2:1)Ensembles de données
TokenizerHugging Face Hub (huggingface.co)Tokenizer BERT-base-casedAutres outils essentiels
GitSite officiel de Git (git-scm.com)Dernière version stableAutres outils essentiels

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Articles connexes