Research Article

Klasyfikacja lekka angielskich tekstów z użyciem głębokiego uczenia się opartego na teorii złożonych systemów

DOI:

10.3791/69344

June 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie proponuje lekką sieciową sieć neuronową graficzną z meta-destylacją i meta-uczeniem, aby poprawić klasyfikację tekstu angielskiego. Poprawia generalizację w ustawieniach z małymi danymi i między domenami, jednocześnie zmniejszając koszt obliczeniowy i utrzymując wysoką wydajność.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Globalizacja i rozwój technologii informacyjnych spowodowały wzrost ilości danych tekstowych w języku angielskim, a istnieje pilna potrzeba ich efektywnej klasyfikacji. Aby poprawić zdolność generalizacji klasyfikacji tekstu angielskiego w scenariuszach z małymi próbkami i międzydomenowymi oraz osiągnąć lekkość modeli, w niniejszym badaniu połączono teorię systemów złożonych z głębokim uczeniem, aby skonstruować model sieci neuronowej oparty na grafie, który w pełni uwzględnia cechy dystrybucyjne próbek tekstowych. Metoda meta-destylacji dwóch poziomów, połączona ze strategiami meta-uczenia, dynamicznie dostosowuje parametry modelu nauczycielskiego i optymalizuje cały proces transferu wiedzy. Wyniki eksperymentów pokazują, że wydajność klasyfikacji zaproponowanego modelu w zadaniach klasyfikacji tekstu z niewielką liczbą próbek i międzydomenową jest znacznie lepsza niż w tradycyjnych sieciach neuronowych opartych na grafie i innych głównych modelach porównawczych. Jeżeli chodzi o lekkość, SM wygenerowana przez mechanizm meta-destylacji dwuetapowej utrzymuje wysoki poziom wydajności w przypadku zbiorów danych dotyczących klasyfikacji tekstu wielotematycznego, jednocześnie znacznie skracając czas obliczeń. Ponadto ta metoda może utrzymywać wysoką wydajność i stabilną wydajność klasyfikacji w scenariuszach przetwarzania długich tekstów i oferuje wyraźne zalety w zakresie wydajności obliczeniowej w porównaniu z tradycyjnymi metodami destylacji i innymi metodami opisanymi w literaturze. Zaproponowana metoda efektywnie poprawia wydajność klasyfikacji tekstu angielskiego w scenariuszach z małymi próbkami i międzydomenowymi, znacznie zmniejszając koszt obliczeniowy, zapewniając tym samym wykonalne i efektywne rozwiązanie techniczne dla klasyfikacji tekstu angielskiego w środowiskach o ograniczonych zasobach.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przyspieszenie globalizacji i postępy w technologii informacyjnej doprowadziły do eksplozywnego wzrostu danych tekstowych w języku angielskim w różnych dziedzinach, takich jak media społecznościowe, badania akademickie i komunikacja biznesowa. Skuteczne klasyfikowanie tych tekstów w celu pozyskiwania informacji, analizy sentymentu, zarządzania treścią i innych funkcji stało się ważnym zadaniem w przetwarzaniu języka naturalnego1. Celem klasyfikacji tekstów angielskich (ETC) jest klasyfikowanie tekstów do wstępnie określonych kategorii na podstawie ich treści semantycznej. Jednak złożoność języka naturalnego, w tym jego niejednoznaczność, zależność od kontekstu i różnorodność wyrażania, stanowi wiele wyzwań dla zadań klasyfikacji tekstu2. Obecnie rozwój technologii Deep Learning (DL) stworzył nowe możliwości dla klasyfikacji tekstu. Pre-treningowane modele językowe reprezentowane przez Bidirectional Encoder Representations from Transformers (BERT) i jego warianty mogą uczyć się bogatej kontekstowej informacji semantycznej poprzez pre-trening na dużych korpusach, co znacząco poprawia wydajność klasyfikacji tekstu3. Jednak obecne metody ETC nadal napotykają na dwa kluczowe ograniczenia: pierwsze, często podkreślają optymalizację pojedynczego modelu lub funkcji, zaniedbując właściwości języka jako złożonego systemu, takie jak jego dynamiczność i zachowanie emergentne, co prowadzi do nieadekwatnej generalizacji w scenariuszach z niską ilością danych lub między domenami; drugie, pomimo silnej wydajności pre-trenowanych modeli, ich wysoki koszt obliczeniowy i duża liczba parametrów poważnie utrudniają praktyczne wdrożenie w środowiskach o ograniczonych zasobach4,5. Aby rozwiązać te problemy, niniejsze badanie proponuje lekki framework klasyfikacji tekstu integrujący Teorię Systemów Złożonych (CST) i Dwuetapowy Mechanizm Meta-Destylacji (TSMDM).

W kontekście tego badania, CST odnosi się do teoretycznego frameworku, który uważa język naturalny za typowy złożony system z dynamiczną ewolucją, semantyczną emergentnością i heterogeniczną dystrybucją wpływu węzłów leksykalnych. Jest on stosowany do symulowania dominującej roli słownictwa rdzeniowego w propagacji znaczeniowej i emergentnej zasadzie ogólnego semantyki z lokalnych cech leksykalnych, poprawiając w ten sposób głębokie zrozumienie semantyki tekstu modelu i adaptacyjność do scenariuszy z niewielką ilością danych i między domenami. Jego kluczowe wkłady są następujące: teoretycznie, z naszej wiedzy, CST jest systematycznie wprowadzany do zadań klasyfikacji tekstu, symulując dynamiczną ewolucję i semantyczną emergentność systemów językowych, aby poprawić głębokie zrozumienie modelu i adaptacyjność do danych z niewielką ilością danych i między domenami. Metodologicznie, zaprojektowano sieć neuronową grafową (GNN) zawierającą cechy dystrybucji próbki. Połączony innowacyjny TSMDM jest zasadniczo różny od standardowej destylacji wiedzy. Standardowa destylacja wiedzy realizuje jednokierunkowy transfer wiedzy z modelu nauczyciela o stałych parametrach (TM) do lekkiego modelu studenta (SM). Meta-destylacja w tym badaniu integruje strategie meta-uczenia się na podstawie destylacji i może dynamicznie dostosowywać parametry TM na podstawie opinii uczenia się SM. Dwuetapowy projekt dodatkowo ustanawia model asystenta nauczającego jako pośrednią warstwę buforującą, aby złagodzić utratę informacji spowodowana nadmiernymi różnicami w złożoności między TM i SM, osiągając znaczne lekkość modelu przy zachowaniu wysokiej dokładności, zapewniając tym samym wydajne rozwiązanie klasyfikacyjne dla scenariuszy o ograniczonych zasobach.

W dziedzinie ETC, badacze przeprowadzili rozległe eksploracje i zaproponowali różne rozwiązania, które integrują różne cechy i architektury modeli, aby sprostać wyzwaniom technicznym w różnych scenariuszach. R. Zhang i wsp. zaprojektowali wielojęzyczny Pre-trenowany Model Fuzji Wielu Cechy (MP-MFFM), aby sprostać problemowi niewystarczającego przechwytywania długoterminowych informacji kontekstowych i strukturalnych w ETC za pomocą obecnych metod DL. Ta metoda łączyła wielojęzyczny BERT, BiLSTM i text CNN, aby wyodrębnić głębokie informacje semantyczne, globalne i lokalne informacje strukturalne oraz je zlaczyć. Ta metoda poprawiła dokładność, wrażliwość i precyzję na trzech zbiorach danych, weryfikując swoją skuteczność6. C. Madhu i wsp. przyjęli Ramówkę Uczenia Fuzzy Graph na podstawie Cechy Dialektu (DF-FGLF), aby sprostać potrzebom klasyfikacji tekstu w nieuporządkowanych i słabo sklasyfikowanych danych w sieciach społecznościowych, a także wpływowi różnic dialektalnych na międzynarodową klasyfikację języka angielskiego. Połączyli oni semantyczne i różnice dialektu w nauce, aby skonstruować zoptymalizowany rozmyty graf. Kiedy było tylko 10 oznaczonych próbek, wartość F1 dla rozpoznawania dialektu i klasyfikacji tekstu przekraczała 93% i 80%, co było lepsze niż podobne metody i odpowiednie do praktycznej klasyfikacji7. B. Shannaq i wsp. przeprowadzili eksperymenty z wykorzystaniem zbiorów danych angielskich i arabskich, aby zbadać wpływ długości n-gramów na klasyfikację tekstu w różnych systemach pisania i wpływ ce

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby poprawić zdolność generalizacji ETC w scenariuszach małych prób i różnych domen oraz zrealizować lekki model, w niniejszej pracy zaproponowano klasyfikację ramek tekstowych integrujących CST i TSMDM. Ogólny proces tego ramki przedstawiono na Rysunek 1.

figure-protocol-1
Rysunek 1: Wizualizacja czterostopniowej lekkiej ramki klasyfikacji angielskich tekstów integrującej CST i TSMDM. Proces pracy składa się z czterech etapów. Etap 1 wykonuje reprezentację tekstową za pomocą dynamicznych osad z otoczenia BERT z wejściowego angielskiego tekstu. Etap 2 stosuje modelowanie sieci neuronowych na podstawie grafów poprzez zbudowanie grafu tekstowego i obliczenie relacji na poziomie instancji i dystrybucji. Etap 3 modeluje powstawanie semantyczne poprzez rekonstrukcję centralności węzłów i wielopoziomową generację prototypów, aby uzyskać ostateczny prototyp kategorii. Etap 4 przeprowadza dwuetapowy dystylację elementarną, gdzie trenuje się model nauczyciela, a wiedza jest przekazywana poprzez meta-dystylację, aby wyprodukować ostateczny model ucznia. Proszę kliknąć tutaj, aby wyświetlić większą wersję tej figury.

Po pierwsze, na etapie reprezentacji tekstowej i dynamicznego osadzanie, model BERT jest wykorzystywany do dynamicznego osadzanie tekstu wejściowego i przechwytywania informacyjnych semantycznych danych. Drugi etap to dystrybucyjnie świadome modelowanie GNN, które uwzględnia charakterystyczne cechy prób, konstruuje model GNN i wzmacnia reprezentację cech poprzez podwójną interakcję informacji na poziomie instancji i dystrybucji. Trzeci etap to modelowanie powstawania semantycznego poprowadzone przez hybrydową teorię systemów, wprowadzającą rekonstrukcję centralności węzłów i mechanizm trójpoziomowego generowania prototypów, aby symulować dynamikę i powstawanie systemu językowego. Wreszcie, na czwartym etapie, przeprowadza się dwuetapowy lekkie meta-dystylację. Proces dystylakcji wiedzy jest optymalizowany poprzez asystenta modelu i strategię meta-uczenia, aby osiągnąć wydajne kompresowanie i przyspieszenie modelu.

Model ETC oparty na charakterystycznych cechach dystrybucji i CST
Przegląd architektury modelu
Zaproponowany model klasyfikacji tekstowej najpierw wykorzystuje przetrenowany BERT do wykonania dynamicznego kodowania kontekstu wejściowego tekstu, generując bogaty semantycznie osad słowny i globalną reprezentację. Następnie konstruuje się graf instancji i graf dystrybucji z tych cech: graf instancji przechwytuje parowe podobieństwa prób, podczas gdy graf dystrybucji modeluje ogólną dystrybucję danych; iteracyjna wymiana informacji między dwoma grafami umożliwia synergetyczne wzmocnienie pojedynczych cech i globalnej struktury. Następnie CST jest zintegrowane, aby głęboko zwiększyć sieć grafu. Rekonstrukcja centralności węzłów wykorzystuje PageRank do sprecyzowania wpływu leksykalnego, symulując dominującą rolę rdzeniowych elementów w sieciach językowych. Jest to szeroko zweryfikowany sposób mierzenia globalnego wpływu węzłów w złożonych topologiach sieci i jest odpowiedni do uchwycenia asymetrycznego rozprzestrzeniania się semantycznego rdzeniowych węzłów leksykalnych w systemach językowych. Trójpoziomowa “mikro–mezo–makro” ramka generowania prototypów naśladuje proces powstawania od lokalnej semantyki do holistycznych reprezentacji kategorii. Wreszcie, wzmocnione reprezentacje cech są wprowadzane do klasyfikatora, aby wyprodukować ostateczne prawdopodobieństwa klas.

Interakcja cech z dystrybucyjnie świadomym GNN
Aby zoptymalizować zdolność generalizacji ETC, efektywnie uchwytywać złożone relacje semantyczne między tekstami i cechami dystrybucji prób (SDF), w niniejszej pracy konstruuje się model ETC oparty na cechach dystrybucji i CST. Osiąga się głębokie wydobywanie informacji globalnych i lokalnych w tekście poprzez integrację mechanizmów takich jak GNN i dynamiczne osadzanie tekstu. GNN to model DL specjalnie zaprojektowany do przetwarzania danych strukturalnych grafu. Zasada działania to użycie mechanizmu przekazywania wiadomości (gdzie każdy węzeł w grafie agreguje informacje o cechach sąsiednich węzłów) i połączenie ich z własnym stanem. Poprzez wiele rund iteracyjnych aktualizacji, stopniowo uczy się wysoko wymiarowej reprezentacji, która obejmuje strukturę topologii. Ten proces umożliwia węzłom przechwytywanie struktury i zależności cech sąsiedniego sąsiedztwa, a nawet globalnego grafu. Aby pokonać ograniczenia tradycyjnych modeli sekwencyjnych w modelowaniu długich zależności na odległość i globalnych relacji, w niniejszej pracy wykorzystuje się GNN do uchwytywania złożonych asocjacyjnych i strukturalnych relacji między próbami. Ze względu na koncentrację GNN na bezpośredniej korelacji informacji między pojedynczymi próbami, ignoruje on ogólne charakterystyczne cechy zestawu prób14,15,16. Dlatego w niniejszej pracy zaproponowano model GNN

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ustawienia eksperymentu i zestaw danych:
Aby kompleksowo ocenić wydajność zaproponowanego modelu i lekkość w małoprobkowym zadaniach klasyfikacji międzydoménowej, eksperymenty przeprowadzono na czterech zestawach danych: FewRel (małoprobkowa klasyfikacja relacji), ARSC (analiza sentymentu międzydoménowej), Reuters-21578 (wielotematyczna klasyfikacja wiadomości) i ArXiv (długie akademickie abstrakty). FewRel, szeroko stosowany zestaw danych do małoprobkowej klasyfikacji relacji źródłowej z Wikipedii...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby poprawić zdolność generalizacji ETC w scenariuszach few-shot i cross-domain, jednocześnie zmniejszając koszty obliczeniowe, niniejsze badanie proponuje lekki framework klasyfikacji tekstu integrujący CST z TSMDM. Integracja CST z TSMDM obejmuje główne ograniczenia istniejących metod ETC (słaba generalizacja few-shot/cross-domain i wysokie koszty obliczeniowe), poprzez wprowadzanie dynamiki systemu językowego i właściwości semantycznych emergentnych do projektu modelu oraz umożliwienie efektywnego transferu wiedzy dla...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnięcia.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do zaakceptowania.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Central Processing Unit (CPU)Dostawcy sprzętu komercyjnego (Intel, Dell, Lenovo)Intel i5-7300HQSpecyfikacje sprzętowe
Graphics Processing Unit (GPU)Dostawcy sprzętu komercyjnego (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMSpecyfikacje sprzętowe
Random Access Memory (RAM)Dostawcy sprzętu komercyjnego16 GB DDR4Specyfikacje sprzętowe
Solid State Drive (SSD)Dostawcy sprzętu komercyjnego1 TB NVMe SSDSpecyfikacje sprzętowe
System operacyjnyOficjalna strona MicrosoftWindows 10 (64-bit)Oprogramowanie systemowe
PythonOficjalna strona Python (python.org)Python 3.8Język programowania
PyTorchOficjalna strona PyTorch (pytorch.org)PyTorch 1.11.0Frameworki uczenia głębokiego & Biblioteki rdzeniowe
CUDAOficjalna strona NVIDIACUDA 11.3Frameworki uczenia głębokiego & Biblioteki rdzeniowe
Hugging Face TransformersHugging Face Hub (huggingface.co)Stała wersja (dostosowana do Python 3.8/PyTorch 1.11.0)Frameworki uczenia głębokiego & Biblioteki rdzeniowe
NumPyPyPI (pypi.org)Stała wersja (dostosowana do Python 3.8)Biblioteki przetwarzania danych & Statystyczne
PandasPyPI (pypi.org)Stała wersja (dostosowana do Python 3.8)Biblioteki przetwarzania danych & Statystyczne
Scikit-learnPyPI (pypi.org)Stała wersja (dostosowana do Python 3.8)Biblioteki przetwarzania danych & Statystyczne
SciPyPyPI (pypi.org)Stała wersja (dostosowana do Python 3.8)Biblioteki przetwarzania danych & Statystyczne
MatplotlibPyPI (pypi.org)Stała wersja (dostosowana do Python 3.8)Biblioteka wizualizacji
AdamWWbudowany w PyTorchZintegrowany w PyTorch 1.11.0Optymalizator
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Wstępnie nauczane modele
FewRelOficjalne repozytorium FewRel (GitHub) / Wikipedia100 kategorii relacji semantycznych, 700 zdań na kategorię; podział trening/walidacja/test (5:2:3)Zestawy danych
ARSCPubliczne zestawy danych do analizy sentymentu między domenami (GitHub/ACL Anthology)23 kategorie produktów Amazon, 69 binarnych zadań analizy sentymentu; podział trening/walidacja/test (4:2:3)Zestawy danych
Reuters-21578Repozytorium uczenia maszynowego UCI / Oficjalne archiwum Reuters21 578 artykułów wiadomości, 90 kategorii tematycznych; Metoda podziału ModApteZestawy danych
ArXivPubliczne API ArXiv (arxiv.org)Abstrakty prac z informatyki; podział trening/walidacja/test (7:2:1)Zestawy danych
TokenizerHugging Face Hub (huggingface.co)BERT-base-cased TokenizerInne kluczowe narzędzia
GitOficjalna strona Git (git-scm.com)Najnowsza stabilna wersjaInne kluczowe narzędzia

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Related Articles