$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Przyspieszenie globalizacji i postępy w technologii informacyjnej doprowadziły do eksplozywnego wzrostu danych tekstowych w języku angielskim w różnych dziedzinach, takich jak media społecznościowe, badania akademickie i komunikacja biznesowa. Skuteczne klasyfikowanie tych tekstów w celu pozyskiwania informacji, analizy sentymentu, zarządzania treścią i innych funkcji stało się ważnym zadaniem w przetwarzaniu języka naturalnego1. Celem klasyfikacji tekstów angielskich (ETC) jest klasyfikowanie tekstów do wstępnie określonych kategorii na podstawie ich treści semantycznej. Jednak złożoność języka naturalnego, w tym jego niejednoznaczność, zależność od kontekstu i różnorodność wyrażania, stanowi wiele wyzwań dla zadań klasyfikacji tekstu2. Obecnie rozwój technologii Deep Learning (DL) stworzył nowe możliwości dla klasyfikacji tekstu. Pre-treningowane modele językowe reprezentowane przez Bidirectional Encoder Representations from Transformers (BERT) i jego warianty mogą uczyć się bogatej kontekstowej informacji semantycznej poprzez pre-trening na dużych korpusach, co znacząco poprawia wydajność klasyfikacji tekstu3. Jednak obecne metody ETC nadal napotykają na dwa kluczowe ograniczenia: pierwsze, często podkreślają optymalizację pojedynczego modelu lub funkcji, zaniedbując właściwości języka jako złożonego systemu, takie jak jego dynamiczność i zachowanie emergentne, co prowadzi do nieadekwatnej generalizacji w scenariuszach z niską ilością danych lub między domenami; drugie, pomimo silnej wydajności pre-trenowanych modeli, ich wysoki koszt obliczeniowy i duża liczba parametrów poważnie utrudniają praktyczne wdrożenie w środowiskach o ograniczonych zasobach4,5. Aby rozwiązać te problemy, niniejsze badanie proponuje lekki framework klasyfikacji tekstu integrujący Teorię Systemów Złożonych (CST) i Dwuetapowy Mechanizm Meta-Destylacji (TSMDM).
W kontekście tego badania, CST odnosi się do teoretycznego frameworku, który uważa język naturalny za typowy złożony system z dynamiczną ewolucją, semantyczną emergentnością i heterogeniczną dystrybucją wpływu węzłów leksykalnych. Jest on stosowany do symulowania dominującej roli słownictwa rdzeniowego w propagacji znaczeniowej i emergentnej zasadzie ogólnego semantyki z lokalnych cech leksykalnych, poprawiając w ten sposób głębokie zrozumienie semantyki tekstu modelu i adaptacyjność do scenariuszy z niewielką ilością danych i między domenami. Jego kluczowe wkłady są następujące: teoretycznie, z naszej wiedzy, CST jest systematycznie wprowadzany do zadań klasyfikacji tekstu, symulując dynamiczną ewolucję i semantyczną emergentność systemów językowych, aby poprawić głębokie zrozumienie modelu i adaptacyjność do danych z niewielką ilością danych i między domenami. Metodologicznie, zaprojektowano sieć neuronową grafową (GNN) zawierającą cechy dystrybucji próbki. Połączony innowacyjny TSMDM jest zasadniczo różny od standardowej destylacji wiedzy. Standardowa destylacja wiedzy realizuje jednokierunkowy transfer wiedzy z modelu nauczyciela o stałych parametrach (TM) do lekkiego modelu studenta (SM). Meta-destylacja w tym badaniu integruje strategie meta-uczenia się na podstawie destylacji i może dynamicznie dostosowywać parametry TM na podstawie opinii uczenia się SM. Dwuetapowy projekt dodatkowo ustanawia model asystenta nauczającego jako pośrednią warstwę buforującą, aby złagodzić utratę informacji spowodowana nadmiernymi różnicami w złożoności między TM i SM, osiągając znaczne lekkość modelu przy zachowaniu wysokiej dokładności, zapewniając tym samym wydajne rozwiązanie klasyfikacyjne dla scenariuszy o ograniczonych zasobach.
W dziedzinie ETC, badacze przeprowadzili rozległe eksploracje i zaproponowali różne rozwiązania, które integrują różne cechy i architektury modeli, aby sprostać wyzwaniom technicznym w różnych scenariuszach. R. Zhang i wsp. zaprojektowali wielojęzyczny Pre-trenowany Model Fuzji Wielu Cechy (MP-MFFM), aby sprostać problemowi niewystarczającego przechwytywania długoterminowych informacji kontekstowych i strukturalnych w ETC za pomocą obecnych metod DL. Ta metoda łączyła wielojęzyczny BERT, BiLSTM i text CNN, aby wyodrębnić głębokie informacje semantyczne, globalne i lokalne informacje strukturalne oraz je zlaczyć. Ta metoda poprawiła dokładność, wrażliwość i precyzję na trzech zbiorach danych, weryfikując swoją skuteczność6. C. Madhu i wsp. przyjęli Ramówkę Uczenia Fuzzy Graph na podstawie Cechy Dialektu (DF-FGLF), aby sprostać potrzebom klasyfikacji tekstu w nieuporządkowanych i słabo sklasyfikowanych danych w sieciach społecznościowych, a także wpływowi różnic dialektalnych na międzynarodową klasyfikację języka angielskiego. Połączyli oni semantyczne i różnice dialektu w nauce, aby skonstruować zoptymalizowany rozmyty graf. Kiedy było tylko 10 oznaczonych próbek, wartość F1 dla rozpoznawania dialektu i klasyfikacji tekstu przekraczała 93% i 80%, co było lepsze niż podobne metody i odpowiednie do praktycznej klasyfikacji7. B. Shannaq i wsp. przeprowadzili eksperymenty z wykorzystaniem zbiorów danych angielskich i arabskich, aby zbadać wpływ długości n-gramów na klasyfikację tekstu w różnych systemach pisania i wpływ ce