Artigo de investigação

Classificação de Textos Ingleses Leves com Aprendizado Profundo Baseado na Teoria dos Sistemas Complexos

DOI:

10.3791/69344

9 de junho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo propõe uma rede neural de grafos leve com metadestilação e meta-aprendizagem para melhorar a classificação de textos em inglês. Aprimora a generalização em ambientes de baixo número de dados e entre domínios, ao mesmo tempo em que reduz custos computacionais e mantém alto desempenho.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A globalização e o desenvolvimento da tecnologia da informação impulsionaram um aumento nos dados de texto em inglês, e há uma necessidade urgente de classificação eficiente. Para melhorar a capacidade de generalização da classificação de textos em inglês em cenários de amostra pequena e entre domínios e alcançar modelos leves, este estudo combina teoria de sistemas complexos com aprendizado profundo para construir um modelo de rede neural de grafos que leva totalmente em conta as características distributivas de amostras de texto. Um método de metadestilação em dois níveis, combinado com estratégias de meta-aprendizado, ajusta dinamicamente os parâmetros do modelo do professor e otimiza todo o processo de transferência de conhecimento. Os resultados experimentais mostram que o desempenho de classificação do modelo proposto em tarefas de classificação de texto em poucos e entre domínios é significativamente superior ao das redes neurais de grafos tradicionais e outros modelos comparativos convencionais. Em termos de levezagem, o SM gerado pelo mecanismo de metadestilação em dois estágios mantém um nível extremamente alto de retenção de desempenho em conjuntos de dados de classificação de texto multi-tópicos, enquanto reduz significativamente o tempo computacional. Além disso, esse método pode manter alta eficiência e desempenho estável em classificação em cenários de processamento de texto longo e oferece vantagens claras em eficiência computacional em comparação com métodos tradicionais de destilação e outros métodos relatados na literatura. O método proposto melhora efetivamente o desempenho de classificação do texto em inglês em cenários de aplicação com pouca amostra e entre domínios, ao mesmo tempo em que reduz significativamente o custo computacional, fornecendo assim uma solução técnica viável e eficiente para a classificação de textos em inglês em ambientes com recursos limitados.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A aceleração da globalização e os avanços na tecnologia da informação levaram ao crescimento explosivo de dados de texto em inglês em áreas como mídias sociais, pesquisa acadêmica e comunicação empresarial. Classificar eficientemente esses textos para recuperação de informações, análise de sentimento, gerenciamento de conteúdo e outras funções tornou-se uma tarefa importante no processamento de linguagemnatural 1. O objetivo da Classificação de Textos em Inglês (ETC) é classificar textos em categorias pré-definidas com base em seu conteúdo semântico. No entanto, a complexidade da linguagem natural, incluindo sua ambiguidade, dependência do contexto e diversidade de expressões, apresenta muitos desafios para as tarefas de classificaçãode texto 2. Atualmente, o crescimento da tecnologia de Deep Learning (DL) criou novas oportunidades para a classificação de textos. Modelos de linguagem pré-treinados representados por Bidirectional Encoder Representations from Transformers (BERT) e suas variantes podem aprender informações semânticas contextuais ricas por meio do pré-treinamento em corpora de grande escala, melhorando significativamente o desempenho da classificaçãode texto 3. No entanto, os métodos ETC atuais ainda enfrentam duas limitações principais: primeiro, eles frequentemente enfatizam a otimização de um único modelo ou característica, negligenciando as propriedades intrínsecas da linguagem como sistema complexo, como sua dinâmica e comportamento emergente, o que leva a uma generalização inadequada em cenários de poucos dados ou entre domínios; Segundo, apesar do forte desempenho dos modelos pré-treinados, seu alto custo computacional e grande número de parâmetros dificultam severamente a implantação prática em ambientes com recursoslimitados 4,5. Para abordar essas questões, este estudo propõe uma estrutura leve de classificação de texto integrando a Teoria dos Sistemas Complexos (CST) e o Mecanismo de Metadestilação em Dois Estágios (TSMDM).

No contexto deste estudo, CST refere-se ao arcabouço teórico que considera a linguagem natural como um sistema complexo típico com evolução dinâmica, emergência semântica e distribuição heterogênea da influência dos nós lexicais. Ele é aplicado para simular o papel dominante do vocabulário central na propagação semântica e a lei emergente da semântica geral a partir de características lexicais locais, aprimorando assim a compreensão profunda do modelo sobre semântica textual e sua adaptabilidade a cenários de dados de poucos disparos e entre domínios. Suas contribuições centrais são as seguintes: teoricamente, até onde sabemos, a CST é introduzida sistematicamente em tarefas de classificação de texto, simulando a evolução dinâmica e o surgimento semântico dos sistemas linguísticos para aprimorar a compreensão profunda e adaptabilidade do modelo a dados de poucos tiros e entre domínios. Metodologicamente, é projetada uma Rede Neural de Grafo (GNN) contendo características de distribuição da amostra. O TSMDM inovador combinado é essencialmente diferente da destilação de conhecimento padrão. A destilação padrão de conhecimento realiza a transferência unidirecional de conhecimento de um Modelo de Professor (TM) de parâmetro fixo para um Modelo de Estudante (SM) leve. A metadestilação neste estudo integra estratégias de meta-aprendizagem baseadas na destilação e pode ajustar dinamicamente os parâmetros da MT com base no feedback de aprendizagem do SM. O design em duas etapas também estabelece um modelo de assistente de ensino como camada intermediária de buffer para mitigar a perda de informação causada por lacunas excessivas de complexidade entre a MT e a SM, alcançando um peso significativo do modelo mantendo alta precisão, fornecendo assim uma solução eficiente de classificação para cenários com recursos limitados.

No campo da ETC, pesquisadores realizaram extensas explorações e propuseram várias soluções que integram diferentes características e arquiteturas de modelos para enfrentar desafios técnicos em diferentes cenários. R. Zhang et al. projetaram um Modelo Multilíngue de Fusão Multi-Característica Pré-Treinado (MP-MFFM) para enfrentar o problema da captura insuficiente de informações estruturais contextuais de longo alcance no ETC, utilizando métodos atuais de DL. Esse método combinava BERT, BiLSTM multilíngue e CNN textual para extrair informações estruturais semânticas profundas, globais e locais e fundi-las. Esse método melhorou a precisão, sensibilidade e precisão em três conjuntos de dados, verificando suaeficácia 6. C. Madhu et al. adotaram um Quadro de Aprendizagem Fuzzy Graph Baseado em Características Dialetais (DF-FGLF) para atender às necessidades de classificação de texto de dados não estruturados e com pouca anotação em redes sociais, bem como ao impacto das diferenças dialetais na classificação internacional do inglês. Eles combinaram recursos semânticos e de aprendizado de diferenças dialetais para construir um grafo fuzzy otimizado. Quando havia apenas 10 amostras anotadas, o valor F1 para reconhecimento dialetal e classificação de textos ultrapassou 93% e 80%, o que foi superior a métodos semelhantes e adequado para classificaçãoprática 7. B. Shannaq et al. realizaram experimentos usando conjuntos de dados em inglês e árabe para investigar o impacto do comprimento de n-gramas na classificação de textos em diferentes sistemas de escrita e o efeito das características linguísticas no comprimento ótimo de n-gramas. O desempenho do inglês 2-gram foi o melhor (precisão 0,482, recordação 0,489, valor F1 =0,472), enquanto o árabe 6-grama foi o melhor (valor F1 cerca de 0,85). A morfologia da linguagem e as características sintáticas afetaram significativamente o desempenho dos modelosn-gramas 8. N. S. Lagutina et al. usaram um vetor de texto construído com base em características bibliométricas de caracteres, vocabulário e estrutura de frases para alcançar a classificação automática de textos curtos em inglês para avaliação do aprendizado dos alunos, combinado com classificadores padrão de aprendizado de máquina como o SVM. O valor F1 do SVM no corpus do Marco Europeu Comum de Referência para Línguas foi de 67%, e o valor F1 do modelo best-BERT (bert-base-cased) foi de 69%. Os erros estavam principalmente em níveis adjacentes, e a qualidade da classificação dependia docorpus 9.

A destilação de conhecimento, como meio eficaz para alcançar o enlevecimento do modelo, melhorar o desempenho do modelo em cenários de amostras pequenas e reduzir custos computacionais, também avançou significativamente em pesquisas relacionadas. Pesquisas anteriores exploraram a aplicação da destilação de conhecimento para enfrentar desafios-chave no processamento de linguagem natural, incluindo: melhorar o desempenho de modelos de pequenos parâmetros sob condições de baixo rótulo, otimizar tarefas de classificação de texto multilíngue, comprimir modelos pré-treinados em grande escala por meio de estratégias híbridas de compressão e destilar representações eficazes de frases para reduzir a diferença de desempenho entre modelos de linguagem grandes e pequenos, enquanto se adaptam a hardware restrições 10,11,12,13. Apesar desses avanços, as abordagens existentes de destilação de conhecimento ainda apresentam limitações críticas para o ETC: carecem de mecanismos dinâmicos de otimização para o processo de transferência de conhecimento, frequentemente sofrem com perda severa de informação ao alternar entre MTs altamente complexos e SMs leves, e falham em integrar efetivamente com as características inerentes de distribuição dos dados textuais. Essas desvantagens resultam em desempenho de generalização subótimo em cenários de poucos tiros e entre domínios. Os modelos leves obtidos por meio desses métodos frequentemente têm dificuldade em equilibrar a eficácia da classificação e a eficiência computacional em ambientes com recursos limitados. Essa é a principal lacuna que a pesquisa neste artigo busca abordar.

Este estudo testa a seguinte hipótese de pesquisa: Primeiro, integrar a CST no ETC pode simular efetivamente a evolução dinâmica e as características de emergência semântica dos sistemas de linguagem natural. Essa integração teórica pode melhorar significativamente a capacidade de generalização do modelo em cenários de poucos tiros e entre domínios, em comparação com modelos tradicionais de classificação de texto que ignoram as propriedades complexas do sistema da linguagem. Segundo, um modelo GNN projetado com consideração explícita das características de distribuição de amostras de texto pode compensar a limitação das GNNs tradicionais que focam apenas na modelagem relacional em nível de instância, e realizar uma mineração mais profunda de informações semânticas globais e locais em textos em inglês. Terceiro, o TSMDM combinado com estratégias de meta-aprendizagem e um modelo de assistente de ensino pode alcançar uma transferência eficiente e de baixa perda de conhecimento de MTs complexos para SMs leves. Isso pode reduzir significativamente o custo computacional do modelo e a escala dos parâmetros, mantendo o alto desempenho de classificação. Além disso, o modelo leve derivado desse mecanismo ainda pode manter um desempenho de classificação estável e eficiente em cenários de processamento de texto longo com estruturas semânticas complexas.

Em resumo, pesquisas relevantes melhoraram o desempenho da classificação de texto por meio da fusão multi-características, aprendizado de características dialetais, otimização n-grama e características métricas estilísticas, além de alcançar o lightweighting do modelo por meio da destilação de conhecimento. No entanto, métodos existentes ainda apresentam deficiências na captura de informações a longa distância, generalização de amostras pequenas e adaptação de modelos complexos e simples. Para reduzir o custo computacional do modelo ETC enquanto garante sua precisão, este estudo constrói um modelo leve combinando CST e TSMDM para aumentar a capacidade de generalização e a eficiência computacional do modelo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para melhorar a capacidade de generalização do ETC em cenários de amostras pequenas e domínios cruzados e realizar um modelo leve, este estudo propõe uma estrutura de classificação de texto integrando CST e TSMDM. O processo geral desse arcabouço é mostrado na Figura 1.

figure-protocol-1
Figura 1: Visualização do framework de classificação de texto inglês leve de quatro estágios que integra CST e TSMDM. O fluxo de trabalho consiste em quatro etapas. O estágio 1 realiza representação de texto usando embeddings dinâmicos baseados em BERT a partir do texto em inglês de entrada. A Etapa 2 aplica a modelagem de redes neurais de grafos construindo um grafo de texto e calculando relações em nível de instância e distribuição. O Estágio 3 modela a emergência semântica por meio da reconstrução da centralidade dos nós e uma estrutura de geração de protótipos multinível para obter o protótipo final da categoria. A Etapa 4 realiza destilação elementar em dois estágios, onde um modelo de professor é treinado e o conhecimento é transferido por metadestilação para produzir o modelo final do aluno. Por favor, clique aqui para ver uma versão ampliada desta figura.

Primeiramente, na fase de representação textual e incorporação dinâmica, o modelo BERT é utilizado para incorporar dinamicamente o texto de entrada e capturar as informações semânticas contextuais. A segunda etapa é a modelagem GNN consciente da distribuição, que considera as características de distribuição das amostras, constrói um modelo GNN e aprimora a representação de características por meio da interação de informação dual no nível da instância e distribuição. A terceira etapa é a modelagem de emergência semântica guiada pela teoria dos sistemas híbridos, introduzindo a reconstrução da centralidade dos nós e um mecanismo de geração de protótipos em três níveis para simular a dinâmica e o surgimento do sistema de linguagem. Finalmente, no quarto estágio, é realizada uma operação de meta-destilação leve em dois níveis. O processo de destilação do conhecimento é otimizado por meio do modelo assistente e da estratégia de meta-aprendizagem para alcançar compressão e aceleração eficientes do modelo.

Modelo ETC baseado em características de distribuição e CST
Visão geral da Arquitetura de Modelos
O modelo proposto de classificação de texto emprega primeiro um BERT pré-treinado para realizar a codificação contextual dinâmica do texto de entrada, gerando embeddings semanticamente ricos em palavras e uma representação global. Em seguida, um grafo de instância e um grafo de distribuição são construídos a partir dessas características: o grafo de instância captura semelhanças de amostra par a par, enquanto o grafo de distribuição modela a distribuição geral dos dados; A troca iterativa de informações entre os dois grafos permite o aprimoramento sinérgico de características individuais e da estrutura global. Subsequentemente, o CST é integrado para aumentar profundamente a rede de grafos. A reconstrução da centralidade de nós usa o PageRank para quantificar a influência lexical, simulando o papel dominante dos elementos centrais em redes linguísticas. Este é um método amplamente validado para medir a influência global de nós em topologias de redes complexas e é bem adequado para capturar a dispersão semântica assimétrica dos nós lexicais centrais em sistemas linguísticos. Uma estrutura de geração de protótipos "micro–meso–macro" em três níveis emula o processo emergente da semântica local às representações holísticas de categorias. Por fim, as representações de características aprimoradas são inseridas em um classificador para produzir as probabilidades finais da classe.

Interação de Características com GNN consciente da distribuição
Para otimizar a capacidade de generalização do ETC e capturar efetivamente relações semânticas complexas entre textos e Características de Distribuição de Amostras (SDFs), este estudo constrói um modelo ETC baseado em características de distribuição e CST. Ele alcança uma mineração profunda de informações globais e locais em texto integrando mecanismos como GNN e incorporação dinâmica de texto. GNN é um modelo DL especificamente projetado para processar dados estruturados em grafos. O princípio central é usar um mecanismo de passagem de mensagens (onde cada nó no grafo agrega as informações de características de seus nós vizinhos) e combiná-lo com seu próprio estado. Por meio de múltiplas rodadas de atualizações iterativas, ele aprende gradualmente uma representação de alta dimensão que inclui a estrutura da topologia. Esse processo permite que os nós capturem a estrutura e dependências de características da vizinhança local e até mesmo do grafo global. Para superar as limitações dos modelos tradicionais de sequência na modelagem de dependências de longo alcance e relações globais, este estudo utiliza GNN para capturar associações semânticas complexas e relações estruturais entre amostras. Devido ao foco do GNN na informação direta de correlação entre amostras individuais, ele ignora as características gerais de distribuição do conjuntoamostral 14, 15 e 16. Portanto, este estudo propõe um modelo GNN que considera a SDF. Esse modelo introduz o BERT para incorporação dinâmica de texto e o combina com uma rede protótipo para calcular as diferenças de características das amostras. BERT é um modelo de linguagem pré-treinado baseado na arquitetura Transformer. O princípio central é capturar simultaneamente a informação semântica de cada palavra no contexto por meio de um codificador bidirecional, e pré-treiná-la em um corpus em grande escala usando duas tarefas: "modelo de linguagem mascarada" e "previsão da próxima frase". Em modelos de linguagem mascarados, algumas palavras na entrada são mascaradas aleatoriamente, e o modelo precisa prever a palavra original com base no contexto. A próxima previsão determina se as duas frases são consecutivas. Após o pré-treinamento, o BERT pode se adaptar rapidamente a várias tarefas de processamento de linguagem natural por meio de ajuste fino, melhorando significativamente o desempenho e fornecendo representações de características de alta qualidade para a construção subsequente de estruturas de grafos. A estrutura específica do modelo ETC construído neste estudo é mostrada na Figura 2.

figure-protocol-2
Figura 2: Design arquitetônico do modelo de classificação de texto em inglês integrado ao CST, considerando características de distribuição de amostras. A figura exibe o design arquitetônico do modelo de classificação de texto em inglês, integrado com a teoria dos sistemas complexos (CST) e levando em conta as características de distribuição de amostras de texto. A arquitetura funde embutimento contextual dinâmico baseado em BERT, rede neural de grafos (GNN) consciente da distribuição e mecanismos de aprimoramento de CST, e realiza mineração aprofundada de informações semânticas globais e locais em textos em inglês por meio de modelagem colaborativa em múltiplos módulos. Por favor, clique aqui para ver uma versão ampliada desta figura.

Neste modelo, para um conjunto de dados geral, a entrada de texto em inglês no modelo BERT gera uma sequência de tokens através de um tokenizador. O método de construção de sequências é mostrado na equação (1).

[CLS], um 1,um 2,... an, [SEP] (1)

Na equação (1), [CLS] é o marcador de classificação localizado no início da sequência. O BERT gerará um estado oculto de posição fixa para [CLS] durante o processo de treinamento. Esse estado é usado diretamente para a representação semântica global de todo o texto. Um1,um 2,... A n representa uma palavra ou subpalavra no texto. [SEP] é um delimitador usado para marcar o fim de uma frase. Após o processamento da sequência acima, as características de cada token são obtidas, fornecendo informações contextuais estruturadas para o modelo. Para conjuntos de dados especiais contendo entidades, se métodos convencionais de construção de sequências forem usados, a informação posicional contida pelas entidades será perdida. Portanto, este estudo constrói a sequência usando o método mostrado na equação (2).

figure-protocol-3(2)

Na equação (2), [E1], [/E1], [E2] e [/E2] são os tokens definidos para determinar as posições inicial e final de duas entidades. De forma semelhante, após o processamento Bert, as características de saída desses tokens transportarão informações semânticas das entidades correspondentes, aproveitando melhor a informação importante sobre a localização da entidade. Posteriormente, este estudo utiliza um modelo GNN considerando SDF para aprimorar a distribuição e as características de instância das amostras. A estrutura do modelo é mostrada na Figura 3.

figure-protocol-4
Figura 3: Arquitetura de interação de características de grafo duplo do modelo de rede neural de grafos conscientes da distribuição. A figura apresenta a arquitetura de interação de características em grafos duplos do modelo GNN consciente de distribuição para classificação de texto em inglês. A arquitetura constrói um grafo de pontos para codificação de similaridade em nível de instância e um grafo de distribuição para codificação de similaridade em nível de distribuição, além de alcançar aprimoramento de características por meio da interação iterativa de informação entre os dois grafos, completando o ciclo de informação entre níveis de características de instância e de distribuição. Por favor, clique aqui para ver uma versão ampliada desta figura.

O modelo alcança aprimoramento de características por meio de um mecanismo de interação em dois estágios. Primeiramente, ele analisa características de distribuição a partir de associações em nível de instância de amostras de dados e, em seguida, otimiza dinamicamente características de instância por meio da troca de informações no nível da distribuição. Ao fortalecer iterativamente as características das instâncias e níveis de distribuição, ela conclui a tarefa de classificação. Especificamente, o modelo utiliza grafos de pontos e grafos de distribuição para promover a troca de informações. O mapa de pontos usa o vetor de características de amostra de texto (atualizado pelas duas últimas camadas do BERT) como nó, quantifica a diferença de características da amostra para calcular o peso das arestas por meio de uma rede dedicada de codificação (uma camada sigmoide + duas camadas convolucionais de normalização em lote) e usa normalização min-max para normalizar para o [intervalo 0,1. Um limiar empírico de similaridade de 0,2 é estabelecido para o limiar de arestas, onde arestas com pesos abaixo desse limite são podadas para eliminar correlações fracas em nível de instância. O grafo de distribuição recebe as características de distribuição de texto fundido como nós, com pesos de aresta calculados com base na similaridade cosseno dos vetores de características de distribuição e normalizados via normalização por L2 para garantir consistência métrica. Um limiar de aresta de 0,15 é adotado, e arestas com pesos abaixo desse valor são removidas, enquanto os pesos de aresta válidos restantes são ainda mapeados e padronizados por um perceptron multicamada para aumentar a discriminabilidade das associações em nível de distribuição. Este estudo define um gráfico figure-protocol-5 de pontos para a iteração da camada l, onde o figure-protocol-6 nó representa características da amostra e as arestas figure-protocol-7 codificam a similaridade em nível de instância. Mapa figure-protocol-8de distribuição , nó figure-protocol-9 representa características da amostra, e arestas figure-protocol-10 codificam similaridade no nível de distribuição. Tomando a roda l-ésima para a l+1-ésima como exemplo, o cálculo de relação em nível de instância calcula a similaridade de pontos por meio de diferenças de características, como mostrado na equação (3).

figure-protocol-11 (3)

Na equação (3), figure-protocol-12 e figure-protocol-13 são os pesos das arestas entre os nós i e j durante as iterações l-ésima e l-1-ésima do grafo pontual, refletindo a similaridade das características da amostra. figure-protocol-14 é uma rede de codificação usada para converter diferenças de características de nós em escalas de peso de aresta, consistindo em uma camada de sigmoide e duas camadas de funções de ativação por lote de convolução. Quando figure-protocol-15 e figure-protocol-16 são a l-1-ésima iteração, os autovetores dos nós i e j são atualizados por Bert nas duas últimas camadas. Depois, as características da distribuição são calculadas com base nas relações de instância, conforme mostrado na equação (4).

figure-protocol-17(4)

Na equação (4), figure-protocol-18 é o autovetor do nó i no grafo de distribuição da camada l. O MLP1 é um perceptron multicamadas composto por funções de ativação e camadas totalmente conectadas, que mapeia as características compostas concatenadas em novas características de distribuição. Depois, a relação de distribuição é calculada com base nas características da distribuição, e as características de instância são calculadas a partir da relação de distribuição para completar o ciclo de informação entre níveis.

Mecanismos de Aprimoramento de Sistemas Complexos
Para aprimorar ainda mais a capacidade de generalização, a CST é aplicada ao modelo acima neste estudo. A evolução dinâmica dos sistemas complexos se manifesta pela distribuição heterogênea da influência dos nós. Para simular o papel dominante do vocabulário central na propagação semântica em sistemas linguísticos, este estudo introduz o índice de centralidade dos nós para reconstruir o mecanismo de propagação da informação. O gráfico de pontos Hp construído para cada tarefa de cenário usa o algoritmo PageRank para quantificar a centralidade do nó C(hi), conforme mostrado na equação (5)17.

figure-protocol-19(5)

Na equação (5), α é o coeficiente de amortecimento α = 0,85. N(h i) representa o conjunto de nós vizinhos, e L(h j) é o grau do nó. A Equação (5) substitui o processo de propagação em cascata da influência do vocabulário em redes linguísticas simuladas, permitindo que o vocabulário central (como verbos e palavras-tópico) ganhe maior centralidade. Depois, a centralidade do nó é acoplada a pesos de aresta para ajustar dinamicamente a força de propagação da informação entre nós. A função de acoplamento λij é mostrada na equação (6).

figure-protocol-20(6)

Na equação (6), σ é a função de ativação Sigmoide, WT é o vetor de peso aprendível, e b significa o termo de viés. O acoplamento dos pesos de centralidade e arestas equilibra dinamicamente as relações locais com a importância global, aumentando assim a adaptabilidade do modelo a mudanças dinâmicas nas tarefas. O surgimento da CST se manifesta na língua inglesa como a semântica geral que supera a soma do vocabuláriolocal 18. Para utilizar essa característica no ETC, este estudo projeta uma estrutura de geração de protótipos em três níveis para simular o processo de emergência de micro características para macrocategorias, conforme mostrado na Figura 4.

figure-protocol-21
Figura 4: Construção em etapas do framework de geração de protótipos micro-meso-macro em três níveis para emergência semântica linguística. A figura ilustra a construção passo a passo da estrutura de geração de protótipos micro-meso-macro em três níveis para simular o surgimento semântico linguístico na classificação de textos em inglês. A estrutura constrói representações hierárquicas de categorias de texto por meio de micro clustering de subclasses com K-médias, fusão de protótipos meso de subclasses baseada em ponderação por similaridade de distribuição, e integração macro não linear via mecanismo de atenção, simulando a característica emergente de "o todo é maior que a soma de suas partes" em sistemas linguísticos. Por favor, clique aqui para ver uma versão ampliada desta figura.

O processo acima constrói representações de categorias de texto passo a passo, do micro ao macro para elevar a capacidade de generalização do modelo. No nível micro, K subclasses são geradas por agrupamento das representações de embutimento de amostras de cada categoria de texto. K-médias é utilizada para dividir as amostras dentro da categoria em subgrupos, e a posição do centroide de cada subgrupo é calculada como o protótipo dasubclasse 19. No nível mesoscópico, a similaridade de distribuição de cada protótipo de subclasse é calculada, uma matriz de similaridade é gerada e, em seguida, os protótipos de subclasses são remontados com base nos pesos de similaridade para quantificar a correlação entre as subclasses. O cálculo do peso de similaridade da subclasse wij é mostrado na equação (7).

figure-protocol-22 (7)

Na equação (7), figure-protocol-23 está a divergência de Jensen-Shannon, usada para medir a diferença de distribuição entre duas subclasses figure-protocol-24 e figure-protocol-2520. Finalmente, os protótipos de subclasses são ponderados e fundidos para obter um conjunto de representações figure-protocol-26de distribuição de classes . No nível macro, os pesos de importância de cada subclasse são aprendidos por meio de mecanismos de atenção, e transformações não lineares são introduzidas para simular o processo de emergência, resultando no protótipo final da classe c final, conforme mostrado na equação (8).

figure-protocol-27(8)

Na equação (8), αk significa o peso de atenção da classe k. U denota a matriz de pesos de transformação não linear. Tanh(·) é usado para aprimorar a representação não linear e simular a soma geral de partes característica de sistemas complexos. Cada nível captura a diversidade dentro das categorias por meio de uma estrutura de subclasses, divide a similaridade da distribuição de pesos para reduzir a influência de subclasses ruidosas e foca dinamicamente em características discriminativas por meio de mecanismos de atenção para aprimorar a capacidade de generalização do modelo. O CST é principalmente integrado ao GNN por meio de dois mecanismos. A primeira é introduzir a centralidade dos nós para reconstruir o processo de disseminação da informação e simular a distribuição heterogênea da influência lexical no sistema linguístico. A centralidade do nó é quantificada por meio do algoritmo PageRank e acoplada dinamicamente aos pesos das arestas, permitindo que o vocabulário central domine a propagação semântica e aumentando a adaptabilidade do modelo às mudanças dinâmicas das tarefas. A segunda é projetar uma estrutura de geração de protótipos em três níveis, desde clustering de micro-subclasses até fusão de protótipos de macro-categorias, para simular a característica emergente no sistema de linguagem de que "o todo é maior que a soma de suas partes". Essa estrutura alcança integração hierárquica de características locais até semântica global por meio de distribuição de similaridade, ponderação e mecanismos de atenção.

Em resumo, a inovação central do modelo ETC construído está na integração profunda das ideias da CST no arcabouço da GNN. Ao reconstruir o mecanismo de disseminação de informações por meio da centralidade dos nós, o modelo simula o papel principal dos elementos centrais no sistema linguístico e aprimora sua adaptabilidade à dinâmica das tarefas. Por meio do framework de geração de protótipos em três níveis, o modelo realiza o processo de emergência das características locais para a semântica global, aprimorando assim a capacidade do modelo de capturar a diversidade e as características discriminatórias dentro da categoria. Esse método evita a limitação das GNNs tradicionais que dependem apenas de relações em nível de instância. Por meio da interação em nível de distribuição e características complexas do sistema, ele oferece uma nova solução para melhorar a capacidade de generalização do modelo em cenários de poucos tiros e entre domínios.

As propriedades emergentes da CST correspondem a uma estrutura de geração de protótipos em três níveis. Nos sistemas linguísticos, o princípio de que "o todo é maior que a soma de suas partes" se manifesta como um salto semântico dos significados locais das palavras para as categorias gerais de texto. Este estudo simula esse processo por meio de um mecanismo de geração de protótipos "micro-meso-macro" em três níveis: no nível micro, as incorporações de amostras são agrupadas para formar protótipos de subclasse; No nível meso, esses protótipos são ponderados e fundidos com base na similaridade de distribuição; e no nível macro, protótipos finais de categorias são sintetizados de forma não linear por meio de um mecanismo de atenção. Por exemplo, na classificação de sentimento, múltiplas palavras negativas como "decepcionante", "lento" e "caro" se misturam e se transformam de forma não linear para emergir como um forte sentimento geral de "avaliação negativa". Centralidade e heterogeneidade de nós na CST alinham-se com um mecanismo de propagação de informação baseado em reconstrução de centralidade de nós. Dentro das redes linguísticas, a influência das palavras é distribuída de forma desigual, com palavras centrais (por exemplo, verbos, termos temáticos) desempenhando papéis dominantes na propagação semântica. Este estudo quantifica a centralidade dos nós usando o algoritmo PageRank e a acopla dinamicamente com pesos de aresta para ajustar a intensidade da distribuição de informações entre nós. Por exemplo, na categorização de notícias, o termo "eleição" tem alta centralidade em textos políticos, levando nós adjacentes como "vote" e "campaign" a ganharem maior peso durante a agregação de informações, aprimorando assim a representação semântica desse tema. A natureza dinâmica e adaptativa da CST corresponde a GNNs conscientes da distribuição e a um mecanismo experimental de ensino dentro da metadestilação. Os sistemas linguísticos evoluem dinamicamente de acordo com o contexto e os requisitos da tarefa. Os modelos capturam mudanças gerais de distribuição nos conjuntos de dados por meio de GNNs conscientes da distribuição. Simultaneamente, um mecanismo experimental instrucional impulsionado pelo meta-aprendizado é introduzido no TSMDM, permitindo que as MTs ajustem dinamicamente parâmetros com base no feedback dos SMs. Por exemplo, na análise de sentimento entre domínios, o modelo pode rapidamente adaptar pesos de características com base na distribuição de dados do domínio alvo e refinar os parâmetros da MT durante a metadestilação para melhorar a eficiência de adaptação para novos domínios.

Modelo LTC baseado no TSMDM
Pipeline de Metadestilação em Dois Estágios
Para enfrentar os desafios do alto custo computacional e dificuldades de implantação em ambientes com recursos limitados, é proposto um modelo leve de classificação de texto baseado em um TSMDM. Esse método de metadestilação executa o processo de destilação em uma ordem sequencial estrita, com dois estágios distintos. A segunda etapa é iniciada somente após a conclusão e convergência do treinamento da primeira etapa: 1) a etapa de compressão de conhecimento do Professor para o Assistente de Ensino (TA) e 2) a etapa de destilação leve de TA para Aluno integrada à adaptação dos parâmetros de metaaprendizagem. Essa abordagem alcança uma transferência eficiente de conhecimento de uma MT complexa para uma SM leve por meio de destilação em dois estágios, incorporando um mecanismo de meta-aprendizagem para otimizar dinamicamente a estratégia de transferência de conhecimento durante oprocesso 21,22. O pipeline geral é ilustrado na Figura 5.

figure-protocol-28
Figura 5: Projeto de pipeline do modelo de classificação de texto leve com mecanismo de metadestilação em dois estágios. A figura projeta o pipeline do modelo de classificação de texto leve com o mecanismo de metadestilação em dois estágios (TSMDM). O pipeline compreende um modelo de professor (fonte de conhecimento de alta complexidade), um modelo de assistente de ensino (camada intermediária de complexidade buffer) e um modelo de aluno (modelo alvo leve), e implementa transferência eficiente de conhecimento por meio de duas etapas sequenciais: compressão de conhecimento de professor para assistente de ensino e destilação leve de assistente de ensino para aluno integrada com meta-aprendizagem. Por favor, clique aqui para ver uma versão ampliada desta figura.

O método envolve três funções: um TM, um modelo TA e um SM, com o processo de destilação dividido em duas etapas: destilação professor-TA e destilação TA-aluno. Na primeira etapa de compressão de conhecimento Teacher-to-TA, o conhecimento da MT é primeiro comprimido em um modelo TA de complexidade intermediária para mitigar a perda de informação causada por lacunas excessivas de capacidade na destilação direta. A TM, servindo como fonte de conhecimento, transfere tanto suas probabilidades de classificação de saída quanto características da camada intermediária para o modelo TA. O modelo TA é treinado alinhando seus resultados e representações de características com as do professor, usando uma função de perda combinada que integra perda de classificação e perda de alinhamentode características 21. Na segunda etapa de destilação leve de TA para Student, que é lançada após a convergência do modelo TA, o conhecimento é ainda mais destilado do modelo TA para o SM leve final. Essa etapa também emprega supervisão dupla (logits de classificação e características intermediárias) e incorpora um mecanismo de meta-aprendizagem: a MT realiza "experimentos de ensino" em tarefas auxiliares para avaliar o estado de aprendizagem do aluno e ajusta dinamicamente seus próprios parâmetros para fornecer orientações mais adaptativas e direcionadas. O SM completa o treinamento minimizando tanto a discrepância de saída quanto a distância das características em relação ao modelo TA, alcançando assim uma redução significativa dos parâmetros enquanto preserva o desempenho da classificação na maior medidapossível 22.

Meta-Aprendizagem com Experimentos de Ensino
Nos métodos tradicionais de destilação do conhecimento, o TM treinado orienta o SM participando do cálculo de perdas. No entanto, as MTs de parâmetros fixos são difíceis de avaliar o status real de aprendizagem dos SMs, nem podem quantificar a contribuição específica de suas orientações para atualizar os parâmetros23,24 do SM. Portanto, este estudo introduz ideias de metaaprendizagem no processo de destilação, permitindo que a MT ajuste seus próprios parâmetros com base no feedback de aprendizagem do SM. O processo de destilação é mostrado na Figura 6.

figure-protocol-29
Figura 6: Processo iterativo de otimização de parâmetros de metadestilação combinado com mecanismo experimental de ensino. A figura mostra o processo iterativo de otimização de parâmetros da metadestilação combinado com o mecanismo de ensino para o lightweighting do modelo de classificação de texto em inglês. O processo gera um aprendiz interno temporário a partir do modelo do aluno, quantifica a perda do efeito do ensino por meio do desempenho simulado do treino do aprendiz interno e permite que o modelo do professor ajuste seus próprios parâmetros por meio da retropropagação da perda, otimizando assim a estratégia subsequente de transferência de conhecimento. Por favor, clique aqui para ver uma versão ampliada desta figura.

A TM otimiza parâmetros por meio de tarefas convencionais de classificação durante sua própria fase de treinamento, resultando em uma perda básica de classificação LT que reflete seu desempenho original. Após concluir o treinamento, o SM S é replicado para gerar uma cópia temporária do aprendiz interno S1. A TM realiza experimentos de ensino em S1, e o erro de desempenho abrangente exibido por S1 neste treinamento simulado é quantificado como perda LQ. Esse sinal é usado como feedback para a TM para avaliar a eficácia do ensino. Por meio da retropropagação de LQ, a MT ajusta ativamente seus próprios parâmetros e otimiza seu método de transmissão de conhecimento. Após concluir a otimização do metaaprendizado, a MT realiza a destilação formal do conhecimento no SM S original e também usa a perda do modelo LS como feedback para ensinar avaliação de eficácia à MT. Para alcançar a leveza do modelo ETC, este estudo considerará incorporar o modelo SDF GNN como uma MT no processo de ensino, conforme mostrado na Figura 7.

figure-protocol-30
Figura 7: Fluxo de atualização de parâmetros do mecanismo experimental de ensino para otimização de modelos de professor em metadestilação. A figura mostra o fluxo de atualização de parâmetros do mecanismo do experimento de ensino para otimização de modelos de professor no processo de meta-destilação. O fluxo primeiro calcula a perda suave entre a previsão do aprendiz interno e a previsão do modelo do professor com a função de perda de erro quadrático médio, combina a perda suave com erro de rótulo rígido para formar a perda total de treinamento, e atualiza os parâmetros do modelo do professor por meio da retropropagação do erro total ponderado para melhorar sua eficácia no ensino. Por favor, clique aqui para ver uma versão ampliada desta figura.

Após concluir o treinamento de destilação de conhecimento, o SM primeiro calcula a diferença entre os resultados previstos da MT e os verdadeiros rótulos. Subsequentemente, a função de perda MSE é usada para medir a distância entre a previsão do SM (aprendiz interno S1) e a previsão da MT. Esse valor de distância é usado como perda suave25. O objetivo final de treinamento consiste em uma combinação ponderada de erro rígido de rótulo e perda suave. Ao retropropagar o erro total ponderado, os parâmetros da MT são atualizados, melhorando assim a eficácia do ensino da MT. O cálculo do parâmetro do aprendiz interno S1 é mostrado na equação (9).

figure-protocol-31(9)

Na equação (9), figure-protocol-32 e figure-protocol-33 são os parâmetros internos do aprendiz e seus parâmetros iniciais influenciados pelo parâmetro TM γT. λ (a taxa de aprendizado, λ = 0,005) controla o tamanho do passo de atualização do parâmetro para aprendizes internos (ou seja, cópias dos SMs) durante a metadestilação26. A equação (9) calcula gradientes de perda por meio da retropropagação, enquanto λ atualiza os parâmetros dos aprendizes internos. Esse mecanismo reflete as características de aprendizagem dos SMs, permitindo que os TMs recebam feedback e ajustem suas estratégias de ensino, aumentando assim a eficácia da destilação de conhecimento subsequente. O cálculo da perda LS no metaaprendizado é mostrado na equação (10).

figure-protocol-34 (10)

Na equação (10), B é a sequência de amostras de meta-aprendizado.

Otimizando a Transferência de Conhecimento com Projeto de Perdas e Modelo de Assistente
Para aumentar ainda mais a eficácia da destilação do conhecimento, este estudo obtém a perda total calculando a perda de classificação e a perda de características. Entre elas, a perda de características adota um mecanismo retrospectivo, usando as saídas de características rasas e atuais da MT para guiar a SM, conforme expresso na equação (11).

figure-protocol-35(11)

Na equação (11), I é o conjunto dos índices da camada de características. D é uma função de distância tomada para calcular a diferença entre duas representações de características. e são funções de representação objetiva nas TM e SM, que convertem as saídas figure-protocol-36 de características e figure-protocol-37 das camadas i e j-ésima em matrizes de atenção.figure-protocol-38 figure-protocol-39 A perda de classificação combina a perda de entropia cruzada entre a saída do SM e o rótulo verdadeiro, assim como a MSE entre a saída dos dois modelos, como a perda suave27,28. No fim das contas, a perda total é obtida ponderando os dois, ajudando o SM a receber melhor orientação da MT. Para minimizar a perda de desempenho durante o processo de destilação do conhecimento, este estudo coloca o modelo do assistente de ensino entre dois modelos, como exibido na Figura 8.

figure-protocol-40
Figura 8: Fluxo de processamento de destilação de conhecimento em dois estágios com modelo de assistente de ensino como camada intermediária de tampão. A figura demonstra o fluxo de processamento de destilação de conhecimento em dois estágios com o modelo de assistente de ensino como camada intermediária de tampão. Os fusíveis do primeiro estágio apresentam perda e perda de classificação para construir a perda total de destilação, e treinam o modelo de assistente de ensino com o conhecimento do modelo do professor; A segunda etapa adota a mesma estratégia de fusão de perda para destilar o conhecimento do modelo de assistente de ensino ao modelo do aluno, reduzindo a perda de informação causada por lacunas excessivas de complexidade entre os modelos professor e aluno. Por favor, clique aqui para ver uma versão ampliada desta figura.

Após concluir a etapa de metadestilação, o modelo TA e a TM passam por destilação convencional de conhecimento. Durante esse processo, as características de ambos são extraídas síncronicamente e a perda correspondente La é calculada. Subsequentemente, essa perda de característica é fundida com a perda de classificação LM1 do modelo para formar a função figure-protocol-41 de perda por destilação no primeiro estágio, conforme mostrado na equação (12).

figure-protocol-42(12)

Na equação (12), β é o coeficiente de peso usado para controlar a proporção de perda de características e perda de classificação na perda total. figure-protocol-43 e figure-protocol-44 são funções de representação objetiva no modelo de assistente de ensino e na MT, que convertem as saídas figure-protocol-45 de características e figure-protocol-46 das camadas i-ésima e j-ésima em matrizes de atenção. zT e zM são as saídas do modelo TM e do assistente. O processo de destilação do modelo de assistente de ensino para o SM é o mesmo do processo acima, o que minimiza a perda do SM por meio de múltiplas iterações para completar a transferência de conhecimento.

Em conclusão, a contribuição central do TSMDM proposto está na otimização do processo de transferência de conhecimento por meio do mecanismo de meta-aprendizagem. Comparado à destilação tradicional, a principal vantagem desse método está em sua capacidade dinâmica de ensino: a MT pode ajustar seus próprios parâmetros por meio do mecanismo experimental de ensino com base no feedback em tempo real do SM, fornecendo assim uma orientação mais direcionada. Enquanto isso, o modelo de assistente de ensino é introduzido como uma camada de tampão, efetivamente preenchendo a lacuna de complexidade entre os TMs e os SMs e reduzindo a perda de informação na transferência de conhecimento. O design colaborativo dessa "estratégia de ensino de otimização por meta-aprendizagem" e "buffering em dois níveis para reduzir a dificuldade de transferência" permite que o SM final alcance um peso significativo de leve, mantendo ao máximo o conhecimento central extraído da TM complexa.

Disponibilidade de Dados
Os conjuntos de dados gerados durante e/ou analisados durante o estudo atual são fornecidos no Arquivo Suplementar 1.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Configuração experimental e conjunto de dados:
Para avaliar de forma abrangente o desempenho e a eficiência leve do modelo proposto em tarefas de classificação cruz-domínio de amostras pequenas, experimentos são realizados em quatro conjuntos de dados: FewRel (classificação relacional em amostras pequenas), ARSC (análise de sentimento entre domínios), Reuters-21578 (categorização de notícias multi-tópicos) e ArXiv (resumos acadêmicos de formato longo). FewRel, um conj...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para aprimorar a capacidade de generalização do ETC em cenários de poucos tiros e entre domínios, ao mesmo tempo em que reduz custos computacionais, este estudo propõe uma estrutura leve de classificação de texto integrando CST com TSMDM. A integração da CST com um framework TSMDM aborda as limitações centrais dos métodos ETC existentes (generalização pobre entre poucos disparos/multidomínio e altos custos computacionais) ao incorporar dinâmicas de sistemas linguísticos e propriedades se...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a reconhecer.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Central Processing Unit (CPU)Fornecedores de hardware comercial (Intel, Dell, Lenovo)Intel i5-7300HQEspecificações de hardware
Graphics Processing Unit (GPU)Fornecedores de hardware comercial (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMEspecificações de hardware
Random Access Memory (RAM)Fornecedores de hardware comercial16 GB DDR4Especificações de hardware
Solid State Drive (SSD)Fornecedores de hardware comercial1 TB NVMe SSDEspecificações de hardware
Operating SystemSite oficial da MicrosoftWindows 10 (64 bits)Software do sistema
PythonSite oficial do Python (python.org)Python 3.8Linguagem de programação
PyTorchSite oficial do PyTorch (pytorch.org)PyTorch 1.11.0Estruturas de aprendizado de máquina profunda & Bibliotecas principais
CUDASite oficial da NVIDIACUDA 11.3Estruturas de aprendizado de máquina profunda & Bibliotecas principais
Hugging Face TransformersHugging Face Hub (huggingface.co)Versão estável (adaptada para Python 3.8/PyTorch 1.11.0)Estruturas de aprendizado de máquina profunda & Bibliotecas principais
NumPyPyPI (pypi.org)Versão estável (adaptada para Python 3.8)Bibliotecas de processamento de dados & Estatísticas
PandasPyPI (pypi.org)Versão estável (adaptada para Python 3.8)Bibliotecas de processamento de dados & Estatísticas
Scikit-learnPyPI (pypi.org)Versão estável (adaptada para Python 3.8)Bibliotecas de processamento de dados & Estatísticas
SciPyPyPI (pypi.org)Versão estável (adaptada para Python 3.8)Bibliotecas de processamento de dados & Estatísticas
MatplotlibPyPI (pypi.org)Versão estável (adaptada para Python 3.8)Biblioteca de visualização
AdamWIntegrado no PyTorchIntegrado no PyTorch 1.11.0Otimizador
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Modelos pré-treinados
FewRelRepositório oficial do FewRel (GitHub) / Wikipedia100 categorias de relações semânticas, 700 frases por categoria; divisão de treino/validação/teste (5:2:3)Conjuntos de dados
ARSCConjuntos de dados públicos de análise de sentimentos multidomínio (GitHub/ACL Anthology)23 categorias de produtos Amazon, 69 tarefas de análise de sentimentos binária; divisão de treino/validação/teste (4:2:3)Conjuntos de dados
Reuters-21578UCI Machine Learning Repository / Arquivo oficial da Reuters21.578 artigos de notícias, 90 categorias temáticas; método de particionamento ModApteConjuntos de dados
ArXivAPI pública do ArXiv (arxiv.org)Resumos de artigos de ciência da computação; divisão de treino/validação/teste (7:2:1)Conjuntos de dados
TokenizerHugging Face Hub (huggingface.co)Tokenizer BERT-base-casedOutras ferramentas essenciais
GitSite oficial do Git (git-scm.com)Versão estável mais recenteOutras ferramentas essenciais

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Artigos relacionados