$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Para melhorar a capacidade de generalização do ETC em cenários de amostras pequenas e domínios cruzados e realizar um modelo leve, este estudo propõe uma estrutura de classificação de texto integrando CST e TSMDM. O processo geral desse arcabouço é mostrado na Figura 1.

Figura 1: Visualização do framework de classificação de texto inglês leve de quatro estágios que integra CST e TSMDM. O fluxo de trabalho consiste em quatro etapas. O estágio 1 realiza representação de texto usando embeddings dinâmicos baseados em BERT a partir do texto em inglês de entrada. A Etapa 2 aplica a modelagem de redes neurais de grafos construindo um grafo de texto e calculando relações em nível de instância e distribuição. O Estágio 3 modela a emergência semântica por meio da reconstrução da centralidade dos nós e uma estrutura de geração de protótipos multinível para obter o protótipo final da categoria. A Etapa 4 realiza destilação elementar em dois estágios, onde um modelo de professor é treinado e o conhecimento é transferido por metadestilação para produzir o modelo final do aluno. Por favor, clique aqui para ver uma versão ampliada desta figura.
Primeiramente, na fase de representação textual e incorporação dinâmica, o modelo BERT é utilizado para incorporar dinamicamente o texto de entrada e capturar as informações semânticas contextuais. A segunda etapa é a modelagem GNN consciente da distribuição, que considera as características de distribuição das amostras, constrói um modelo GNN e aprimora a representação de características por meio da interação de informação dual no nível da instância e distribuição. A terceira etapa é a modelagem de emergência semântica guiada pela teoria dos sistemas híbridos, introduzindo a reconstrução da centralidade dos nós e um mecanismo de geração de protótipos em três níveis para simular a dinâmica e o surgimento do sistema de linguagem. Finalmente, no quarto estágio, é realizada uma operação de meta-destilação leve em dois níveis. O processo de destilação do conhecimento é otimizado por meio do modelo assistente e da estratégia de meta-aprendizagem para alcançar compressão e aceleração eficientes do modelo.
Modelo ETC baseado em características de distribuição e CST
Visão geral da Arquitetura de Modelos
O modelo proposto de classificação de texto emprega primeiro um BERT pré-treinado para realizar a codificação contextual dinâmica do texto de entrada, gerando embeddings semanticamente ricos em palavras e uma representação global. Em seguida, um grafo de instância e um grafo de distribuição são construídos a partir dessas características: o grafo de instância captura semelhanças de amostra par a par, enquanto o grafo de distribuição modela a distribuição geral dos dados; A troca iterativa de informações entre os dois grafos permite o aprimoramento sinérgico de características individuais e da estrutura global. Subsequentemente, o CST é integrado para aumentar profundamente a rede de grafos. A reconstrução da centralidade de nós usa o PageRank para quantificar a influência lexical, simulando o papel dominante dos elementos centrais em redes linguísticas. Este é um método amplamente validado para medir a influência global de nós em topologias de redes complexas e é bem adequado para capturar a dispersão semântica assimétrica dos nós lexicais centrais em sistemas linguísticos. Uma estrutura de geração de protótipos "micro–meso–macro" em três níveis emula o processo emergente da semântica local às representações holísticas de categorias. Por fim, as representações de características aprimoradas são inseridas em um classificador para produzir as probabilidades finais da classe.
Interação de Características com GNN consciente da distribuição
Para otimizar a capacidade de generalização do ETC e capturar efetivamente relações semânticas complexas entre textos e Características de Distribuição de Amostras (SDFs), este estudo constrói um modelo ETC baseado em características de distribuição e CST. Ele alcança uma mineração profunda de informações globais e locais em texto integrando mecanismos como GNN e incorporação dinâmica de texto. GNN é um modelo DL especificamente projetado para processar dados estruturados em grafos. O princípio central é usar um mecanismo de passagem de mensagens (onde cada nó no grafo agrega as informações de características de seus nós vizinhos) e combiná-lo com seu próprio estado. Por meio de múltiplas rodadas de atualizações iterativas, ele aprende gradualmente uma representação de alta dimensão que inclui a estrutura da topologia. Esse processo permite que os nós capturem a estrutura e dependências de características da vizinhança local e até mesmo do grafo global. Para superar as limitações dos modelos tradicionais de sequência na modelagem de dependências de longo alcance e relações globais, este estudo utiliza GNN para capturar associações semânticas complexas e relações estruturais entre amostras. Devido ao foco do GNN na informação direta de correlação entre amostras individuais, ele ignora as características gerais de distribuição do conjuntoamostral 14, 15 e 16. Portanto, este estudo propõe um modelo GNN que considera a SDF. Esse modelo introduz o BERT para incorporação dinâmica de texto e o combina com uma rede protótipo para calcular as diferenças de características das amostras. BERT é um modelo de linguagem pré-treinado baseado na arquitetura Transformer. O princípio central é capturar simultaneamente a informação semântica de cada palavra no contexto por meio de um codificador bidirecional, e pré-treiná-la em um corpus em grande escala usando duas tarefas: "modelo de linguagem mascarada" e "previsão da próxima frase". Em modelos de linguagem mascarados, algumas palavras na entrada são mascaradas aleatoriamente, e o modelo precisa prever a palavra original com base no contexto. A próxima previsão determina se as duas frases são consecutivas. Após o pré-treinamento, o BERT pode se adaptar rapidamente a várias tarefas de processamento de linguagem natural por meio de ajuste fino, melhorando significativamente o desempenho e fornecendo representações de características de alta qualidade para a construção subsequente de estruturas de grafos. A estrutura específica do modelo ETC construído neste estudo é mostrada na Figura 2.

Figura 2: Design arquitetônico do modelo de classificação de texto em inglês integrado ao CST, considerando características de distribuição de amostras. A figura exibe o design arquitetônico do modelo de classificação de texto em inglês, integrado com a teoria dos sistemas complexos (CST) e levando em conta as características de distribuição de amostras de texto. A arquitetura funde embutimento contextual dinâmico baseado em BERT, rede neural de grafos (GNN) consciente da distribuição e mecanismos de aprimoramento de CST, e realiza mineração aprofundada de informações semânticas globais e locais em textos em inglês por meio de modelagem colaborativa em múltiplos módulos. Por favor, clique aqui para ver uma versão ampliada desta figura.
Neste modelo, para um conjunto de dados geral, a entrada de texto em inglês no modelo BERT gera uma sequência de tokens através de um tokenizador. O método de construção de sequências é mostrado na equação (1).
[CLS], um 1,um 2,... an, [SEP] (1)
Na equação (1), [CLS] é o marcador de classificação localizado no início da sequência. O BERT gerará um estado oculto de posição fixa para [CLS] durante o processo de treinamento. Esse estado é usado diretamente para a representação semântica global de todo o texto. Um1,um 2,... A n representa uma palavra ou subpalavra no texto. [SEP] é um delimitador usado para marcar o fim de uma frase. Após o processamento da sequência acima, as características de cada token são obtidas, fornecendo informações contextuais estruturadas para o modelo. Para conjuntos de dados especiais contendo entidades, se métodos convencionais de construção de sequências forem usados, a informação posicional contida pelas entidades será perdida. Portanto, este estudo constrói a sequência usando o método mostrado na equação (2).
(2)
Na equação (2), [E1], [/E1], [E2] e [/E2] são os tokens definidos para determinar as posições inicial e final de duas entidades. De forma semelhante, após o processamento Bert, as características de saída desses tokens transportarão informações semânticas das entidades correspondentes, aproveitando melhor a informação importante sobre a localização da entidade. Posteriormente, este estudo utiliza um modelo GNN considerando SDF para aprimorar a distribuição e as características de instância das amostras. A estrutura do modelo é mostrada na Figura 3.

Figura 3: Arquitetura de interação de características de grafo duplo do modelo de rede neural de grafos conscientes da distribuição. A figura apresenta a arquitetura de interação de características em grafos duplos do modelo GNN consciente de distribuição para classificação de texto em inglês. A arquitetura constrói um grafo de pontos para codificação de similaridade em nível de instância e um grafo de distribuição para codificação de similaridade em nível de distribuição, além de alcançar aprimoramento de características por meio da interação iterativa de informação entre os dois grafos, completando o ciclo de informação entre níveis de características de instância e de distribuição. Por favor, clique aqui para ver uma versão ampliada desta figura.
O modelo alcança aprimoramento de características por meio de um mecanismo de interação em dois estágios. Primeiramente, ele analisa características de distribuição a partir de associações em nível de instância de amostras de dados e, em seguida, otimiza dinamicamente características de instância por meio da troca de informações no nível da distribuição. Ao fortalecer iterativamente as características das instâncias e níveis de distribuição, ela conclui a tarefa de classificação. Especificamente, o modelo utiliza grafos de pontos e grafos de distribuição para promover a troca de informações. O mapa de pontos usa o vetor de características de amostra de texto (atualizado pelas duas últimas camadas do BERT) como nó, quantifica a diferença de características da amostra para calcular o peso das arestas por meio de uma rede dedicada de codificação (uma camada sigmoide + duas camadas convolucionais de normalização em lote) e usa normalização min-max para normalizar para o [intervalo 0,1. Um limiar empírico de similaridade de 0,2 é estabelecido para o limiar de arestas, onde arestas com pesos abaixo desse limite são podadas para eliminar correlações fracas em nível de instância. O grafo de distribuição recebe as características de distribuição de texto fundido como nós, com pesos de aresta calculados com base na similaridade cosseno dos vetores de características de distribuição e normalizados via normalização por L2 para garantir consistência métrica. Um limiar de aresta de 0,15 é adotado, e arestas com pesos abaixo desse valor são removidas, enquanto os pesos de aresta válidos restantes são ainda mapeados e padronizados por um perceptron multicamada para aumentar a discriminabilidade das associações em nível de distribuição. Este estudo define um gráfico
de pontos para a iteração da camada l, onde o
nó representa características da amostra e as arestas
codificam a similaridade em nível de instância. Mapa
de distribuição , nó
representa características da amostra, e arestas
codificam similaridade no nível de distribuição. Tomando a roda l-ésima para a l+1-ésima como exemplo, o cálculo de relação em nível de instância calcula a similaridade de pontos por meio de diferenças de características, como mostrado na equação (3).
(3)
Na equação (3),
e
são os pesos das arestas entre os nós i e j durante as iterações l-ésima e l-1-ésima do grafo pontual, refletindo a similaridade das características da amostra.
é uma rede de codificação usada para converter diferenças de características de nós em escalas de peso de aresta, consistindo em uma camada de sigmoide e duas camadas de funções de ativação por lote de convolução. Quando
e
são a l-1-ésima iteração, os autovetores dos nós i e j são atualizados por Bert nas duas últimas camadas. Depois, as características da distribuição são calculadas com base nas relações de instância, conforme mostrado na equação (4).
(4)
Na equação (4),
é o autovetor do nó i no grafo de distribuição da camada l. O MLP1 é um perceptron multicamadas composto por funções de ativação e camadas totalmente conectadas, que mapeia as características compostas concatenadas em novas características de distribuição. Depois, a relação de distribuição é calculada com base nas características da distribuição, e as características de instância são calculadas a partir da relação de distribuição para completar o ciclo de informação entre níveis.
Mecanismos de Aprimoramento de Sistemas Complexos
Para aprimorar ainda mais a capacidade de generalização, a CST é aplicada ao modelo acima neste estudo. A evolução dinâmica dos sistemas complexos se manifesta pela distribuição heterogênea da influência dos nós. Para simular o papel dominante do vocabulário central na propagação semântica em sistemas linguísticos, este estudo introduz o índice de centralidade dos nós para reconstruir o mecanismo de propagação da informação. O gráfico de pontos Hp construído para cada tarefa de cenário usa o algoritmo PageRank para quantificar a centralidade do nó C(hi), conforme mostrado na equação (5)17.
(5)
Na equação (5), α é o coeficiente de amortecimento α = 0,85. N(h i) representa o conjunto de nós vizinhos, e L(h j) é o grau do nó. A Equação (5) substitui o processo de propagação em cascata da influência do vocabulário em redes linguísticas simuladas, permitindo que o vocabulário central (como verbos e palavras-tópico) ganhe maior centralidade. Depois, a centralidade do nó é acoplada a pesos de aresta para ajustar dinamicamente a força de propagação da informação entre nós. A função de acoplamento λij é mostrada na equação (6).
(6)
Na equação (6), σ é a função de ativação Sigmoide, WT é o vetor de peso aprendível, e b significa o termo de viés. O acoplamento dos pesos de centralidade e arestas equilibra dinamicamente as relações locais com a importância global, aumentando assim a adaptabilidade do modelo a mudanças dinâmicas nas tarefas. O surgimento da CST se manifesta na língua inglesa como a semântica geral que supera a soma do vocabuláriolocal 18. Para utilizar essa característica no ETC, este estudo projeta uma estrutura de geração de protótipos em três níveis para simular o processo de emergência de micro características para macrocategorias, conforme mostrado na Figura 4.

Figura 4: Construção em etapas do framework de geração de protótipos micro-meso-macro em três níveis para emergência semântica linguística. A figura ilustra a construção passo a passo da estrutura de geração de protótipos micro-meso-macro em três níveis para simular o surgimento semântico linguístico na classificação de textos em inglês. A estrutura constrói representações hierárquicas de categorias de texto por meio de micro clustering de subclasses com K-médias, fusão de protótipos meso de subclasses baseada em ponderação por similaridade de distribuição, e integração macro não linear via mecanismo de atenção, simulando a característica emergente de "o todo é maior que a soma de suas partes" em sistemas linguísticos. Por favor, clique aqui para ver uma versão ampliada desta figura.
O processo acima constrói representações de categorias de texto passo a passo, do micro ao macro para elevar a capacidade de generalização do modelo. No nível micro, K subclasses são geradas por agrupamento das representações de embutimento de amostras de cada categoria de texto. K-médias é utilizada para dividir as amostras dentro da categoria em subgrupos, e a posição do centroide de cada subgrupo é calculada como o protótipo dasubclasse 19. No nível mesoscópico, a similaridade de distribuição de cada protótipo de subclasse é calculada, uma matriz de similaridade é gerada e, em seguida, os protótipos de subclasses são remontados com base nos pesos de similaridade para quantificar a correlação entre as subclasses. O cálculo do peso de similaridade da subclasse wij é mostrado na equação (7).
(7)
Na equação (7),
está a divergência de Jensen-Shannon, usada para medir a diferença de distribuição entre duas subclasses
e
20. Finalmente, os protótipos de subclasses são ponderados e fundidos para obter um conjunto de representações
de distribuição de classes . No nível macro, os pesos de importância de cada subclasse são aprendidos por meio de mecanismos de atenção, e transformações não lineares são introduzidas para simular o processo de emergência, resultando no protótipo final da classe c final, conforme mostrado na equação (8).
(8)
Na equação (8), αk significa o peso de atenção da classe k. U denota a matriz de pesos de transformação não linear. Tanh(·) é usado para aprimorar a representação não linear e simular a soma geral de partes característica de sistemas complexos. Cada nível captura a diversidade dentro das categorias por meio de uma estrutura de subclasses, divide a similaridade da distribuição de pesos para reduzir a influência de subclasses ruidosas e foca dinamicamente em características discriminativas por meio de mecanismos de atenção para aprimorar a capacidade de generalização do modelo. O CST é principalmente integrado ao GNN por meio de dois mecanismos. A primeira é introduzir a centralidade dos nós para reconstruir o processo de disseminação da informação e simular a distribuição heterogênea da influência lexical no sistema linguístico. A centralidade do nó é quantificada por meio do algoritmo PageRank e acoplada dinamicamente aos pesos das arestas, permitindo que o vocabulário central domine a propagação semântica e aumentando a adaptabilidade do modelo às mudanças dinâmicas das tarefas. A segunda é projetar uma estrutura de geração de protótipos em três níveis, desde clustering de micro-subclasses até fusão de protótipos de macro-categorias, para simular a característica emergente no sistema de linguagem de que "o todo é maior que a soma de suas partes". Essa estrutura alcança integração hierárquica de características locais até semântica global por meio de distribuição de similaridade, ponderação e mecanismos de atenção.
Em resumo, a inovação central do modelo ETC construído está na integração profunda das ideias da CST no arcabouço da GNN. Ao reconstruir o mecanismo de disseminação de informações por meio da centralidade dos nós, o modelo simula o papel principal dos elementos centrais no sistema linguístico e aprimora sua adaptabilidade à dinâmica das tarefas. Por meio do framework de geração de protótipos em três níveis, o modelo realiza o processo de emergência das características locais para a semântica global, aprimorando assim a capacidade do modelo de capturar a diversidade e as características discriminatórias dentro da categoria. Esse método evita a limitação das GNNs tradicionais que dependem apenas de relações em nível de instância. Por meio da interação em nível de distribuição e características complexas do sistema, ele oferece uma nova solução para melhorar a capacidade de generalização do modelo em cenários de poucos tiros e entre domínios.
As propriedades emergentes da CST correspondem a uma estrutura de geração de protótipos em três níveis. Nos sistemas linguísticos, o princípio de que "o todo é maior que a soma de suas partes" se manifesta como um salto semântico dos significados locais das palavras para as categorias gerais de texto. Este estudo simula esse processo por meio de um mecanismo de geração de protótipos "micro-meso-macro" em três níveis: no nível micro, as incorporações de amostras são agrupadas para formar protótipos de subclasse; No nível meso, esses protótipos são ponderados e fundidos com base na similaridade de distribuição; e no nível macro, protótipos finais de categorias são sintetizados de forma não linear por meio de um mecanismo de atenção. Por exemplo, na classificação de sentimento, múltiplas palavras negativas como "decepcionante", "lento" e "caro" se misturam e se transformam de forma não linear para emergir como um forte sentimento geral de "avaliação negativa". Centralidade e heterogeneidade de nós na CST alinham-se com um mecanismo de propagação de informação baseado em reconstrução de centralidade de nós. Dentro das redes linguísticas, a influência das palavras é distribuída de forma desigual, com palavras centrais (por exemplo, verbos, termos temáticos) desempenhando papéis dominantes na propagação semântica. Este estudo quantifica a centralidade dos nós usando o algoritmo PageRank e a acopla dinamicamente com pesos de aresta para ajustar a intensidade da distribuição de informações entre nós. Por exemplo, na categorização de notícias, o termo "eleição" tem alta centralidade em textos políticos, levando nós adjacentes como "vote" e "campaign" a ganharem maior peso durante a agregação de informações, aprimorando assim a representação semântica desse tema. A natureza dinâmica e adaptativa da CST corresponde a GNNs conscientes da distribuição e a um mecanismo experimental de ensino dentro da metadestilação. Os sistemas linguísticos evoluem dinamicamente de acordo com o contexto e os requisitos da tarefa. Os modelos capturam mudanças gerais de distribuição nos conjuntos de dados por meio de GNNs conscientes da distribuição. Simultaneamente, um mecanismo experimental instrucional impulsionado pelo meta-aprendizado é introduzido no TSMDM, permitindo que as MTs ajustem dinamicamente parâmetros com base no feedback dos SMs. Por exemplo, na análise de sentimento entre domínios, o modelo pode rapidamente adaptar pesos de características com base na distribuição de dados do domínio alvo e refinar os parâmetros da MT durante a metadestilação para melhorar a eficiência de adaptação para novos domínios.
Modelo LTC baseado no TSMDM
Pipeline de Metadestilação em Dois Estágios
Para enfrentar os desafios do alto custo computacional e dificuldades de implantação em ambientes com recursos limitados, é proposto um modelo leve de classificação de texto baseado em um TSMDM. Esse método de metadestilação executa o processo de destilação em uma ordem sequencial estrita, com dois estágios distintos. A segunda etapa é iniciada somente após a conclusão e convergência do treinamento da primeira etapa: 1) a etapa de compressão de conhecimento do Professor para o Assistente de Ensino (TA) e 2) a etapa de destilação leve de TA para Aluno integrada à adaptação dos parâmetros de metaaprendizagem. Essa abordagem alcança uma transferência eficiente de conhecimento de uma MT complexa para uma SM leve por meio de destilação em dois estágios, incorporando um mecanismo de meta-aprendizagem para otimizar dinamicamente a estratégia de transferência de conhecimento durante oprocesso 21,22. O pipeline geral é ilustrado na Figura 5.

Figura 5: Projeto de pipeline do modelo de classificação de texto leve com mecanismo de metadestilação em dois estágios. A figura projeta o pipeline do modelo de classificação de texto leve com o mecanismo de metadestilação em dois estágios (TSMDM). O pipeline compreende um modelo de professor (fonte de conhecimento de alta complexidade), um modelo de assistente de ensino (camada intermediária de complexidade buffer) e um modelo de aluno (modelo alvo leve), e implementa transferência eficiente de conhecimento por meio de duas etapas sequenciais: compressão de conhecimento de professor para assistente de ensino e destilação leve de assistente de ensino para aluno integrada com meta-aprendizagem. Por favor, clique aqui para ver uma versão ampliada desta figura.
O método envolve três funções: um TM, um modelo TA e um SM, com o processo de destilação dividido em duas etapas: destilação professor-TA e destilação TA-aluno. Na primeira etapa de compressão de conhecimento Teacher-to-TA, o conhecimento da MT é primeiro comprimido em um modelo TA de complexidade intermediária para mitigar a perda de informação causada por lacunas excessivas de capacidade na destilação direta. A TM, servindo como fonte de conhecimento, transfere tanto suas probabilidades de classificação de saída quanto características da camada intermediária para o modelo TA. O modelo TA é treinado alinhando seus resultados e representações de características com as do professor, usando uma função de perda combinada que integra perda de classificação e perda de alinhamentode características 21. Na segunda etapa de destilação leve de TA para Student, que é lançada após a convergência do modelo TA, o conhecimento é ainda mais destilado do modelo TA para o SM leve final. Essa etapa também emprega supervisão dupla (logits de classificação e características intermediárias) e incorpora um mecanismo de meta-aprendizagem: a MT realiza "experimentos de ensino" em tarefas auxiliares para avaliar o estado de aprendizagem do aluno e ajusta dinamicamente seus próprios parâmetros para fornecer orientações mais adaptativas e direcionadas. O SM completa o treinamento minimizando tanto a discrepância de saída quanto a distância das características em relação ao modelo TA, alcançando assim uma redução significativa dos parâmetros enquanto preserva o desempenho da classificação na maior medidapossível 22.
Meta-Aprendizagem com Experimentos de Ensino
Nos métodos tradicionais de destilação do conhecimento, o TM treinado orienta o SM participando do cálculo de perdas. No entanto, as MTs de parâmetros fixos são difíceis de avaliar o status real de aprendizagem dos SMs, nem podem quantificar a contribuição específica de suas orientações para atualizar os parâmetros23,24 do SM. Portanto, este estudo introduz ideias de metaaprendizagem no processo de destilação, permitindo que a MT ajuste seus próprios parâmetros com base no feedback de aprendizagem do SM. O processo de destilação é mostrado na Figura 6.

Figura 6: Processo iterativo de otimização de parâmetros de metadestilação combinado com mecanismo experimental de ensino. A figura mostra o processo iterativo de otimização de parâmetros da metadestilação combinado com o mecanismo de ensino para o lightweighting do modelo de classificação de texto em inglês. O processo gera um aprendiz interno temporário a partir do modelo do aluno, quantifica a perda do efeito do ensino por meio do desempenho simulado do treino do aprendiz interno e permite que o modelo do professor ajuste seus próprios parâmetros por meio da retropropagação da perda, otimizando assim a estratégia subsequente de transferência de conhecimento. Por favor, clique aqui para ver uma versão ampliada desta figura.
A TM otimiza parâmetros por meio de tarefas convencionais de classificação durante sua própria fase de treinamento, resultando em uma perda básica de classificação LT que reflete seu desempenho original. Após concluir o treinamento, o SM S é replicado para gerar uma cópia temporária do aprendiz interno S1. A TM realiza experimentos de ensino em S1, e o erro de desempenho abrangente exibido por S1 neste treinamento simulado é quantificado como perda LQ. Esse sinal é usado como feedback para a TM para avaliar a eficácia do ensino. Por meio da retropropagação de LQ, a MT ajusta ativamente seus próprios parâmetros e otimiza seu método de transmissão de conhecimento. Após concluir a otimização do metaaprendizado, a MT realiza a destilação formal do conhecimento no SM S original e também usa a perda do modelo LS como feedback para ensinar avaliação de eficácia à MT. Para alcançar a leveza do modelo ETC, este estudo considerará incorporar o modelo SDF GNN como uma MT no processo de ensino, conforme mostrado na Figura 7.

Figura 7: Fluxo de atualização de parâmetros do mecanismo experimental de ensino para otimização de modelos de professor em metadestilação. A figura mostra o fluxo de atualização de parâmetros do mecanismo do experimento de ensino para otimização de modelos de professor no processo de meta-destilação. O fluxo primeiro calcula a perda suave entre a previsão do aprendiz interno e a previsão do modelo do professor com a função de perda de erro quadrático médio, combina a perda suave com erro de rótulo rígido para formar a perda total de treinamento, e atualiza os parâmetros do modelo do professor por meio da retropropagação do erro total ponderado para melhorar sua eficácia no ensino. Por favor, clique aqui para ver uma versão ampliada desta figura.
Após concluir o treinamento de destilação de conhecimento, o SM primeiro calcula a diferença entre os resultados previstos da MT e os verdadeiros rótulos. Subsequentemente, a função de perda MSE é usada para medir a distância entre a previsão do SM (aprendiz interno S1) e a previsão da MT. Esse valor de distância é usado como perda suave25. O objetivo final de treinamento consiste em uma combinação ponderada de erro rígido de rótulo e perda suave. Ao retropropagar o erro total ponderado, os parâmetros da MT são atualizados, melhorando assim a eficácia do ensino da MT. O cálculo do parâmetro do aprendiz interno S1 é mostrado na equação (9).
(9)
Na equação (9),
e
são os parâmetros internos do aprendiz e seus parâmetros iniciais influenciados pelo parâmetro TM γT. λ (a taxa de aprendizado, λ = 0,005) controla o tamanho do passo de atualização do parâmetro para aprendizes internos (ou seja, cópias dos SMs) durante a metadestilação26. A equação (9) calcula gradientes de perda por meio da retropropagação, enquanto λ atualiza os parâmetros dos aprendizes internos. Esse mecanismo reflete as características de aprendizagem dos SMs, permitindo que os TMs recebam feedback e ajustem suas estratégias de ensino, aumentando assim a eficácia da destilação de conhecimento subsequente. O cálculo da perda LS no metaaprendizado é mostrado na equação (10).
(10)
Na equação (10), B é a sequência de amostras de meta-aprendizado.
Otimizando a Transferência de Conhecimento com Projeto de Perdas e Modelo de Assistente
Para aumentar ainda mais a eficácia da destilação do conhecimento, este estudo obtém a perda total calculando a perda de classificação e a perda de características. Entre elas, a perda de características adota um mecanismo retrospectivo, usando as saídas de características rasas e atuais da MT para guiar a SM, conforme expresso na equação (11).
(11)
Na equação (11), I é o conjunto dos índices da camada de características. D é uma função de distância tomada para calcular a diferença entre duas representações de características. e são funções de representação objetiva nas TM e SM, que convertem as saídas
de características e
das camadas i e j-ésima em matrizes de atenção.
A perda de classificação combina a perda de entropia cruzada entre a saída do SM e o rótulo verdadeiro, assim como a MSE entre a saída dos dois modelos, como a perda suave27,28. No fim das contas, a perda total é obtida ponderando os dois, ajudando o SM a receber melhor orientação da MT. Para minimizar a perda de desempenho durante o processo de destilação do conhecimento, este estudo coloca o modelo do assistente de ensino entre dois modelos, como exibido na Figura 8.

Figura 8: Fluxo de processamento de destilação de conhecimento em dois estágios com modelo de assistente de ensino como camada intermediária de tampão. A figura demonstra o fluxo de processamento de destilação de conhecimento em dois estágios com o modelo de assistente de ensino como camada intermediária de tampão. Os fusíveis do primeiro estágio apresentam perda e perda de classificação para construir a perda total de destilação, e treinam o modelo de assistente de ensino com o conhecimento do modelo do professor; A segunda etapa adota a mesma estratégia de fusão de perda para destilar o conhecimento do modelo de assistente de ensino ao modelo do aluno, reduzindo a perda de informação causada por lacunas excessivas de complexidade entre os modelos professor e aluno. Por favor, clique aqui para ver uma versão ampliada desta figura.
Após concluir a etapa de metadestilação, o modelo TA e a TM passam por destilação convencional de conhecimento. Durante esse processo, as características de ambos são extraídas síncronicamente e a perda correspondente La é calculada. Subsequentemente, essa perda de característica é fundida com a perda de classificação LM1 do modelo para formar a função
de perda por destilação no primeiro estágio, conforme mostrado na equação (12).
(12)
Na equação (12), β é o coeficiente de peso usado para controlar a proporção de perda de características e perda de classificação na perda total.
e
são funções de representação objetiva no modelo de assistente de ensino e na MT, que convertem as saídas
de características e
das camadas i-ésima e j-ésima em matrizes de atenção. zT e zM são as saídas do modelo TM e do assistente. O processo de destilação do modelo de assistente de ensino para o SM é o mesmo do processo acima, o que minimiza a perda do SM por meio de múltiplas iterações para completar a transferência de conhecimento.
Em conclusão, a contribuição central do TSMDM proposto está na otimização do processo de transferência de conhecimento por meio do mecanismo de meta-aprendizagem. Comparado à destilação tradicional, a principal vantagem desse método está em sua capacidade dinâmica de ensino: a MT pode ajustar seus próprios parâmetros por meio do mecanismo experimental de ensino com base no feedback em tempo real do SM, fornecendo assim uma orientação mais direcionada. Enquanto isso, o modelo de assistente de ensino é introduzido como uma camada de tampão, efetivamente preenchendo a lacuna de complexidade entre os TMs e os SMs e reduzindo a perda de informação na transferência de conhecimento. O design colaborativo dessa "estratégia de ensino de otimização por meta-aprendizagem" e "buffering em dois níveis para reduzir a dificuldade de transferência" permite que o SM final alcance um peso significativo de leve, mantendo ao máximo o conhecimento central extraído da TM complexa.
Disponibilidade de Dados
Os conjuntos de dados gerados durante e/ou analisados durante o estudo atual são fornecidos no Arquivo Suplementar 1.