$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Para mejorar la capacidad de generalización de ETC en escenarios de muestras pequeñas y dominios cruzados y lograr un modelo ligero, este estudio propone un marco de clasificación de texto que integra CST y TSMDM. El proceso general de este marco se muestra en la Figura 1.

Figura 1: Visualización del marco ligero de clasificación de texto en inglés de cuatro etapas que integra CST y TSMDM. El flujo de trabajo consta de cuatro etapas. La etapa 1 realiza la representación de texto utilizando incrustaciones dinámicas basadas en BERT a partir del texto en inglés de entrada. La etapa 2 aplica el modelado de redes neuronales de grafos construyendo un grafo de texto y calculando relaciones a nivel de instancia y distribución. La etapa 3 modela la emergencia semántica mediante la reconstrucción de centralidades de nodos y un marco de generación de prototipos multinivel para obtener el prototipo final de categoría. La etapa 4 realiza una destilación elemental en dos etapas, donde se entrena un modelo de profesor y se transfiere el conocimiento mediante metadestilación para producir el modelo final del alumno. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En primer lugar, en la etapa de representación textual e incrustación dinámica, se utiliza el modelo BERT para incrustar dinámicamente el texto de entrada y capturar la información semántica contextual. La segunda etapa es el modelado GNN consciente de la distribución, que considera las características de distribución de las muestras, construye un modelo GNN y mejora la representación de características mediante la interacción dual de información a nivel de instancia y distribución. La tercera etapa es el modelado de emergencia semántica guiado por la teoría de sistemas híbridos, introduciendo la reconstrucción de centralidades de nodos y un mecanismo de generación de prototipos en tres niveles para simular la dinámica y el surgimiento del sistema del lenguaje. Finalmente, en la cuarta etapa, se realiza una operación ligera de metadestilación en dos niveles. El proceso de destilación del conocimiento se optimiza mediante el modelo asistente y la estrategia de meta-aprendizaje para lograr una compresión y aceleración eficientes del modelo.
Modelo ETC basado en características de distribución y CST
Resumen de la arquitectura de modelos
El modelo propuesto de clasificación de texto emplea primero un BERT preentrenado para realizar la codificación contextual dinámica del texto de entrada, generando incrustaciones de palabras semánticamente ricas y una representación global. A continuación, se construyen a partir de estas características un grafo de instancia y un grafo de distribución: el grafo de instancias captura similitudes muestrales por pares, mientras que el grafo de distribución modela la distribución general de los datos; El intercambio iterativo de información entre ambos grafos permite la mejora sinérgica de características individuales y la estructura global. Posteriormente, la CST se integra para aumentar profundamente la red de grafos. La reconstrucción de centralidad de nodos utiliza PageRank para cuantificar la influencia léxica, simulando el papel dominante de los elementos centrales en redes lingüísticas. Este es un método ampliamente validado para medir la influencia global de los nodos en topologías de redes complejas y es muy adecuado para captar la dispersión semántica asimétrica de los nodos léxicos centrales en sistemas de lenguaje. Un marco de generación de prototipos "micro–meso–macro" de tres niveles emula el proceso emergente desde la semántica local hasta las representaciones holísticas de categorías. Finalmente, las representaciones mejoradas de características se introducen en un clasificador para producir las probabilidades finales de clase.
Interacción de características con GNN consciente de la distribución
Para optimizar la capacidad de generalización de ETC y capturar eficazmente complejas relaciones semánticas entre textos y Características de Distribución de Muestras (SDFs), este estudio construye un modelo ETC basado en características de distribución y CST. Logra una minería profunda de información global y local en el texto integrando mecanismos como GNN y la incrustación dinámica de texto. GNN es un modelo DL diseñado específicamente para procesar datos estructurados en grafos. El principio fundamental es utilizar un mecanismo de paso de mensajes (donde cada nodo del grafo agrega la información de características de sus nodos vecinos) y combinarlo con su propio estado. A través de múltiples rondas de actualizaciones iterativas, aprende gradualmente una representación de alta dimensión que incluye la estructura topológica. Este proceso permite a los nodos capturar la estructura y las dependencias de características del vecindario local e incluso del grafo global. Para superar las limitaciones de los modelos de secuencia tradicionales en el modelado de dependencias a largo plazo y relaciones globales, este estudio utiliza GNN para capturar asociaciones semánticas complejas y relaciones estructurales entre muestras. Debido al enfoque de GNN en la información directa de correlación entre muestras individuales, ignora las características generales de distribución del conjuntode muestras 14, 15 y 16. Por ello, este estudio propone un modelo GNN que considera SDF. Este modelo introduce BERT para incrustación dinámica de texto y lo combina con una red prototipo para calcular las diferencias de características de las muestras. BERT es un modelo de lenguaje preentrenado basado en la arquitectura Transformer. El principio fundamental es capturar simultáneamente la información semántica de cada palabra en el contexto mediante un codificador bidireccional y preentrenarla en un corpus a gran escala usando dos tareas: "modelo de lenguaje enmascarado" y "predicción de la siguiente frase". En los modelos de lenguaje enmascarados, algunas palabras en la entrada están enmascaradas aleatoriamente, y el modelo necesita predecir la palabra original basándose en el contexto. La siguiente predicción determina si las dos frases son consecutivas. Tras el preentrenamiento, BERT puede adaptarse rápidamente a diversas tareas de procesamiento de lenguaje natural mediante el ajuste fino, mejorando significativamente el rendimiento y proporcionando representaciones de características de alta calidad para la construcción posterior de estructuras de grafos. La estructura específica del modelo ETC construido en este estudio se muestra en la Figura 2.

Figura 2: Diseño arquitectónico del modelo de clasificación de texto inglés integrado en CST considerando características de distribución muestral. La figura muestra el diseño arquitectónico del modelo de clasificación de textos en inglés, integrado con la teoría de sistemas complejos (CST) y teniendo en cuenta las características de distribución de muestras de texto. La arquitectura fusiona incrustación contextual dinámica basada en BERT, redes neuronales de grafos conscientes de la distribución (GNN) y mecanismos de mejora de CST, y realiza una minería profunda de información semántica global y local en textos en inglés mediante modelado colaborativo multimódulo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En este modelo, para un conjunto de datos general, el texto en inglés introducido en el modelo BERT genera una secuencia de tokens a través de un tokenizador. El método de construcción de secuencias se muestra en la ecuación (1).
[CLS], un 1, un2,... an, [SEP] (1)
En la ecuación (1), [CLS] es el marcador de clasificación situado al inicio de la secuencia. BERT generará un estado oculto de posición fija para [CLS] durante el proceso de entrenamiento. Este estado se utiliza directamente para la representación semántica global de todo el texto. Un1, un2,... An representa una palabra o subpalabra en el texto. [SEP] es un delimitador usado para marcar el final de una frase. Tras el procesamiento de la secuencia anterior por parte de Bert, se obtienen las características de cada token, proporcionando información contextual estructurada para el modelo. Para conjuntos de datos especiales que contienen entidades, si se utilizan métodos convencionales de construcción de secuencias, se perderá la información posicional contenida por las entidades. Por lo tanto, este estudio construye la secuencia utilizando el método mostrado en la ecuación (2).
(2)
En la ecuación (2), [E1], [/E1], [E2] y [/E2] son los tokens que determinan las posiciones de inicio y final de dos entidades. De manera similar, tras el procesamiento Bert, las características de salida de estos tokens transportarán información semántica de las entidades correspondientes, aprovechando mejor la información importante sobre la ubicación de la entidad. Posteriormente, este estudio utiliza un modelo GNN que considera SDF para mejorar la distribución y las características de instancia de las muestras. La estructura del modelo se muestra en la Figura 3.

Figura 3: Arquitectura de interacción de características de grafos duales del modelo de red neuronal de grafos conscientes de la distribución. La figura presenta la arquitectura de interacción de características de doble grafo del modelo GNN consciente de la distribución para la clasificación de texto en inglés. La arquitectura construye un grafo de puntos para la codificación de similitud a nivel de instancia y un grafo de distribución para la codificación de similitud a nivel de distribución, y logra la mejora de características mediante interacción iterativa de información entre ambos grafos, completando el ciclo de información internivel de características de instancia y de distribución. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El modelo logra mejorar características mediante un mecanismo de interacción en dos etapas. En primer lugar, analiza características de distribución a partir de asociaciones a nivel de instancia de muestras de datos, y luego optimiza dinámicamente las características de instancia mediante el intercambio de información a nivel de distribución. Al fortalecer iterativamente las características de las instancias y los niveles de distribución, finalmente completa la tarea de clasificación. Específicamente, el modelo utiliza grafos puntuales y grafos de distribución para lograr el intercambio de información. El mapa de puntos utiliza el vector de características de muestra de texto (actualizado por las dos últimas capas de BERT) como nodo, cuantifica la diferencia de características de la muestra para calcular el peso de las aristas a través de una red de codificación dedicada (una capa sigmoide + dos capas convolucionales de normalización por lotes), y utiliza normalización min-max para normalizar al [intervalo 0,1. Se establece un umbral empírico de similitud de 0,2 para el umbral de aristas, donde las aristas con pesos inferiores a este umbral se podan para eliminar correlaciones débiles a nivel de instancia. El grafo de distribución toma las características de distribución de texto fusionado como nodos, con pesos de aristas calculados en base a la similitud coseno de los vectores de características de distribución y normalizados mediante normalización L2 para asegurar la consistencia de la métrica. Se adopta un umbral de aristas de 0,15 y se eliminan las aristas con pesos inferiores a este valor, mientras que los pesos válidos restantes se mapean y estandarizan mediante un perceptrón multicapa para mejorar la discriminabilidad de las asociaciones a nivel de distribución. Este estudio define un grafo
de puntos para la iteración de la capa l, donde el nodo
representa las características de la muestra y el borde
codifica la similitud a nivel de instancia. El mapa
de distribución , nodo
representa las características de la muestra, y el borde
codifica la similitud del nivel de distribución. Tomando como ejemplo la rueda l-ésima a la l+1-ésima rueda, el cálculo de la relación a nivel de instancia calcula la similitud puntual a través de diferencias de características, como se muestra en la ecuación (3).
(3)
En la ecuación (3),
y
son los pesos de aristas entre los nodos i y j durante las iteraciones l-ésima y l-1-ésima del grafo de puntos, reflejando la similitud de las características muestrales.
es una red de codificación utilizada para convertir diferencias de características de nodos en escalas de peso de aristas, que consiste en una capa de sigmoides y dos capas de funciones de activación por lotes de convolución. Cuando
y
son la l-1-ésima iteración, los vectores propios de los nodos i y j son actualizados por Bert en las dos últimas capas. Después, las características de la distribución se calculan en función de las relaciones de instancia, como se muestra en la ecuación (4).
(4)
En la ecuación (4),
es el vector propio del nodo i en el grafo de distribución de la capa l-ésima. MLP1 es un perceptrón multicapa compuesto por funciones de activación y capas totalmente conectadas, que mapea las características compuestas concatenadas en nuevas características de distribución. Después, la relación de distribución se calcula en función de las características de la distribución, y las características de instancia se calculan a partir de la relación de distribución para completar el bucle de información entre niveles.
Mecanismos de mejora de sistemas complejos
Para mejorar aún más la capacidad de generalización, se aplica CST al modelo anterior en este estudio. La evolución dinámica de los sistemas complejos se manifiesta mediante la distribución heterogénea de la influencia de los nodos. Para simular el papel dominante del vocabulario central en la propagación semántica en sistemas lingüísticos, este estudio introduce el índice de centralidad de nodos para reconstruir el mecanismo de propagación de la información. El gráfico de puntos Hp construido para cada tarea de escenario utiliza el algoritmo PageRank para cuantificar la centralidad del nodo C(hi), como se muestra en la ecuación (5)17.
(5)
En la ecuación (5), α es el coeficiente de amortiguamiento, α = 0,85. N(h i) representa el conjunto de nodos vecinos, y L(h j) es el grado del nodo. La ecuación (5) reemplaza el proceso de propagación en cascada de influencia del vocabulario en redes lingüísticas simuladas, permitiendo que el vocabulario central (como verbos y palabras temáticas) adquiera mayor centralidad. Después, la centralidad del nodo se acopla con pesos de aristas para ajustar dinámicamente la fuerza de propagación de la información entre nodos. La función de acoplamiento λij se muestra en la ecuación (6).
(6)
En la ecuación (6), σ es la función de activación sigmoide, WT es el vector de pesos aprendible y b significa el término de sesgo. El acoplamiento de los pesos de centralidad y aristas equilibra dinámicamente las relaciones locales con la importancia global, mejorando así la adaptabilidad del modelo a cambios dinámicos en las tareas. La aparición de CST se manifiesta en el idioma inglés como la semántica general que supera la suma del vocabulariolocal 18. Para utilizar esta característica en ETC, este estudio diseña un marco de generación de prototipos de tres niveles para simular el proceso de emergencia de microcaracterísticas a macrocategorías, como se muestra en la Figura 4.

Figura 4: Construcción escalonada del marco de generación de prototipos micro-meso-macro de tres niveles para la emergencia semántica lingüística. La figura ilustra la construcción paso a paso del marco de generación de prototipos micro-meso-macro de tres niveles para simular la aparición semántica lingüística en la clasificación de textos en inglés. El marco construye representaciones jerárquicas de categorías de texto mediante agrupamiento de micro subclases con K-medias, fusión de prototipos de subclases meso basada en ponderación por similitud de distribuciones e integración macro no lineal mediante mecanismo de atención, simulando la característica emergente de "el todo es mayor que la suma de sus partes" en sistemas de lenguaje. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El proceso anterior construye representaciones de categorías de texto paso a paso, desde micro hasta macro para mejorar la capacidad de generalización del modelo. A nivel micro, K subclases se generan agrupando las representaciones de incrustación de muestra de cada categoría de texto. Se utiliza K-media para dividir las muestras dentro de la categoría en subgrupos, y la posición del centroide de cada subgrupo se calcula como el prototipo desubclase 19. A nivel mesoscópico, se calcula la similitud de distribución de cada prototipo de subclase, se genera una matriz de similitud y luego se reensamblan los prototipos de subclase basándose en pesos de similitud para cuantificar la correlación entre subclases. El cálculo del peso de similitud de subclase wij se muestra en la ecuación (7).
(7)
En la ecuación (7),
está la divergencia de Jensen-Shannon, utilizada para medir la diferencia de distribución entre dos subclases
y
20. Finalmente, los prototipos de subclase se ponderan y fusionan para obtener un conjunto de representaciones
de distribución de clases . A nivel macro, los pesos de importancia de cada subclase se aprenden mediante mecanismos de atención, y se introducen transformaciones no lineales para simular el proceso de emergencia, resultando en el prototipo final de clase c como se muestra en la ecuación (8).
(8)
En la ecuación (8), αk significa el peso de atención de la clase k. U denota la matriz de pesos de transformación no lineal. Tanh(·) se utiliza para mejorar la representación no lineal y simular la suma global de partes característica de sistemas complejos. Cada nivel captura la diversidad dentro de las categorías a través de una estructura de subclases, la similitud de distribución de pesos para reducir la influencia de subclases ruidosas y se centra dinámicamente en características discriminativas mediante mecanismos de atención para mejorar la capacidad de generalización del modelo. La CST se integra principalmente con GNN a través de dos mecanismos. La primera es introducir la centralidad de nodos para reconstruir el proceso de difusión de información y simular la distribución heterogénea de la influencia léxica en el sistema lingüístico. La centralidad del nodo se cuantifica mediante el algoritmo PageRank y se acopla dinámicamente con los pesos de las aristas, permitiendo que el vocabulario central domine la propagación semántica y mejorando la adaptabilidad del modelo a los cambios dinámicos de las tareas. La segunda es diseñar un marco de generación de prototipos en tres niveles, desde el agrupamiento de micro-subclases hasta la fusión de prototipos de macro-categorías, para simular la característica emergente en el sistema de lenguaje de que "el todo es mayor que la suma de sus partes". Este marco logra una integración jerárquica desde las características locales hasta la semántica global mediante la ponderación de similitud de distribución y mecanismos de atención.
En resumen, la innovación central del modelo ETC construido radica en integrar profundamente las ideas de CST en el marco de GNN. Al reconstruir el mecanismo de difusión de información mediante la centralidad de los nodos, el modelo simula el papel principal de los elementos centrales en el sistema lingüístico y mejora su adaptabilidad a la dinámica de la tarea. A través del marco de generación de prototipos de tres niveles, el modelo realiza el proceso de aparición de características locales a semántica global, mejorando así la capacidad del modelo para captar la diversidad y las características discriminatorias dentro de la categoría. Este método evita la limitación de las GNN tradicionales que solo dependen de relaciones a nivel de instancia. A través de la interacción a nivel de distribución y características complejas del sistema, proporciona una nueva solución para mejorar la capacidad de generalización del modelo en escenarios de pocos disparos y entre dominios.
Las propiedades emergentes de la CST corresponden a un marco de generación de prototipos de tres niveles. En los sistemas lingüísticos, el principio de que "el todo es mayor que la suma de sus partes" se manifiesta como un salto semántico de los significados locales de las palabras a las categorías generales de texto. Este estudio simula este proceso mediante un mecanismo de generación de prototipos "micro-meso-macro" de tres niveles: a nivel micro, las incrustaciones de muestras se agrupan para formar prototipos de subclase; A nivel meso, estos prototipos se ponderan y fusionan en función de la similitud distribucional; y a nivel macro, los prototipos de categorías finales se sintetizan de forma no lineal mediante un mecanismo de atención. Por ejemplo, en la clasificación de sentimiento, múltiples palabras negativas como "decepcionante", "lento" y "caro" se mezclan y transforman de forma no lineal para emerger como un fuerte sentimiento global de "evaluación negativa". La centralidad y heterogeneidad de nodos en CST se alinean con un mecanismo de propagación de información basado en la reconstrucción de centralidad de nodos. Dentro de las redes lingüísticas, la influencia de las palabras está distribuida de forma desigual, con palabras clave (por ejemplo, verbos, términos temáticos) desempeñando papeles dominantes en la propagación semántica. Este estudio cuantifica la centralidad de nodos utilizando el algoritmo PageRank y la acopla dinámicamente con pesos de aristas para ajustar la intensidad de la dispersión de información entre nodos. Por ejemplo, en la categorización de noticias, el término "elección" tiene una gran centralidad en textos políticos, lo que lleva a nodos adyacentes como "votar" y "campaña" a obtener mayor peso durante la agregación de información, mejorando así la representación semántica de ese tema. La naturaleza dinámica y adaptativa de la CST corresponde a GNNs conscientes de la distribución y a un mecanismo de experimento didáctico dentro de la metadestilación. Los sistemas lingüísticos evolucionan dinámicamente según el contexto y los requisitos de la tarea. Los modelos capturan los cambios generales de distribución en los conjuntos de datos mediante GNNs conscientes de la distribución. Simultáneamente, se introduce en TSMDM un mecanismo experimental instruccional impulsado por el meta-aprendizaje, que permite a las MT ajustar dinámicamente parámetros basándose en la retroalimentación de los SMs. Por ejemplo, en el análisis de sentimiento entre dominios, el modelo puede adaptar rápidamente los pesos de características basados en la distribución de datos del dominio objetivo y refinar los parámetros de la MT durante la metadestilación para mejorar la eficiencia de adaptación a nuevos dominios.
Modelo de LTC basado en TSMDM
Tubería de Metadestilación en dos etapas
Para abordar los desafíos del alto coste computacional y las dificultades de despliegue en entornos con recursos limitados, se propone un modelo ligero de clasificación de texto basado en un TSMDM. Este método de metadestilación ejecuta el proceso de destilación en un orden secuencial estricto con dos etapas distintas. La segunda etapa se inicia solo tras la finalización y convergencia de la formación de la primera etapa: 1) la etapa de compresión de conocimiento de profesor a asistente de enseñanza (TA) y 2) la etapa de destilación ligera de asistente a estudiante integrada con la adaptación de parámetros de meta-aprendizaje. Este enfoque logra una transferencia eficiente de conocimiento de una MT compleja a una SM ligera mediante destilación en dos etapas, incorporando un mecanismo de meta-aprendizaje para optimizar dinámicamente la estrategia de transferencia de conocimiento durante elproceso 21,22. El conjunto de la tubería se ilustra en la Figura 5.

Figura 5: Diseño de tubería del modelo ligero de clasificación de texto con mecanismo de metadestilación en dos etapas. La figura diseña la cadena del modelo de clasificación de texto ligero con el mecanismo de metadestilación de dos etapas (TSMDM). La cadena comprende un modelo de profesor (fuente de conocimiento de alta complejidad), un modelo de asistente de enseñanza (capa intermedia de complejo buffer) y un modelo de estudiante (modelo blanco ligero), e implementa una transferencia eficiente de conocimiento a través de dos etapas secuenciales: compresión de conocimiento de profesor a asistente de enseñanza y destilación ligera de asistente de enseñanza a estudiante integrada con meta-aprendizaje. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El método implica tres funciones: un modelo de MT, un modelo TA y un SM, dividiendo el proceso de destilación en dos etapas: destilación profesor-TA y destilación TA-alumno. En la primera etapa de compresión de conocimiento de Teacher a TA, el conocimiento de la MT se comprime primero en un modelo TA de complejidad intermedia para mitigar la pérdida de información causada por excesivas brechas de capacidad en la destilación directa. La TM, que sirve como fuente de conocimiento, transfiere tanto sus probabilidades de clasificación de salida como sus características de capa intermedia al modelo TA. El modelo TA se entrena alineando sus salidas y representaciones de características con las del profesor, utilizando una función de pérdida combinada que integra la pérdida de clasificación y la pérdida de alineaciónde características 21. En la segunda etapa de destilación ligera de TA a Estudiante, que se inicia tras la convergencia del modelo TA, el conocimiento se destila aún más desde el modelo TA hasta el SM ligero final. Esta etapa también emplea supervisión dual (logits de clasificación y características intermedias) e incorpora un mecanismo de meta-aprendizaje: la MT realiza "experimentos de enseñanza" en tareas auxiliares para evaluar el estado de aprendizaje del estudiante y ajusta dinámicamente sus propios parámetros para ofrecer una orientación más adaptativa y dirigida. El SM completa el entrenamiento minimizando tanto la discrepancia de salida como la distancia de las características respecto al modelo TA, logrando así una reducción significativa de parámetros mientras preserva el rendimiento de clasificación en la mayor medida posible22.
Meta-aprendizaje con experimentos de enseñanza
En los métodos tradicionales de destilación de conocimiento, el TM entrenado guía al SM participando en el cálculo de pérdidas. Sin embargo, las MT de parámetros fijos son difíciles de evaluar el estado real de aprendizaje de las SMs, ni pueden cuantificar la contribución específica de su guía a la actualización de los parámetrosSM 23,24. Por ello, este estudio introduce ideas de metaaprendizaje en el proceso de destilación, permitiendo a la MT ajustar sus propios parámetros basándose en la retroalimentación de aprendizaje de la SM. El proceso de destilación se muestra en la Figura 6.

Figura 6: Proceso iterativo de optimización de parámetros de metadestilación combinado con mecanismos de experimento de enseñanza. La figura muestra el proceso iterativo de optimización de parámetros de la metadestilación combinado con el mecanismo de experimento didáctico para la ponderación del modelo de clasificación de texto en inglés. El proceso genera un aprendiz interno temporal a partir del modelo del estudiante, cuantifica la pérdida del efecto de la enseñanza a través del rendimiento simulado de entrenamiento del aprendiz interno y permite al modelo del profesor ajustar sus propios parámetros mediante la retropropagación de la pérdida, optimizando así la estrategia posterior de transferencia de conocimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La MT optimiza los parámetros mediante tareas convencionales de clasificación durante su propia fase de entrenamiento, lo que resulta en una pérdida básica de clasificación LT que refleja su rendimiento original. Tras completar la formación, el SM S se replica para generar una copia temporal del aprendiz interno S1. La MT realiza experimentos de enseñanza en S1, y el error de rendimiento integral que exhibe S1 en este entrenamiento simulado se cuantifica como pérdida LQ. Esta señal se utiliza como retroalimentación para la MT para evaluar la efectividad de la enseñanza. Mediante la retropropagación de LQ, la MT ajusta activamente sus propios parámetros y optimiza su método de transmisión de conocimiento. Tras completar la optimización del metaaprendizaje, la MT realiza la destilación formal del conocimiento en el SM S original, y también utiliza la pérdida del modelo LS como retroalimentación para enseñar la evaluación de la efectividad a la MT. Para lograr un aligeramiento del modelo ETC, este estudio considerará incorporar el modelo SDF GNN como una MT en el proceso de experimento docente, como se muestra en la Figura 7.

Figura 7: Flujo de actualización de parámetros del mecanismo de experimento docente para la optimización del modelo docente en metadestilación. La figura muestra el flujo de actualización de parámetros del mecanismo de experimento docente para la optimización del modelo docente en el proceso de metadestilación. El flujo calcula primero la pérdida suave entre la predicción del aprendiz interno y la predicción del modelo del profesor con la función de pérdida por error cuadrático medio, combina la pérdida suave con el error de etiqueta dura para formar la pérdida total de entrenamiento, y actualiza los parámetros del modelo del profesor mediante la retropropagación del error total ponderado para mejorar su efectividad docente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Tras completar el entrenamiento en destilación de conocimientos, el SM primero calcula la diferencia entre los resultados predichos de la MT y las etiquetas verdaderas. Posteriormente, la función de pérdida MSE se utiliza para medir la distancia entre la predicción SM (inner learner S1) y la predicción TM. Este valor de distancia se utiliza como la pérdida suave25. El objetivo final de entrenamiento consiste en una combinación ponderada de error duro en la etiqueta y pérdida suave. Al retropropagar el error total ponderado, se actualizan los parámetros de la MT, mejorando así la efectividad de la enseñanza de la MT. El cálculo del parámetro del aprendiz interno S1 se muestra en la ecuación (9).
(9)
En la ecuación (9),
y
son los parámetros internos del aprendiz y sus parámetros iniciales están influenciados por el parámetro TM γT. λ (la tasa de aprendizaje, λ = 0,005) controla el tamaño del paso de actualización de parámetros para los aprendices internos (es decir, copias de los SMs) durante la metadestilación26. La ecuación (9) calcula gradientes de pérdida mediante retropropagación, mientras que λ actualiza los parámetros de los aprendices internos. Este mecanismo refleja las características de aprendizaje de los SM, permitiendo que los TMs reciban retroalimentación y ajusten sus estrategias de enseñanza, mejorando así la eficacia posterior de la destilación de conocimiento. El cálculo de la pérdida LS en metaaprendizaje se muestra en la ecuación (10).
(10)
En la ecuación (10), B es la secuencia de meta-aprendizaje de la muestra.
Optimización de la transferencia de conocimiento con diseño de pérdidas y modelo asistente
Para mejorar aún más la eficacia de la destilación del conocimiento, este estudio obtiene la pérdida global calculando la pérdida de clasificación y la pérdida de características. Entre ellas, la pérdida de características adopta un mecanismo retrospectivo, utilizando las salidas superficiales y actuales de las características de la MT para guiar la SM, expresada en la ecuación (11).
(11)
En la ecuación (11), I es el conjunto de índices de la capa de características. D es una función de distancia que se utiliza para calcular la diferencia entre dos representaciones de características. y son funciones de representación objetiva en la TM y la SM, que convierten las salidas
de características y
de las capas i y j-ésima en matrices de atención.
La pérdida de clasificación combina la pérdida de entropía cruzada entre la salida SM y la etiqueta real, así como la MSE entre la salida de los dos modelos, como la pérdida suave27,28. En última instancia, la pérdida global se obtiene ponderando ambos, ayudando al SM a recibir mejor orientación de la TM. Para minimizar la pérdida de rendimiento durante el proceso de destilación del conocimiento, este estudio sitúa el modelo del asistente de enseñanza entre dos modelos, como se muestra en la Figura 8.

Figura 8: Flujo de procesamiento de destilación de conocimiento en dos etapas con modelo de asistente docente como capa intermedia de tampón. La figura demuestra el flujo de procesamiento de destilación de conocimiento en dos etapas con el modelo de asistente docente como capa intermedia de tampón. Los fusibles de la primera etapa presentan pérdida y pérdida de clasificación para construir la pérdida total por destilación, y entrenan al modelo de asistente de enseñanza con el conocimiento del modelo del profesor; La segunda etapa adopta la misma estrategia de fusión de pérdidas para destilar el conocimiento del modelo de asistente de enseñanza al modelo del alumno, reduciendo la pérdida de información causada por excesivas brechas de complejidad entre los modelos del profesor y del alumno. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Tras completar la etapa de metadestilación, el modelo TA y la MT se someten a destilación de conocimiento convencional. Durante este proceso, las características de ambos se extraen síncronamente y se calcula la pérdida correspondiente La . Posteriormente, esta pérdida de características se fusiona con la pérdida de clasificación LM1 del modelo para formar la función
de pérdida por destilación en la primera etapa, como se muestra en la ecuación (12).
(12)
En la ecuación (12), β es el coeficiente de peso utilizado para controlar la proporción de pérdida de características y de clasificación en la pérdida total. y son funciones de representación objetiva en el modelo del asistente de enseñanza y en la MT, que convierten las salidas
de características y
de las capas i y j-ésima en matrices de atención.
zT y zM son las salidas del modelo TM y del asistente. El proceso de destilación desde el modelo de asistente de enseñanza hasta el SM es el mismo que el proceso anterior, lo que minimiza la pérdida del SM a través de múltiples iteraciones para completar la transferencia de conocimiento.
En conclusión, la contribución central del TSMDM propuesto radica en optimizar el proceso de transferencia de conocimiento a través del mecanismo de meta-aprendizaje. En comparación con la destilación tradicional, la principal ventaja de este método radica en su capacidad de enseñanza dinámica: la MT puede ajustar sus propios parámetros a través del mecanismo del experimento didáctico basándose en la retroalimentación en tiempo real del SM, proporcionando así una orientación más específica. Mientras tanto, el modelo del asistente de enseñanza se introduce como una capa de tampón, lo que sirve de puente sobre la brecha de complejidad entre los MTs y los SMs y reduce la pérdida de información en la transferencia de conocimiento. El diseño colaborativo de esta "estrategia de enseñanza de optimización de meta-aprendizaje" y "almacenamiento en búfer de dos niveles para reducir la dificultad de transferencia" permite al SM final lograr un aligeramiento significativo mientras conserva al máximo el conocimiento básico extraído de la TM compleja.
Disponibilidad de datos
Los conjuntos de datos generados durante y/o analizados durante el estudio actual se proporcionan en el Archivo Suplementario 1.