Artículo de investigación

Clasificación ligera de textos en inglés con aprendizaje profundo basado en la teoría de sistemas complejos

DOI:

10.3791/69344

9 de junio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio propone una red neuronal ligera de grafos con metadestilación y metaaprendizaje para mejorar la clasificación de textos en inglés. Mejora la generalización en entornos de pocos datos y entre dominios, al tiempo que reduce el coste computacional y mantiene un alto rendimiento.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La globalización y el desarrollo de la tecnología de la información han impulsado un auge de los datos de texto en inglés, y existe una necesidad urgente de una clasificación eficiente. Para mejorar la capacidad de generalización de la clasificación de textos en inglés en escenarios de muestra pequeña y entre dominios, y para lograr modelos ligeros, este estudio combina teoría de sistemas complejos con aprendizaje profundo para construir un modelo de redes neuronales de grafos que tenga en cuenta completamente las características distribucionales de muestras de texto. Un método de metadestilación de dos niveles, combinado con estrategias de meta-aprendizaje, ajusta dinámicamente los parámetros del modelo del profesor y optimiza todo el proceso de transferencia de conocimiento. Los resultados experimentales muestran que el rendimiento de clasificación del modelo propuesto en tareas de clasificación de texto de pocos disparos y entre dominios es significativamente superior al de las redes neuronales de grafos tradicionales y otros modelos comparativos convencionales. En cuanto a la ponderación ligera, la SM generada por el mecanismo de metadestilación en dos etapas mantiene un nivel extremadamente alto de retención de rendimiento en conjuntos de datos de clasificación textual multitema, mientras reduce significativamente el tiempo computacional. Además, este método puede mantener alta eficiencia y un rendimiento de clasificación estable en escenarios de procesamiento de texto largo y ofrece claras ventajas en eficiencia computacional en comparación con los métodos tradicionales de destilación y otros métodos reportados en la literatura. El método propuesto mejora eficazmente el rendimiento de clasificación del texto en inglés en escenarios de aplicación con pocos ejemplos y entre dominios, al tiempo que reduce significativamente el coste computacional, proporcionando así una solución técnica factible y eficiente para la clasificación de textos en inglés en entornos con recursos limitados.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La aceleración de la globalización y los avances en tecnología de la información han provocado un crecimiento explosivo de los datos de texto en inglés en campos como las redes sociales, la investigación académica y la comunicación empresarial. Clasificar eficazmente estos textos para la recuperación de información, análisis de sentimientos, gestión de contenidos y otras funciones se ha convertido en una tarea importante en el procesamiento del lenguajenatural. El objetivo de la Clasificación de Textos en Inglés (ETC) es clasificar los textos en categorías predefinidas según su contenido semántico. Sin embargo, la complejidad del lenguaje natural, incluyendo su ambigüedad, dependencia del contexto y diversidad de expresión, plantea muchos desafíos para las tareas de clasificaciónde texto 2. Actualmente, el crecimiento de la tecnología de Aprendizaje Profundo (DL) ha creado nuevas oportunidades para la clasificación de textos. Los modelos de lenguaje preentrenados representados por Bidirectional Encoder Representations from Transformers (BERT) y sus variantes pueden obtener información semántica contextual enriquecida mediante el preentrenamiento en corpus a gran escala, mejorando significativamente el rendimiento de la clasificaciónde texto 3. Sin embargo, los métodos actuales de ETC aún enfrentan dos limitaciones clave: primero, a menudo enfatizan la optimización de un único modelo o característica, descuidando las propiedades intrínsecas del lenguaje como sistema complejo, como su dinámica y comportamiento emergente, lo que conduce a una generalización insuficiente en escenarios de pocos datos o entre dominios; Segundo, a pesar del fuerte rendimiento de los modelos preentrenados, su alto coste computacional y el elevado número de parámetros dificultan gravemente el despliegue práctico en entornos con recursoslimitados 4,5. Para abordar estas cuestiones, este estudio propone un marco ligero de clasificación de textos que integra la Teoría de Sistemas Complejos (CST) y el Mecanismo de Metadestilación en Dos Etapas (TSMDM).

En el contexto de este estudio, CST se refiere al marco teórico que considera el lenguaje natural como un sistema complejo típico con evolución dinámica, emergencia semántica y distribución heterogénea de la influencia de nodos léxicos. Se aplica para simular el papel dominante del vocabulario central en la propagación semántica y la ley emergente de la semántica general a partir de características léxicas locales, mejorando así la profunda comprensión del modelo sobre la semántica textual y su adaptabilidad a escenarios de datos de pocos disparos y entre dominios. Sus contribuciones principales son las siguientes: teóricamente, hasta donde sabemos, la CST se introduce sistemáticamente en tareas de clasificación de texto, simulando la evolución dinámica y la aparición semántica de los sistemas lingüísticos para mejorar la profunda comprensión y adaptabilidad del modelo a datos de pocos disparos y entre dominios. Metodológicamente, se diseña una Red Neuronal de Grafos (GNN) que contiene características de distribución de muestras. El innovador TSMDM combinado es esencialmente diferente de la destilación de conocimiento estándar. La destilación estándar de conocimiento realiza una transferencia unidireccional de conocimiento de un Modelo de Profesor (TM) de parámetros fijos a un Modelo de Estudiante (SM) ligero. La metadestilación en este estudio integra estrategias de metaaprendizaje basadas en la destilación y puede ajustar dinámicamente los parámetros de la MT en función de la retroalimentación de aprendizaje de la SM. El diseño en dos etapas establece además un modelo de asistente de enseñanza como capa intermedia de búfer para mitigar la pérdida de información causada por excesivas brechas de complejidad entre el TM y el SM, logrando un aligeramiento significativo del modelo manteniendo una alta precisión, proporcionando así una solución eficiente de clasificación para escenarios con recursos limitados.

En el campo de la ETC, los investigadores han realizado una exploración exhaustiva y han propuesto diversas soluciones que integran diferentes características y arquitecturas de modelos para abordar desafíos técnicos en distintos escenarios. R. Zhang et al. diseñaron un Modelo Multilingüe Preentrenado de Fusión Multi-Característica (MP-MFFM) para abordar el problema de la captura insuficiente de información estructural contextual a largo alcance en ETC utilizando los métodos DL actuales. Este método combinaba BERT, BiLSTM multilingüe y CNN de texto para extraer información semántica profunda, global y estructural local y fusionarla. Este método mejoró la precisión, sensibilidad y precisión en tres conjuntos de datos, verificando suefectividad 6. C. Madhu et al. adoptaron un Marco de Aprendizaje de Grafos Difusos Basados en Características Dialectales (DF-FGLF) para abordar las necesidades de clasificación de texto de datos no estructurados y con poca anotación en redes sociales, así como el impacto de las diferencias dialectales en la clasificación internacional del inglés. Combinaron características semánticas y dialectales de aprendizaje de diferencias para construir un grafo difuso optimizado. Cuando solo había 10 muestras anotadas, el valor F1 para el reconocimiento dialectal y la clasificación de textos superaba el 93% y el 80%, lo que era superior a métodos similares y adecuado para la clasificaciónpráctica 7. B. Shannaq et al. realizaron experimentos utilizando conjuntos de datos en inglés y árabe para investigar el impacto de la longitud de n-gramos en la clasificación de textos en diferentes sistemas de escritura y el efecto de las características lingüísticas en la longitud óptima de n-gramos. El rendimiento del inglés de 2 gramos fue el mejor (precisión 0,482, recuerdo 0,489, valor F1 = 0,472), mientras que el árabe de 6 gramos fue el mejor (valor F1 alrededor de 0,85). La morfología y las características sintácticas del lenguaje afectaron significativamente el rendimiento de los modelosn-gramas 8. N. S. Lagutina et al. utilizaron un vector de texto construido a partir de caracteres, vocabulario y características bibliométricas de la estructura de las oraciones para lograr la clasificación automática de textos cortos en inglés para evaluar el aprendizaje de los estudiantes, combinado con clasificadores estándar de aprendizaje automático como SVM. El valor F1 de SVM en el corpus del Marco Europeo Común de Referencia para Lenguas fue del 67%, y el valor F1 del modelo best-BERT (con mayúsculas en base de bert) fue del 69%. Los errores estaban mayormente en niveles adyacentes, y la calidad de clasificación dependía del corpus9.

La destilación de conocimiento, como medio eficaz para lograr el aligeramiento del modelo, mejorar el rendimiento del modelo en escenarios de muestras pequeñas y reducir los costes computacionales, también ha logrado avances significativos en investigaciones relacionadas. Investigaciones previas han explorado la aplicación de la destilación de conocimiento para abordar desafíos clave en el procesamiento del lenguaje natural, incluyendo: mejorar el rendimiento de modelos de pequeños parámetros bajo condiciones de baja etiqueta, optimizar tareas de clasificación de texto multilingüe, comprimir modelos preentrenados a gran escala mediante estrategias de compresión híbrida y destilar representaciones efectivas de frases para reducir la brecha de rendimiento entre modelos de lenguaje grandes y pequeños, adaptándose al hardware restricciones10, 11, 12, 13. A pesar de estos avances, los enfoques existentes de destilación de conocimiento siguen teniendo limitaciones críticas para el ETC: carecen de mecanismos dinámicos de optimización para el proceso de transferencia de conocimiento, a menudo sufren una pérdida severa de información al destilar entre MTs altamente complejos y SMs ligeros, y no logran integrarse eficazmente con las características de distribución inherentes de los datos textuales. Estos inconvenientes resultan en un rendimiento de generalización subóptimo en escenarios de pocos disparos y de dominio cruzado. Los modelos ligeros obtenidos mediante estos métodos a menudo tienen dificultades para equilibrar la efectividad de la clasificación y la eficiencia computacional en entornos con recursos limitados. Esta es la principal carencia que la investigación de este artículo pretende abordar.

Este estudio pone a prueba la siguiente hipótesis de investigación: Primero, integrar la CST en el ETC puede simular eficazmente la evolución dinámica y las características de emergencia semántica de los sistemas de lenguaje natural. Esta integración teórica puede mejorar significativamente la capacidad de generalización del modelo en escenarios de pocos disparos y entre dominios, en comparación con los modelos tradicionales de clasificación de texto que ignoran las complejas propiedades del lenguaje del sistema. En segundo lugar, un modelo GNN diseñado con una consideración explícita de las características de distribución de muestras de texto puede compensar la limitación de los GNN tradicionales que solo se centran en el modelado relacional a nivel de instancia, y lograr una minería más profunda de información semántica global y local en textos en inglés. En tercer lugar, el TSMDM combinado con estrategias de metaaprendizaje y un modelo de asistente de enseñanza puede lograr una transferencia eficiente y de baja pérdida de conocimientos de MTs complejos a SMs ligeros. Esto puede reducir significativamente el coste computacional y la escala de parámetros del modelo, manteniendo un alto rendimiento de clasificación. Además, el modelo ligero derivado de este mecanismo puede mantener un rendimiento de clasificación estable y eficiente en escenarios de procesamiento de texto largo con estructuras semánticas complejas.

En resumen, la investigación relevante ha mejorado el rendimiento en la clasificación de textos mediante fusión multi-características, aprendizaje de características dialectales, optimización de n-gramas y características métricas estilísticas, y también ha logrado la ligera ponderación de modelos mediante la destilación de conocimiento. Sin embargo, los métodos existentes aún presentan deficiencias en la captura de información a larga distancia, la generalización de muestras pequeñas y la adaptación de modelos complejos y simples. Para reducir el coste computacional del modelo ETC asegurando su precisión, este estudio construye un modelo ligero combinando CST y TSMDM para mejorar la capacidad de generalización y la eficiencia computacional del modelo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para mejorar la capacidad de generalización de ETC en escenarios de muestras pequeñas y dominios cruzados y lograr un modelo ligero, este estudio propone un marco de clasificación de texto que integra CST y TSMDM. El proceso general de este marco se muestra en la Figura 1.

figure-protocol-1
Figura 1: Visualización del marco ligero de clasificación de texto en inglés de cuatro etapas que integra CST y TSMDM. El flujo de trabajo consta de cuatro etapas. La etapa 1 realiza la representación de texto utilizando incrustaciones dinámicas basadas en BERT a partir del texto en inglés de entrada. La etapa 2 aplica el modelado de redes neuronales de grafos construyendo un grafo de texto y calculando relaciones a nivel de instancia y distribución. La etapa 3 modela la emergencia semántica mediante la reconstrucción de centralidades de nodos y un marco de generación de prototipos multinivel para obtener el prototipo final de categoría. La etapa 4 realiza una destilación elemental en dos etapas, donde se entrena un modelo de profesor y se transfiere el conocimiento mediante metadestilación para producir el modelo final del alumno. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En primer lugar, en la etapa de representación textual e incrustación dinámica, se utiliza el modelo BERT para incrustar dinámicamente el texto de entrada y capturar la información semántica contextual. La segunda etapa es el modelado GNN consciente de la distribución, que considera las características de distribución de las muestras, construye un modelo GNN y mejora la representación de características mediante la interacción dual de información a nivel de instancia y distribución. La tercera etapa es el modelado de emergencia semántica guiado por la teoría de sistemas híbridos, introduciendo la reconstrucción de centralidades de nodos y un mecanismo de generación de prototipos en tres niveles para simular la dinámica y el surgimiento del sistema del lenguaje. Finalmente, en la cuarta etapa, se realiza una operación ligera de metadestilación en dos niveles. El proceso de destilación del conocimiento se optimiza mediante el modelo asistente y la estrategia de meta-aprendizaje para lograr una compresión y aceleración eficientes del modelo.

Modelo ETC basado en características de distribución y CST
Resumen de la arquitectura de modelos
El modelo propuesto de clasificación de texto emplea primero un BERT preentrenado para realizar la codificación contextual dinámica del texto de entrada, generando incrustaciones de palabras semánticamente ricas y una representación global. A continuación, se construyen a partir de estas características un grafo de instancia y un grafo de distribución: el grafo de instancias captura similitudes muestrales por pares, mientras que el grafo de distribución modela la distribución general de los datos; El intercambio iterativo de información entre ambos grafos permite la mejora sinérgica de características individuales y la estructura global. Posteriormente, la CST se integra para aumentar profundamente la red de grafos. La reconstrucción de centralidad de nodos utiliza PageRank para cuantificar la influencia léxica, simulando el papel dominante de los elementos centrales en redes lingüísticas. Este es un método ampliamente validado para medir la influencia global de los nodos en topologías de redes complejas y es muy adecuado para captar la dispersión semántica asimétrica de los nodos léxicos centrales en sistemas de lenguaje. Un marco de generación de prototipos "micro–meso–macro" de tres niveles emula el proceso emergente desde la semántica local hasta las representaciones holísticas de categorías. Finalmente, las representaciones mejoradas de características se introducen en un clasificador para producir las probabilidades finales de clase.

Interacción de características con GNN consciente de la distribución
Para optimizar la capacidad de generalización de ETC y capturar eficazmente complejas relaciones semánticas entre textos y Características de Distribución de Muestras (SDFs), este estudio construye un modelo ETC basado en características de distribución y CST. Logra una minería profunda de información global y local en el texto integrando mecanismos como GNN y la incrustación dinámica de texto. GNN es un modelo DL diseñado específicamente para procesar datos estructurados en grafos. El principio fundamental es utilizar un mecanismo de paso de mensajes (donde cada nodo del grafo agrega la información de características de sus nodos vecinos) y combinarlo con su propio estado. A través de múltiples rondas de actualizaciones iterativas, aprende gradualmente una representación de alta dimensión que incluye la estructura topológica. Este proceso permite a los nodos capturar la estructura y las dependencias de características del vecindario local e incluso del grafo global. Para superar las limitaciones de los modelos de secuencia tradicionales en el modelado de dependencias a largo plazo y relaciones globales, este estudio utiliza GNN para capturar asociaciones semánticas complejas y relaciones estructurales entre muestras. Debido al enfoque de GNN en la información directa de correlación entre muestras individuales, ignora las características generales de distribución del conjuntode muestras 14, 15 y 16. Por ello, este estudio propone un modelo GNN que considera SDF. Este modelo introduce BERT para incrustación dinámica de texto y lo combina con una red prototipo para calcular las diferencias de características de las muestras. BERT es un modelo de lenguaje preentrenado basado en la arquitectura Transformer. El principio fundamental es capturar simultáneamente la información semántica de cada palabra en el contexto mediante un codificador bidireccional y preentrenarla en un corpus a gran escala usando dos tareas: "modelo de lenguaje enmascarado" y "predicción de la siguiente frase". En los modelos de lenguaje enmascarados, algunas palabras en la entrada están enmascaradas aleatoriamente, y el modelo necesita predecir la palabra original basándose en el contexto. La siguiente predicción determina si las dos frases son consecutivas. Tras el preentrenamiento, BERT puede adaptarse rápidamente a diversas tareas de procesamiento de lenguaje natural mediante el ajuste fino, mejorando significativamente el rendimiento y proporcionando representaciones de características de alta calidad para la construcción posterior de estructuras de grafos. La estructura específica del modelo ETC construido en este estudio se muestra en la Figura 2.

figure-protocol-2
Figura 2: Diseño arquitectónico del modelo de clasificación de texto inglés integrado en CST considerando características de distribución muestral. La figura muestra el diseño arquitectónico del modelo de clasificación de textos en inglés, integrado con la teoría de sistemas complejos (CST) y teniendo en cuenta las características de distribución de muestras de texto. La arquitectura fusiona incrustación contextual dinámica basada en BERT, redes neuronales de grafos conscientes de la distribución (GNN) y mecanismos de mejora de CST, y realiza una minería profunda de información semántica global y local en textos en inglés mediante modelado colaborativo multimódulo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En este modelo, para un conjunto de datos general, el texto en inglés introducido en el modelo BERT genera una secuencia de tokens a través de un tokenizador. El método de construcción de secuencias se muestra en la ecuación (1).

[CLS], un 1, un2,... an, [SEP] (1)

En la ecuación (1), [CLS] es el marcador de clasificación situado al inicio de la secuencia. BERT generará un estado oculto de posición fija para [CLS] durante el proceso de entrenamiento. Este estado se utiliza directamente para la representación semántica global de todo el texto. Un1, un2,... An representa una palabra o subpalabra en el texto. [SEP] es un delimitador usado para marcar el final de una frase. Tras el procesamiento de la secuencia anterior por parte de Bert, se obtienen las características de cada token, proporcionando información contextual estructurada para el modelo. Para conjuntos de datos especiales que contienen entidades, si se utilizan métodos convencionales de construcción de secuencias, se perderá la información posicional contenida por las entidades. Por lo tanto, este estudio construye la secuencia utilizando el método mostrado en la ecuación (2).

figure-protocol-3(2)

En la ecuación (2), [E1], [/E1], [E2] y [/E2] son los tokens que determinan las posiciones de inicio y final de dos entidades. De manera similar, tras el procesamiento Bert, las características de salida de estos tokens transportarán información semántica de las entidades correspondientes, aprovechando mejor la información importante sobre la ubicación de la entidad. Posteriormente, este estudio utiliza un modelo GNN que considera SDF para mejorar la distribución y las características de instancia de las muestras. La estructura del modelo se muestra en la Figura 3.

figure-protocol-4
Figura 3: Arquitectura de interacción de características de grafos duales del modelo de red neuronal de grafos conscientes de la distribución. La figura presenta la arquitectura de interacción de características de doble grafo del modelo GNN consciente de la distribución para la clasificación de texto en inglés. La arquitectura construye un grafo de puntos para la codificación de similitud a nivel de instancia y un grafo de distribución para la codificación de similitud a nivel de distribución, y logra la mejora de características mediante interacción iterativa de información entre ambos grafos, completando el ciclo de información internivel de características de instancia y de distribución. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El modelo logra mejorar características mediante un mecanismo de interacción en dos etapas. En primer lugar, analiza características de distribución a partir de asociaciones a nivel de instancia de muestras de datos, y luego optimiza dinámicamente las características de instancia mediante el intercambio de información a nivel de distribución. Al fortalecer iterativamente las características de las instancias y los niveles de distribución, finalmente completa la tarea de clasificación. Específicamente, el modelo utiliza grafos puntuales y grafos de distribución para lograr el intercambio de información. El mapa de puntos utiliza el vector de características de muestra de texto (actualizado por las dos últimas capas de BERT) como nodo, cuantifica la diferencia de características de la muestra para calcular el peso de las aristas a través de una red de codificación dedicada (una capa sigmoide + dos capas convolucionales de normalización por lotes), y utiliza normalización min-max para normalizar al [intervalo 0,1. Se establece un umbral empírico de similitud de 0,2 para el umbral de aristas, donde las aristas con pesos inferiores a este umbral se podan para eliminar correlaciones débiles a nivel de instancia. El grafo de distribución toma las características de distribución de texto fusionado como nodos, con pesos de aristas calculados en base a la similitud coseno de los vectores de características de distribución y normalizados mediante normalización L2 para asegurar la consistencia de la métrica. Se adopta un umbral de aristas de 0,15 y se eliminan las aristas con pesos inferiores a este valor, mientras que los pesos válidos restantes se mapean y estandarizan mediante un perceptrón multicapa para mejorar la discriminabilidad de las asociaciones a nivel de distribución. Este estudio define un grafo figure-protocol-5 de puntos para la iteración de la capa l, donde el nodo figure-protocol-6 representa las características de la muestra y el borde figure-protocol-7 codifica la similitud a nivel de instancia. El mapa figure-protocol-8de distribución , nodo figure-protocol-9 representa las características de la muestra, y el borde figure-protocol-10 codifica la similitud del nivel de distribución. Tomando como ejemplo la rueda l-ésima a la l+1-ésima rueda, el cálculo de la relación a nivel de instancia calcula la similitud puntual a través de diferencias de características, como se muestra en la ecuación (3).

figure-protocol-11 (3)

En la ecuación (3), figure-protocol-12 y figure-protocol-13 son los pesos de aristas entre los nodos i y j durante las iteraciones l-ésima y l-1-ésima del grafo de puntos, reflejando la similitud de las características muestrales. figure-protocol-14 es una red de codificación utilizada para convertir diferencias de características de nodos en escalas de peso de aristas, que consiste en una capa de sigmoides y dos capas de funciones de activación por lotes de convolución. Cuando figure-protocol-15 y figure-protocol-16 son la l-1-ésima iteración, los vectores propios de los nodos i y j son actualizados por Bert en las dos últimas capas. Después, las características de la distribución se calculan en función de las relaciones de instancia, como se muestra en la ecuación (4).

figure-protocol-17(4)

En la ecuación (4), figure-protocol-18 es el vector propio del nodo i en el grafo de distribución de la capa l-ésima. MLP1 es un perceptrón multicapa compuesto por funciones de activación y capas totalmente conectadas, que mapea las características compuestas concatenadas en nuevas características de distribución. Después, la relación de distribución se calcula en función de las características de la distribución, y las características de instancia se calculan a partir de la relación de distribución para completar el bucle de información entre niveles.

Mecanismos de mejora de sistemas complejos
Para mejorar aún más la capacidad de generalización, se aplica CST al modelo anterior en este estudio. La evolución dinámica de los sistemas complejos se manifiesta mediante la distribución heterogénea de la influencia de los nodos. Para simular el papel dominante del vocabulario central en la propagación semántica en sistemas lingüísticos, este estudio introduce el índice de centralidad de nodos para reconstruir el mecanismo de propagación de la información. El gráfico de puntos Hp construido para cada tarea de escenario utiliza el algoritmo PageRank para cuantificar la centralidad del nodo C(hi), como se muestra en la ecuación (5)17.

figure-protocol-19(5)

En la ecuación (5), α es el coeficiente de amortiguamiento, α = 0,85. N(h i) representa el conjunto de nodos vecinos, y L(h j) es el grado del nodo. La ecuación (5) reemplaza el proceso de propagación en cascada de influencia del vocabulario en redes lingüísticas simuladas, permitiendo que el vocabulario central (como verbos y palabras temáticas) adquiera mayor centralidad. Después, la centralidad del nodo se acopla con pesos de aristas para ajustar dinámicamente la fuerza de propagación de la información entre nodos. La función de acoplamiento λij se muestra en la ecuación (6).

figure-protocol-20(6)

En la ecuación (6), σ es la función de activación sigmoide, WT es el vector de pesos aprendible y b significa el término de sesgo. El acoplamiento de los pesos de centralidad y aristas equilibra dinámicamente las relaciones locales con la importancia global, mejorando así la adaptabilidad del modelo a cambios dinámicos en las tareas. La aparición de CST se manifiesta en el idioma inglés como la semántica general que supera la suma del vocabulariolocal 18. Para utilizar esta característica en ETC, este estudio diseña un marco de generación de prototipos de tres niveles para simular el proceso de emergencia de microcaracterísticas a macrocategorías, como se muestra en la Figura 4.

figure-protocol-21
Figura 4: Construcción escalonada del marco de generación de prototipos micro-meso-macro de tres niveles para la emergencia semántica lingüística. La figura ilustra la construcción paso a paso del marco de generación de prototipos micro-meso-macro de tres niveles para simular la aparición semántica lingüística en la clasificación de textos en inglés. El marco construye representaciones jerárquicas de categorías de texto mediante agrupamiento de micro subclases con K-medias, fusión de prototipos de subclases meso basada en ponderación por similitud de distribuciones e integración macro no lineal mediante mecanismo de atención, simulando la característica emergente de "el todo es mayor que la suma de sus partes" en sistemas de lenguaje. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El proceso anterior construye representaciones de categorías de texto paso a paso, desde micro hasta macro para mejorar la capacidad de generalización del modelo. A nivel micro, K subclases se generan agrupando las representaciones de incrustación de muestra de cada categoría de texto. Se utiliza K-media para dividir las muestras dentro de la categoría en subgrupos, y la posición del centroide de cada subgrupo se calcula como el prototipo desubclase 19. A nivel mesoscópico, se calcula la similitud de distribución de cada prototipo de subclase, se genera una matriz de similitud y luego se reensamblan los prototipos de subclase basándose en pesos de similitud para cuantificar la correlación entre subclases. El cálculo del peso de similitud de subclase wij se muestra en la ecuación (7).

figure-protocol-22 (7)

En la ecuación (7), figure-protocol-23 está la divergencia de Jensen-Shannon, utilizada para medir la diferencia de distribución entre dos subclases figure-protocol-24 y figure-protocol-2520. Finalmente, los prototipos de subclase se ponderan y fusionan para obtener un conjunto de representaciones figure-protocol-26de distribución de clases . A nivel macro, los pesos de importancia de cada subclase se aprenden mediante mecanismos de atención, y se introducen transformaciones no lineales para simular el proceso de emergencia, resultando en el prototipo final de clase c como se muestra en la ecuación (8).

figure-protocol-27(8)

En la ecuación (8), αk significa el peso de atención de la clase k. U denota la matriz de pesos de transformación no lineal. Tanh(·) se utiliza para mejorar la representación no lineal y simular la suma global de partes característica de sistemas complejos. Cada nivel captura la diversidad dentro de las categorías a través de una estructura de subclases, la similitud de distribución de pesos para reducir la influencia de subclases ruidosas y se centra dinámicamente en características discriminativas mediante mecanismos de atención para mejorar la capacidad de generalización del modelo. La CST se integra principalmente con GNN a través de dos mecanismos. La primera es introducir la centralidad de nodos para reconstruir el proceso de difusión de información y simular la distribución heterogénea de la influencia léxica en el sistema lingüístico. La centralidad del nodo se cuantifica mediante el algoritmo PageRank y se acopla dinámicamente con los pesos de las aristas, permitiendo que el vocabulario central domine la propagación semántica y mejorando la adaptabilidad del modelo a los cambios dinámicos de las tareas. La segunda es diseñar un marco de generación de prototipos en tres niveles, desde el agrupamiento de micro-subclases hasta la fusión de prototipos de macro-categorías, para simular la característica emergente en el sistema de lenguaje de que "el todo es mayor que la suma de sus partes". Este marco logra una integración jerárquica desde las características locales hasta la semántica global mediante la ponderación de similitud de distribución y mecanismos de atención.

En resumen, la innovación central del modelo ETC construido radica en integrar profundamente las ideas de CST en el marco de GNN. Al reconstruir el mecanismo de difusión de información mediante la centralidad de los nodos, el modelo simula el papel principal de los elementos centrales en el sistema lingüístico y mejora su adaptabilidad a la dinámica de la tarea. A través del marco de generación de prototipos de tres niveles, el modelo realiza el proceso de aparición de características locales a semántica global, mejorando así la capacidad del modelo para captar la diversidad y las características discriminatorias dentro de la categoría. Este método evita la limitación de las GNN tradicionales que solo dependen de relaciones a nivel de instancia. A través de la interacción a nivel de distribución y características complejas del sistema, proporciona una nueva solución para mejorar la capacidad de generalización del modelo en escenarios de pocos disparos y entre dominios.

Las propiedades emergentes de la CST corresponden a un marco de generación de prototipos de tres niveles. En los sistemas lingüísticos, el principio de que "el todo es mayor que la suma de sus partes" se manifiesta como un salto semántico de los significados locales de las palabras a las categorías generales de texto. Este estudio simula este proceso mediante un mecanismo de generación de prototipos "micro-meso-macro" de tres niveles: a nivel micro, las incrustaciones de muestras se agrupan para formar prototipos de subclase; A nivel meso, estos prototipos se ponderan y fusionan en función de la similitud distribucional; y a nivel macro, los prototipos de categorías finales se sintetizan de forma no lineal mediante un mecanismo de atención. Por ejemplo, en la clasificación de sentimiento, múltiples palabras negativas como "decepcionante", "lento" y "caro" se mezclan y transforman de forma no lineal para emerger como un fuerte sentimiento global de "evaluación negativa". La centralidad y heterogeneidad de nodos en CST se alinean con un mecanismo de propagación de información basado en la reconstrucción de centralidad de nodos. Dentro de las redes lingüísticas, la influencia de las palabras está distribuida de forma desigual, con palabras clave (por ejemplo, verbos, términos temáticos) desempeñando papeles dominantes en la propagación semántica. Este estudio cuantifica la centralidad de nodos utilizando el algoritmo PageRank y la acopla dinámicamente con pesos de aristas para ajustar la intensidad de la dispersión de información entre nodos. Por ejemplo, en la categorización de noticias, el término "elección" tiene una gran centralidad en textos políticos, lo que lleva a nodos adyacentes como "votar" y "campaña" a obtener mayor peso durante la agregación de información, mejorando así la representación semántica de ese tema. La naturaleza dinámica y adaptativa de la CST corresponde a GNNs conscientes de la distribución y a un mecanismo de experimento didáctico dentro de la metadestilación. Los sistemas lingüísticos evolucionan dinámicamente según el contexto y los requisitos de la tarea. Los modelos capturan los cambios generales de distribución en los conjuntos de datos mediante GNNs conscientes de la distribución. Simultáneamente, se introduce en TSMDM un mecanismo experimental instruccional impulsado por el meta-aprendizaje, que permite a las MT ajustar dinámicamente parámetros basándose en la retroalimentación de los SMs. Por ejemplo, en el análisis de sentimiento entre dominios, el modelo puede adaptar rápidamente los pesos de características basados en la distribución de datos del dominio objetivo y refinar los parámetros de la MT durante la metadestilación para mejorar la eficiencia de adaptación a nuevos dominios.

Modelo de LTC basado en TSMDM
Tubería de Metadestilación en dos etapas
Para abordar los desafíos del alto coste computacional y las dificultades de despliegue en entornos con recursos limitados, se propone un modelo ligero de clasificación de texto basado en un TSMDM. Este método de metadestilación ejecuta el proceso de destilación en un orden secuencial estricto con dos etapas distintas. La segunda etapa se inicia solo tras la finalización y convergencia de la formación de la primera etapa: 1) la etapa de compresión de conocimiento de profesor a asistente de enseñanza (TA) y 2) la etapa de destilación ligera de asistente a estudiante integrada con la adaptación de parámetros de meta-aprendizaje. Este enfoque logra una transferencia eficiente de conocimiento de una MT compleja a una SM ligera mediante destilación en dos etapas, incorporando un mecanismo de meta-aprendizaje para optimizar dinámicamente la estrategia de transferencia de conocimiento durante elproceso 21,22. El conjunto de la tubería se ilustra en la Figura 5.

figure-protocol-28
Figura 5: Diseño de tubería del modelo ligero de clasificación de texto con mecanismo de metadestilación en dos etapas. La figura diseña la cadena del modelo de clasificación de texto ligero con el mecanismo de metadestilación de dos etapas (TSMDM). La cadena comprende un modelo de profesor (fuente de conocimiento de alta complejidad), un modelo de asistente de enseñanza (capa intermedia de complejo buffer) y un modelo de estudiante (modelo blanco ligero), e implementa una transferencia eficiente de conocimiento a través de dos etapas secuenciales: compresión de conocimiento de profesor a asistente de enseñanza y destilación ligera de asistente de enseñanza a estudiante integrada con meta-aprendizaje. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El método implica tres funciones: un modelo de MT, un modelo TA y un SM, dividiendo el proceso de destilación en dos etapas: destilación profesor-TA y destilación TA-alumno. En la primera etapa de compresión de conocimiento de Teacher a TA, el conocimiento de la MT se comprime primero en un modelo TA de complejidad intermedia para mitigar la pérdida de información causada por excesivas brechas de capacidad en la destilación directa. La TM, que sirve como fuente de conocimiento, transfiere tanto sus probabilidades de clasificación de salida como sus características de capa intermedia al modelo TA. El modelo TA se entrena alineando sus salidas y representaciones de características con las del profesor, utilizando una función de pérdida combinada que integra la pérdida de clasificación y la pérdida de alineaciónde características 21. En la segunda etapa de destilación ligera de TA a Estudiante, que se inicia tras la convergencia del modelo TA, el conocimiento se destila aún más desde el modelo TA hasta el SM ligero final. Esta etapa también emplea supervisión dual (logits de clasificación y características intermedias) e incorpora un mecanismo de meta-aprendizaje: la MT realiza "experimentos de enseñanza" en tareas auxiliares para evaluar el estado de aprendizaje del estudiante y ajusta dinámicamente sus propios parámetros para ofrecer una orientación más adaptativa y dirigida. El SM completa el entrenamiento minimizando tanto la discrepancia de salida como la distancia de las características respecto al modelo TA, logrando así una reducción significativa de parámetros mientras preserva el rendimiento de clasificación en la mayor medida posible22.

Meta-aprendizaje con experimentos de enseñanza
En los métodos tradicionales de destilación de conocimiento, el TM entrenado guía al SM participando en el cálculo de pérdidas. Sin embargo, las MT de parámetros fijos son difíciles de evaluar el estado real de aprendizaje de las SMs, ni pueden cuantificar la contribución específica de su guía a la actualización de los parámetrosSM 23,24. Por ello, este estudio introduce ideas de metaaprendizaje en el proceso de destilación, permitiendo a la MT ajustar sus propios parámetros basándose en la retroalimentación de aprendizaje de la SM. El proceso de destilación se muestra en la Figura 6.

figure-protocol-29
Figura 6: Proceso iterativo de optimización de parámetros de metadestilación combinado con mecanismos de experimento de enseñanza. La figura muestra el proceso iterativo de optimización de parámetros de la metadestilación combinado con el mecanismo de experimento didáctico para la ponderación del modelo de clasificación de texto en inglés. El proceso genera un aprendiz interno temporal a partir del modelo del estudiante, cuantifica la pérdida del efecto de la enseñanza a través del rendimiento simulado de entrenamiento del aprendiz interno y permite al modelo del profesor ajustar sus propios parámetros mediante la retropropagación de la pérdida, optimizando así la estrategia posterior de transferencia de conocimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La MT optimiza los parámetros mediante tareas convencionales de clasificación durante su propia fase de entrenamiento, lo que resulta en una pérdida básica de clasificación LT que refleja su rendimiento original. Tras completar la formación, el SM S se replica para generar una copia temporal del aprendiz interno S1. La MT realiza experimentos de enseñanza en S1, y el error de rendimiento integral que exhibe S1 en este entrenamiento simulado se cuantifica como pérdida LQ. Esta señal se utiliza como retroalimentación para la MT para evaluar la efectividad de la enseñanza. Mediante la retropropagación de LQ, la MT ajusta activamente sus propios parámetros y optimiza su método de transmisión de conocimiento. Tras completar la optimización del metaaprendizaje, la MT realiza la destilación formal del conocimiento en el SM S original, y también utiliza la pérdida del modelo LS como retroalimentación para enseñar la evaluación de la efectividad a la MT. Para lograr un aligeramiento del modelo ETC, este estudio considerará incorporar el modelo SDF GNN como una MT en el proceso de experimento docente, como se muestra en la Figura 7.

figure-protocol-30
Figura 7: Flujo de actualización de parámetros del mecanismo de experimento docente para la optimización del modelo docente en metadestilación. La figura muestra el flujo de actualización de parámetros del mecanismo de experimento docente para la optimización del modelo docente en el proceso de metadestilación. El flujo calcula primero la pérdida suave entre la predicción del aprendiz interno y la predicción del modelo del profesor con la función de pérdida por error cuadrático medio, combina la pérdida suave con el error de etiqueta dura para formar la pérdida total de entrenamiento, y actualiza los parámetros del modelo del profesor mediante la retropropagación del error total ponderado para mejorar su efectividad docente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Tras completar el entrenamiento en destilación de conocimientos, el SM primero calcula la diferencia entre los resultados predichos de la MT y las etiquetas verdaderas. Posteriormente, la función de pérdida MSE se utiliza para medir la distancia entre la predicción SM (inner learner S1) y la predicción TM. Este valor de distancia se utiliza como la pérdida suave25. El objetivo final de entrenamiento consiste en una combinación ponderada de error duro en la etiqueta y pérdida suave. Al retropropagar el error total ponderado, se actualizan los parámetros de la MT, mejorando así la efectividad de la enseñanza de la MT. El cálculo del parámetro del aprendiz interno S1 se muestra en la ecuación (9).

figure-protocol-31(9)

En la ecuación (9), figure-protocol-32 y figure-protocol-33 son los parámetros internos del aprendiz y sus parámetros iniciales están influenciados por el parámetro TM γT. λ (la tasa de aprendizaje, λ = 0,005) controla el tamaño del paso de actualización de parámetros para los aprendices internos (es decir, copias de los SMs) durante la metadestilación26. La ecuación (9) calcula gradientes de pérdida mediante retropropagación, mientras que λ actualiza los parámetros de los aprendices internos. Este mecanismo refleja las características de aprendizaje de los SM, permitiendo que los TMs reciban retroalimentación y ajusten sus estrategias de enseñanza, mejorando así la eficacia posterior de la destilación de conocimiento. El cálculo de la pérdida LS en metaaprendizaje se muestra en la ecuación (10).

figure-protocol-34 (10)

En la ecuación (10), B es la secuencia de meta-aprendizaje de la muestra.

Optimización de la transferencia de conocimiento con diseño de pérdidas y modelo asistente
Para mejorar aún más la eficacia de la destilación del conocimiento, este estudio obtiene la pérdida global calculando la pérdida de clasificación y la pérdida de características. Entre ellas, la pérdida de características adopta un mecanismo retrospectivo, utilizando las salidas superficiales y actuales de las características de la MT para guiar la SM, expresada en la ecuación (11).

figure-protocol-35(11)

En la ecuación (11), I es el conjunto de índices de la capa de características. D es una función de distancia que se utiliza para calcular la diferencia entre dos representaciones de características. y son funciones de representación objetiva en la TM y la SM, que convierten las salidas figure-protocol-36 de características y figure-protocol-37 de las capas i y j-ésima en matrices de atención.figure-protocol-38 figure-protocol-39 La pérdida de clasificación combina la pérdida de entropía cruzada entre la salida SM y la etiqueta real, así como la MSE entre la salida de los dos modelos, como la pérdida suave27,28. En última instancia, la pérdida global se obtiene ponderando ambos, ayudando al SM a recibir mejor orientación de la TM. Para minimizar la pérdida de rendimiento durante el proceso de destilación del conocimiento, este estudio sitúa el modelo del asistente de enseñanza entre dos modelos, como se muestra en la Figura 8.

figure-protocol-40
Figura 8: Flujo de procesamiento de destilación de conocimiento en dos etapas con modelo de asistente docente como capa intermedia de tampón. La figura demuestra el flujo de procesamiento de destilación de conocimiento en dos etapas con el modelo de asistente docente como capa intermedia de tampón. Los fusibles de la primera etapa presentan pérdida y pérdida de clasificación para construir la pérdida total por destilación, y entrenan al modelo de asistente de enseñanza con el conocimiento del modelo del profesor; La segunda etapa adopta la misma estrategia de fusión de pérdidas para destilar el conocimiento del modelo de asistente de enseñanza al modelo del alumno, reduciendo la pérdida de información causada por excesivas brechas de complejidad entre los modelos del profesor y del alumno. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Tras completar la etapa de metadestilación, el modelo TA y la MT se someten a destilación de conocimiento convencional. Durante este proceso, las características de ambos se extraen síncronamente y se calcula la pérdida correspondiente La . Posteriormente, esta pérdida de características se fusiona con la pérdida de clasificación LM1 del modelo para formar la función figure-protocol-41 de pérdida por destilación en la primera etapa, como se muestra en la ecuación (12).

figure-protocol-42(12)

En la ecuación (12), β es el coeficiente de peso utilizado para controlar la proporción de pérdida de características y de clasificación en la pérdida total. y son funciones de representación objetiva en el modelo del asistente de enseñanza y en la MT, que convierten las salidas figure-protocol-43 de características y figure-protocol-44 de las capas i y j-ésima en matrices de atención.figure-protocol-45 figure-protocol-46 zT y zM son las salidas del modelo TM y del asistente. El proceso de destilación desde el modelo de asistente de enseñanza hasta el SM es el mismo que el proceso anterior, lo que minimiza la pérdida del SM a través de múltiples iteraciones para completar la transferencia de conocimiento.

En conclusión, la contribución central del TSMDM propuesto radica en optimizar el proceso de transferencia de conocimiento a través del mecanismo de meta-aprendizaje. En comparación con la destilación tradicional, la principal ventaja de este método radica en su capacidad de enseñanza dinámica: la MT puede ajustar sus propios parámetros a través del mecanismo del experimento didáctico basándose en la retroalimentación en tiempo real del SM, proporcionando así una orientación más específica. Mientras tanto, el modelo del asistente de enseñanza se introduce como una capa de tampón, lo que sirve de puente sobre la brecha de complejidad entre los MTs y los SMs y reduce la pérdida de información en la transferencia de conocimiento. El diseño colaborativo de esta "estrategia de enseñanza de optimización de meta-aprendizaje" y "almacenamiento en búfer de dos niveles para reducir la dificultad de transferencia" permite al SM final lograr un aligeramiento significativo mientras conserva al máximo el conocimiento básico extraído de la TM compleja.

Disponibilidad de datos
Los conjuntos de datos generados durante y/o analizados durante el estudio actual se proporcionan en el Archivo Suplementario 1.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Configuración experimental y conjunto de datos:
Para evaluar de forma exhaustiva el rendimiento y la eficiencia ligera del modelo propuesto en tareas de clasificación multidominio de muestras pequeñas, se realizan experimentos con cuatro conjuntos de datos: FewRel (clasificación relacional de muestra pequeña), ARSC (análisis de sentimiento entre dominios), Reuters-21578 (categorización de noticias multitema) y ArXiv (resúmenes académicos de formato largo). FewRel, un ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para mejorar la capacidad de generalización de ETC en escenarios de pocos disparos y entre dominios, reduciendo al mismo tiempo los costes computacionales, este estudio propone un marco ligero de clasificación de texto que integra CST con TSMDM. Integrar CST con un marco TSMDM aborda las limitaciones fundamentales de los métodos ETC existentes (mala generalización de pocos disparos/entre dominios y altos costes computacionales) al incorporar dinámicas de sistemas lingüísticos y propiedad...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que reconocer.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Central Processing Unit (CPU)Proveedores de hardware comercial (Intel, Dell, Lenovo)Intel i5-7300HQEspecificaciones de hardware
Graphics Processing Unit (GPU)Proveedores de hardware comercial (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMEspecificaciones de hardware
Random Access Memory (RAM)Proveedores de hardware comercial16 GB DDR4Especificaciones de hardware
Solid State Drive (SSD)Proveedores de hardware comercial1 TB NVMe SSDEspecificaciones de hardware
Operating SystemSitio web oficial de MicrosoftWindows 10 (64-bit)Software del sistema
PythonSitio web oficial de Python (python.org)Python 3.8Lenguaje de programación
PyTorchSitio web oficial de PyTorch (pytorch.org)PyTorch 1.11.0Marcos de aprendizaje profundo & Bibliotecas principales
CUDASitio web oficial de NVIDIACUDA 11.3Marcos de aprendizaje profundo & Bibliotecas principales
Hugging Face TransformersHugging Face Hub (huggingface.co)Versión estable (adaptada a Python 3.8/PyTorch 1.11.0)Marcos de aprendizaje profundo & Bibliotecas principales
NumPyPyPI (pypi.org)Versión estable (adaptada a Python 3.8)Bibliotecas de procesamiento de datos & estadísticas
PandasPyPI (pypi.org)Versión estable (adaptada a Python 3.8)Bibliotecas de procesamiento de datos & estadísticas
Scikit-learnPyPI (pypi.org)Versión estable (adaptada a Python 3.8)Bibliotecas de procesamiento de datos & estadísticas
SciPyPyPI (pypi.org)Versión estable (adaptada a Python 3.8)Bibliotecas de procesamiento de datos & estadísticas
MatplotlibPyPI (pypi.org)Versión estable (adaptada a Python 3.8)Biblioteca de visualización
AdamWIntegrado en PyTorchIntegrado en PyTorch 1.11.0Optimizador
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Modelos pre-entrenados
FewRelRepositorio oficial de FewRel (GitHub) / Wikipedia100 categorías de relaciones semánticas, 700 oraciones por categoría; división de entrenamiento/validación/prueba (5:2:3)Conjuntos de datos
ARSCConjuntos de datos de análisis de sentimiento de dominio público (GitHub/ACL Anthology)23 categorías de productos de Amazon, 69 tareas de análisis de sentimiento binario; división de entrenamiento/validación/prueba (4:2:3)Conjuntos de datos
Reuters-21578Repositorio de aprendizaje automático de UCI / Archivo oficial de Reuters21,578 artículos de noticias, 90 categorías temáticas; método de partición ModApteConjuntos de datos
ArXivAPI pública de ArXiv (arxiv.org)Resúmenes de artículos de ciencias de la computación; división de entrenamiento/validación/prueba (7:2:1)Conjuntos de datos
TokenizerHugging Face Hub (huggingface.co)Tokenizer BERT-base-casedOtras herramientas esenciales
GitSitio web oficial de Git (git-scm.com)Última versión estableOtras herramientas esenciales

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Artículos relacionados