Исследовательская статья

Лёгкая классификация английских текстов с глубоким обучением на основе сложной системной теории

DOI:

10.3791/69344

9 июня 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании предлагается создание лёгкой нейронной сети графов с мета-дистилляцией и мета-обучением для улучшения классификации текста на английском языке. Улучшает обобщение в условиях низкого количества данных и междоменных ресурсов, одновременно снижая вычислительные затраты и поддерживая высокую производительность.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Глобализация и развитие информационных технологий вызвали всплеск числа текстовых данных на английском языке, и существует острая необходимость в эффективной классификации. Для повышения способности к обобщению классификации английского текста в сценариях с малыми выборками и междоменных областей и создания лёгких моделей, это исследование сочетает сложную системную теорию с глубоким обучением для построения модели нейронных сетей графов, полностью учитывающей распределительные характеристики текстовых образцов. Двухуровневый метод мета-дистилляции в сочетании со стратегиями мета-обучения динамически корректирует параметры модели учителя и оптимизирует весь процесс передачи знаний. Экспериментальные результаты показывают, что классификационные характеристики предлагаемой модели в задачах классификации текста с несколькими кадрами и между областями значительно превосходят традиционные нейронные сети графов и другие основные сравнительные модели. С точки зрения облегчения, SM, генерируемый двухступенчатым механизмом мета-дистилляции, поддерживает чрезвычайно высокий уровень удержания производительности на многотематических наборах классификации текста, при этом значительно сокращая вычислительное время. Кроме того, этот метод способен поддерживать высокую эффективность и стабильную производительность классификации в сценариях длительной обработки текста и предлагает явные преимущества в вычислительной эффективности по сравнению с традиционными методами дистилляции и другими методами, описанными в литературе. Предлагаемый метод эффективно повышает эффективность классификации английского текста в сценариях с низким уровнем выборок и междоменных приложений, одновременно значительно снижая вычислительные затраты, обеспечивая тем самым реализуемое и эффективное техническое решение для классификации английского текста в условиях с ограниченными ресурсами.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ускорение глобализации и прогресс в информационных технологиях привели к стремительному росту англоязычных текстовых данных в таких сферах, как социальные сети, академические исследования и деловая коммуникация. Эффективная классификация этих текстов для поиска информации, анализа настроений, управления контентом и других функций стала важной задачей в обработке естественногоязыка 1. Цель классификации английского текста (ETC) — классифицировать тексты по заранее определённым категориям на основе их семантического содержания. Однако сложность естественного языка, включая его неоднозначность, зависимость от контекста и разнообразие выражений, ставит множество вызовов перед задачами классификациитекста 2. В настоящее время развитие технологий глубокого обучения (DL) создало новые возможности для классификации текста. Предварительно обученные языковые модели, представленные Bidirectional Encoder Representations from Transformers (BERT) и их варианты, могут изучать богатую контекстуальную семантическую информацию через предварительное обучение на крупномасштабных корпусах, значительно повышая производительность классификациитекста 3. Однако современные методы ETC по-прежнему имеют два ключевых ограничения: во-первых, они часто делают упор на оптимизацию одной модели или признака, игнорируя внутренние свойства языка как сложной системы, такие как его динамичность и возникающее поведение, что приводит к недостаточной обобщённости при сценариях с низким уровнем данных или междоменных областях; Во-вторых, несмотря на высокую производительность предварительно обученных моделей, их высокие вычислительные затраты и большое количество параметров серьёзно затрудняют практическое внедрение в условиях с ограниченными ресурсами 4,5. Для решения этих проблем в исследовании предлагается лёгкий фреймворк классификации текста, интегрирующий теорию сложных систем (CST) и двухступенчатый механизм мета-дистилляции (TSMDM).

В контексте данного исследования CST относится к теоретической основе, рассматривающей естественный язык как типичную сложную систему с динамической эволюцией, семантической эмерджентностью и гетерогенным распределением влияния лексических узлов. Он применяется для моделирования доминирующей роли основной лексики в распространении семантики и возникающего закона общей семантики на основе локальных лексических признаков, тем самым расширяя глубокое понимание текстовой семантики и адаптацию модели к сценариям малочастотных и междоменных данных. Её основные вклады таковы: теоретически, насколько нам известно, CST систематически внедряется в задачи классификации текста, моделируя динамическую эволюцию и семантическое появление языковых систем для повышения глубокого понимания и адаптации модели к малочисленным и междоменным данным. Методологически разрабатывается нейронная сеть графов (GNN), содержащая характеристики распределения образцов. Объединённый инновационный TSMDM существенно отличается от стандартной дистилляции знаний. Стандартная дистилляция знаний реализует односторонний перенос знаний от модели учителя с фиксированным параметром (TM) к легкой модели ученика (SM). Мета-дистилляция в данном исследовании интегрирует стратегии мета-обучения на основе дистилляции и может динамически корректировать параметры ТМ на основе обратной связи обучения СМ. Двухступенчатая конструкция дополнительно устанавливает модель ассистента преподавателя в качестве промежуточного буферного слоя для снижения потери информации, вызванной чрезмерными разрывами сложности между TM и SM, обеспечивая значительную облегчённость модели при сохранении высокой точности и обеспечивая эффективное решение классификации для сценариев с ограниченными ресурсами.

В области ETC исследователи провели обширные исследования и предложили различные решения, интегрирующие различные функции и архитектуры моделей для решения технических задач в различных сценариях. Р. Чжан и др. разработали многоязычную предобученную многофункциональную модель синтеза (MP-MFFM) для решения проблемы недостаточного захвата долгосрочной контекстной структурной информации в ETC с использованием современных методов DL. Этот метод сочетал многоязычные BERT, BiLSTM и текстовый CNN для извлечения глубокой семантической, глобальной и локальной структурной информации и их объединения. Этот метод улучшил точность, чувствительность и точность на трёх наборах данных, подтвердивего эффективность 6. К. Мадху и др. приняли Рамочную рамку обучения нечетких графов на основе признаков диалекта (DF-FGLF) для удовлетворения потребностей в классификации текста неструктурированных и малоаннотированных данных в социальных сетях, а также влияния различий диалектов на международную классификацию английского языка. Они объединили семантические и диалектные особенности обучения различиям для построения оптимизированного нечеткого графа. Когда было всего 10 аннотированных образцов, значение F1 для распознавания диалектов и классификации текста превышало 93% и 80%, что превосходило аналогичные методы и подходило для практическойклассификации 7. Б. Шаннак и др. провели эксперименты с использованием наборов данных на английском и арабском языках, чтобы изучить влияние длины n-граммов на классификацию текста в различных системах письма и влияние языковых особенностей на оптимальную длину n-грамм. Показатели английского 2-граммового были лучшими (точность 0,482, отзыв 0,489, значение F1 =0,472), а арабского 6-граммового — лучшим (значение F1 около 0,85). Морфология языка и синтаксические особенности существенно повлияли на производительность n-грамовыхмоделей 8. Н. С. Лагутина и др. использовали текстовый вектор, построенный на основе библиометрических особенностей символов, словарного запаса и структуры предложений, чтобы добиться автоматической классификации коротких английских текстов для оценки обучения учащихся, в сочетании со стандартными классификаторами машинного обучения, такими как SVM. Значение F1 SVM в корпусе Common European Framework of Reference for Languages составляло 67%, а значение F1 в модели best-BERT (bert-base-cased) — 69%. Ошибки в основном находились на смежных уровнях, а качество классификации зависело откорпуса 9.

Дистилляция знаний, как эффективный способ достижения лёгкого веса моделей, повышения производительности моделей в небольших выборочных сценариях и снижения вычислительных затрат, также добилась значительного прогресса в соответствующих исследованиях. Предыдущие исследования касались применения дистилляции знаний для решения ключевых задач обработки естественного языка, включая: повышение производительности моделей с малыми параметрами при условиях низкой метки, оптимизацию задач многоязычной классификации текста, сжатие крупномасштабных предварительно обученных моделей с помощью гибридных стратегий сжатия и выравнивание эффективных предложений для сокращения разрыва в производительности между большими и малыми языковыми моделями при адаптации к аппаратному обеспечению ограничения 10,11,12,13. Несмотря на эти достижения, существующие методы дистилляции знаний всё ещё имеют критические ограничения для ETC: им не хватает динамических механизмов оптимизации процесса передачи знаний, они часто страдают от серьёзных потерь информации при перегоне между сложными TM и лёгкими SM и не интегрируются эффективно с характерными характеристиками распределения текстовых данных. Эти недостатки приводят к неоптимальным результатам обобщения в сценариях с меньшими выстрелами и кросс-доменами. Лёгкие модели, полученные с помощью таких методов, часто испытывают трудности с балансом эффективности классификации и вычислительной эффективности в условиях ограниченных ресурсов. Это ключевой пробел, который стремится устранить исследование в этой статье.

Это исследование проверяет следующую гипотезу: во-первых, интеграция CST в ETC может эффективно моделировать динамическую эволюцию и семантические характеристики естественных языковых систем. Такая теоретическая интеграция может значительно повысить способность модели к обобщению в сценариях с небольшим числом кадров и междоменных областях по сравнению с традиционными моделями классификации текста, игнорирующими сложные системные свойства языка. Во-вторых, модель GNN, разработанная с явным учётом характеристик распределения образцов текста, может компенсировать ограничения традиционных GNN, которые сосредоточены только на реляционном моделировании на уровне экземпляра и обеспечивают более глубокий анализ глобальной и локальной семантической информации в английских текстах. В-третьих, TSMDM в сочетании со стратегиями мета-обучения и моделью ассистента преподавателя позволяет эффективно и с минимальными потерями передачи знаний от сложных ТМ к лёгким СМ. Это может значительно снизить вычислительные затраты и масштаб параметров модели при сохранении высокой производительности классификации. Кроме того, лёгкая модель, полученная из этого механизма, всё ещё может сохранять стабильную и эффективную классификационную производительность в сценариях длительной обработки текста со сложными семантическими структурами.

В заключение, соответствующие исследования повысили производительность классификации текста за счёт мульти-элементного синтеза, изучения диалектных признаков, оптимизации n-граммов и стилистических метрических признаков, а также достигли облегчения моделей за счёт дистилляции знаний. Однако существующие методы всё ещё имеют недостатки в захвате информации на большие расстояния, обобщении малых выборок и адаптации сложных и простых моделей. Чтобы снизить вычислительные затраты модели ETC при одновременном обеспечении её точности, в этом исследовании создана лёгкая модель путём объединения CST и TSMDM для повышения её возможности обобщения и вычислительной эффективности.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для повышения способности к обобщению ETC в сценариях небольших выборок и междоменных областей и реализации лёгкой модели в этом исследовании предлагается структура классификации текста, интегрирующая CST и TSMDM. Общий процесс работы этой структуры показан на рисунке 1.

figure-protocol-1
Рисунок 1: Визуализация четырёхступенчатого облегченного фреймворка классификации английского текста, интегрирующего CST и TSMDM. Рабочий процесс состоит из четырёх этапов. Этап 1 выполняет представление текста с использованием динамических эмбеддингов на основе BERT из входного английского текста. Этап 2 применяет моделирование нейронных сетей графов путём построения текстового графа и вычисления отношений на уровне экземпляра и распределения. Этап 3 моделирует семантическое возникновение через реконструкцию центральности узлов и многоуровневую структуру генерации прототипов для получения конечного прототипа категории. Этап 4 проводит двухступенчатую элементную дистилляцию, при которой обучается модель учителя, а знания передаются через мета-дистилляцию для получения конечной модели ученика. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Во-первых, на этапе представления текста и динамического вложения используется модель BERT для динамического встраивания входного текста и захвата контекстуальной семантической информации. Второй этап — моделирование GNN, ориентированное на распределение, которое учитывает характеристики распределения выборок, строит модель GNN и улучшает представление признаков через двойное информационное взаимодействие на уровне экземпляра и уровня распределения. Третий этап — это семантическое моделирование возникновения, основанное на теории гибридных систем, вводящее реконструкцию центральности узлов и трёхуровневый механизм генерации прототипов для моделирования динамики и возникновения языковой системы. Наконец, на четвёртом этапе проводится двухуровневая мета-дистилляционная легкая операция. Процесс дистилляции знаний оптимизируется с помощью ассистент-модели и стратегии мета-обучения для достижения эффективного сжатия и ускорения моделей.

Модель ETC, основанная на характеристиках распределения и CST
Обзор архитектуры модели
Предлагаемая модель классификации текста сначала использует предварительно обученный BERT для динамического контекстного кодирования входного текста, генерируя семантически богатые вложения слов и глобальное представление. Далее из этих признаков строятся граф экземпляра и граф распределения: граф экземпляра фиксирует попарные сходства выборок, а граф распределения моделирует общее распределение данных; Итеративный обмен информацией между двумя графами обеспечивает синергетическое улучшение отдельных признаков и глобальной структуры. Впоследствии CST интегрируется для глубокого расширения графовой сети. Реконструкция центральности узлов использует PageRank для количественной оценки лексического влияния, моделируя доминирующую роль основных элементов в языковых сетях. Это широко проверенный метод измерения глобального влияния узлов в сложных сетевых топологиях, который хорошо подходит для отражения асимметричного семантического распространения основных лексических узлов в языковых системах. Трехуровневая структура генерации прототипов «микро-мезо-макро» эмулирует возникающий процесс — от локальной семантики к целостным представлениям категорий. Наконец, расширенные представления признаков подаются в классификатор для получения окончательных вероятностей класса.

Взаимодействие функций с GNN, ориентированным на распределение
Для оптимизации возможности обобщения ETC, эффективного захвата сложных семантических связей между текстами и признаками распределения образцов (SDF), это исследование строит модель ETC на основе признаков распределения и CST. Он достигает глубокого анализа глобальной и локальной информации в тексте за счёт интеграции таких механизмов, как GNN и динамическое вложение текста. GNN — это модель DL, специально разработанная для обработки графово-структурированных данных. Основной принцип заключается в использовании механизма передачи сообщений (когда каждый узел в графе агрегирует информацию о признаках соседних узлов) и комбинировании её со своим состоянием. Через несколько раундов итеративных обновлений он постепенно осваивает высокомерное представление, включающее структуру топологии. Этот процесс позволяет узлам фиксировать зависимости от структуры и признаков локального окружения и даже глобального графа. Для преодоления ограничений традиционных моделей последовательностей в моделировании долгосрочных зависимостей и глобальных отношений в этом исследовании используется GNN для фиксации сложных семантических и структурных связей между выборками. Из-за фокуса GNN на информации о прямой корреляции между отдельными образцами, он игнорирует общие характеристики распределения выборочногонабора 14,15,16. Поэтому в данном исследовании предложена модель GNN, учитывающая SDF. Эта модель вводит BERT для динамического вложения текста и объединяет его с прототипной сетью для вычисления различий в признаках выборок. BERT — это предварительно обученная языковая модель, основанная на архитектуре Transformer. Основной принцип заключается в одновременном захвате семантической информации каждого слова в контексте с помощью двунаправленного кодировщика и предварительном обучении на крупномасштабном корпусе с помощью двух задач: «маскированной языковой модели» и «предсказания следующего предложения». В маскированных языковых моделях некоторые слова на входе случайно маскированы, и модели необходимо предсказывать исходное слово на основе контекста. Следующее предсказание определяет, являются ли два предложения последовательными. После предварительного обучения BERT может быстро адаптироваться к различным задачам обработки естественного языка за счёт тонкой настройки, значительно повышая производительность и предоставляя высококачественные представления признаков для последующего построения структуры графов. Конкретная структура модели ETC, построенной в этом исследовании, показана на рисунке 2.

figure-protocol-2
Рисунок 2: Архитектурное проектирование интегрированной с CST английской модели классификации текста с учётом особенностей распределения образцов. На рисунке представлен архитектурный дизайн английской модели классификации текста, интегрированный с теорией сложных систем (CST) и учёт характеристик распределения образцов текста. Архитектура объединяет динамическое контекстное вложение на базе BERT, нейронные сети графов с учётом распределения (GNN) и механизмы улучшения CST, а также реализует глубокий анализ глобальной и локальной семантической информации в английских текстах посредством многомодульного совместного моделирования. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

В этой модели, для общего набора данных, английский текст в модель BERT генерирует последовательность токенов через токенайзер. Метод построения последовательностей показан в уравнении (1).

[CLS], 1,2,... an, [SEP] (1)

В уравнении (1) [CLS] — это маркер классификации, расположенный в начале последовательности. BERT генерирует фиксированное состояние скрытого положения для [CLS] во время обучения. Это состояние напрямую используется для глобального семантического представления всего текста. 1,2,... n обозначает слово или подслово в тексте. [SEP] — это разделитель, используемый для обозначения конца предложения. После обработки вышеуказанной последовательности Бертом получаются признаки каждого токена, предоставляя структурированную контекстную информацию для модели. Для специальных наборов данных, содержащих сущности, при использовании обычных методов построения последовательностей, позиционная информация, содержащаяся в этих сущностях, будет утрачена. Поэтому это исследование строит последовательность с помощью метода, показанного в уравнении (2).

figure-protocol-3(2)

В уравнении (2) [E1], [/E1], [E2] и [/E2] — это жетоны, заданные для определения начальной и конечной позиции двух сущностей. Аналогично, после обработки Bert выходные функции этих токенов будут нести семантическую информацию соответствующих сущностей, что позволяет лучше использовать важную информацию о местоположении сущности. Впоследствии в этом исследовании используется модель GNN, учитывающая SDF, для улучшения особенностей распределения и экземпляров образцов. Структура модели показана на рисунке 3.

figure-protocol-4
Рисунок 3: Архитектура взаимодействия с двумя графами в модели нейронной сети с учётом распределения графов .На рисунке представлена архитектура взаимодействия признаков с двумя графами модели GNN с учетом распределения для классификации английского текста. Архитектура строит точечный граф для кодирования сходства на уровне экземпляра и граф распределения для кодирования сходства на уровне распределения, а также достигает улучшения признаков за счёт итеративного информационного взаимодействия между двумя графами, завершая межуровневый информационный цикл признаков экземпляра и характеристик распределения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Модель достигает усиления функций с помощью двухступенчатого механизма взаимодействия. Во-первых, он анализирует функции распределения из ассоциаций выборок данных на уровне экземпляра, а затем динамически оптимизирует особенности экземпляра через обмен информацией на уровне распределения. Путём итеративного усиления особенностей экземпляров и уровней распределения в конечном итоге завершает задачу классификации. В частности, модель использует точечные графики и графики распределения для достижения обмена информацией. Точечная карта использует вектор признаков текстовой выборки (обновляемый последними двумя слоями BERT) в качестве узла, количественно определяет разницу признаков выборки для вычисления веса рёбер через специальную сеть кодирования (один сигмоидный слой + два сверточных пакетных нормировочных слоя) и использует минимальную максимальную нормализацию для нормализации до интервала [0,1. Эмпирический порог сходства устанавливается 0,2 для порога рёбер, когда рёбра с весом ниже этого порога уменьшаются для устранения слабых корреляций на уровне экземпляров. Граф распределения принимает элементы распределения слияного текста как узлы, при этом веса рёбер рассчитываются на основе косинусного сходства векторов признаков распределения и нормализуются с помощью нормализации L2 для обеспечения метрической согласованности. Принимается порог рёбер 0,15, а рёбра с весами ниже этого значения удаляются, а оставшиеся допустимые веса рёбер дополнительно отображаются и стандартизируются многослойным перцептроном для повышения дискриминируемости ассоциаций на уровне распределения. В этом исследовании определяется точечный граф figure-protocol-5 для итерации l-слоя, где узел figure-protocol-6 представляет образцовые признаки, а ребро figure-protocol-7 кодирует сходство на уровне экземпляра. Карта figure-protocol-8распределения , узел figure-protocol-9 представляет образцовые признаки, а ребро figure-protocol-10 кодирует сходство на уровне распределения. Возьмём в качестве примера от l-го до l+1-го колеса, расчёт отношений на уровне экземпляра рассчитывает точечное сходство через различия признаков, как показано в уравнении (3).

figure-protocol-11 (3)

В уравнении (3) figure-protocol-12 и figure-protocol-13 — это веса рёбер между узлами i и j во время l-й и l-1-й итераций точечного графа, отражающих сходство признаков выборок. figure-protocol-14 — это сеть кодирования, используемая для преобразования различий признаков узлов в весовые шкалы ребер, состоящая из одного слоя сигмоидных и двух слоёв функций активации сверточных пакетных норм. Когда figure-protocol-15 и figure-protocol-16 — l-1-я итерация, собственные векторы узлов i и j обновляются Бертом в последних двух слоях. Затем характеристики распределения рассчитываются на основе соотношений экземпляров, как показано в уравнении (4).

figure-protocol-17(4)

В уравнении (4) figure-protocol-18 — собственный вектор узла i в графе распределения l-го слоя. MLP 1 — это многослойный перцептрон, состоящий из функций активации и полностью связанных слоёв, который отображает объединённые составные признаки в новые распределительные особенности. Затем рассчитывается распределение на основе характеристик распределения, а признаки экземпляра — из отношения распределения для завершения межуровневого информационного цикла.

Механизмы усовершенствования сложных систем
Для дальнейшего улучшения возможности обобщения CST применяется к вышеуказанной модели в данном исследовании. Динамическая эволюция сложных систем проявляется в гетерогенном распределении влияния узлов. Для моделирования доминирующей роли основной лексики в семантическом распространении языковых систем в этом исследовании вводится индекс центральности узлов для реконструкции механизма распространения информации. Точечный график Hp , построенный для каждой задачи сценария, использует алгоритм PageRank для количественной оценки центральности узла C(hi), как показано в уравнении (5)17.

figure-protocol-19(5)

В уравнении (5) α — коэффициент демпфирования, α = 0,85. N(hi) представляет множество соседних узлов, а L(h j) — степень узла. Уравнение (5) заменяет каскадный процесс распространения влияния словарного запаса в симулированных языковых сетях, позволяя основному словарному запасу (таким как глаголы и тематические слова) приобрести более высокую центральность. Затем центральность узла связывается с весами рёбер для динамической корректировки силы распространения информации между узлами. Функция связи λij показана в уравнении (6).

figure-protocol-20(6)

В уравнении (6) σ — это функция активации Сигмоида, W T — обучаемый вектор веса, а b — член смещения. Взаимодействие весов центральности и рёбер динамически уравновешивает локальные отношения с глобальным значением, тем самым повышая адаптивность модели к динамическим изменениям задач. Появление CST проявляется в английском языке как общая семантика, превосходящая сумму местногословарного запаса 18. Для использования этой функции в ETC в этом исследовании разрабатывается трехуровневая структура генерации прототипов, моделирующая процесс возникновения от микропризнаков к макрокатегориям, как показано на рисунке 4.

figure-protocol-21
Рисунок 4: Поэтапное построение микро-мезомакро-трехуровневой структуры генерации прототипов для лингвистической семантической эмерджентности. Иллюстрация иллюстрирует пошаговое построение трехуровневой модели прототипов микро-мезомакро для моделирования лингвистического семантического возникновения в классификации английских текстов. Фреймворк строит иерархические представления текстовых категорий через кластеризацию микроподклассов с K-средними, слияние прототипов подклассов мезоклассов на основе взвешивания сходства распределения и макронелинейную интеграцию через механизм внимания, имитируя возникающую характеристику «целое больше суммы своих частей» в языковых системах. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Вышеуказанный процесс пошагово строит представления текстовых категорий от микро к макро, чтобы повысить способность модели к обобщению. На микроуровне K подклассов генерируются путём кластеризации образцов вложенных представлений каждой категории текста. K-средние используются для разделения образцов внутри категории на подгруппы, а центральное положение каждой подгруппы вычисляется как прототипподкласса 19. На мезоскопическом уровне рассчитывается сходство распределения каждого прототипа подкласса, формируется матрица сходства, а затем прототипы подклассов собираются заново на основе весов сходства для количественной оценки корреляции между подклассами. Вычисление веса сходства подкласса wij показано в уравнении (7).

figure-protocol-22 (7)

В уравнении (7) figure-protocol-23 — это дивергенция Дженсена Шеннона, используемая для измерения разницы в распределении между двумя подклассами figure-protocol-24 и figure-protocol-2520. Наконец, прототипы подклассов взвешиваются и сливаются для получения набора представлений figure-protocol-26распределения классов . На макроуровне веса важности каждого подкласса изучаются с помощью механизмов внимания, а также вводятся нелинейные преобразования для моделирования процесса возникновения, в результате чего получается финальный прототип класса c, как показано в уравнении (8).

figure-protocol-27(8)

В уравнении (8) αk означает вес внимания k-класса. U обозначает нелинейную матрицу весов преобразования. tanh(·) используется для усиления нелинейного представления и моделирования общей суммы частей, характерных для сложных систем. Каждый уровень отражает разнообразие внутри категорий через структуру подклассов, взвешивает сходство распределения для снижения влияния шумных подклассов и динамически фокусируется на дискриминационных признаках через механизмы внимания для повышения способности модели к обобщению. CST в основном интегрирован с GNN через два механизма. Первый — ввести центральность узлов для реконструкции процесса распространения информации и моделирования гетерогенного распределения лексического влияния в языковой системе. Центральность узлов количественно измеряется алгоритмом PageRank и динамически связывается с весами рёбер, что позволяет основному словарю доминировать в семантическом распространении и повышает адаптивность модели к динамическим изменениям задач. Вторая — разработать трехуровневую структуру генерации прототипов — от кластеризации микроподклассов до слияния прототипов макрокатегорий, чтобы смоделировать возникающую характеристику в языковой системе, согласно которой «целое больше суммы его частей». Эта структура достигает иерархической интеграции от локальных признаков к глобальной семантике через распределение, сходство, взвешивание и механизмы внимания.

В заключение, основная инновация конструированной модели ETC заключается в глубокой интеграции идей CST в рамки GNN. Реконструируя механизм распространения информации через центральность узлов, модель моделирует ведущую роль основных элементов в языковой системе и повышает её адаптивность к динамике задач. Благодаря трехуровневой структуре генерации прототипов модель реализует процесс возникновения от локальных признаков к глобальной семантике, тем самым расширяя способность модели отражать разнообразие и дискриминационные признаки внутри категории. Этот метод избегает ограничений традиционных GNN, которые опираются только на связи на уровне экземпляра. Благодаря взаимодействию на уровне распределения и сложным характеристикам системы он предоставляет новое решение для улучшения возможности обобщения модели в сценариях с несколькими кадрами и кросс-доменными режимами.

Возникающие свойства CST соответствуют трехуровневой структуре генерации прототипов. В языковых системах принцип «целое больше суммы своих частей» проявляется как семантический скачок от локальных значений слов к общим категориям текста. В этом исследовании этот процесс моделируется с помощью трёхуровневого механизма генерации прототипов «микро-мезо-макро»: на микроуровне вложения образцов кластеризуются в прототипы подкласса; На уровне мезо эти прототипы взвешиваются и сливаются на основе сходства распределения; а на макроуровне прототипы конечных категорий синтезируются нелинейно с помощью механизма внимания. Например, в классификации настроений несколько негативных слов, таких как «разочаровывающий», «медленный» и «дорогой», смешиваются и трансформируются нелинейно, создавая сильное общее чувство «негативной оценки». Центральность узлов и гетерогенность в CST совпадают с механизмом распространения информации на основе реконструкции центральности узлов. Внутри языковых сетей влияние слов распределено неравномерно, при этом основные слова (например, глаголы, тематические термины) играют доминирующую роль в семантическом распространении. В данном исследовании количественно оценивается центральность узлов с помощью алгоритма PageRank и динамически связывает его с весами рёбер для корректировки интенсивности распространения информации между узлами. Например, при классификации новостей термин «выборы» занимает высокую центральную роль в политических текстах, что приводит к тому, что соседние узлы, такие как «голосование» и «кампания», приобретают более высокий вес при агрегации информации, тем самым усиливая семантическое представление этой темы. Динамический и адаптивный характер КСТ соответствует ГНН, осознавающим распределение, и обучающему экспериментальному механизму в мета-дистилляции. Языковые системы развиваются динамически в зависимости от контекста и требований к задаче. Модели фиксируют общие изменения распределения в наборах данных с учётом распределения GNN. Одновременно в TSMDM внедряется механизм обучающего эксперимента, управляемый мета-обучением, позволяющий TM динамически корректировать параметры на основе обратной связи от SM. Например, в междоменном анализе настроений модель может быстро адаптировать веса признаков на основе распределения данных целевого домена и уточнять параметры TM во время мета-дистилляции для повышения эффективности адаптации для новых доменов.

Модель LTC на основе TSMDM
Двухступенчатый конвейер мета-дистилляции
Для решения проблем высоких вычислительных затрат и трудностей развертывания в условиях ограниченных ресурсов предлагается лёгкая модель классификации текста на основе TSMDM. Этот метод мета-дистилляции выполняет процесс дистилляции в строгом последовательном порядке с двумя отдельными этапами. Второй этап начинается только после завершения и сближения обучения первого этапа: 1) этап сжатия знаний от учителя к ассистенту преподавателя (TA), и 2) этап лёгкой дистилляции от преподавателя к ученику, интегрируемый с адаптацией параметров мета-обучения. Этот подход обеспечивает эффективную передачу знаний от сложного TM к лёгкому SM через двухступенчатую дистилляцию, при этом внедряя механизм мета-обучения для динамической оптимизации стратегии передачи знанийв процессе 21,22. Общий конвейер иллюстрируется на рисунке 5.

figure-protocol-28
Рисунок 5: Конвейерное проектирование модели классификации лёгкого текста с двухступенчатым механизмом мета-дистилляции. На рисунке изображена конвейер модели легкой классификации текста с двухступенчатым механизмом мета-дистилляции (TSMDM). Конвейер включает модель учителя (источник знаний высокой сложности), модель ассистента преподавателя (буферный слой промежуточной сложности) и модель ученика (легкая целевая модель), а также реализует эффективную передачу знаний через два последовательных этапа: сжатие знаний от учителя к ассистенту преподавателя и лёгкую дистилляцию от ассистента преподавателя к ученику, интегрированную с мета-обучением. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Метод включает три функции: TM, модель TA и SM, процесс дистилляции разделён на два этапа: дистилляция учителя-TA и дистилляция TA-ученика. На первом этапе сжатия знаний от учителя к ассистенту знания из ТМ сначала сжимаются в модель ТА средней сложности для снижения потери информации, вызванной чрезмерными разрывами в ёмкости при прямой дистилляции. TM, выступая в роли источника знаний, переносит как свои вероятности классификации выхода, так и признаки промежуточного уровня в модель TA. Модель TA обучается путём выравнивания своих выходов и представлений признаков с результатами учителя, используя комбинированную функцию потерь, интегрирующую потери классификации и потери выравниванияпризнаков 21. На втором этапе лёгкой дистилляции от TA-до студента, который запускается после слияния модели TA, знания дополнительно передаются от модели TA до финальной легкой модели SM. На этом этапе также используется двойной надзор (классификационные логиты и промежуточные признаки) и мета-механизм обучения: TM проводит «учебные эксперименты» по вспомогательным задачам для оценки состояния обучения ученика и динамически корректирует свои параметры для предоставления более адаптивных и целенаправленных рекомендаций. SM завершает обучение, минимизируя как выходные различия, так и расстояние признаков относительно модели TA, тем самым достигая значительного снижения параметров при максимальном сохранении эффективностиклассификации 22.

Мета-обучение с обучающими экспериментами
В традиционных методах дистилляции на основе знаний обученный ТМ направляет SM, участвуя в расчёте потерь. Однако фиксированные параметры ТМ сложно оценить фактический статус обучения СМ, и они не могут количественно оценить конкретный вклад их рекомендаций в обновление параметровСМ 23,24. Таким образом, данное исследование вводит идеи мета-обучения в процесс дистилляции, позволяя ТМ корректировать свои параметры на основе обратной связи обучения СМ. Процесс дистилляции показан на рисунке 6.

figure-protocol-29
Рисунок 6: Итеративный процесс оптимизации параметров мета-дистилляции в сочетании с обучающим механизмом эксперимента. На рисунке изображен итеративный процесс оптимизации параметров мета-дистилляции в сочетании с механизмом обучающего эксперимента для облегчения модели классификации текста на английском языке. Процесс генерирует временного внутреннего ученика из модели учащегося, количественно оценивает потерю эффекта преподавания через имитируемую тренировочную эффективность внутреннего ученика и позволяет модели учителя корректировать свои параметры через обратное распространение потери, тем самым оптимизируя последующую стратегию передачи знаний. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

TM оптимизирует параметры с помощью традиционных задач классификации на собственной фазе обучения, что приводит к базовой потере классификации LT, отражающей его исходную производительность. После завершения обучения SM S реплицируется для получения временной копии внутреннего ученика S1. TM проводит обучающие эксперименты по S1, и комплексная ошибка производительности, проявленная S1 в этом смоделированном обучении, квантифицируется как потеря LQ. Этот сигнал используется как обратная связь с TM для оценки эффективности преподавания. Благодаря обратному распространению LQ TM активно корректирует свои параметры и оптимизирует метод передачи знаний. После завершения оптимизации мета-обучения TM выполняет формальную дистилляцию знаний на исходном SM S, а также использует потерю модели L S в качестве обратной связи для обучения эффективности TM. Для достижения упрощения модели ETC в этом исследовании будет рассмотрено включение модели SDF GNN в качестве TM в процесс обучающего эксперимента, как показано на рисунке 7.

figure-protocol-30
Рисунок 7: Поток обновления параметров в механизме обучающего эксперимента для оптимизации модели учителя в мета-дистилляции. На рисунке показана процесс обновления параметров в механизме эксперимента обучения для оптимизации модели учителя в процессе мета-дистилляции. Поток сначала вычисляет мягкие потери между предсказанием внутреннего учащегося и предсказанием модели учителя с функцией среднего квадрата потери ошибки, комбинирует мягкие потери с жёсткой ошибкой метки для формирования общей обучающей потери и обновляет параметры модели учителя через обратное распространение взвешенной общей ошибки для повышения эффективности преподавания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

После завершения обучения по дистилляции знаний SM сначала вычисляет разницу между предсказанными результатами TM и истинными метками. Впоследствии функция потерь MSE используется для измерения расстояния между предсказанием SM (внутренний обучающийся S1) и прогнозом TM. Это значение расстояния используется как мягкийпотерь 25. Итоговая цель обучения состоит из взвешенной комбинации жёсткой ошибки маркировки и мягкого потерь. Путём обратного распространения взвешенной общей ошибки параметры TM обновляются, что повышает эффективность обучения TM. Расчет параметров внутреннего учащегося S1 показан в уравнении (9).

figure-protocol-31(9)

В уравнении (9) figure-protocol-32 и figure-protocol-33 — внутренние параметры обучающегося и их начальные параметры, на которые влияет параметр TM γT. λ (скорость обучения, λ = 0,005) управляет размером шага обновления параметров для внутренних учащихся (то есть копий SM) во времямета-дистилляции 26. Уравнение (9) вычисляет градиенты потерь через обратное распространение, а λ обновляет параметры внутренних учащихся. Этот механизм отражает особенности обучения SM, позволяя TM получать обратную связь и корректировать свои методы преподавания, тем самым повышая эффективность последующего синтеза знаний. Расчёт потерьL S в мета-обучении показан в уравнении (10).

figure-protocol-34 (10)

В уравнении (10) B — это мета-обучающая последовательность выборки.

Оптимизация передачи знаний с помощью проектирования потерь и модели помощника
Для дальнейшего повышения эффективности дистилляции знаний это исследование определяет общую потерю за счет расчёта потери классификации и потери признаков. Среди них потеря признаков использует ретроспективный механизм, использующий мелкие и текущие выходы признаков TM для управления SM, как это выражено в уравнении (11).

figure-protocol-35(11)

В уравнении (11) I — это множество индексов слоёв признаков. D — это функция расстояния, используемая для вычисления разницы между двумя представлениями признаков. и являются функциями объективного представления в TM и SM, которые преобразуют выходные figure-protocol-36 признаки и figure-protocol-37 i-го и j-го слоёв в матрицы внимания.figure-protocol-38 figure-protocol-39 Потери классификации объединяют потери по перекрестной энтропии между выходом SM и истинной меткой, а также MSE между выходом двух моделей, как мягкие потери27,28. В конечном итоге общая потеря достигается за счёт взвешивания обоих, что помогает SM лучше получать руководство от TM. Чтобы минимизировать потерю производительности в процессе дистилляции знаний, в этом исследовании модель ассистента преподавателя размещается между двумя моделями, как показано на рисунке 8.

figure-protocol-40
Рисунок 8: Двухступенчатый процесс обработки дистилляции знаний с моделью ассистента преподавателя в качестве промежуточного буферного слоя. На рисунке демонстрируется двухэтапный процесс обработки дистилляции знаний с моделью ассистента преподавателя в качестве промежуточного буферного слоя. Первая ступень объединяет потери особенностей и потери классификации для построения полных потерь дистилляции и обучает модель ассистента преподавателя знаниям модели учителя; На втором этапе применяется та же стратегия слияния потерь, чтобы перевести знания модели ассистента преподавателя в модель ученика, снижая потери информации, вызванные чрезмерными разрывами сложности между моделями учителя и ученика. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

После завершения этапа мета-дистилляции модель TA и TM проходят традиционную дистилляцию знаний. В ходе этого процесса признаки обоих случаев синхронно извлекаются, и соответствующая потеря La вычисляется. Впоследствии эти потери признаков объединяются с классификационными потерями LM1 модели для формирования функции figure-protocol-41 потерь дистилляции на первой ступени, как показано в уравнении (12).

figure-protocol-42(12)

В уравнении (12) β — коэффициент веса, используемый для контроля доли потери признаков и потерь классификации в общей потере. а также являются функциями объективного представления в модели ассистента преподавателя и TM, которые преобразуют выходы figure-protocol-43 признаков i-го figure-protocol-44 и j-го слоёв в матрицы внимания.figure-protocol-45 figure-protocol-46 zT и zM — это выходы модели TM и ассистента. Процесс дистилляции от модели ассистента преподавателя к SM совпадает с предыдущим процессом, что минимизирует потерю SM при нескольких итерациях для полной передачи знаний.

В заключение, основной вклад предлагаемого TSMDM заключается в оптимизации процесса передачи знаний через механизм мета-обучения. По сравнению с традиционной дистилляцией, основное преимущество этого метода заключается в его динамической способности к обучению: TM может корректировать свои параметры через механизм обучающего эксперимента на основе обратной связи в реальном времени от SM, тем самым обеспечивая более целенаправленное руководство. Тем временем модель ассистента преподавателя введена как буферный слой, эффективно преодолевая разрыв в сложности между TM и SM и снижая потерю информации при передаче знаний. Совместное проектирование этой «стратегии обучения с оптимизацией мета-обучения» и «двухуровневой буферизации для снижения сложности переноса» позволяет финальному SM значительно облегчить вес, сохраняя при этом основные знания, извлечённые из сложного TM в максимальной степени.

Доступность данных
Наборы данных, созданные в ходе текущего исследования и/или проанализированные в ходе текущего исследования, представлены в Дополнительном файле 1.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальная настройка и набор данных:
Для всесторонней оценки производительности и лёгкой эффективности предлагаемой модели в задачах междоменной классификации проводятся эксперименты с четырьмя наборами данных: FewRel (реляционная классификация малых выборок), ARSC (анализ настроений между областями), Reuters-21578 (многотематическая классификация новостей) и ArXiv (длинные академические аннотации). FewRel, широко используемый набор реляционной классификации ма...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для повышения возможности обобщения ETC в малочисленных и кросс-доменных сценариях, одновременно снижая вычислительные затраты, в этом исследовании предлагается лёгкий фреймворк классификации текста, интегрирующий CST с TSMDM. Интеграция CST с фреймворком TSMDM решает основные ограничения существующих методов ETC (слабое обобщение на несколько кадров/кросс-доменов и высокие вычислительные затраты), внедряя лингвистическую динамику системы и возникающие семантические свойства в дизайн мод...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего признавать.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Центральный процессор (ЦП)Коммерческие поставщики оборудования (Intel, Dell, Lenovo)Intel i5-7300HQАппаратные характеристики
Графический процессор (ГП)Коммерческие поставщики оборудования (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 ГБ VRAMАппаратные характеристики
Оперативная память (ОЗУ)Коммерческие поставщики оборудования16 ГБ DDR4Аппаратные характеристики
Твердотельный накопитель (SSD)Коммерческие поставщики оборудования1 ТБ NVMe SSDАппаратные характеристики
Операционная системаОфициальный сайт MicrosoftWindows 10 (64-bit)Системное ПО
PythonОфициальный сайт Python (python.org)Python 3.8Язык программирования
PyTorchОфициальный сайт PyTorch (pytorch.org)PyTorch 1.11.0Фреймворки и основные библиотеки для глубокого обучения
CUDAОфициальный сайт NVIDIACUDA 11.3Фреймворки и основные библиотеки для глубокого обучения
Hugging Face TransformersHugging Face Hub (huggingface.co)Стабильная версия (адаптированная для Python 3.8/PyTorch 1.11.0)Фреймворки и основные библиотеки для глубокого обучения
NumPyPyPI (pypi.org)Стабильная версия (адаптированная для Python 3.8)Библиотеки для обработки данных и статистического анализа
PandasPyPI (pypi.org)Стабильная версия (адаптированная для Python 3.8)Библиотеки для обработки данных и статистического анализа
Scikit-learnPyPI (pypi.org)Стабильная версия (адаптированная для Python 3.8)Библиотеки для обработки данных и статистического анализа
SciPyPyPI (pypi.org)Стабильная версия (адаптированная для Python 3.8)Библиотеки для обработки данных и статистического анализа
MatplotlibPyPI (pypi.org)Стабильная версия (адаптированная для Python 3.8)Библиотека для визуализации
AdamWВстроенный в PyTorchИнтегрирован в PyTorch 1.11.0Оптимизатор
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Предварительно обученные модели
FewRelОфициальное репозиторий FewRel (GitHub) / Wikipedia100 категорий семантических отношений, 700 предложений на категорию; разделение на тренировочную/валидационную/тестовую выборку (5:2:3)Наборы данных
ARSCПубличные наборы данных для анализа сентиментов из разных областей (GitHub/ACL Anthology)23 категории продуктов Amazon, 69 задачи бинарного анализа сентиментов; разделение на тренировочную/валидационную/тестовую выборку (4:2:3)Наборы данных
Reuters-21578Репозиторий машинного обучения UCI / Официальный архив Reuters21 578 новостных статей, 90 тематических категорий; метод разбиения ModApteНаборы данных
ArXivОткрытый API ArXiv (arxiv.org)Абстрактные статей по теории компьютерных наук; разделение на тренировочную/валидационную/тестовую выборку (7:2:1)Наборы данных
ТокенайзерHugging Face Hub (huggingface.co)Токенайзер BERT-base-casedДругие важные инструменты
GitОфициальный сайт Git (git-scm.com)Последняя стабильная версияДругие важные инструменты

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Похожие статьи