$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Для повышения способности к обобщению ETC в сценариях небольших выборок и междоменных областей и реализации лёгкой модели в этом исследовании предлагается структура классификации текста, интегрирующая CST и TSMDM. Общий процесс работы этой структуры показан на рисунке 1.

Рисунок 1: Визуализация четырёхступенчатого облегченного фреймворка классификации английского текста, интегрирующего CST и TSMDM. Рабочий процесс состоит из четырёх этапов. Этап 1 выполняет представление текста с использованием динамических эмбеддингов на основе BERT из входного английского текста. Этап 2 применяет моделирование нейронных сетей графов путём построения текстового графа и вычисления отношений на уровне экземпляра и распределения. Этап 3 моделирует семантическое возникновение через реконструкцию центральности узлов и многоуровневую структуру генерации прототипов для получения конечного прототипа категории. Этап 4 проводит двухступенчатую элементную дистилляцию, при которой обучается модель учителя, а знания передаются через мета-дистилляцию для получения конечной модели ученика. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Во-первых, на этапе представления текста и динамического вложения используется модель BERT для динамического встраивания входного текста и захвата контекстуальной семантической информации. Второй этап — моделирование GNN, ориентированное на распределение, которое учитывает характеристики распределения выборок, строит модель GNN и улучшает представление признаков через двойное информационное взаимодействие на уровне экземпляра и уровня распределения. Третий этап — это семантическое моделирование возникновения, основанное на теории гибридных систем, вводящее реконструкцию центральности узлов и трёхуровневый механизм генерации прототипов для моделирования динамики и возникновения языковой системы. Наконец, на четвёртом этапе проводится двухуровневая мета-дистилляционная легкая операция. Процесс дистилляции знаний оптимизируется с помощью ассистент-модели и стратегии мета-обучения для достижения эффективного сжатия и ускорения моделей.
Модель ETC, основанная на характеристиках распределения и CST
Обзор архитектуры модели
Предлагаемая модель классификации текста сначала использует предварительно обученный BERT для динамического контекстного кодирования входного текста, генерируя семантически богатые вложения слов и глобальное представление. Далее из этих признаков строятся граф экземпляра и граф распределения: граф экземпляра фиксирует попарные сходства выборок, а граф распределения моделирует общее распределение данных; Итеративный обмен информацией между двумя графами обеспечивает синергетическое улучшение отдельных признаков и глобальной структуры. Впоследствии CST интегрируется для глубокого расширения графовой сети. Реконструкция центральности узлов использует PageRank для количественной оценки лексического влияния, моделируя доминирующую роль основных элементов в языковых сетях. Это широко проверенный метод измерения глобального влияния узлов в сложных сетевых топологиях, который хорошо подходит для отражения асимметричного семантического распространения основных лексических узлов в языковых системах. Трехуровневая структура генерации прототипов «микро-мезо-макро» эмулирует возникающий процесс — от локальной семантики к целостным представлениям категорий. Наконец, расширенные представления признаков подаются в классификатор для получения окончательных вероятностей класса.
Взаимодействие функций с GNN, ориентированным на распределение
Для оптимизации возможности обобщения ETC, эффективного захвата сложных семантических связей между текстами и признаками распределения образцов (SDF), это исследование строит модель ETC на основе признаков распределения и CST. Он достигает глубокого анализа глобальной и локальной информации в тексте за счёт интеграции таких механизмов, как GNN и динамическое вложение текста. GNN — это модель DL, специально разработанная для обработки графово-структурированных данных. Основной принцип заключается в использовании механизма передачи сообщений (когда каждый узел в графе агрегирует информацию о признаках соседних узлов) и комбинировании её со своим состоянием. Через несколько раундов итеративных обновлений он постепенно осваивает высокомерное представление, включающее структуру топологии. Этот процесс позволяет узлам фиксировать зависимости от структуры и признаков локального окружения и даже глобального графа. Для преодоления ограничений традиционных моделей последовательностей в моделировании долгосрочных зависимостей и глобальных отношений в этом исследовании используется GNN для фиксации сложных семантических и структурных связей между выборками. Из-за фокуса GNN на информации о прямой корреляции между отдельными образцами, он игнорирует общие характеристики распределения выборочногонабора 14,15,16. Поэтому в данном исследовании предложена модель GNN, учитывающая SDF. Эта модель вводит BERT для динамического вложения текста и объединяет его с прототипной сетью для вычисления различий в признаках выборок. BERT — это предварительно обученная языковая модель, основанная на архитектуре Transformer. Основной принцип заключается в одновременном захвате семантической информации каждого слова в контексте с помощью двунаправленного кодировщика и предварительном обучении на крупномасштабном корпусе с помощью двух задач: «маскированной языковой модели» и «предсказания следующего предложения». В маскированных языковых моделях некоторые слова на входе случайно маскированы, и модели необходимо предсказывать исходное слово на основе контекста. Следующее предсказание определяет, являются ли два предложения последовательными. После предварительного обучения BERT может быстро адаптироваться к различным задачам обработки естественного языка за счёт тонкой настройки, значительно повышая производительность и предоставляя высококачественные представления признаков для последующего построения структуры графов. Конкретная структура модели ETC, построенной в этом исследовании, показана на рисунке 2.

Рисунок 2: Архитектурное проектирование интегрированной с CST английской модели классификации текста с учётом особенностей распределения образцов. На рисунке представлен архитектурный дизайн английской модели классификации текста, интегрированный с теорией сложных систем (CST) и учёт характеристик распределения образцов текста. Архитектура объединяет динамическое контекстное вложение на базе BERT, нейронные сети графов с учётом распределения (GNN) и механизмы улучшения CST, а также реализует глубокий анализ глобальной и локальной семантической информации в английских текстах посредством многомодульного совместного моделирования. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
В этой модели, для общего набора данных, английский текст в модель BERT генерирует последовательность токенов через токенайзер. Метод построения последовательностей показан в уравнении (1).
[CLS], 1,2,... an, [SEP] (1)
В уравнении (1) [CLS] — это маркер классификации, расположенный в начале последовательности. BERT генерирует фиксированное состояние скрытого положения для [CLS] во время обучения. Это состояние напрямую используется для глобального семантического представления всего текста. 1,2,... n обозначает слово или подслово в тексте. [SEP] — это разделитель, используемый для обозначения конца предложения. После обработки вышеуказанной последовательности Бертом получаются признаки каждого токена, предоставляя структурированную контекстную информацию для модели. Для специальных наборов данных, содержащих сущности, при использовании обычных методов построения последовательностей, позиционная информация, содержащаяся в этих сущностях, будет утрачена. Поэтому это исследование строит последовательность с помощью метода, показанного в уравнении (2).
(2)
В уравнении (2) [E1], [/E1], [E2] и [/E2] — это жетоны, заданные для определения начальной и конечной позиции двух сущностей. Аналогично, после обработки Bert выходные функции этих токенов будут нести семантическую информацию соответствующих сущностей, что позволяет лучше использовать важную информацию о местоположении сущности. Впоследствии в этом исследовании используется модель GNN, учитывающая SDF, для улучшения особенностей распределения и экземпляров образцов. Структура модели показана на рисунке 3.

Рисунок 3: Архитектура взаимодействия с двумя графами в модели нейронной сети с учётом распределения графов .На рисунке представлена архитектура взаимодействия признаков с двумя графами модели GNN с учетом распределения для классификации английского текста. Архитектура строит точечный граф для кодирования сходства на уровне экземпляра и граф распределения для кодирования сходства на уровне распределения, а также достигает улучшения признаков за счёт итеративного информационного взаимодействия между двумя графами, завершая межуровневый информационный цикл признаков экземпляра и характеристик распределения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Модель достигает усиления функций с помощью двухступенчатого механизма взаимодействия. Во-первых, он анализирует функции распределения из ассоциаций выборок данных на уровне экземпляра, а затем динамически оптимизирует особенности экземпляра через обмен информацией на уровне распределения. Путём итеративного усиления особенностей экземпляров и уровней распределения в конечном итоге завершает задачу классификации. В частности, модель использует точечные графики и графики распределения для достижения обмена информацией. Точечная карта использует вектор признаков текстовой выборки (обновляемый последними двумя слоями BERT) в качестве узла, количественно определяет разницу признаков выборки для вычисления веса рёбер через специальную сеть кодирования (один сигмоидный слой + два сверточных пакетных нормировочных слоя) и использует минимальную максимальную нормализацию для нормализации до интервала [0,1. Эмпирический порог сходства устанавливается 0,2 для порога рёбер, когда рёбра с весом ниже этого порога уменьшаются для устранения слабых корреляций на уровне экземпляров. Граф распределения принимает элементы распределения слияного текста как узлы, при этом веса рёбер рассчитываются на основе косинусного сходства векторов признаков распределения и нормализуются с помощью нормализации L2 для обеспечения метрической согласованности. Принимается порог рёбер 0,15, а рёбра с весами ниже этого значения удаляются, а оставшиеся допустимые веса рёбер дополнительно отображаются и стандартизируются многослойным перцептроном для повышения дискриминируемости ассоциаций на уровне распределения. В этом исследовании определяется точечный граф
для итерации l-слоя, где узел
представляет образцовые признаки, а ребро
кодирует сходство на уровне экземпляра. Карта
распределения , узел
представляет образцовые признаки, а ребро
кодирует сходство на уровне распределения. Возьмём в качестве примера от l-го до l+1-го колеса, расчёт отношений на уровне экземпляра рассчитывает точечное сходство через различия признаков, как показано в уравнении (3).
(3)
В уравнении (3)
и
— это веса рёбер между узлами i и j во время l-й и l-1-й итераций точечного графа, отражающих сходство признаков выборок.
— это сеть кодирования, используемая для преобразования различий признаков узлов в весовые шкалы ребер, состоящая из одного слоя сигмоидных и двух слоёв функций активации сверточных пакетных норм. Когда
и
— l-1-я итерация, собственные векторы узлов i и j обновляются Бертом в последних двух слоях. Затем характеристики распределения рассчитываются на основе соотношений экземпляров, как показано в уравнении (4).
(4)
В уравнении (4)
— собственный вектор узла i в графе распределения l-го слоя. MLP 1 — это многослойный перцептрон, состоящий из функций активации и полностью связанных слоёв, который отображает объединённые составные признаки в новые распределительные особенности. Затем рассчитывается распределение на основе характеристик распределения, а признаки экземпляра — из отношения распределения для завершения межуровневого информационного цикла.
Механизмы усовершенствования сложных систем
Для дальнейшего улучшения возможности обобщения CST применяется к вышеуказанной модели в данном исследовании. Динамическая эволюция сложных систем проявляется в гетерогенном распределении влияния узлов. Для моделирования доминирующей роли основной лексики в семантическом распространении языковых систем в этом исследовании вводится индекс центральности узлов для реконструкции механизма распространения информации. Точечный график Hp , построенный для каждой задачи сценария, использует алгоритм PageRank для количественной оценки центральности узла C(hi), как показано в уравнении (5)17.
(5)
В уравнении (5) α — коэффициент демпфирования, α = 0,85. N(hi) представляет множество соседних узлов, а L(h j) — степень узла. Уравнение (5) заменяет каскадный процесс распространения влияния словарного запаса в симулированных языковых сетях, позволяя основному словарному запасу (таким как глаголы и тематические слова) приобрести более высокую центральность. Затем центральность узла связывается с весами рёбер для динамической корректировки силы распространения информации между узлами. Функция связи λij показана в уравнении (6).
(6)
В уравнении (6) σ — это функция активации Сигмоида, W T — обучаемый вектор веса, а b — член смещения. Взаимодействие весов центральности и рёбер динамически уравновешивает локальные отношения с глобальным значением, тем самым повышая адаптивность модели к динамическим изменениям задач. Появление CST проявляется в английском языке как общая семантика, превосходящая сумму местногословарного запаса 18. Для использования этой функции в ETC в этом исследовании разрабатывается трехуровневая структура генерации прототипов, моделирующая процесс возникновения от микропризнаков к макрокатегориям, как показано на рисунке 4.

Рисунок 4: Поэтапное построение микро-мезомакро-трехуровневой структуры генерации прототипов для лингвистической семантической эмерджентности. Иллюстрация иллюстрирует пошаговое построение трехуровневой модели прототипов микро-мезомакро для моделирования лингвистического семантического возникновения в классификации английских текстов. Фреймворк строит иерархические представления текстовых категорий через кластеризацию микроподклассов с K-средними, слияние прототипов подклассов мезоклассов на основе взвешивания сходства распределения и макронелинейную интеграцию через механизм внимания, имитируя возникающую характеристику «целое больше суммы своих частей» в языковых системах. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Вышеуказанный процесс пошагово строит представления текстовых категорий от микро к макро, чтобы повысить способность модели к обобщению. На микроуровне K подклассов генерируются путём кластеризации образцов вложенных представлений каждой категории текста. K-средние используются для разделения образцов внутри категории на подгруппы, а центральное положение каждой подгруппы вычисляется как прототипподкласса 19. На мезоскопическом уровне рассчитывается сходство распределения каждого прототипа подкласса, формируется матрица сходства, а затем прототипы подклассов собираются заново на основе весов сходства для количественной оценки корреляции между подклассами. Вычисление веса сходства подкласса wij показано в уравнении (7).
(7)
В уравнении (7)
— это дивергенция Дженсена Шеннона, используемая для измерения разницы в распределении между двумя подклассами
и
20. Наконец, прототипы подклассов взвешиваются и сливаются для получения набора представлений
распределения классов . На макроуровне веса важности каждого подкласса изучаются с помощью механизмов внимания, а также вводятся нелинейные преобразования для моделирования процесса возникновения, в результате чего получается финальный прототип класса c, как показано в уравнении (8).
(8)
В уравнении (8) αk означает вес внимания k-класса. U обозначает нелинейную матрицу весов преобразования. tanh(·) используется для усиления нелинейного представления и моделирования общей суммы частей, характерных для сложных систем. Каждый уровень отражает разнообразие внутри категорий через структуру подклассов, взвешивает сходство распределения для снижения влияния шумных подклассов и динамически фокусируется на дискриминационных признаках через механизмы внимания для повышения способности модели к обобщению. CST в основном интегрирован с GNN через два механизма. Первый — ввести центральность узлов для реконструкции процесса распространения информации и моделирования гетерогенного распределения лексического влияния в языковой системе. Центральность узлов количественно измеряется алгоритмом PageRank и динамически связывается с весами рёбер, что позволяет основному словарю доминировать в семантическом распространении и повышает адаптивность модели к динамическим изменениям задач. Вторая — разработать трехуровневую структуру генерации прототипов — от кластеризации микроподклассов до слияния прототипов макрокатегорий, чтобы смоделировать возникающую характеристику в языковой системе, согласно которой «целое больше суммы его частей». Эта структура достигает иерархической интеграции от локальных признаков к глобальной семантике через распределение, сходство, взвешивание и механизмы внимания.
В заключение, основная инновация конструированной модели ETC заключается в глубокой интеграции идей CST в рамки GNN. Реконструируя механизм распространения информации через центральность узлов, модель моделирует ведущую роль основных элементов в языковой системе и повышает её адаптивность к динамике задач. Благодаря трехуровневой структуре генерации прототипов модель реализует процесс возникновения от локальных признаков к глобальной семантике, тем самым расширяя способность модели отражать разнообразие и дискриминационные признаки внутри категории. Этот метод избегает ограничений традиционных GNN, которые опираются только на связи на уровне экземпляра. Благодаря взаимодействию на уровне распределения и сложным характеристикам системы он предоставляет новое решение для улучшения возможности обобщения модели в сценариях с несколькими кадрами и кросс-доменными режимами.
Возникающие свойства CST соответствуют трехуровневой структуре генерации прототипов. В языковых системах принцип «целое больше суммы своих частей» проявляется как семантический скачок от локальных значений слов к общим категориям текста. В этом исследовании этот процесс моделируется с помощью трёхуровневого механизма генерации прототипов «микро-мезо-макро»: на микроуровне вложения образцов кластеризуются в прототипы подкласса; На уровне мезо эти прототипы взвешиваются и сливаются на основе сходства распределения; а на макроуровне прототипы конечных категорий синтезируются нелинейно с помощью механизма внимания. Например, в классификации настроений несколько негативных слов, таких как «разочаровывающий», «медленный» и «дорогой», смешиваются и трансформируются нелинейно, создавая сильное общее чувство «негативной оценки». Центральность узлов и гетерогенность в CST совпадают с механизмом распространения информации на основе реконструкции центральности узлов. Внутри языковых сетей влияние слов распределено неравномерно, при этом основные слова (например, глаголы, тематические термины) играют доминирующую роль в семантическом распространении. В данном исследовании количественно оценивается центральность узлов с помощью алгоритма PageRank и динамически связывает его с весами рёбер для корректировки интенсивности распространения информации между узлами. Например, при классификации новостей термин «выборы» занимает высокую центральную роль в политических текстах, что приводит к тому, что соседние узлы, такие как «голосование» и «кампания», приобретают более высокий вес при агрегации информации, тем самым усиливая семантическое представление этой темы. Динамический и адаптивный характер КСТ соответствует ГНН, осознавающим распределение, и обучающему экспериментальному механизму в мета-дистилляции. Языковые системы развиваются динамически в зависимости от контекста и требований к задаче. Модели фиксируют общие изменения распределения в наборах данных с учётом распределения GNN. Одновременно в TSMDM внедряется механизм обучающего эксперимента, управляемый мета-обучением, позволяющий TM динамически корректировать параметры на основе обратной связи от SM. Например, в междоменном анализе настроений модель может быстро адаптировать веса признаков на основе распределения данных целевого домена и уточнять параметры TM во время мета-дистилляции для повышения эффективности адаптации для новых доменов.
Модель LTC на основе TSMDM
Двухступенчатый конвейер мета-дистилляции
Для решения проблем высоких вычислительных затрат и трудностей развертывания в условиях ограниченных ресурсов предлагается лёгкая модель классификации текста на основе TSMDM. Этот метод мета-дистилляции выполняет процесс дистилляции в строгом последовательном порядке с двумя отдельными этапами. Второй этап начинается только после завершения и сближения обучения первого этапа: 1) этап сжатия знаний от учителя к ассистенту преподавателя (TA), и 2) этап лёгкой дистилляции от преподавателя к ученику, интегрируемый с адаптацией параметров мета-обучения. Этот подход обеспечивает эффективную передачу знаний от сложного TM к лёгкому SM через двухступенчатую дистилляцию, при этом внедряя механизм мета-обучения для динамической оптимизации стратегии передачи знанийв процессе 21,22. Общий конвейер иллюстрируется на рисунке 5.

Рисунок 5: Конвейерное проектирование модели классификации лёгкого текста с двухступенчатым механизмом мета-дистилляции. На рисунке изображена конвейер модели легкой классификации текста с двухступенчатым механизмом мета-дистилляции (TSMDM). Конвейер включает модель учителя (источник знаний высокой сложности), модель ассистента преподавателя (буферный слой промежуточной сложности) и модель ученика (легкая целевая модель), а также реализует эффективную передачу знаний через два последовательных этапа: сжатие знаний от учителя к ассистенту преподавателя и лёгкую дистилляцию от ассистента преподавателя к ученику, интегрированную с мета-обучением. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Метод включает три функции: TM, модель TA и SM, процесс дистилляции разделён на два этапа: дистилляция учителя-TA и дистилляция TA-ученика. На первом этапе сжатия знаний от учителя к ассистенту знания из ТМ сначала сжимаются в модель ТА средней сложности для снижения потери информации, вызванной чрезмерными разрывами в ёмкости при прямой дистилляции. TM, выступая в роли источника знаний, переносит как свои вероятности классификации выхода, так и признаки промежуточного уровня в модель TA. Модель TA обучается путём выравнивания своих выходов и представлений признаков с результатами учителя, используя комбинированную функцию потерь, интегрирующую потери классификации и потери выравниванияпризнаков 21. На втором этапе лёгкой дистилляции от TA-до студента, который запускается после слияния модели TA, знания дополнительно передаются от модели TA до финальной легкой модели SM. На этом этапе также используется двойной надзор (классификационные логиты и промежуточные признаки) и мета-механизм обучения: TM проводит «учебные эксперименты» по вспомогательным задачам для оценки состояния обучения ученика и динамически корректирует свои параметры для предоставления более адаптивных и целенаправленных рекомендаций. SM завершает обучение, минимизируя как выходные различия, так и расстояние признаков относительно модели TA, тем самым достигая значительного снижения параметров при максимальном сохранении эффективностиклассификации 22.
Мета-обучение с обучающими экспериментами
В традиционных методах дистилляции на основе знаний обученный ТМ направляет SM, участвуя в расчёте потерь. Однако фиксированные параметры ТМ сложно оценить фактический статус обучения СМ, и они не могут количественно оценить конкретный вклад их рекомендаций в обновление параметровСМ 23,24. Таким образом, данное исследование вводит идеи мета-обучения в процесс дистилляции, позволяя ТМ корректировать свои параметры на основе обратной связи обучения СМ. Процесс дистилляции показан на рисунке 6.

Рисунок 6: Итеративный процесс оптимизации параметров мета-дистилляции в сочетании с обучающим механизмом эксперимента. На рисунке изображен итеративный процесс оптимизации параметров мета-дистилляции в сочетании с механизмом обучающего эксперимента для облегчения модели классификации текста на английском языке. Процесс генерирует временного внутреннего ученика из модели учащегося, количественно оценивает потерю эффекта преподавания через имитируемую тренировочную эффективность внутреннего ученика и позволяет модели учителя корректировать свои параметры через обратное распространение потери, тем самым оптимизируя последующую стратегию передачи знаний. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
TM оптимизирует параметры с помощью традиционных задач классификации на собственной фазе обучения, что приводит к базовой потере классификации LT, отражающей его исходную производительность. После завершения обучения SM S реплицируется для получения временной копии внутреннего ученика S1. TM проводит обучающие эксперименты по S1, и комплексная ошибка производительности, проявленная S1 в этом смоделированном обучении, квантифицируется как потеря LQ. Этот сигнал используется как обратная связь с TM для оценки эффективности преподавания. Благодаря обратному распространению LQ TM активно корректирует свои параметры и оптимизирует метод передачи знаний. После завершения оптимизации мета-обучения TM выполняет формальную дистилляцию знаний на исходном SM S, а также использует потерю модели L S в качестве обратной связи для обучения эффективности TM. Для достижения упрощения модели ETC в этом исследовании будет рассмотрено включение модели SDF GNN в качестве TM в процесс обучающего эксперимента, как показано на рисунке 7.

Рисунок 7: Поток обновления параметров в механизме обучающего эксперимента для оптимизации модели учителя в мета-дистилляции. На рисунке показана процесс обновления параметров в механизме эксперимента обучения для оптимизации модели учителя в процессе мета-дистилляции. Поток сначала вычисляет мягкие потери между предсказанием внутреннего учащегося и предсказанием модели учителя с функцией среднего квадрата потери ошибки, комбинирует мягкие потери с жёсткой ошибкой метки для формирования общей обучающей потери и обновляет параметры модели учителя через обратное распространение взвешенной общей ошибки для повышения эффективности преподавания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
После завершения обучения по дистилляции знаний SM сначала вычисляет разницу между предсказанными результатами TM и истинными метками. Впоследствии функция потерь MSE используется для измерения расстояния между предсказанием SM (внутренний обучающийся S1) и прогнозом TM. Это значение расстояния используется как мягкийпотерь 25. Итоговая цель обучения состоит из взвешенной комбинации жёсткой ошибки маркировки и мягкого потерь. Путём обратного распространения взвешенной общей ошибки параметры TM обновляются, что повышает эффективность обучения TM. Расчет параметров внутреннего учащегося S1 показан в уравнении (9).
(9)
В уравнении (9)
и
— внутренние параметры обучающегося и их начальные параметры, на которые влияет параметр TM γT. λ (скорость обучения, λ = 0,005) управляет размером шага обновления параметров для внутренних учащихся (то есть копий SM) во времямета-дистилляции 26. Уравнение (9) вычисляет градиенты потерь через обратное распространение, а λ обновляет параметры внутренних учащихся. Этот механизм отражает особенности обучения SM, позволяя TM получать обратную связь и корректировать свои методы преподавания, тем самым повышая эффективность последующего синтеза знаний. Расчёт потерьL S в мета-обучении показан в уравнении (10).
(10)
В уравнении (10) B — это мета-обучающая последовательность выборки.
Оптимизация передачи знаний с помощью проектирования потерь и модели помощника
Для дальнейшего повышения эффективности дистилляции знаний это исследование определяет общую потерю за счет расчёта потери классификации и потери признаков. Среди них потеря признаков использует ретроспективный механизм, использующий мелкие и текущие выходы признаков TM для управления SM, как это выражено в уравнении (11).
(11)
В уравнении (11) I — это множество индексов слоёв признаков. D — это функция расстояния, используемая для вычисления разницы между двумя представлениями признаков. и являются функциями объективного представления в TM и SM, которые преобразуют выходные
признаки и
i-го и j-го слоёв в матрицы внимания.
Потери классификации объединяют потери по перекрестной энтропии между выходом SM и истинной меткой, а также MSE между выходом двух моделей, как мягкие потери27,28. В конечном итоге общая потеря достигается за счёт взвешивания обоих, что помогает SM лучше получать руководство от TM. Чтобы минимизировать потерю производительности в процессе дистилляции знаний, в этом исследовании модель ассистента преподавателя размещается между двумя моделями, как показано на рисунке 8.

Рисунок 8: Двухступенчатый процесс обработки дистилляции знаний с моделью ассистента преподавателя в качестве промежуточного буферного слоя. На рисунке демонстрируется двухэтапный процесс обработки дистилляции знаний с моделью ассистента преподавателя в качестве промежуточного буферного слоя. Первая ступень объединяет потери особенностей и потери классификации для построения полных потерь дистилляции и обучает модель ассистента преподавателя знаниям модели учителя; На втором этапе применяется та же стратегия слияния потерь, чтобы перевести знания модели ассистента преподавателя в модель ученика, снижая потери информации, вызванные чрезмерными разрывами сложности между моделями учителя и ученика. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
После завершения этапа мета-дистилляции модель TA и TM проходят традиционную дистилляцию знаний. В ходе этого процесса признаки обоих случаев синхронно извлекаются, и соответствующая потеря La вычисляется. Впоследствии эти потери признаков объединяются с классификационными потерями LM1 модели для формирования функции
потерь дистилляции на первой ступени, как показано в уравнении (12).
(12)
В уравнении (12) β — коэффициент веса, используемый для контроля доли потери признаков и потерь классификации в общей потере. а также являются функциями объективного представления в модели ассистента преподавателя и TM, которые преобразуют выходы
признаков i-го
и j-го слоёв в матрицы внимания.
zT и zM — это выходы модели TM и ассистента. Процесс дистилляции от модели ассистента преподавателя к SM совпадает с предыдущим процессом, что минимизирует потерю SM при нескольких итерациях для полной передачи знаний.
В заключение, основной вклад предлагаемого TSMDM заключается в оптимизации процесса передачи знаний через механизм мета-обучения. По сравнению с традиционной дистилляцией, основное преимущество этого метода заключается в его динамической способности к обучению: TM может корректировать свои параметры через механизм обучающего эксперимента на основе обратной связи в реальном времени от SM, тем самым обеспечивая более целенаправленное руководство. Тем временем модель ассистента преподавателя введена как буферный слой, эффективно преодолевая разрыв в сложности между TM и SM и снижая потерю информации при передаче знаний. Совместное проектирование этой «стратегии обучения с оптимизацией мета-обучения» и «двухуровневой буферизации для снижения сложности переноса» позволяет финальному SM значительно облегчить вес, сохраняя при этом основные знания, извлечённые из сложного TM в максимальной степени.
Доступность данных
Наборы данных, созданные в ходе текущего исследования и/или проанализированные в ходе текущего исследования, представлены в Дополнительном файле 1.