$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Разработка метода LBA с учётом MPFR и эмоциональных перспектив
Создана многоперспективная система оценки для анализа онлайн-обучения студентов (SOLB), а также разработана модель MPFR. Для дальнейшего анализа субъективных чувств учащихся в обучении в этом исследовании используется алгоритм XGBoost и разработан алгоритм IGWO для гиперпараметрической оптимизации с целью повышения точности классификации.
Создание модели MPFR для LBA
Для анализа SOLB это исследование в основном начинается с двух точек зрения для формирования полного плана анализа. Во-первых, с точки зрения эффективности обучения, это исследование рассматривает три перспективы: учебный план, индивидуальный и класс, чтобы сформировать модель MPFR. Во-вторых, с точки зрения анализа настроений к комментариям студентов, это исследование разрабатывает усовершенствованный алгоритм XGBoost. С помощью анализа учебных результатов и эмоций обратной связи учеников это исследование позволяет лучше проанализировать SOLB. Что касается конкретных технических деталей анализа эффективности обучения, это исследование сначала использует данные с онлайн-платформы обучения и предварительно их обрабатывает. Во-вторых, в этом исследовании отбираются основные показатели оценки эффективности обучения с разных точек зрения для создания комплексной системы оценки. Впоследствии создаётся соответствующая модель MPFR для оценки поведения в обучении.
В этом исследовании собраны данные с платформы Superstar (источник: https://www.chaoxing.com/). Он содержит информацию из разных аспектов, таких как занятия в классе и оценка оценок, что может стать хорошей основой для последующих LBA. После получения данных необходимо предварительно обработать, в основном включая удаление нерелевантных полей, фильтрацию данных и проверку целостности данных. Например, в данных преподавателей необходимо удалить нерелевантную информацию, такую как номер и кафедру, к которой относится курс. Впоследствии это исследование строит инженерию признаков LBA на основе данных о поведении обучения платформы Superstar. Индекс студенческого LBA служит основой инженерии признаков для последующей модели MPFR, и содержание этого индекса показано на рисунке 1.

Рисунок 1: Показатели для студентов LBA. На рисунке прояснены три основных измерения (учебная программа, индивидуальная программа, класс) студенческого LBA и конкретные показатели оценки под каждым измерением, обеспечивая поддержку модели MPFR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
На рисунке 1 индикаторы LBA студентов в основном строятся вокруг трёх перспектив: курсовой, индивидуальной и классной, с чётким акцентом на каждое измерение, обеспечивая точную поддержку признаков для построения моделей MPFR. Среди них, с точки зрения показателей размера курса, это исследование выбирает процент выполнения заданий, продолжительность обучения и частоту взаимодействия с курсами. Основная задача этого измерения — общее качество выполнения заданий и своевременность участия в обучении. Например, процент выполнения заданий используется для отслеживания разницы в уровне завершения до и после дедлайна; Длительность изучения курса используется для различия интервалов интенсивности обучения; Частота, конечно, используется для фильтрации эффективного интерактивного поведения. На личном уровне в качестве показателей оценки выбираются личный прогресс в обучении, качество выполнения домашних заданий и результаты экзаменов. Это измерение сосредоточено на степени совпадения личного прогресса в обучении и результатов овладения знаниями. Примеры включают сравнение личного прогресса в обучении с планами курсов, оценку точности и эффективности выполненных заданий, а также классификацию уровней владения знаниями на основе результатов тестов. Кроме того, с точки зрения размера класса, выбранные показатели включают средний балл класса, взаимодействие в классе и атмосферу обучения в классе. Это измерение в основном сосредоточено на влиянии общей учебной среды на индивидуальное поведение. Например, средняя оценка используется для определения относительного уровня индивидуальной эффективности в группе; активность взаимодействия класса используется для отражения степени коллективного участия; Учебная атмосфера используется для анализа движущего влияния групповой среды на учебное поведение. Для анализа учебного поведения учащихся строится модель расплывчатого мышления, а характеристики учебного поведения получаются с разных точек зрения. Нечеткое рассуждение — это метод рассуждения с использованием нечеткой логики, который обрабатывает неточную или неопределённую информацию с помощью нечетких множеств и нечетких правил, а также обладает преимуществами высокой гибкости и лёгкогопонимания 11,12. Нечеткое рассуждение, как основной вычислительный механизм MPFR-моделей, применяется после инженерии признаков. Основной процесс нечеткого рассуждения показан на рисунке 2.

Рисунок 2: Основная блок-схема нечеткого рассуждения. На рисунке показаны основные процессы размытого мышления, включающие четыре ключевых шага: нечеткость, построение базы нечетких правил, нечеткое рассуждение и размытие размытия, а также проясняется логика модели MPFR при обработке данных о неопределенном поведении обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Размытое рассуждение в основном включает нечеткое рассуждение, создание библиотеки нечетких правил (FRL), нечеткое рассуждение и размытость. Среди них фаззификация требует преобразования точных входных данных в нечеткие множества и определения функций принадлежности. FRL содержит ряд неясных правил и в основном используется для описания взаимосвязи между входом и выходом. При создании нечеткой базы правил в исследовании приглашаются три доцента образовательных технологий с опытом преподавания ≥ 8 лет совместно разработать 28 правил, а окончательные правила определяются через три этапа итерации с использованием «метода Дельфи». Например, правило 1: ЕСЛИ уровень выполнения задания составляет менее 30%, а индивидуальный прогресс в обучении отстаёт от графика на 2 недели → ТОГДА состояние высокого риска. Нечеткое рассуждение — это процесс вывода нечетких входных данных, построенных на FRL, и получения нечетких результатов. Наконец, размытие преобразует нечеткий результат в точное значение выхода. В исследовании выбирается треугольная функция принадлежности, которая широко используется в системах нечеткой логики и обладает такими преимуществами, как высокая гибкость и высокая вычислительная эффективность. Выражение функции μA(x) показано в уравнении (1).
(1)
В уравнении (1) x — это удельное входное значение. a, b и c — это три вершины треугольника. При размытии в данной статье используется метод центроида для преобразования выходных результатов. Метод центроида — это широко используемая техника размытия в нечеткой логике, обладающая такими преимуществами, как сильная интуитивность, простота вычислений иустойчивость 13. Выражение метода центроида показано в уравнении (2)14.
(2)
В уравнении (2) f* — это выходное значение после размытия, которое является центроидом нечеткого множества. μ(x) — функция принадлежности.
— взвешенная сумма всех точек в нечетком множестве.
— интеграл функции принадлежности по всем возможным значениям x. Рациональность использования вручную определённых правил и функций членства в модели MPFR отражается в трёх аспектах. Во-первых, гарантия профессиональной квалификации: законодатели — три доцента образовательных технологий, сертифицированные «Аналитиком поведения онлайн-обучения» Центра исследований онлайн-образования Министерства образования, чтобы гарантировать соответствие правил законам образования и преподавания. Во-вторых, преимущество эффективности: время вывода ручных правил значительно меньше, чем у методов, основанных на данных, что делает их более подходящими для потребностей онлайн-образовательных платформ в «реальном времени» и не требуют большого количества аннотированных данных, что снижает затраты на сбор данных15. В-третьих, адаптация к основному требованию «интерпретируемости» в онлайн-образовательных сценариях, вручную определённые правила и треугольные функции членства (Уравнение 1) могут напрямую соответствовать интуитивному восприятию в учебных сценариях. Педагогам не нужен сложный технический фон, чтобы понять причины, по которым ученик считается группой риска. Методы, основанные на данных, такие как нейро-нечеткие системы, могут автоматически оптимизировать правила. Однако большинство сгенерированных правил — это сложные математические выражения, которые трудно интерпретировать педагогам, что снижает приемлемость модели в реальном обучении.
Разработка улучшенной модели анализа настроений студенческих комментариев для XGBoost
Разработанная модель MPFR может анализировать SOLB с трех аспектов: курсовой, индивидуальной и классовой. Однако внешний анализ поведенческих данных имеет ограничения в выражении субъективных чувств учащихся. Поэтому для дальнейшего анализа субъективных чувств учащихся к обучению собираются и предварительно обрабатываются дополнительные данные с платформ обучения MOOC, содержащие информацию о комментариях учащихся. Впоследствии XGBoost используется для построения модели классификации настроений. IGWO разработан для оптимизации параметров с целью повышения точности классификационной модели. Улучшение XGBoost отражено в его оптимизации параметров с помощью алгоритма IGWO. Предобработка данных — важнейший первый шаг перед созданием и анализом модели. Процесс предварительной обработки данных показан на рисунке 3.

Рисунок 3: Процесс предварительной обработки данных. Девятиступенчатый процесс предварительной обработки данных включает очистку текста, сегментацию слов, удаление стоп-слова, извлечение стем и распознавание слов по настроению, обеспечивая высококачественные данные для последующего анализа поведения и классификации настроений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Этапы предварительной обработки данных следующие: Первый шаг — очистка текста для удаления нерелевантных полей в данных платформы Чаосинга и фильтрации недопустимых образцов. В то же время нетекстовые поля и короткие отзывы удаляются из данных обзоров на платформе MOOC. Второй шаг — выполнение сегментационной обработки. Среди них китайские комментарии используют «точный режим» Jieba для обработки сегментации текста, а английские — функцию сегментации слов из библиотеки NLTK для обработки. Третий шаг — убрать распространённые стоп-слова, такие как «de», «yes», «in» и т.д. Среди них китайские стоп-слова используют список стоп-слов Харбинского технологического института (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). Стоп-слова удаляются путём сопоставления слов. Английские стоп-слова используют универсальный список стоп-слов, встроенный в библиотеку NLTK, который также удаляется посредством сопоставления слов за словом. Четвёртый шаг — использовать stemmer библиотеки NLTK для извлечения сводов из текста и восстановления глаголов в английской форме в их основной форме. Пятый шаг — определить положительные и отрицательные эмоциональные слова в комментариях на основе эмоционального словаря CNKI, чтобы предоставить основу для предварительной аннотации для последующего эмоционального классификации. Шестой этап — извлечение признаков. Среди них структурированные данные платформы Чаосин стандартизированы, а индикаторы классификации кодируются отдельно. В то же время эти данные комментариев платформы MOOC используют метод предварительно обученной языковой модели (Bidirectional Encoder Representation from Transformers, BERT) для извлечения текстовых признаков. Основное преимущество модели BERT в извлечении текстовых признаков заключается в том, что она может динамически генерировать контекстно-ориентированные векторы слов с помощью глубокой двунаправленной архитектуры Transformer, эффективно решая неоднозначность, которую традиционные модели статического вложения слов не могут решить. Седьмой шаг — решение проблемы дисбалансных категорий настроений в данных комментариев. Для обработки используется технология синтетического меньшинства перевыборки (SMOTE). Для интерполяции выбираются пять образцов ближайших соседей с целью генерации синтетических выборок класса меньшинств с фиксированным случайным семем 42 для обеспечения воспроизводимости эксперимента. Восьмой шаг — аннотация и разбиение данных. Девятый шаг — заполнить недостающие значения в данных суперзвезды и удалить выбросы. При обработке балансировки данных SMOTE создаёт новые составные выборки, интерполируя между выборками классов меньшинств, тем самым увеличивая количество выборок меньшинств и делая распределение классов в наборе данных болеесбалансированным — 16,17. Выражение SMOTE показано в уравнении (3).
Bmn = dm + rand(0,1) x (dmn - dm) (3)
В уравнении (3) Bmn — искусственно построенная выборка класса меньшинства, dm — i-я выборка класса меньшинства, а dmn — n-я выборка среди k-ближайших соседей dm . rand(0,1) — случайное число между 0 и 1. XGBoost улучшает прогнозную эффективность, путём итеративного добавления деревьев предсказаний. У него есть такие преимущества, как высокая точность, высокая гибкость и простота использования18,19. Шаги итеративного построения модели дерева с использованием XGBoost в основном включают: инициализацию модели, итеративное построение дерева, целевой функции и члена регуляризации. Прогнозируемый результат
в t--й итерации показан в уравнении (4).
(4)
В уравнении (4)
— это значение прогноза модели после t-1-й итерации, ft(h) — функция предсказания деревьевой модели, добавленной в t-й итерации, а h — входной вектор признаков. Целевая функция для минимизации XGBoost показана в уравнении (5).
(5)
В уравнении (5) i — это число выборки. I и J — это общее количество образцов и деревьев, а j — количество деревьев.
— функция потерь, а gi — истинная метка i-го образца
. — предсказанное значение модели для i-й выборки после t--й итерации. Ω(ft) — это член регуляризации, а (ft) — функция предсказания j-го дерева. Общее выражение Ω(f) для регуляризации показано в уравнении (6).
(6)
В уравнении (6) γ означает коэффициент штрафа для количества листовых узлов, λ — коэффициент регуляризации L2 для веса листовых узлов, а w — вес листовых узлов. Однако выбор гиперпараметров XGBoost оказывает прямое и значимое влияние на производительность. Распространённые гиперпараметры XGBoost включают скорость обучения, максимальную глубину дерева и параметры регуляризации. Из-за потенциально большого пространства гиперпараметров ручная настройка этих параметров не только занимает много времени, но и затрудняет поиск оптимальной комбинации параметров. Поэтому это исследование разрабатывает IGWO для оптимизации гиперпараметров XGBoost. GWO ищет оптимальные решения, моделируя социальную иерархию и стратегии охоты серых волков, с такими преимуществами, как меньшее количество параметров и сильнаяадаптивность 20,21. В GWO начальное положение популяции порождается, как показано в уравнении (7).
(7)
В уравнении (7) Puv — это положение u-го индивида в v-м измерении.
и
— верхняя и нижняя границы пространства V-го поиска. RAND() — случайное число между [0,1]. Однако алгоритм GWO может столкнуться с такими проблемами, как медленная скорость сходимости и застревание в локальном оптимуме на средних и поздних стадиях. Это также означает, что на данный момент GWO может не иметь возможности эффективно исследовать всё пространство решений, что затруднит поиск глобально оптимального решения. Для решения этой проблемы исследование улучшает GWO с двух аспектов: введение хаотической карты палатки (TCM) и нелинейного коэффициента сходимости (NCF). ТКМ — это простое хаотическое отображение, которое гарантирует, что потенциально оптимальные области решения не будут пропущены в процессе поиска и избегают повторных поисков одной и той же области22. Таким образом, с помощью ТКМ можно сгенерировать более однородную и случайную начальную популяцию, а также повысить способность алгоритма преодолевать локальные оптимумы. Вычисление ТКМ показано в уравнении (8).
(8)
В уравнении (8) y — это управляющий параметр. Rt иR t+1 — это переменные состояния системы на t--й и t+1-й итерациях. Формула для NCF z показана в уравнении (9).
(9)
В уравнении (9) zmax — максимальный коэффициент сходимости, а tmax — максимальное количество итераций. Этот нелинейный метод убывания позволяет GWO поддерживать большой размер шага для глобального поиска на ранней стадии. На среднем этапе поиска скорость сходимости ускоряется, а на поздней стадии локальный поиск выполняется меньшими шагами, что эффективно балансирует глобальные и локальные возможности поиска и повышает эффективность оптимизации. Алгоритм IGWO используется специально для этапа оптимизации гиперпараметров классификатора настроений XGBoost, и его основной процесс показан на рисунке 4.

Рисунок 4: Основной процесс IGWO. На рисунке описан процесс выполнения IGWO, включая инициализацию популяции на основе хаотического отображения палаток, обновление позиции нелинейных коэффициентов сходимости и оптимальный индивидуальный скрининг, а также проясняется логика оптимизации гиперпараметров XGBoost. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
На рисунке 4 процесс IGWO включает: инициализацию алгоритма; использование ТКМ для инициализации популяции; вычисление начального значения приспособленности каждого индивида; использование NCF для обновления позиций серых волков; выбор решения с наилучшей приспособленностью как нового оптимального человека; И выпускать идеального человека. Оптимальное сочетание гиперпараметров XGBoost можно вывести через IGWO. Общий процесс классификации настроений интегрирует предварительную обработку данных, оптимизацию IGWO и окончательную модель XGBoost. Процесс классификационной модели на основе IGWO-XGBoost показан на рисунке 5.

Рисунок 5: Процесс классификационной модели на основе IGWO-XGBoost. На рисунке показана полный процесс модели классификации настроений IGWO-XGBoost — от ввода и предварительной обработки данных до разбиения наборов данных, оптимизации гиперпараметров IGWO, построения модели XGBoost и вывода результатов классификации, чётко отражая цепочку операций модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Модель, основанная на IGWO-XGBoost, включает такие процессы, как входные данные, предварительная обработка данных, разбиение наборов данных, оптимизация гиперпараметров алгоритма IGWO, оптимальная комбинация гиперпараметров, построение XGBoost на основе оптимальной комбинации гиперпараметров и вывод результатов классификации. С помощью этой модели классификации эмоции в комментариях учащихся можно классифицировать, что позволяет получить более интуитивное понимание субъективных чувств студентов по поводу обучения. Конкретные версии программного обеспечения, случайные семена, аппаратные характеристики, экологические характеристики и источники наборов данных, использованные в исследовании, приведены в таблице 1.
| Тип множества | Конкретная модель и содержание |
| Базовое программное обеспечение | Python 3.9.7 |
| Основная библиотека | XGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1 |
| Случайный сид | Установить глобальное случайное начало на 42 |
| Технические характеристики оборудования/среды | 1. Операционная система: Windows 10 Professional Edition (64 бит, номер версии 22H2) |
| 2. Процессор: Intel Core i5-12600KF (с основной частотой 3,7 ГГц и частотой динамического ускорения 4,9 ГГц) |
| 3. Память: 64 ГБ DDR4 (частота 3200 МГц, поддерживает до 128 ГБ памяти) |
| 4. Память: 1 ТБ SSD (Samsung 980 Pro, скорость чтения 7450 МБ/с) |
| 5. Видеокарта: NVIDIA GeForce RTX 3060 (12 ГБ видеопамяти) |
| Источники набора данных и детали доступа | 1. Набор данных платформы Superstar: |
| -Source Uniform Resource Locator (URL): https://www.chaoxing.com/ |
| - Метод приобретения: подать заявку через открытую платформу Chaoxing Education Big Data (путь приложения: официальный сайт платформы → центр разработчиков → интерфейс данных → набор датасетов поведения в обучении) |
| 2. Набор комментариев на платформе MOOC: |
| -URL источника: https://www.icourse163.org/.cn |
| - Метод приобретения: Подайте заявку через канал «поддержка исследований данных» платформы MOOC |
| Пользовательские скрипты или модели | 1. Скрипт предварительной обработки данных |
| 2. Скрипт модели MPFR |
3. Скрипт модели IGWO-XGBoost
|
Таблица 1: Конкретные версии программного обеспечения, случайные семена, аппаратные характеристики, экологические характеристики и источники наборов данных, используемые в исследовании. Предоставить подробный список необходимой программной и аппаратной среды, случайных настроек seed, источников наборов данных и диапазона поиска гиперпараметров XGBoost для исследования, чтобы обеспечить воспроизводимость и стандартизацию эксперимента.
Таблица 1 показывает, что исследование использует XGBoost 1.7.5 в качестве основной основы модели классификации настроений и вводит Scikit learn 1.2.2 для предварительной обработки данных, извлечения признаков и оценки моделей. Кроме того, исследование единообразно устанавливает случайное семя на 42, чтобы обеспечить воспроизводимость разбиения данных, перевыборки SMOTE, оптимизации гиперпараметров IGWO и обучения моделей IGWO-XGBost. Кроме того, алгоритм IGWO задаёт пространство поиска для гиперпараметров XGBoost. Диапазон поиска для скорости обучения равен [0,001, 0,3] по логарифмической шкале, а максимальная глубина дерева исследуется в целочисленном множестве {3, 4,..., 15}. Диапазон оптимизации терма L2 регуляризации равен [0,1, 5,0], а коэффициент выборки каждого подмножества признаков дерева оптимизирован в диапазоне [0,6, 1,0]. Диапазон настройки для минимального веса листовых узлов равен [1, 10].
Набор данных и связанный с ним код для предварительной обработки и анализа данных были сгенерированы и проанализированы самой командой. Основные скрипты для предварительной обработки данных показаны в Таблице 2.
| Импортировать Pandas как PD, jieba, re, numpy как NP |
| из nltk.tokenize импорт word_tokenize; from nltk.stem import PorterStemmer |
| Определенно чисто (текст, L): |
| Return re.sub(r"[^\u4E00-\u9fa5]" если l=="zh" иначе r"[^a-zA-Z]", " ", text).strip() |
| Def Process(текст, L): |
| t = jieba.lcut(текст) если l=="zh" иначе word_tokenize(текст) |
| return " ".join([PorterStemmer().stem(w) если l=="en" иначе w для w в t, если w не в открытом("hit_stopwords.txt").read().split()]) |
| Def Main(C,M,L): |
| cx=pd.read_csv(c).query("продолжительность обучения курса>=1 & результаты экзамена.notna()"); mc=pd.read_csv(m).query("текст комментария.str.len()>=5") |
| mc["t"]=mc["текст комментария"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v для k,v в локальных параметрах().items()}) |
Таблица 2: Основной скрипт для предварительной обработки данных. Представить основную информацию о скрипте для предварительной обработки данных, уточнить этапы предварительной обработки, соответствующие скрипту, и предоставить технические ссылки для воспроизведения исследовательских методов.