Исследовательская статья

Многоперспективное нечеткое мышление и анализ поведения онлайн-обучения на основе XGBoost

DOI:

10.3791/69515

17 марта 2026 г.

В этой статье

Уведомление об исправлении

Important: There has been an erratum issued for this article. View Erratum Notice

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании используется многоперспективная модель нечеткого рассуждения и улучшенный алгоритм усиления экстремального градиентного бустинга (XGBoost) (оптимизированный с помощью усовершенствованного алгоритма оптимизации серого волка) для анализа поведения в онлайн-обучении и классификации эмоций комментариев студентов, обеспечивая поддержку персонализированного обучения и своевременного вмешательства.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Бурное развитие онлайн-образования сделало онлайн-классы важной частью образовательной сферы. Глубокий анализ учебного поведения учащихся в онлайн-обучении помогает им оптимизировать стратегии преподавания и обеспечивать персонализированную поддержку обучения для учащихся. Поэтому для глубокого анализа учебного поведения учащихся это исследование собирает данные с онлайн-платформ для обучения и предварительно их обрабатывает. Впоследствии это исследование строит многоперспективную модель размытого рассуждения, охватывающую три измерения: учебный план, индивидуальный и класс, чтобы всесторонне рассмотреть учебные результаты учащихся на разных уровнях. Эта модель обрабатывает неопределённую информацию в данных о поведении обучения через нечеткие наборы и нечеткие правила, достигая многомерной оценки эффективности обучения. Улучшенный алгоритм XGBoost разработан для классификации эмоций студентов при комментариях. Этот улучшенный алгоритм оптимизирует гиперпараметры алгоритма XGBoost, улучшая алгоритм оптимизации серого волка. Алгоритм повышает точность классификации эмоций и дополнительно исследует эмоциональные тенденции и обратную связь на отношение к их учебному поведению. Результаты показали, что с точки зрения учебной программы уровень выполнения заданий за 3 недели до экзамена был примерно выше 45%, что значительно выше, чем через три недели после публикации задания (оба менее 18%). Эти результаты показали, что студенты чаще готовы выполнять задачи до срока и явно прокрастинировали. Максимальная точность улучшенного алгоритма классификации составила 98,78%, что на 8,57%, 7,55%, 6,38% и на 6,01% выше, чем у модели сравнения, а среднее время — 58 мс. Показатели воспоминания негативных, положительных и нейтральных эмоций составили 98,35%, 97,69% и 98,02%. Модель исследования может эффективно анализировать поведение учащихся в онлайн-обучении и обеспечивать раннее выявление учащихся из группы риска, способствуя персонализированному обучению и точному вмешательству в онлайн-обучение.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Глубокая интеграция Интернета и образовательных технологий сделала онлайн-образование шагом из маргинального дополнения к мейнстримной форме. К концу 2023 года число зарегистрированных онлайн-обучающихся в мире превысило 1,2 миллиарда, а Китай стабильно занимал первое место в мире как по числу массовых открытых онлайн-курсов (MOOC), так и по числуобучающихся 1,2. Однако, хотя онлайн-обучение приносит удобство, оно также подвергает вызовы, такие как непрозрачный процесс обучения, разделение учителей и учеников во времени и пространстве, а также отставание регуляторной обратной связи. Существует положительная корреляция между данными об обучении и учебной успеваемостью. Динамическая настройка на основе данных может увеличить уровень завершения курса более чем на 20% и значительно снизить риск отчисления 3,4,5. Поэтому проведение анализа поведения в обучении (LBA) крайне важно. По этому вопросу современные методы включают описативную статистику, анализ по правилам ассоциаций и традиционную классификацию машинногообучения 6. Многие учёные изучали этот вопрос.

Для проведения LBA Ли И и др. использовали данные об обучающем поведении с онлайн-платформ обучения Гарвардского университета и Массачусетского технологического института для создания импульсной нейронной сети (PNN) для прогнозирования результатов обучения. Они проанализировали корреляцию между поведением в обучении и результатами. Модель прогнозирования поведения в онлайн-обучении на основе PNN достигла точности 99,80%7. Цзэн Б разработал эффективную модель визуализации поведения в онлайн-обучении английскому с использованием анализа задерживаемых последовательностей, комбинированных методов анализа данных и алгоритма минимального остовного дерева. Кроме того, в ходе исследования была создана онлайн-платформа интеллектуального обучения для сервисов по групповому учебному маршруту (GLP). Разработанный метод мог успешно собратьGLP 8. Чжао М и др. разработали двухслойную систему долгосрочной краткосрочной памяти (LSTM), чтобы выявить потенциальные проблемы в онлайн-обучении учащихся. Они использовали фреймворк TensorFlow и язык Python, а также данные с онлайн-платформ Kaggle, edX и Open University of the UK. Эта сеть имела хорошую производительность с максимальной точностью 83,4%9. Ли Ф. и др. собрали и проанализировали данные об обучающем поведении у 109 студентов бакалавриата, чтобы понять групповые поведенческие характеристики различных онлайн-обучающихся. В этом исследовании был введён анализ основных компонентов для снижения размерности данных и использован агломеративная иерархическая кластеризация для классификации учащихся по различным категориям. Среди них было 15 групп, и предложенный метод имел хорошую точностькластеризации 10.

В заключение, современные исследования LBA довольно разнообразны и используют широкий спектр методов. Однако у этих исследований и методов есть и определённые недостатки. Например, в учебниках для студентов недостаточно изучена эмоциональная информация, а описательная статистика не может раскрыть сложные механизмы взаимодействия, лежащие в основе поведения. Классификация в машинном обучении часто основана на признаках одной перспективы, что отделяет многомерную информацию от курсов, отдельных лиц и классов. Для более эффективного выполнения LBA в данном исследовании разрабатывается модель многоперспективного нечеткого рассуждения (MPFR) и модель классификации эмоций на основе алгоритмов Improved Grey Wolf Optimization (IGWO) и eXtreme Gradient Boosting (XGBoost).

В существующих исследованиях LBA, хотя LSTM может отражать временную корреляцию поведения в обучении, его способность обрабатывать размытые и неуверенные данные о поведении обучения слаба. Сверточная нейронная сеть (CNN) обладает определёнными преимуществами в извлечении текстовых признаков, но лучше фиксирует локальные признаки и затрудняет интеграцию многомерной глобальной информации о курсах, отдельных особях и классах. По сравнению с методами глубокого обучения, такими как CNN и LSTM, модель MPFR способна фиксировать неопределённую информацию в поведении обучения с помощью нечеткого мышления. Например, «умеренное участие» студентов и «базовое владение» размытыми состояниями компенсируют ограничения локального извлечения функций CNN. IGWO-XGBoost балансирует точность и эффективность в классификации настроений, компенсируя трудоёмкую классификацию настроений LSTM и слабую семантическую нечеткость обработки CNN. Данное исследование направлено на предоставление трёхмерной информационной поддержки онлайн-обучения путем объединения результатов анализа поведения и эмоций. Инновация исследования заключается в создании модели MPFR, охватывающей три измерения: учебный план, индивидуальный и класс. Такое всестороннее рассмотрение с разных точек зрения может всесторонне и стереоскопически отражать учебные показатели учащихся, избегая важной информации, которая может быть упущена с одной точки зрения. Этот метод обладает хорошей масштабируемостью платформы и может быть адаптирован к основным онлайн-платформам, таким как Chaoxing и MOOC, то есть через единый интерфейс предварительной обработки данных без необходимости дополнительных функций разработки платформы. В то же время этот метод инкапсулирован как простой инструмент анализа, и преподавателям достаточно загрузить базовые данные, экспортированные с платформы, чтобы автоматически генерировать отчёты LBA без сложных технических операций.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Разработка метода LBA с учётом MPFR и эмоциональных перспектив

Создана многоперспективная система оценки для анализа онлайн-обучения студентов (SOLB), а также разработана модель MPFR. Для дальнейшего анализа субъективных чувств учащихся в обучении в этом исследовании используется алгоритм XGBoost и разработан алгоритм IGWO для гиперпараметрической оптимизации с целью повышения точности классификации.

Создание модели MPFR для LBA

Для анализа SOLB это исследование в основном начинается с двух точек зрения для формирования полного плана анализа. Во-первых, с точки зрения эффективности обучения, это исследование рассматривает три перспективы: учебный план, индивидуальный и класс, чтобы сформировать модель MPFR. Во-вторых, с точки зрения анализа настроений к комментариям студентов, это исследование разрабатывает усовершенствованный алгоритм XGBoost. С помощью анализа учебных результатов и эмоций обратной связи учеников это исследование позволяет лучше проанализировать SOLB. Что касается конкретных технических деталей анализа эффективности обучения, это исследование сначала использует данные с онлайн-платформы обучения и предварительно их обрабатывает. Во-вторых, в этом исследовании отбираются основные показатели оценки эффективности обучения с разных точек зрения для создания комплексной системы оценки. Впоследствии создаётся соответствующая модель MPFR для оценки поведения в обучении.

В этом исследовании собраны данные с платформы Superstar (источник: https://www.chaoxing.com/). Он содержит информацию из разных аспектов, таких как занятия в классе и оценка оценок, что может стать хорошей основой для последующих LBA. После получения данных необходимо предварительно обработать, в основном включая удаление нерелевантных полей, фильтрацию данных и проверку целостности данных. Например, в данных преподавателей необходимо удалить нерелевантную информацию, такую как номер и кафедру, к которой относится курс. Впоследствии это исследование строит инженерию признаков LBA на основе данных о поведении обучения платформы Superstar. Индекс студенческого LBA служит основой инженерии признаков для последующей модели MPFR, и содержание этого индекса показано на рисунке 1.

figure-protocol-1
Рисунок 1: Показатели для студентов LBA. На рисунке прояснены три основных измерения (учебная программа, индивидуальная программа, класс) студенческого LBA и конкретные показатели оценки под каждым измерением, обеспечивая поддержку модели MPFR. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

На рисунке 1 индикаторы LBA студентов в основном строятся вокруг трёх перспектив: курсовой, индивидуальной и классной, с чётким акцентом на каждое измерение, обеспечивая точную поддержку признаков для построения моделей MPFR. Среди них, с точки зрения показателей размера курса, это исследование выбирает процент выполнения заданий, продолжительность обучения и частоту взаимодействия с курсами. Основная задача этого измерения — общее качество выполнения заданий и своевременность участия в обучении. Например, процент выполнения заданий используется для отслеживания разницы в уровне завершения до и после дедлайна; Длительность изучения курса используется для различия интервалов интенсивности обучения; Частота, конечно, используется для фильтрации эффективного интерактивного поведения. На личном уровне в качестве показателей оценки выбираются личный прогресс в обучении, качество выполнения домашних заданий и результаты экзаменов. Это измерение сосредоточено на степени совпадения личного прогресса в обучении и результатов овладения знаниями. Примеры включают сравнение личного прогресса в обучении с планами курсов, оценку точности и эффективности выполненных заданий, а также классификацию уровней владения знаниями на основе результатов тестов. Кроме того, с точки зрения размера класса, выбранные показатели включают средний балл класса, взаимодействие в классе и атмосферу обучения в классе. Это измерение в основном сосредоточено на влиянии общей учебной среды на индивидуальное поведение. Например, средняя оценка используется для определения относительного уровня индивидуальной эффективности в группе; активность взаимодействия класса используется для отражения степени коллективного участия; Учебная атмосфера используется для анализа движущего влияния групповой среды на учебное поведение. Для анализа учебного поведения учащихся строится модель расплывчатого мышления, а характеристики учебного поведения получаются с разных точек зрения. Нечеткое рассуждение — это метод рассуждения с использованием нечеткой логики, который обрабатывает неточную или неопределённую информацию с помощью нечетких множеств и нечетких правил, а также обладает преимуществами высокой гибкости и лёгкогопонимания 11,12. Нечеткое рассуждение, как основной вычислительный механизм MPFR-моделей, применяется после инженерии признаков. Основной процесс нечеткого рассуждения показан на рисунке 2.

figure-protocol-2
Рисунок 2: Основная блок-схема нечеткого рассуждения. На рисунке показаны основные процессы размытого мышления, включающие четыре ключевых шага: нечеткость, построение базы нечетких правил, нечеткое рассуждение и размытие размытия, а также проясняется логика модели MPFR при обработке данных о неопределенном поведении обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Размытое рассуждение в основном включает нечеткое рассуждение, создание библиотеки нечетких правил (FRL), нечеткое рассуждение и размытость. Среди них фаззификация требует преобразования точных входных данных в нечеткие множества и определения функций принадлежности. FRL содержит ряд неясных правил и в основном используется для описания взаимосвязи между входом и выходом. При создании нечеткой базы правил в исследовании приглашаются три доцента образовательных технологий с опытом преподавания ≥ 8 лет совместно разработать 28 правил, а окончательные правила определяются через три этапа итерации с использованием «метода Дельфи». Например, правило 1: ЕСЛИ уровень выполнения задания составляет менее 30%, а индивидуальный прогресс в обучении отстаёт от графика на 2 недели → ТОГДА состояние высокого риска. Нечеткое рассуждение — это процесс вывода нечетких входных данных, построенных на FRL, и получения нечетких результатов. Наконец, размытие преобразует нечеткий результат в точное значение выхода. В исследовании выбирается треугольная функция принадлежности, которая широко используется в системах нечеткой логики и обладает такими преимуществами, как высокая гибкость и высокая вычислительная эффективность. Выражение функции μA(x) показано в уравнении (1).

figure-protocol-3 (1)

В уравнении (1) x — это удельное входное значение. a, b и c — это три вершины треугольника. При размытии в данной статье используется метод центроида для преобразования выходных результатов. Метод центроида — это широко используемая техника размытия в нечеткой логике, обладающая такими преимуществами, как сильная интуитивность, простота вычислений иустойчивость 13. Выражение метода центроида показано в уравнении (2)14.

figure-protocol-4 (2)

В уравнении (2) f* — это выходное значение после размытия, которое является центроидом нечеткого множества. μ(x) — функция принадлежности. figure-protocol-5— взвешенная сумма всех точек в нечетком множестве. figure-protocol-6 — интеграл функции принадлежности по всем возможным значениям x. Рациональность использования вручную определённых правил и функций членства в модели MPFR отражается в трёх аспектах. Во-первых, гарантия профессиональной квалификации: законодатели — три доцента образовательных технологий, сертифицированные «Аналитиком поведения онлайн-обучения» Центра исследований онлайн-образования Министерства образования, чтобы гарантировать соответствие правил законам образования и преподавания. Во-вторых, преимущество эффективности: время вывода ручных правил значительно меньше, чем у методов, основанных на данных, что делает их более подходящими для потребностей онлайн-образовательных платформ в «реальном времени» и не требуют большого количества аннотированных данных, что снижает затраты на сбор данных15. В-третьих, адаптация к основному требованию «интерпретируемости» в онлайн-образовательных сценариях, вручную определённые правила и треугольные функции членства (Уравнение 1) могут напрямую соответствовать интуитивному восприятию в учебных сценариях. Педагогам не нужен сложный технический фон, чтобы понять причины, по которым ученик считается группой риска. Методы, основанные на данных, такие как нейро-нечеткие системы, могут автоматически оптимизировать правила. Однако большинство сгенерированных правил — это сложные математические выражения, которые трудно интерпретировать педагогам, что снижает приемлемость модели в реальном обучении.

Разработка улучшенной модели анализа настроений студенческих комментариев для XGBoost

Разработанная модель MPFR может анализировать SOLB с трех аспектов: курсовой, индивидуальной и классовой. Однако внешний анализ поведенческих данных имеет ограничения в выражении субъективных чувств учащихся. Поэтому для дальнейшего анализа субъективных чувств учащихся к обучению собираются и предварительно обрабатываются дополнительные данные с платформ обучения MOOC, содержащие информацию о комментариях учащихся. Впоследствии XGBoost используется для построения модели классификации настроений. IGWO разработан для оптимизации параметров с целью повышения точности классификационной модели. Улучшение XGBoost отражено в его оптимизации параметров с помощью алгоритма IGWO. Предобработка данных — важнейший первый шаг перед созданием и анализом модели. Процесс предварительной обработки данных показан на рисунке 3.

figure-protocol-7
Рисунок 3: Процесс предварительной обработки данных. Девятиступенчатый процесс предварительной обработки данных включает очистку текста, сегментацию слов, удаление стоп-слова, извлечение стем и распознавание слов по настроению, обеспечивая высококачественные данные для последующего анализа поведения и классификации настроений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Этапы предварительной обработки данных следующие: Первый шаг — очистка текста для удаления нерелевантных полей в данных платформы Чаосинга и фильтрации недопустимых образцов. В то же время нетекстовые поля и короткие отзывы удаляются из данных обзоров на платформе MOOC. Второй шаг — выполнение сегментационной обработки. Среди них китайские комментарии используют «точный режим» Jieba для обработки сегментации текста, а английские — функцию сегментации слов из библиотеки NLTK для обработки. Третий шаг — убрать распространённые стоп-слова, такие как «de», «yes», «in» и т.д. Среди них китайские стоп-слова используют список стоп-слов Харбинского технологического института (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). Стоп-слова удаляются путём сопоставления слов. Английские стоп-слова используют универсальный список стоп-слов, встроенный в библиотеку NLTK, который также удаляется посредством сопоставления слов за словом. Четвёртый шаг — использовать stemmer библиотеки NLTK для извлечения сводов из текста и восстановления глаголов в английской форме в их основной форме. Пятый шаг — определить положительные и отрицательные эмоциональные слова в комментариях на основе эмоционального словаря CNKI, чтобы предоставить основу для предварительной аннотации для последующего эмоционального классификации. Шестой этап — извлечение признаков. Среди них структурированные данные платформы Чаосин стандартизированы, а индикаторы классификации кодируются отдельно. В то же время эти данные комментариев платформы MOOC используют метод предварительно обученной языковой модели (Bidirectional Encoder Representation from Transformers, BERT) для извлечения текстовых признаков. Основное преимущество модели BERT в извлечении текстовых признаков заключается в том, что она может динамически генерировать контекстно-ориентированные векторы слов с помощью глубокой двунаправленной архитектуры Transformer, эффективно решая неоднозначность, которую традиционные модели статического вложения слов не могут решить. Седьмой шаг — решение проблемы дисбалансных категорий настроений в данных комментариев. Для обработки используется технология синтетического меньшинства перевыборки (SMOTE). Для интерполяции выбираются пять образцов ближайших соседей с целью генерации синтетических выборок класса меньшинств с фиксированным случайным семем 42 для обеспечения воспроизводимости эксперимента. Восьмой шаг — аннотация и разбиение данных. Девятый шаг — заполнить недостающие значения в данных суперзвезды и удалить выбросы. При обработке балансировки данных SMOTE создаёт новые составные выборки, интерполируя между выборками классов меньшинств, тем самым увеличивая количество выборок меньшинств и делая распределение классов в наборе данных болеесбалансированным — 16,17. Выражение SMOTE показано в уравнении (3).

Bmn = dm + rand(0,1) x (dmn - dm) (3)

В уравнении (3) Bmn — искусственно построенная выборка класса меньшинства, dm — i-я выборка класса меньшинства, а dmn — n-я выборка среди k-ближайших соседей dm . rand(0,1) — случайное число между 0 и 1. XGBoost улучшает прогнозную эффективность, путём итеративного добавления деревьев предсказаний. У него есть такие преимущества, как высокая точность, высокая гибкость и простота использования18,19. Шаги итеративного построения модели дерева с использованием XGBoost в основном включают: инициализацию модели, итеративное построение дерева, целевой функции и члена регуляризации. Прогнозируемый результат figure-protocol-8 в t--й итерации показан в уравнении (4).

figure-protocol-9   (4)

В уравнении (4) figure-protocol-10 — это значение прогноза модели после t-1-й итерации, ft(h) — функция предсказания деревьевой модели, добавленной в t-й итерации, а h — входной вектор признаков. Целевая функция для минимизации XGBoost показана в уравнении (5).

figure-protocol-11 (5)

В уравнении (5) i — это число выборки. I и J — это общее количество образцов и деревьев, а j — количество деревьев. figure-protocol-12— функция потерь, а gi — истинная метка i-го образца figure-protocol-13. — предсказанное значение модели для i-й выборки после t--й итерации. Ω(ft) — это член регуляризации, а (ft) — функция предсказания j-го дерева. Общее выражение Ω(f) для регуляризации показано в уравнении (6).

figure-protocol-14 (6)

В уравнении (6) γ означает коэффициент штрафа для количества листовых узлов, λ — коэффициент регуляризации L2 для веса листовых узлов, а w — вес листовых узлов. Однако выбор гиперпараметров XGBoost оказывает прямое и значимое влияние на производительность. Распространённые гиперпараметры XGBoost включают скорость обучения, максимальную глубину дерева и параметры регуляризации. Из-за потенциально большого пространства гиперпараметров ручная настройка этих параметров не только занимает много времени, но и затрудняет поиск оптимальной комбинации параметров. Поэтому это исследование разрабатывает IGWO для оптимизации гиперпараметров XGBoost. GWO ищет оптимальные решения, моделируя социальную иерархию и стратегии охоты серых волков, с такими преимуществами, как меньшее количество параметров и сильнаяадаптивность 20,21. В GWO начальное положение популяции порождается, как показано в уравнении (7).

figure-protocol-15(7)

В уравнении (7) Puv — это положение u-го индивида в v-м измерении. figure-protocol-16 и figure-protocol-17 — верхняя и нижняя границы пространства V-го поиска. RAND() — случайное число между [0,1]. Однако алгоритм GWO может столкнуться с такими проблемами, как медленная скорость сходимости и застревание в локальном оптимуме на средних и поздних стадиях. Это также означает, что на данный момент GWO может не иметь возможности эффективно исследовать всё пространство решений, что затруднит поиск глобально оптимального решения. Для решения этой проблемы исследование улучшает GWO с двух аспектов: введение хаотической карты палатки (TCM) и нелинейного коэффициента сходимости (NCF). ТКМ — это простое хаотическое отображение, которое гарантирует, что потенциально оптимальные области решения не будут пропущены в процессе поиска и избегают повторных поисков одной и той же области22. Таким образом, с помощью ТКМ можно сгенерировать более однородную и случайную начальную популяцию, а также повысить способность алгоритма преодолевать локальные оптимумы. Вычисление ТКМ показано в уравнении (8).

figure-protocol-18 (8)

В уравнении (8) y — это управляющий параметр.  Rt иR t+1 — это переменные состояния системы на t--й и t+1-й итерациях. Формула для NCF z показана в уравнении (9).

figure-protocol-19(9)

В уравнении (9) zmax — максимальный коэффициент сходимости, а tmax — максимальное количество итераций. Этот нелинейный метод убывания позволяет GWO поддерживать большой размер шага для глобального поиска на ранней стадии. На среднем этапе поиска скорость сходимости ускоряется, а на поздней стадии локальный поиск выполняется меньшими шагами, что эффективно балансирует глобальные и локальные возможности поиска и повышает эффективность оптимизации. Алгоритм IGWO используется специально для этапа оптимизации гиперпараметров классификатора настроений XGBoost, и его основной процесс показан на рисунке 4.

figure-protocol-20
Рисунок 4: Основной процесс IGWO. На рисунке описан процесс выполнения IGWO, включая инициализацию популяции на основе хаотического отображения палаток, обновление позиции нелинейных коэффициентов сходимости и оптимальный индивидуальный скрининг, а также проясняется логика оптимизации гиперпараметров XGBoost. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

На рисунке 4 процесс IGWO включает: инициализацию алгоритма; использование ТКМ для инициализации популяции; вычисление начального значения приспособленности каждого индивида; использование NCF для обновления позиций серых волков; выбор решения с наилучшей приспособленностью как нового оптимального человека; И выпускать идеального человека. Оптимальное сочетание гиперпараметров XGBoost можно вывести через IGWO. Общий процесс классификации настроений интегрирует предварительную обработку данных, оптимизацию IGWO и окончательную модель XGBoost. Процесс классификационной модели на основе IGWO-XGBoost показан на рисунке 5.

figure-protocol-21
Рисунок 5: Процесс классификационной модели на основе IGWO-XGBoost. На рисунке показана полный процесс модели классификации настроений IGWO-XGBoost — от ввода и предварительной обработки данных до разбиения наборов данных, оптимизации гиперпараметров IGWO, построения модели XGBoost и вывода результатов классификации, чётко отражая цепочку операций модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Модель, основанная на IGWO-XGBoost, включает такие процессы, как входные данные, предварительная обработка данных, разбиение наборов данных, оптимизация гиперпараметров алгоритма IGWO, оптимальная комбинация гиперпараметров, построение XGBoost на основе оптимальной комбинации гиперпараметров и вывод результатов классификации. С помощью этой модели классификации эмоции в комментариях учащихся можно классифицировать, что позволяет получить более интуитивное понимание субъективных чувств студентов по поводу обучения. Конкретные версии программного обеспечения, случайные семена, аппаратные характеристики, экологические характеристики и источники наборов данных, использованные в исследовании, приведены в таблице 1.

Тип множестваКонкретная модель и содержание
Базовое программное обеспечениеPython 3.9.7
Основная библиотекаXGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1
Случайный сидУстановить глобальное случайное начало на 42
Технические характеристики оборудования/среды1. Операционная система: Windows 10 Professional Edition (64 бит, номер версии 22H2)
2. Процессор: Intel Core i5-12600KF (с основной частотой 3,7 ГГц и частотой динамического ускорения 4,9 ГГц)
3. Память: 64 ГБ DDR4 (частота 3200 МГц, поддерживает до 128 ГБ памяти)
4. Память: 1 ТБ SSD (Samsung 980 Pro, скорость чтения 7450 МБ/с)
5. Видеокарта: NVIDIA GeForce RTX 3060 (12 ГБ видеопамяти)
Источники набора данных и детали доступа1. Набор данных платформы Superstar:
-Source Uniform Resource Locator (URL): https://www.chaoxing.com/
- Метод приобретения: подать заявку через открытую платформу Chaoxing Education Big Data (путь приложения: официальный сайт платформы → центр разработчиков → интерфейс данных → набор датасетов поведения в обучении)
2. Набор комментариев на платформе MOOC:
-URL источника: https://www.icourse163.org/.cn
- Метод приобретения: Подайте заявку через канал «поддержка исследований данных» платформы MOOC
Пользовательские скрипты или модели1. Скрипт предварительной обработки данных
2. Скрипт модели MPFR
3. Скрипт модели IGWO-XGBoost
 

Таблица 1: Конкретные версии программного обеспечения, случайные семена, аппаратные характеристики, экологические характеристики и источники наборов данных, используемые в исследовании. Предоставить подробный список необходимой программной и аппаратной среды, случайных настроек seed, источников наборов данных и диапазона поиска гиперпараметров XGBoost для исследования, чтобы обеспечить воспроизводимость и стандартизацию эксперимента.

Таблица 1 показывает, что исследование использует XGBoost 1.7.5 в качестве основной основы модели классификации настроений и вводит Scikit learn 1.2.2 для предварительной обработки данных, извлечения признаков и оценки моделей. Кроме того, исследование единообразно устанавливает случайное семя на 42, чтобы обеспечить воспроизводимость разбиения данных, перевыборки SMOTE, оптимизации гиперпараметров IGWO и обучения моделей IGWO-XGBost. Кроме того, алгоритм IGWO задаёт пространство поиска для гиперпараметров XGBoost. Диапазон поиска для скорости обучения равен [0,001, 0,3] по логарифмической шкале, а максимальная глубина дерева исследуется в целочисленном множестве {3, 4,..., 15}. Диапазон оптимизации терма L2 регуляризации равен [0,1, 5,0], а коэффициент выборки каждого подмножества признаков дерева оптимизирован в диапазоне [0,6, 1,0]. Диапазон настройки для минимального веса листовых узлов равен [1, 10].

Набор данных и связанный с ним код для предварительной обработки и анализа данных были сгенерированы и проанализированы самой командой. Основные скрипты для предварительной обработки данных показаны в Таблице 2.

Импортировать Pandas как PD, jieba, re, numpy как NP
из nltk.tokenize импорт word_tokenize; from nltk.stem import PorterStemmer
Определенно чисто (текст, L):
Return re.sub(r"[^\u4E00-\u9fa5]" если l=="zh" иначе r"[^a-zA-Z]", " ", text).strip()
Def Process(текст, L):
t = jieba.lcut(текст) если l=="zh" иначе word_tokenize(текст)
return " ".join([PorterStemmer().stem(w) если l=="en" иначе w для w в t, если w не в открытом("hit_stopwords.txt").read().split()])
Def Main(C,M,L):
cx=pd.read_csv(c).query("продолжительность обучения курса>=1 & результаты экзамена.notna()"); mc=pd.read_csv(m).query("текст комментария.str.len()>=5")
mc["t"]=mc["текст комментария"].apply(clean,args=("zh",)).apply(process,args=("zh",))
np.savez("out.npz",**{k:v для k,v в локальных параметрах().items()})

Таблица 2: Основной скрипт для предварительной обработки данных. Представить основную информацию о скрипте для предварительной обработки данных, уточнить этапы предварительной обработки, соответствующие скрипту, и предоставить технические ссылки для воспроизведения исследовательских методов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Результаты LBA с учётом многоперспективной и классификации настроений

Для проверки производительности создаётся экспериментальная среда и описывается экспериментальный набор данных. Кроме того, в этом исследовании выбирается сравнительный алгоритм IGWO-XGBoost и анализируется и проверяет его с помощью таких показателей, как точность, расход времени и скорость воспоминания. В анализе результатов исследование делит его на два чётко выраженных ра...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для анализа SOLB в этом исследовании были разработаны модели MPFR и IGWO-XGBoost и использованы данные с онлайн-платформ обучения. В эксперименте наблюдалась высокая согласованность между оценкой модели вывода и фактической оценкой, что свидетельствует об эффективности модели вывода. Около 25% студентов занимались 1-10 часов на курсе. Доля студентов с учебными часами в возрасте 11-20, 21-30, 31-40 часов и старше 41 часа составляла 30%, 20%, 15% и 10%. Это свидетельствует о умеренной инте...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет соответствующих финансовых или нефинансовых интересов для раскрытия.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Модель предварительно обученного языка BERTИсследование Googlehttps://github.com/google-research/bert
Словарь эмоций CNKICNKIhttps://www.cnki.net/
Платформа Чаосинг изучает поведенческие данныеЧаосинг INFORMATION TECHNOLOGY DEVELOPMENT Co., Ltdhttps://www.chaoxing.com/
Компьютерная памятьУниверсальный поставщик оборудования (конкретной модели нет)
Список терминов Харбинского технологического институтаХарбинский технологический институтhttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF Intel CorporationBX8071512600KF
Инструмент сегментации слов Jieba (режим точности)Стороннее сообщество с открытым исходным кодомhttps://github.com/fxsjy/jieba.
Данные оценки студентов платформы MOOCLove Course Networkhttps://www.icourse163.org/
Библиотека NLTKКоманда разработчиков NLTKhttps://www.nltk.org/
Язык программирования PythonФонд программного обеспечения Pythonhttps://www.python.org/
Scikit-learn 1.2.2Scikit learn teamhttps://scikit-learn.org/stable/
Платформа Smart Tree изучает поведенческие данныеSmart Tree Networkhttps://www.zhihuishu.com/
Технология SMOTEКоманда разработчиков Disbalanced LearnИнтегрировано в библиотеку Imbalanced Learn, https://imbalanced-learn.org/stable/
Операционная система Windows 10Корпорация Microsofthttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5Команда разработчиков XGBoosthttps://xgboost.readthedocs.io/

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Исправление

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

Теги

XGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

Похожие статьи