Artículo de investigación

Razonamiento difuso multiperspectiva y análisis basado en XGBoost sobre el comportamiento de aprendizaje en línea

DOI:

10.3791/69515

17 de marzo de 2026

En este artículo

Aviso de erratum

Important: There has been an erratum issued for this article. View Erratum Notice

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utiliza un modelo de razonamiento difuso multiperspectiva y un algoritmo mejorado de aumento de gradiente extremo (XGBoost) (optimizado por un algoritmo mejorado de optimización de lobo gris) para analizar el comportamiento de aprendizaje en línea y clasificar las emociones de los comentarios de los estudiantes, proporcionando apoyo para una enseñanza personalizada e intervención oportuna.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El auge del desarrollo de la educación en línea ha convertido las aulas online en un componente importante del campo educativo. El análisis en profundidad del comportamiento de aprendizaje de los estudiantes en la enseñanza online puede ayudar a los profesores a optimizar las estrategias de enseñanza y ofrecer apoyo personalizado al aprendizaje para los estudiantes. Por ello, para realizar un análisis en profundidad del comportamiento de aprendizaje de los estudiantes, este estudio recopila datos de plataformas de enseñanza online y los preprocesa. Posteriormente, este estudio construye un modelo de razonamiento difuso multiperspectiva que abarca tres dimensiones: currículo, individual y clase, para considerar de forma integral el rendimiento de aprendizaje de los estudiantes desde diferentes niveles. Este modelo procesa información incierta en los datos de comportamiento de aprendizaje mediante conjuntos difusos y reglas difusas, logrando una evaluación multidimensional del rendimiento del aprendizaje. Un algoritmo mejorado de XGBoost está diseñado para clasificar las emociones de los estudiantes en los comentarios. Este algoritmo mejorado optimiza los hiperparámetros del algoritmo XGBoost mejorando el algoritmo de optimización del lobo gris. El algoritmo mejora la precisión de la clasificación emocional y explora más a fondo las tendencias emocionales y la retroalimentación de actitud detrás de su comportamiento de aprendizaje. Los resultados mostraron que, desde la perspectiva curricular, la tasa de finalización de tareas del curso 3 semanas antes del examen era básicamente superior al 45%, mucho más alta que la tasa de finalización tres semanas después de que se publicara la tarea (ambas por debajo del 18%). Estos resultados indicaron que los estudiantes tenían más inclinación a completar tareas antes de la fecha límite y tenían una evidente procrastinación. La precisión máxima del algoritmo de clasificación mejorada fue del 98,78%, que fue del 8,57%, 7,55%, 6,38% y 6,01% superior al modelo de comparación, y su consumo medio de tiempo fue de 58 ms. Las tasas de recuerdo en emociones negativas, positivas y neutras fueron del 98,35%, 97,69% y 98,02%. El modelo de investigación puede analizar eficazmente el comportamiento de aprendizaje en línea de los estudiantes y permitir la identificación temprana de estudiantes en riesgo, facilitando la enseñanza personalizada y la intervención precisa en la educación online.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La profunda integración de Internet y la tecnología educativa ha hecho que la educación online pase de ser un complemento marginal a una forma convencional. A finales de 2023, el número de estudiantes registrados en línea en todo el mundo había superado los 1.200 millones, y China había estado consistentemente en primer lugar tanto en número de Cursos Masivos Abiertos en Línea (MOOCs) como enestudiantes 1,2. Sin embargo, aunque la enseñanza online aporta comodidad, también expone desafíos como el proceso de aprendizaje opaco, la separación entre profesores y estudiantes en tiempo y espacio, y la retroalimentación regulatoria lenta. Existe una correlación positiva entre los datos de comportamiento de aprendizaje y el rendimiento académico. La afinación dinámica basada en datos puede aumentar la tasa de finalización de cursos en más de un 20% y reducir significativamente el riesgo deabandono 3,4,5. Por lo tanto, realizar un Análisis de Conducta de Aprendizaje (LBA) es fundamental. Respecto a este tema, los métodos actuales incluyen estadística descriptiva, minería de reglas de asociación y clasificación tradicional por aprendizajeautomático 6. Muchos estudiosos han investigado este tema.

Para realizar LBA, Li Y et al. utilizaron datos de comportamiento de aprendizaje de plataformas de enseñanza en línea de la Universidad de Harvard y el Instituto Tecnológico de Massachusetts para construir una Red Neuronal de Pulsos (PNN) que prediga los resultados de aprendizaje. Analizaron la correlación entre el comportamiento de aprendizaje y los resultados. El modelo de predicción del comportamiento de aprendizaje en línea basado en PNN alcanzó una precisión del 99,80%7. Zeng B diseñó un modelo eficiente para visualizar el comportamiento de aprendizaje en inglés en línea utilizando análisis de secuencias lagadas, métodos combinados de minería de datos y el algoritmo de árbol de expansión mínima. Además, el estudio también estableció una plataforma de aprendizaje inteligente en línea para servicios de construcción de la Ruta de Aprendizaje en Grupo (GLP). El método diseñado podía construir con éxito un GLP8. Zhao M y colaboradores diseñaron una Memoria a Corto Plazo Largo (LSTM) de doble capa para revelar posibles problemas en el aprendizaje online de los estudiantes. Utilizaron el framework TensorFlow y el lenguaje Python, y emplearon datos de plataformas online como Kaggle, edX y la Open University del Reino Unido. Esta red tuvo buen rendimiento, con una precisión máxima del 83,4%. Li F et al. recopilaron y analizaron datos de comportamiento de aprendizaje de 109 estudiantes de grado para comprender las características del comportamiento grupal de diferentes estudiantes en línea. Este estudio introdujo el análisis de componentes principales para reducir la dimensionalidad de los datos y utilizó agrupaciones jerárquicas aglomerativas para clasificar a los estudiantes en varias categorías. De ellos, 15 grupos estaban agrupados y el método propuesto tenía una buena precisión deagrupamiento 10.

En resumen, la investigación actual sobre LBA es bastante diversa y emplea una amplia variedad de métodos. Sin embargo, estos estudios y métodos también presentan ciertas carencias. Por ejemplo, no hay suficiente extracción de información emocional en los textos de revisión de los estudiantes, y la estadística descriptiva no puede revelar los complejos mecanismos de interacción detrás de los comportamientos. La clasificación por aprendizaje automático suele basarse en características de perspectiva única, que separan la información multidimensional de asignaturas, individuos y clases. Para mejorar el rendimiento de LBA, este estudio diseña un modelo de Razonamiento Difuso Multi-Perspectiva (MPFR) y construye un modelo de clasificación emocional basado en algoritmos de Optimización Mejorada de Grey Wolf (IGWO) y Aumento de Gradiente Tremendo (XGBoost).

En la investigación existente sobre LBA, aunque el LSTM puede captar la correlación temporal de los comportamientos de aprendizaje, su capacidad para manejar datos difusos e inciertos de conductas de aprendizaje es débil. La Red Neuronal Convolucional (CNN) tiene ciertas ventajas en la extracción de características de texto, pero es mejor capturando características locales y es difícil integrar información global multidimensional de cursos, individuos y clases. En comparación con métodos de aprendizaje profundo como CNN y LSTM, el modelo MPFR puede capturar información incierta en el comportamiento de aprendizaje mediante razonamiento difuso. Por ejemplo, la "participación moderada" y el "dominio básico" de los estados difusos de los estudiantes compensan las limitaciones de la extracción local de reportajes de CNN. IGWO-XGBoost equilibra precisión y eficiencia en la clasificación de sentimiento, compensando la larga clasificación de sentimiento LSTM y el débil procesamiento semántico difuso de CNN. Este estudio tiene como objetivo proporcionar apoyo informativo tridimensional para la intervención docente en línea, combinando los resultados del análisis de conducta y de las emociones. La innovación de la investigación radica en la construcción de un modelo MPFR que abarca tres dimensiones: currículo, individual y clase. Esta consideración integral desde múltiples perspectivas puede reflejar de forma exhaustiva y estereoscópica el rendimiento de aprendizaje de los estudiantes, evitando información importante que pueda pasar desapercibida desde una sola perspectiva. Este método tiene buena escalabilidad de plataforma y puede adaptarse a plataformas de aprendizaje online convencionales como Chaoxing y MOOC, es decir, mediante una interfaz unificada de preprocesamiento de datos sin necesidad de funciones adicionales de desarrollo de plataforma. Al mismo tiempo, este método se ha encapsulado como una herramienta de análisis sencilla, y los educadores solo necesitan subir los datos básicos exportados desde la plataforma para generar automáticamente informes LBA sin operaciones técnicas complejas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diseño del método LBA considerando las perspectivas MPFR y emocionales

Se construye un sistema de evaluación multiperspectiva para analizar el Comportamiento de Aprendizaje en Línea (SOLB) de los estudiantes, y se diseña un modelo MPFR. Para analizar más a fondo los sentimientos subjetivos de los estudiantes durante el aprendizaje, este estudio adopta el algoritmo XGBoost y diseña el algoritmo IGWO para optimizar hiperparámetros y mejorar la precisión de la clasificación.

Construcción del modelo MPFR para LBA

Para analizar SOLB, este estudio parte principalmente de dos perspectivas para formar un plan de análisis completo. En primer lugar, en términos de rendimiento de aprendizaje, este estudio considera tres perspectivas: currículo, individual y clase, para formar el modelo MPFR. En segundo lugar, en términos de análisis de sentimiento de los comentarios de los estudiantes, este estudio diseña un algoritmo XGBoost mejorado. A través del análisis del rendimiento en el aprendizaje y las emociones de retroalimentación de los estudiantes, este estudio puede analizar mejor la SOLB. En cuanto a detalles técnicos específicos del análisis del rendimiento del aprendizaje, este estudio utiliza primero datos de una plataforma de aprendizaje online y los preprocesa. En segundo lugar, este estudio selecciona indicadores clave de evaluación del rendimiento del aprendizaje desde diferentes perspectivas para construir un sistema de evaluación integral. Posteriormente, se construye un modelo MPFR correspondiente para evaluar el comportamiento de aprendizaje.

Este estudio selecciona datos de la plataforma Superstar (fuente: https://www.chaoxing.com/). Contiene información de múltiples dimensiones, como actividades en el aula y evaluación de calificaciones, que puede proporcionar una buena base para futuras asignaturas de LBA. Tras obtener los datos, debe ser preprocesado, incluyendo principalmente la eliminación de campos irrelevantes, el filtrado de datos y las comprobaciones de integridad de los datos. Por ejemplo, en los datos del profesor, es necesario eliminar información irrelevante como el número y el departamento al que pertenece el curso. Posteriormente, este estudio construye la ingeniería de características de LBA basada en los datos de comportamiento de aprendizaje de la plataforma Superstar. El índice LBA de estudiantes proporciona una base de ingeniería de características para el modelo MPFR posterior, y el contenido de este índice se muestra en la Figura 1.

figure-protocol-1
Figura 1: Indicadores para LBA estudiantil. La figura aclara las tres dimensiones principales (currículo, individual, clase) del LBA del estudiante y los indicadores específicos de evaluación bajo cada dimensión, proporcionando soporte de características para el modelo MPFR. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En la Figura 1, los indicadores del LBA para estudiantes giran principalmente en torno a tres perspectivas: curso, individual y clase, con un claro enfoque en cada dimensión, proporcionando un soporte preciso de características para la construcción de modelos MPFR. Entre ellas, en cuanto a indicadores de dimensión del curso, este estudio selecciona la tasa de finalización de tareas del curso, la duración del aprendizaje y la frecuencia de interacción con el curso. La preocupación central de esta dimensión es la calidad general de finalización de las tareas del curso y la puntualidad de la participación en el aprendizaje. Por ejemplo, la tasa de finalización de las tareas del curso se utiliza para seguir la diferencia en las tasas de finalización antes y después del plazo; La duración del estudio del curso se utiliza para distinguir diferentes intervalos de intensidad de aprendizaje; La frecuencia de interacción se utiliza para filtrar comportamientos interactivos efectivos. A nivel personal, el progreso en el aprendizaje personal, la calidad de la finalización de deberes y las puntuaciones de los exámenes se seleccionan como indicadores de evaluación. Esta dimensión se centra en el grado de coincidencia entre el progreso del aprendizaje personal y los resultados en el dominio del conocimiento. Ejemplos incluyen comparar el progreso personal del aprendizaje con los planes de curso, evaluar la precisión y eficiencia de los trabajos completados y clasificar los niveles de dominio del conocimiento basándose en las puntuaciones de los exámenes. Además, en cuanto a la dimensión de la clase, los indicadores seleccionados incluyen la puntuación media de la clase, la actividad de interacción en clase y el ambiente de aprendizaje en clase. Esta dimensión se centra principalmente en el impacto del entorno de aprendizaje en general en el comportamiento individual. Por ejemplo, la nota media se utiliza para localizar el nivel relativo de rendimiento individual en el grupo; la actividad de interacción de clase se utiliza para reflejar el grado de participación colectiva; El ambiente de aprendizaje se utiliza para analizar el efecto impulsor del entorno grupal en el comportamiento de aprendizaje. Para analizar el comportamiento de aprendizaje de los estudiantes, se construye un modelo de razonamiento difuso y se obtienen las características del comportamiento de aprendizaje desde diferentes perspectivas. El razonamiento difuso es un método de razonamiento que utiliza lógica difusa, que procesa información imprecisa o incierta mediante conjuntos difusos y reglas difusas, y cuenta con las ventajas de una gran flexibilidad y fácil comprensión11,12. El razonamiento difuso, como mecanismo central de computación de los modelos MPFR, se aplica después de la ingeniería de características. El proceso principal de razonamiento difuso se muestra en la Figura 2.

figure-protocol-2
Figura 2: El diagrama principal del razonamiento difuso. La figura muestra el proceso central del razonamiento difuso, incluyendo cuatro pasos clave: fuzzificación, construcción de la base de reglas difusas, razonamiento difuso y desenfoque, y aclara la lógica del modelo MPFR en el manejo de datos de comportamiento de aprendizaje inciertos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El razonamiento difuso implica principalmente fuzzificación, establecimiento de una Biblioteca de Reglas Difusas (FRL), razonamiento difuso y desenfoque. Entre ellas, la fuzzificación requiere convertir datos de entrada precisos en conjuntos difusos e implica definir funciones de pertenencia. El FRL contiene una serie de reglas difusas y se utiliza principalmente para describir la relación entre entrada y salida. En la construcción de la base de reglas difusas, el estudio invita a tres profesores asociados de tecnología educativa con ≥ de 8 años de experiencia docente para desarrollar conjuntamente 28 reglas, y determina las reglas finales mediante tres rondas de iteración utilizando el "método Delphi". Por ejemplo, Regla 1: SI la tasa de finalización de la tarea del curso es inferior al 30% y el progreso individual está 2 semanas retrasado respecto al calendario → ENTONCES el estado de alto riesgo. El razonamiento difuso es el proceso de inferir datos de entrada difusos construidos sobre un FRL y obtener resultados de salida difusos. Finalmente, la eliminación de difuminado convertirá el resultado de salida borrosa en un valor de salida preciso. El estudio selecciona una función de pertenencia triangular, que es una función ampliamente utilizada en sistemas lógicos difusos y que presenta ventajas como gran flexibilidad y alta eficiencia computacional. La expresión de la función μA(x) se muestra en la ecuación (1).

figure-protocol-3 (1)

En la ecuación (1), x es el valor de entrada específico. A, B y C son los tres vértices de un triángulo. En el desenfoque, este artículo utiliza el método del centroide para convertir los resultados de salida. El método del centroide es una técnica de desenfoque comúnmente utilizada en lógica difusa, que presenta ventajas como una fuerte intuición, cálculo sencillo y estabilidad13. La expresión del método del centroide se muestra en la ecuación (2)14.

figure-protocol-4 (2)

En la ecuación (2), f* es el valor de salida tras el desenfoque, que es el centroide del conjunto difuso. μ(x) es la función de membresía. figure-protocol-5 es la suma ponderada de todos los puntos en un conjunto difuso. figure-protocol-6 es la integral de la función de pertenencia sobre todos los valores posibles de x. La racionalidad de usar reglas y funciones de pertenencia definidas manualmente en el modelo MPFR se refleja en tres aspectos. En primer lugar, garantía de cualificación experta: los responsables de la normativa son tres profesores asociados de tecnología educativa y han sido certificados por el "Analista de Comportamiento de Aprendizaje en Línea" del "Centro de Investigación en Educación Online del Ministerio de Educación" para garantizar que las normas cumplan con las leyes de educación y enseñanza. En segundo lugar, ventaja de eficiencia: El tiempo de inferencia de las reglas manuales es mucho menor que el de los métodos basados en datos, lo que lo hace más adecuado para las necesidades de "inferencia en tiempo real" de las plataformas educativas online y no requiere una gran cantidad de datos anotados, reduciendo así los costes de recogidade datos 15. En tercer lugar, adaptándose al requisito fundamental de "interpretabilidad" en escenarios de educación online, las reglas definidas manualmente y las funciones de pertenencia triangular (Ecuación 1) pueden corresponder directamente a la cognición intuitiva en escenarios de enseñanza. Los educadores no necesitan una formación técnica compleja para entender la razón por la que un estudiante se considera en riesgo. Métodos basados en datos, como los sistemas neuro-fuzzy, pueden optimizar automáticamente las reglas. Sin embargo, la mayoría de las reglas generadas son expresiones matemáticas complejas, que resultan difíciles de interpretar para los educadores, lo que reduce la aceptabilidad del modelo en la intervención docente real.

Diseño de un modelo mejorado de análisis de sentimiento de comentarios estudiantiles para XGBoost

El modelo MPFR diseñado puede analizar SOLB desde tres aspectos: curso, individual y clase. Sin embargo, el análisis externo de datos conductuales tiene limitaciones a la hora de expresar los sentimientos subjetivos de los estudiantes. Por ello, para analizar más a fondo los sentimientos subjetivos de los estudiantes sobre el aprendizaje, se recopilan y preprocesan datos adicionales de las plataformas de aprendizaje MOOC que contienen información de comentarios de los estudiantes. Posteriormente, el XGBoost se utiliza para construir el modelo de clasificación de sentimiento. El IGWO está diseñado para optimizar sus parámetros y mejorar la precisión del modelo de clasificación. La mejora de XGBoost se refleja en su optimización de parámetros mediante el algoritmo IGWO. El preprocesamiento de datos es un primer paso crucial antes de la construcción y el análisis del modelo. El proceso de preprocesamiento de datos se muestra en la Figura 3.

figure-protocol-7
Figura 3: El proceso de preprocesamiento de datos. El proceso de preprocesamiento de datos de nueve pasos incluye limpieza de texto, segmentación de palabras, eliminación de palabras de parada, extracción de tallos y reconocimiento de palabras de sentimiento, proporcionando datos de alta calidad para el análisis de comportamiento y la clasificación de sentimientos posteriores. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Los pasos de preprocesamiento de datos son los siguientes: El primer paso es realizar una limpieza de texto para eliminar campos irrelevantes en los datos de la plataforma Chaoxing y filtrar muestras inválidas. Al mismo tiempo, los campos no textuales y las reseñas breves se eliminan de los datos de reseñas en la plataforma MOOC. El segundo paso es realizar el procesamiento de segmentación. Entre ellos, los comentarios chinos utilizan el "modo preciso" de Jieba para el procesamiento de segmentación de texto, mientras que los comentarios en inglés emplean la función de segmentación de palabras de la biblioteca NLTK para su procesamiento. El tercer paso es eliminar palabras clave comunes como ''de'', ''yes'', ''in'', etc. Entre ellas, las palabras clave chinas utilizan la lista de palabras clave (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) del Instituto de Tecnología de Harbin. Las palabras de paso se eliminan mediante coincidencias de palabras. Las palabras de oclusiva en inglés utilizan la lista universal de palabras de parada integrada en la biblioteca NLTK, que también se elimina mediante coincidencia palabra por palabra. El cuarto paso es utilizar el stemmer de la biblioteca NLTK para extraer stems del texto y restaurar los verbos en los datos ingleses a su forma stem. El quinto paso es identificar las palabras emocionales positivas y negativas en los comentarios basándose en el diccionario emocional de CNKI para proporcionar una base previa a la anotación para la posterior clasificación emocional. El sexto paso es realizar la extracción de características. Entre ellos, los datos estructurados en la plataforma Chaoxing están estandarizados, mientras que los indicadores de clasificación se codifican por separado. Al mismo tiempo, estos datos de comentarios de la plataforma MOOC utilizan un modelo de lenguaje preentrenado (Bidirectional Encoder Representation from Transformers, BERT) para extraer características de texto. La principal ventaja del modelo BERT en la extracción de características de texto es que puede generar dinámicamente vectores de palabra conscientes del contexto mediante una arquitectura Transformer bidireccional profunda, abordando efectivamente la ambigüedad que los modelos estáticos tradicionales de incrustación de palabras no pueden manejar. El séptimo paso es abordar el problema de las categorías de sentimiento desequilibradas en los datos de comentarios. Se emplea la Técnica de Sobremuestreo de Minorías Sintéticas (SMOTE) para procesarlo. Se seleccionan cinco muestras de vecinos más cercanos para interpolación y así generar muestras sintéticas de la clase minoritaria, con una semilla aleatoria fija de 42 para asegurar la reproducibilidad del experimento. El octavo paso es anotar y particionar los datos. El noveno paso es rellenar los valores que faltan en los datos de superestrellas y eliminar los valores atípicos. Al realizar el procesamiento de balanceo de datos, SMOTE crea nuevas muestras compuestas interpolando entre muestras de clases minoritarias, aumentando así el número de muestras de clases minoritarias y haciendo que la distribución por clases del conjunto de datos sea másequilibrada 16,17. La expresión de SMOTE se muestra en la ecuación (3).

Bmn = dm + rand(0,1) x (dmn -d m) (3)

En la ecuación (3), Bmn es una muestra de clase minoritaria construida artificialmente, dm es la i-ésima muestra de clase minoritaria, y dmn es la n-ésima muestra entre los k vecinos más cercanos de dm. rand(0,1) es un número aleatorio entre 0 y 1. XGBoost mejora el rendimiento predictivo añadiendo iterativamente árboles de predicción. Tiene ventajas como alta precisión, gran flexibilidad y facilidad de uso18,19. Los pasos para construir iterativamente un modelo de árbol usando XGBoost incluyen: inicializar el modelo, construir iterativamente el árbol, la función objetivo y el término de regularización. La salida figure-protocol-8 predicha en la t-ésima iteración se muestra en la ecuación (4).

figure-protocol-9   (4)

En la ecuación (4), figure-protocol-10 es el valor de predicción del modelo tras la t - 1ª iteración, ft(h) es la función de predicción del modelo en árbol añadida en la t-ésima iteración, y h es el vector de características de entrada. La función objetivo para minimizar XGBoost se muestra en la ecuación (5).

figure-protocol-11 (5)

En la ecuación (5), i es el número de muestra. I y J son el número total de muestras y árboles, y j es el número de árboles. figure-protocol-12 es la función de pérdida, y gi es la verdadera etiqueta de la i -ésima muestra. figure-protocol-13 es el valor predicho del modelo para la i -ésima muestra tras la t-ésima iteración. Ω(f t) es el término de regularización, y (ft) es la función de predicción del j -ésimo árbol. La expresión general Ω(f) para la regularización se muestra en la ecuación (6).

figure-protocol-14 (6)

En la ecuación (6), γ significa el coeficiente de penalización para la cantidad de nodos hoja, λ es el coeficiente de regularización L2 para el peso de los nodos hoja, y w es el peso de los nodos hoja. Sin embargo, la elección de los hiperparámetros XGBoost tiene un efecto directo y significativo en el rendimiento. Los hiperparámetros comunes de XGBoost incluyen la tasa de aprendizaje, la profundidad máxima del árbol y los parámetros de regularización. Debido al potencial gran espacio de hiperparámetros, ajustar manualmente estos parámetros no solo consume mucho tiempo, sino que también es difícil encontrar la combinación óptima de parámetros. Por ello, este estudio diseña IGWO para optimizar los hiperparámetros de XGBoost. GWO busca soluciones óptimas simulando la jerarquía social y las estrategias de caza de los lobos grises, con ventajas como menos parámetros y una fuerteadaptabilidad 20,21. En GWO, se genera la posición inicial de la población como se muestra en la ecuación (7).

figure-protocol-15(7)

En la ecuación (7), Puv es la posición del u-ésimo individuo en la v-ésima dimensión. figure-protocol-16 y figure-protocol-17 son los límites superior e inferior del v-ésimo espacio de búsqueda. rand() es un número aleatorio entre [0,1]. Sin embargo, el algoritmo GWO puede encontrarse con problemas como la lenta velocidad de convergencia y quedarse atascado en óptimos locales en las etapas intermedias y posteriores. Esto también significa que, en este momento, GWO puede no ser capaz de explorar eficazmente todo el espacio de soluciones, lo que dificulta encontrar la solución óptima global. Para abordar este problema, este estudio mejora GWO desde dos aspectos: la introducción del Mapa Caótico de la Tienda (TCM) y el Factor de Convergencia No Lineal (NCF). La MTC es un mapeo caótico simple que garantiza que las regiones óptimas de solución potenciales no se pierdan durante el proceso de búsqueda y evita búsquedas repetidas en la misma región22. Por tanto, mediante la MTC, se puede generar una población inicial más uniforme y aleatoria, y se puede mejorar la capacidad del algoritmo para superar óptimos locales. El cálculo de la MTC se muestra en la ecuación (8).

figure-protocol-18 (8)

En la ecuación (8), y es el parámetro de control.  Rt y Rt+1 son las variables de estado del sistema en las t-ésima y t+1-ésima iteraciones. La fórmula para la NCF z se muestra en la ecuación (9).

figure-protocol-19(9)

En la ecuación (9), zmax es el factor máximo de convergencia y tmax es el número máximo de iteraciones. Este método no lineal de disminución permite a GWO mantener un gran tamaño de paso para la búsqueda global en la etapa inicial. En la etapa intermedia de la búsqueda, la velocidad de convergencia se acelera, mientras que en la etapa posterior la búsqueda local se realiza con pasos más pequeños, equilibrando eficazmente las capacidades de búsqueda global y local y mejorando el rendimiento de optimización. El algoritmo IGWO se utiliza específicamente para la etapa de optimización de hiperparámetros del clasificador de sentimiento XGBoost, y su proceso principal se muestra en la Figura 4.

figure-protocol-20
Figura 4: El proceso principal de IGWO. La figura describe el proceso de ejecución de IGWO, incluyendo la inicialización de poblaciones basada en mapeo caótico de tendas, actualización de posición de factores de convergencia no lineales y cribado individual óptimo, y aclara la lógica para optimizar los hiperparámetros XGBoost. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En la Figura 4, el proceso IGWO incluye: inicializar el algoritmo; el uso de la MTC para inicializar la población; calcular el valor inicial de aptitud de cada individuo; usando NCF para actualizar las posiciones de los lobos grises; seleccionar la solución con la mejor forma física como nuevo individuo óptimo; y la salida de la persona óptima. La combinación óptima de hiperparámetros XGBoost puede enviarse a través de IGWO. El proceso general de clasificación de sentimiento integra el preprocesamiento de datos, la optimización IGWO y el modelo final XGBoost. El proceso del modelo de clasificación basado en IGWO-XGBoost se muestra en la Figura 5.

figure-protocol-21
Figura 5: El proceso del modelo de clasificación basado en IGWO-XGBoost. La figura muestra el proceso completo del modelo de clasificación de sentimiento IGWO-XGBoost, desde la entrada y preprocesamiento de datos hasta la partición de conjuntos de datos, la optimización de hiperparámetros de IGWO, la construcción del modelo XGBoost y la salida de resultados de clasificación, presentando claramente la cadena de operaciones del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El modelo basado en IGWO-XGBoost incluye procesos como datos de entrada, preprocesamiento de datos, partición de conjuntos de datos, optimización de hiperparámetros del algoritmo IGWO, combinación óptima de hiperparámetros, construcción de XGBoost basada en la combinación óptima de hiperparámetros y salida de resultados de clasificación. A través de este modelo de clasificación, las emociones en los comentarios de los estudiantes pueden clasificarse, lo que permite una comprensión más intuitiva de los sentimientos subjetivos de los estudiantes sobre el aprendizaje. Las versiones específicas del software, semillas aleatorias, especificaciones de hardware, especificaciones ambientales y fuentes de conjuntos de datos utilizadas en el estudio se muestran en la Tabla 1.

Tipo de decoradoModelo y contenido específicos
Software básicoPython 3.9.7
Biblioteca centralXGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1
Semilla aleatoriaEstablece la semilla aleatoria global en 42
Especificaciones de hardware/entorno1. Sistema operativo: Windows 10 Edición Profesional (64 bits, número de versión 22H2)
2. Procesador: Intel Core i5-12600KF (con frecuencia principal de 3,7 GHz y frecuencia de aceleración dinámica de 4,9 GHz)
3. Memoria: 64GB DDR4 (frecuencia 3200MHz, soporta hasta 128GB de memoria)
4. Almacenamiento: SSD de 1TB (Samsung 980 Pro, velocidad de lectura 7450MB/s)
5. Tarjeta gráfica: NVIDIA GeForce RTX 3060 (12GB de memoria de vídeo)
Fuentes de conjuntos de datos y detalles de acceso1. Conjunto de datos de plataformas superstar:
-Localizador uniforme de recursos de la fuente (URL): https://www.chaoxing.com/
-Método de adquisición: solicitar a través de la plataforma abierta de big data de Chaoxing Education (ruta de aplicación: plataforma web oficial → centro de desarrollo → interfaz de datos → conjunto de datos de comportamiento de aprendizaje)
2. Conjunto de datos de comentarios de la plataforma MOOC:
-URL de la fuente: https://www.icourse163.org/.cn
-Método de adquisición: Solicitar a través del canal de "soporte de investigación de datos" de la plataforma MOOC
Scripts o modelos personalizados1. Script de preprocesamiento de datos
2. Script modelo MPFR
3. Script modelo IGWO-XGBoost
 

Tabla 1: Versiones específicas de software, semillas aleatorias, especificaciones de hardware, especificaciones ambientales y fuentes de conjuntos de datos utilizadas en la investigación. Proporciona una lista detallada del entorno de software y hardware requerido, configuraciones semillada aleatorias, fuentes de conjuntos de datos y el rango de búsqueda de hiperparámetros XGBoost para el estudio para garantizar la reproducibilidad y estandarización del experimento.

La Tabla 1 muestra que el estudio adopta XGBoost 1.7.5 como marco central del modelo de clasificación de sentimiento e introduce Scikit learn 1.2.2 para preprocesamiento de datos, extracción de características y evaluación de modelos. Además, el estudio establece uniformemente la semilla aleatoria en 42 para asegurar la reproducibilidad de la partición de datos, el sobremuestreo SMOTE, la optimización de hiperparámetros IGWO y los resultados del entrenamiento del modelo IGWO-XGBoost. Además, el algoritmo IGWO establece el espacio de búsqueda para los hiperparámetros XGBoost. El rango de búsqueda para la tasa de aprendizaje es [0,001, 0,3] en la escala logarítmica, y la profundidad máxima del árbol se busca en el conjunto entero {3, 4,..., 15}. El rango de optimización del término de regularización L2 es [0,1, 5,0], y la proporción de muestreo de cada subconjunto de características del árbol está optimizada dentro del rango de [0,6, 1,0]. El rango de sintonización para el peso mínimo de los nodos hoja es [1, 10].

El conjunto de datos y el código de preprocesamiento y análisis de datos relacionados fueron generados y analizados por el propio equipo. Los scripts básicos para el preprocesamiento de datos se muestran en la Tabla 2.

Pandas importados como PD, Jieba, Re, Numpy, como NP
de la word_tokenize de importación de nltk.tokenize; de la importación nltk.stem PorterStemmer
Definitivamente limpio (texto, l):
return re.sub(r"[^\u4e00-\u9fa5]" si l=="zh" si no r"[^a-zA-Z]", " ", text).strip()
Def Process (texto, l):
t = jieba.lcut(texto) si l=="zh" si no word_tokenize(texto)
return " ".join([PorterStemmer().stem(w) si l=="en" si no w por w en t si w no está en open("hit_stopwords.txt").read().split()])
def main(c,m,l):
cx=pd.read_csv(c).query("duración del curso>=1 & resultados del examen.notna()"); mc=pd.read_csv(m).query("text de comentario.str.len()>=5")
mc["t"]=mc["texto de comentario"].apply(clean,args=("zh",).apply(proceso,args=("zh",))
np.savez("out.npz",**{k:v for k,v in locals().items()})

Tabla 2: Script central para el preprocesamiento de datos. Presentar la información central del script para el preprocesamiento de datos, aclarar los pasos de preprocesamiento correspondientes al script y proporcionar referencias técnicas para la replicación de métodos de investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Resultados de LBA considerando la clasificación multiperspectiva y de sentimiento

Para verificar el rendimiento, se configura el entorno experimental y se describe el conjunto de datos experimental. Además, este estudio selecciona el algoritmo comparativo IGWO-XGBoost y lo analiza y verifica utilizando indicadores como la precisión, el consumo de tiempo y la tasa de recuerdo. En el análisis de resultados, el estudio lo divide en dos secciones ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para el análisis de SOLB, este estudio diseñó modelos MPFR e IGWO-XGBoost y utilizó datos de plataformas de enseñanza en línea. En el experimento, hubo una alta consistencia entre la valoración del modelo de inferencia y la puntuación real, lo que indica la efectividad del modelo de inferencia. Aproximadamente el 25% de los estudiantes tuvo un tiempo de estudio de 1 a 10 horas en el curso. La proporción de estudiantes con horas de estudio entre 11 y 20 años, 21 y 30 años, 31 y 40 horas y...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen intereses financieros o no financieros relevantes que revelar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Modelo de lenguaje preentrenado en BERTInvestigación en Googlehttps://github.com/google-research/bert
Diccionario de emociones de CNKICNKIhttps://www.cnki.net/
La plataforma de chaoxing aprende datos de comportamientoChaoxing INFORMATION TECHNOLOGY DEVELOPMENT Co., Ltdhttps://www.chaoxing.com/
Memoria de ordenadorProveedor universal de hardware (sin modelo específico)
Lista de términos descontinuados del Instituto de Tecnología de HarbinInstituto Tecnológico de Harbinhttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF Intel CorporationBX8071512600KF
Herramienta de segmentación de palabras Jieba (modo de precisión)Comunidad de código abierto de terceroshttps://github.com/fxsjy/jieba.
Datos de reseñas estudiantiles de la plataforma MOOCRed de Cursos de Amorhttps://www.icourse163.org/
Biblioteca NLTKEquipo de desarrollo de NLTKhttps://www.nltk.org/
Lenguaje de programación PythonFundación de Software Pythonhttps://www.python.org/
Scikit-learn 1.2.2Equipo de aprendizaje de Scikithttps://scikit-learn.org/stable/
La plataforma Smart Tree aprende datos de comportamientoRed de Árboles Inteligenteshttps://www.zhihuishu.com/
Tecnología SMOTEEquipo de Desarrollo de Aprendizaje DesequilibradoIntegrado en la biblioteca Imparable Learn, https://imbalanced-learn.org/stable/
Sistema operativo Windows 10Microsoft Corporationhttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5Equipo de desarrollo de XGBoosthttps://xgboost.readthedocs.io/

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Erratum

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

Etiquetas

XGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

Artículos relacionados