Artigo de investigação

Raciocínio Nebuloso Multi-Perspectiva e Análise Baseada em XGBoost do Comportamento de Aprendizagem Online

DOI:

10.3791/69515

17 de março de 2026

Neste artigo

Aviso de errata

Important: There has been an erratum issued for this article. View Erratum Notice

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utiliza um modelo de raciocínio difuso multiperspectivas e um algoritmo aprimorado de aumento de gradiente extremo (XGBoost) (otimizado por um algoritmo aprimorado de otimização do lobo cinzento) para analisar comportamentos de aprendizagem online e classificar as emoções dos comentários dos alunos, oferecendo suporte para ensino personalizado e intervenção oportuna.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O desenvolvimento acelerado da educação online tornou as salas de aula online um componente importante do campo educacional. A análise aprofundada do comportamento de aprendizagem dos alunos no ensino online pode ajudar os professores a otimizar estratégias de ensino e oferecer suporte personalizado para os alunos. Portanto, para realizar uma análise aprofundada do comportamento de aprendizagem dos alunos, este estudo coleta dados de plataformas de ensino online e os pré-processa. Posteriormente, este estudo constrói um modelo de raciocínio difuso multiperspectiva, cobrindo três dimensões: currículo, individual e de turma, para considerar de forma abrangente o desempenho de aprendizagem dos alunos em diferentes níveis. Esse modelo processa informações incertas em dados de comportamento de aprendizagem por meio de conjuntos e regras difusas, alcançando uma avaliação multidimensional do desempenho de aprendizagem. Um algoritmo XGBoost aprimorado foi projetado para classificar as emoções dos comentários dos alunos. Esse algoritmo aprimorado otimiza os hiperparâmetros do algoritmo XGBoost ao aprimorar o algoritmo de otimização do lobo cinzento. O algoritmo aprimora a precisão da classificação emocional e explora ainda mais as tendências emocionais e o feedback de atitude por trás do comportamento de aprendizagem deles. Os resultados mostraram que, do ponto de vista curricular, a taxa de conclusão das tarefas do curso 3 semanas antes do exame era basicamente superior a 45%, o que era muito maior do que a taxa de conclusão três semanas após o lançamento da tarefa (ambas abaixo de 18%). Esses resultados indicaram que os alunos estavam mais inclinados a concluir as tarefas antes do prazo e apresentavam procrastinação evidente. A precisão máxima do algoritmo de classificação aprimorada foi de 98,78%, 8,57%, 7,55%, 6,38% e 6,01% maior que o modelo de comparação, e seu consumo médio de tempo foi de 58 ms. As taxas de recordação em emoções negativas, positivas e neutras foram de 98,35%, 97,69% e 98,02%. O modelo de pesquisa pode analisar efetivamente o comportamento de aprendizagem online dos alunos e permitir a identificação precoce de alunos em risco, facilitando o ensino personalizado e a intervenção precisa na educação online.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A profunda integração da Internet com a tecnologia educacional fez a educação online passar de um suplemento marginal para uma forma convencional. No final de 2023, o número de alunos online registrados no mundo todo ultrapassava 1,2 bilhão, e a China vinha consistentemente ocupando o primeiro lugar mundial tanto em número de Cursos Online Abertos em Massa (MOOCs) quanto emalunos 1,2. No entanto, embora o ensino online traga conveniência, ele também expõe desafios como o processo opaco de aprendizagem, a separação entre professores e alunos em tempo e espaço, e o atraso no feedback regulatório. Há uma correlação positiva entre dados de comportamento de aprendizagem e desempenho acadêmico. O ajuste dinâmico baseado em dados pode aumentar as taxas de conclusão de cursos em mais de 20% e reduzir significativamente o risco de evasão 3,4,5. Portanto, realizar a Análise do Comportamento de Aprendizagem (LBA) é fundamental. Sobre essa questão, os métodos atuais incluem estatística descritiva, mineração de regras de associação e classificação tradicional por aprendizadode máquina 6. Muitos estudiosos pesquisaram essa questão.

Para conduzir a LBA, Li Y et al. utilizaram dados de comportamento de aprendizagem provenientes de plataformas de ensino online da Universidade de Harvard e do Instituto de Tecnologia de Massachusetts para construir uma Rede Neural de Pulsos (PNN) para prever resultados de aprendizagem. Eles analisaram a correlação entre comportamento de aprendizagem e resultados. O modelo de predição de comportamento de aprendizagem online baseado em PNN alcançou uma precisão de 99,80%. Zeng B projetou um modelo eficiente para visualizar o comportamento de aprendizagem online de inglês usando análise de sequências lagadas, métodos combinados de mineração de dados e o algoritmo de árvore de expansão mínima. Além disso, o estudo também estabeleceu uma plataforma de aprendizagem inteligente online para serviços de construção do Group Learning Path (GLP). O método projetado poderia construir com sucesso um GLP8. Zhao M et al. projetaram uma Memória de Curto Prazo Longo (LSTM) de dupla camada para revelar potenciais problemas na aprendizagem online dos alunos. Eles usaram o framework TensorFlow e a linguagem Python, e utilizaram dados das plataformas online Kaggle, edX e da Open University do Reino Unido. Essa rede teve bom desempenho, com uma precisão máxima de 83,4%. Li F et al. coletaram e analisaram dados de comportamento de aprendizagem de 109 estudantes de graduação para entender as características do comportamento em grupo de diferentes aprendizes online. Este estudo introduziu análise de componentes principais para reduzir a dimensionalidade dos dados e usou agrupamento hierárquico aglomerativo para classificar os aprendizes em várias categorias. Entre eles, 15 grupos foram agrupados, e o método proposto teve boa precisão deagrupamento 10.

Em resumo, a pesquisa atual sobre LBA é bastante diversa e emprega uma ampla variedade de métodos. No entanto, esses estudos e métodos também apresentam certas limitações. Por exemplo, há uma mineração insuficiente de informações emocionais nos textos de revisão dos alunos, e estatísticas descritivas não conseguem revelar os complexos mecanismos de interação por trás dos comportamentos. A classificação por aprendizado de máquina geralmente é baseada em características de perspectiva única, que separam informações multidimensionais de cursos, indivíduos e turmas. Para melhor desempenho na LBA, este estudo projeta um modelo de Raciocínio Fuzzy Multi-Perspective (MPFR) e constrói um modelo de classificação de emoções baseado nos algoritmos Improved Grey Wolf Optimization (IGWO) e eXtreme Gradient Boosting (XGBoost).

Nas pesquisas existentes sobre LBA, embora a LSTM possa capturar a correlação temporal dos comportamentos de aprendizagem, sua capacidade de lidar com dados de comportamentos de aprendizagem difusos e incertos é fraca. A Rede Neural Convolucional (CNN) possui certas vantagens na extração de características de texto, mas é melhor em capturar características locais e é difícil integrar informações globais multidimensionais de cursos, indivíduos e classes. Comparado a métodos de aprendizado profundo como CNN e LSTM, o modelo MPFR pode capturar informações incertas no comportamento de aprendizagem por meio de raciocínio difuso. Por exemplo, a "participação moderada" e o "domínio básico" dos estudantes sobre estados difuses compensam as limitações da extração local de recursos da CNN. IGWO-XGBoost equilibra precisão e eficiência na classificação de sentimento, compensando a demorada classificação de sentimento LSTM e o fraco processamento semântico difuso da CNN. Este estudo tem como objetivo fornecer suporte informacional tridimensional para intervenção de ensino online, combinando os resultados da análise comportamental e emocional. A inovação da pesquisa está na construção de um modelo MPFR que abrange três dimensões: currículo, individual e de turma. Essa consideração abrangente sob múltiplas perspectivas pode refletir de forma abrangente e estereoscópica o desempenho de aprendizagem dos alunos, evitando informações importantes que podem ser ignoradas de uma única perspectiva. Esse método possui boa escalabilidade de plataforma e pode ser adaptado para plataformas de aprendizado online convencionais, como Chaoxing e MOOC, ou seja, por meio de uma interface unificada de pré-processamento de dados sem a necessidade de funções adicionais de desenvolvimento de plataforma. Ao mesmo tempo, esse método foi encapsulado como uma ferramenta simples de análise, e os educadores só precisam enviar os dados básicos exportados da plataforma para gerar automaticamente relatórios LBA sem operações técnicas complexas.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Desenho do método LBA considerando o MPFR e perspectivas emocionais

Um sistema de avaliação multiperspectivas é construído para analisar o Comportamento de Aprendizagem Online dos Alunos (SOLB), e um modelo MPFR é projetado. Para analisar mais profundamente os sentimentos subjetivos dos alunos na aprendizagem, este estudo adota o algoritmo XGBoost e projeta o algoritmo IGWO para otimização de hiperparâmetros a fim de melhorar a precisão da classificação.

Construção do modelo MPFR para LBA

Para analisar o SOLB, este estudo parte principalmente de duas perspectivas para formar um plano de análise completo. Primeiramente, em termos de desempenho na aprendizagem, este estudo considera três perspectivas: currículo, individual e de classe, para formar o modelo MPFR. Em segundo lugar, em termos de análise de sentimento dos comentários dos alunos, este estudo desenvolve um algoritmo XGBoost aprimorado. Por meio da análise do desempenho de aprendizagem e do feedback emocional dos alunos, este estudo pode analisar melhor a SOLB. Em termos de detalhes técnicos específicos da análise de desempenho de aprendizagem, este estudo utiliza primeiro dados de uma plataforma de aprendizagem online e os pré-processa. Em segundo lugar, este estudo seleciona indicadores centrais de avaliação de desempenho em aprendizagem sob diferentes perspectivas para construir um sistema de avaliação abrangente. Subsequentemente, um modelo MPFR correspondente é construído para avaliar o comportamento de aprendizagem.

Este estudo seleciona dados da plataforma Superstar (fonte de: https://www.chaoxing.com/). Ele contém informações de múltiplas dimensões, como atividades em sala de aula e avaliação de notas, que podem fornecer uma boa base para LBAs subsequentes. Após a obtenção dos dados, eles precisam ser pré-processados, incluindo principalmente exclusão de campos irrelevantes, filtragem de dados e verificações de integridade dos dados. Por exemplo, nos dados dos professores, informações irrelevantes, como o número e o departamento ao qual o curso pertence, precisam ser removidas. Posteriormente, este estudo constrói a engenharia de características do LBA com base nos dados de comportamento de aprendizagem da plataforma Superstar. O índice LBA estudantil fornece uma base de engenharia de características para o modelo MPFR subsequente, e o conteúdo desse índice é mostrado na Figura 1.

figure-protocol-1
Figura 1: Indicadores para LBA estudantil. A figura esclarece as três dimensões principais (currículo, individual, turma) do LBA dos alunos e os indicadores específicos de avaliação em cada dimensão, fornecendo suporte de recursos para o modelo MPFR. Por favor, clique aqui para ver uma versão ampliada desta figura.

Na Figura 1, os indicadores do LBA dos alunos giram principalmente em torno de três perspectivas: curso, individual e turma, com foco claro em cada dimensão, fornecendo suporte preciso para a construção de modelos MPFR. Entre eles, em termos de indicadores de dimensão do curso, este estudo seleciona a taxa de conclusão de tarefas do curso, a duração do aprendizado do curso e a frequência da interação do curso. A principal preocupação dessa dimensão é a qualidade geral da conclusão das tarefas do curso e a pontualidade da participação no aprendizado. Por exemplo, a taxa de conclusão das tarefas do curso é usada para acompanhar a diferença nas taxas de conclusão antes e depois do prazo; A duração do curso é usada para distinguir diferentes intervalos de intensidade de aprendizagem; A frequência da interação do curso é usada para filtrar comportamentos interativos eficazes. No nível pessoal, o progresso de aprendizagem pessoal, a qualidade da conclusão de tarefas de casa e as notas das provas são selecionados como indicadores de avaliação. Essa dimensão foca no grau de correspondência entre o progresso da aprendizagem pessoal e os resultados do domínio do conhecimento. Exemplos incluem comparar o progresso de aprendizagem pessoal com planos de curso, avaliar a precisão e eficiência das tarefas concluídas e classificar os níveis de domínio do conhecimento com base nas notas dos testes. Além disso, em termos de dimensão da turma, os indicadores selecionados incluem a média da turma, a atividade de interação da turma e o ambiente de aprendizagem da turma. Essa dimensão foca principalmente no impacto do ambiente de aprendizagem no comportamento individual. Por exemplo, a nota média é usada para localizar o nível relativo de desempenho individual no grupo; A atividade de interação de classe é usada para refletir o grau de participação coletiva; A atmosfera de aprendizagem é usada para analisar o efeito impulsionador do ambiente de grupo no comportamento de aprendizagem. Para analisar o comportamento de aprendizagem dos alunos, constrói-se um modelo de raciocínio difuso e as características comportamentais de aprendizagem são obtidas a partir de diferentes perspectivas. Raciocínio fuzzy é um método de raciocínio que utiliza lógica fuzzy, que processa informações imprecisas ou incertas por meio de conjuntos e regras fuzzy, e possui as vantagens de forte flexibilidade e fácil compreensão11,12. O raciocínio difuso, como mecanismo central de computação dos modelos MPFR, é aplicado após a engenharia de características. O principal processo de raciocínio difuso é mostrado na Figura 2.

figure-protocol-2
Figura 2: O principal fluxograma do raciocínio difuso. A figura mostra o processo central do raciocínio fuzzy, incluindo quatro etapas principais: fuzzificação, construção da base de regras fuzzy, raciocínio difuso e desfocar, além de esclarecer a lógica do modelo MPFR no manejo de dados de comportamento de aprendizagem incerto. Por favor, clique aqui para ver uma versão ampliada desta figura.

O raciocínio difuso envolve principalmente fuzzificação, estabelecimento de uma Biblioteca de Regras Fuzzy (FRL), raciocínio difuso e desfoqueamento. Entre elas, a fuzzificação requer converter dados de entrada precisos em conjuntos difusos e envolve definir funções de pertensão. O FRL contém uma série de regras fuzzy e é usado principalmente para descrever a relação entre entrada e saída. Na construção da base de regras difusas, o estudo convida três professores associados de tecnologia educacional com experiência de ensino de ≥ 8 anos para desenvolverem conjuntamente 28 regras, e determina as regras finais por meio de três rodadas de iteração usando o "método Delphi". Por exemplo, Regra 1: SE a taxa de conclusão da tarefa do curso for menor que 30% e o progresso individual de aprendizagem estiver 2 semanas atrasado no cronograma → ENTÃO o estado de alto risco. Raciocínio difuso é o processo de inferir dados de entrada difusos construídos sobre um FRL e obter resultados de saída difusos. Por fim, a desfoque converte o resultado de saída borrado em um valor de saída preciso. O estudo seleciona uma função de pertença triangular, que é uma função amplamente utilizada em sistemas lógicos fuzzy e possui vantagens como forte flexibilidade e alta eficiência computacional. A expressão da função μA(x) é mostrada na equação (1).

figure-protocol-3 (1)

Na equação (1), x é o valor específico de entrada. A, B e C são os três vértices de um triângulo. No desfoqueamento, este artigo utiliza o método do centroide para converter os resultados de saída. O método do centroide é uma técnica de desfoque comumente usada em lógica fuzzy, que apresenta vantagens como forte intuitividade, cálculo simples eestabilidade 13. A expressão do método do centróide é mostrada na equação (2)14.

figure-protocol-4 (2)

Na equação (2), f* é o valor de saída após a desfoqueamento, que é o centróide do conjunto fuzzy. μ(x) é a função de membros. figure-protocol-5 é a soma ponderada de todos os pontos em um conjunto fuzzy. figure-protocol-6 é a integral da função de pertença sobre todos os valores possíveis de x. A racionalidade do uso de regras e funções de pertença definidas manualmente no modelo MPFR se reflete em três aspectos. Primeiramente, garantia de qualificação especializada: os elaboradores de regras são três professores associados de tecnologia educacional, certificados pelo "Analista de Comportamento de Aprendizagem Online" do "Centro de Pesquisa em Educação Online do Ministério da Educação" para garantir que as regras estejam em conformidade com as leis de educação e ensino. Em segundo lugar, vantagem de eficiência: O tempo de inferência das regras manuais é muito menor do que o dos métodos orientados por dados, tornando-o mais adequado para as necessidades de "inferência em tempo real" das plataformas de educação online e não exigindo uma grande quantidade de dados anotados, reduzindo os custos de coletade dados 15. Terceiro, adaptando-se ao requisito central de "interpretabilidade" em cenários de educação online, regras definidas manualmente e funções triangulares de pertença (Equação 1) podem corresponder diretamente à cognição intuitiva em cenários de ensino. Educadores não precisam de uma formação técnica complexa para entender a razão por que um aluno está sendo considerado em risco. Métodos orientados por dados, como sistemas neuro-fuzzy, podem otimizar automaticamente regras. No entanto, a maioria das regras geradas são expressões matemáticas complexas, difíceis de interpretar para educadores, o que reduz a aceitação do modelo na intervenção real do ensino.

Design de um modelo aprimorado de análise de sentimento de comentários dos estudantes para o XGBoost

O modelo MPFR projetado pode analisar o SOLB sob três aspectos: curso, individual e turma. No entanto, a análise externa de dados comportamentais tem limitações na expressão dos sentimentos subjetivos dos alunos. Portanto, para analisar mais a fundo os sentimentos subjetivos dos alunos sobre a aprendizagem, dados adicionais das plataformas de aprendizagem MOOC contendo informações de comentários dos alunos são coletados e pré-processados. Posteriormente, o XGBoost é utilizado para construir o modelo de classificação de sentimento. O IGWO foi projetado para otimizar seus parâmetros e melhorar a precisão do modelo de classificação. A melhoria do XGBoost se reflete em sua otimização de parâmetros por meio do algoritmo IGWO. O pré-processamento de dados é um passo inicial crucial antes da construção e análise do modelo. O processo de pré-processamento de dados é mostrado na Figura 3.

figure-protocol-7
Figura 3: O processo de pré-processamento de dados. O processo de pré-processamento de dados em nove etapas inclui limpeza de texto, segmentação de palavras, remoção de palavras paradas, extração de hastes e reconhecimento de palavras de sentimento, fornecendo dados de alta qualidade para análise de comportamento e classificação de sentimento subsequentes. Por favor, clique aqui para ver uma versão ampliada desta figura.

As etapas de pré-processamento de dados são as seguintes: A primeira etapa é realizar a limpeza do texto para remover campos irrelevantes nos dados da plataforma Chaoxing e filtrar amostras inválidas. Ao mesmo tempo, campos não textuais e resenhas curtas são removidos dos dados de resenhas na plataforma MOOC. O segundo passo é realizar o processamento de segmentação. Entre eles, os comentários chineses usam o "modo preciso" do Jieba para processamento de segmentação de texto, enquanto comentários em inglês usam a função de segmentação de palavras da biblioteca NLTK para processamento. O terceiro passo é remover palavras de som comuns como ''de'', ''yes'', ''in'', etc. Entre elas, as palavras de parada chinesas utilizam a lista de palavras de parada (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) do Instituto de Tecnologia de Harbin. Palavras de parada são excluídas por correspondência de palavras. As palavras de parada em inglês usam a lista universal de palavras de parada incorporada à biblioteca NLTK, que também é excluída por meio de correspondência palavra por palavra. O quarto passo é usar o stemmer da biblioteca NLTK para extrair os troncos do texto e restaurar verbos nos dados em inglês para sua forma de raíze. O quinto passo é identificar as palavras emocionais positivas e negativas nos comentários com base no dicionário emocional do CNKI para fornecer uma base pré-anotação para a classificação emocional subsequente. O sexto passo é realizar a extração de características. Entre eles, os dados estruturados na plataforma Chaoxing são padronizados, enquanto os indicadores de classificação são codificados separadamente. Ao mesmo tempo, esses dados de comentários da plataforma MOOC utilizam um modelo de linguagem pré-treinado (Bidirectional Encoder Representation from Transformers, BERT) para extrair características de texto. A principal vantagem do modelo BERT na extração de características de texto é que ele pode gerar dinamicamente vetores de palavras conscientes do contexto por meio de uma arquitetura Transformer bidirecional profunda, abordando efetivamente a ambiguidade que os modelos tradicionais de embedding estático de palavras não conseguem lidar. O sétimo passo é abordar a questão das categorias de sentimento desequilibradas nos dados dos comentários. A Técnica de Superamostragem de Minorias Sintéticas (SMOTE) é empregada para processá-la. Cinco amostras de vizinhos mais próximos são selecionadas para interpolação a fim de gerar amostras sintéticas de classes minoritárias, com uma semente aleatória fixa de 42 para garantir a reprodutibilidade do experimento. O oitavo passo é anotar e particionar os dados. O nono passo é preencher os valores ausentes nos dados da superestrela e remover outliers. Ao realizar o processamento de balanceamento de dados, o SMOTE cria novas amostras compostas interpolando entre amostras de classes minoritárias, aumentando assim o número de amostras de classes minoritárias e tornando a distribuição de classes do conjunto de dados maisequilibrada 16,17. A expressão do SMOTE é mostrada na equação (3).

Bmn = dm + rand(0,1) x (dmn -d m) (3)

Na equação (3), Bmn é uma amostra artificialmente construída de classe minoritária, dm é a i-ésima amostra de classe minoritária, e dmn é a n-ésima amostra entre os k vizinhos mais próximos de dm. rand(0,1) é um número aleatório entre 0 e 1. O XGBoost melhora o desempenho preditivo adicionando iterativamente árvores de previsão. Possui vantagens como alta precisão, grande flexibilidade e facilidade de uso18,19. As etapas para construir iterativamente um modelo em árvore usando XGBoost incluem principalmente: inicializar o modelo, construir iterativamente a árvore, a função objetivo e o termo de regularização. A saída figure-protocol-8 prevista na t-ésima iteração é mostrada na equação (4).

figure-protocol-9   (4)

Na equação (4), figure-protocol-10 é o valor de predição do modelo após t - 1ª iteração, ft(h) é a função de predição do modelo em árvore adicionada na t-ésima iteração, e h é o vetor de características de entrada. A função objetivo para minimizar XGBoost é mostrada na equação (5).

figure-protocol-11 (5)

Na equação (5), i é o número da amostra. I e J são o número total de amostras e árvores, e j é o número de árvores. figure-protocol-12 é a função de perda, e gi é o verdadeiro rótulo da i -ésima amostra. figure-protocol-13 é o valor previsto do modelo para a i-ésima amostra após a t-ésima iteração. Ω(ft) é o termo de regularização, e (ft) é a função de predição da j -ésima árvore. A expressão geral Ω(f) para regularização é mostrada na equação (6).

figure-protocol-14 (6)

Na equação (6), γ significa o coeficiente de penalidade para a quantidade de nós folha, λ é o coeficiente de regularização L2 para o peso dos nós folha, e w é o peso dos nós folha. No entanto, a escolha dos hiperparâmetros XGBoost tem um efeito direto e significativo no desempenho. Hiperparâmetros comuns do XGBoost incluem taxa de aprendizado, profundidade máxima da árvore e parâmetros de regularização. Devido ao espaço potencialmente grande de hiperparâmetros, ajustar manualmente esses parâmetros não só consome tempo, mas também é difícil encontrar a combinação ideal de parâmetros. Portanto, este estudo projeta o IGWO para otimizar os hiperparâmetros do XGBoost. O GWO busca soluções ótimas simulando a hierarquia social e as estratégias de caça dos lobos-cinzentos, com vantagens como menos parâmetros e forteadaptabilidade 20,21. Em GWO, a posição inicial da população é gerada conforme mostrado na equação (7).

figure-protocol-15(7)

Na equação (7), Puv é a posição do u-ésimo indivíduo na v-ésima dimensão. figure-protocol-16 e figure-protocol-17 são os limites superior e inferior do v-ésimo espaço de busca. rand() é um número aleatório entre [0,1]. No entanto, o algoritmo GWO pode enfrentar problemas como lenta velocidade de convergência e travamento em ótimos locais nos estágios intermediários e posteriores. Isso também significa que, neste momento, o GWO pode não ser capaz de explorar efetivamente todo o espaço de soluções, dificultando encontrar a solução global ótima. Para abordar essa questão, este estudo melhora o GWO sob dois aspectos, a saber, a introdução do Mapa Caótico de Tenda (MTC) e do Fator de Convergência Não Linear (NCF). A MTC é um mapeamento caótico simples que garante que regiões ideais de solução não sejam perdidas durante o processo de busca e evita buscas repetidas na mesma região22. Portanto, por meio da MTC, uma população inicial mais uniforme e aleatória pode ser gerada, e a capacidade do algoritmo de superar ótimos locais pode ser aprimorada. O cálculo da MTC é mostrado na equação (8).

figure-protocol-18 (8)

Na equação (8), y é o parâmetro de controle.  Rt e Rt+1 são as variáveis de estado do sistema nas t-ésima e t+1-ésima iteração. A fórmula para a NCF z é mostrada na equação (9).

figure-protocol-19(9)

Na equação (9), zmax é o fator máximo de convergência e tmax é o número máximo de iterações. Esse método decrescente não linear permite que o GWO mantenha um grande tamanho de passo para busca global no estágio inicial. No estágio intermediário da busca, a velocidade de convergência acelera, enquanto na fase mais avançada, a busca local é realizada em etapas menores, equilibrando efetivamente as capacidades globais e locais de busca e melhorando o desempenho da otimização. O algoritmo IGWO é usado especificamente para a etapa de otimização de hiperparâmetros do classificador de sentimento XGBoost, e seu processo principal é mostrado na Figura 4.

figure-protocol-20
Figura 4: O processo principal do IGWO. A figura descreve o processo de execução do IGWO, incluindo inicialização populacional baseada em mapeamento caótico de tendas, atualização de posição dos fatores de convergência não lineares e triagem individual ideal, além de esclarecer a lógica para otimizar hiperparâmetros XGBoost. Por favor, clique aqui para ver uma versão ampliada desta figura.

Na Figura 4, o processo IGWO inclui: inicializar o algoritmo; usando MTC para inicializar a população; calculando o valor inicial de aptidão de cada indivíduo; usando NCF para atualizar as posições dos lobos cinzentos; selecionar a solução com melhor aptidão como novo indivíduo ideal; e a entrega do indivíduo ideal. A combinação ótima dos hiperparâmetros XGBoost pode ser enviada via IGWO. O processo geral de classificação de sentimento integra pré-processamento de dados, otimização IGWO e o modelo final XGBoost. O processo do modelo de classificação baseado no IGWO-XGBoost é mostrado na Figura 5.

figure-protocol-21
Figura 5: O processo do modelo de classificação baseado no IGWO-XGBoost. A figura mostra o processo completo do modelo de classificação de sentimento IGWO-XGBoost, desde a entrada e pré-processamento dos dados até o particionamento de conjuntos de dados, otimização de hiperparâmetros IGWO, construção do modelo XGBoost e resultado de classificação, apresentando claramente a cadeia operacional do modelo. Por favor, clique aqui para ver uma versão ampliada desta figura.

O modelo baseado no IGWO-XGBoost inclui processos como dados de entrada, pré-processamento de dados, particionamento de conjuntos de dados, otimização de hiperparâmetros do algoritmo IGWO, combinação ótima de hiperparâmetros, construção do XGBoost baseada na combinação ótima de hiperparâmetros e saída dos resultados de classificação. Por meio desse modelo de classificação, as emoções nos comentários dos alunos podem ser classificadas, proporcionando assim uma compreensão mais intuitiva dos sentimentos subjetivos dos alunos sobre a aprendizagem. As versões específicas do software, sementes aleatórias, especificações de hardware, especificações ambientais e fontes de conjunto de dados usadas no estudo estão apresentadas na Tabela 1.

Tipo de cenárioModelo e conteúdo específicos
Software básicoPython 3.9.7
Biblioteca centralXGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1
Semente aleatóriaDefina a semente aleatória global para 42
Especificações de hardware/ambiente1. Sistema Operacional: Windows 10 Professional Edition (64 bits, número de versão 22H2)
2. Processador: Intel Core i5-12600KF (com frequência principal de 3,7GHz e frequência de aceleração dinâmica de 4,9GHz)
3. Memória: 64GB DDR4 (frequência 3200MHz, suporta até 128GB de memória)
4. Armazenamento: SSD de 1TB (Samsung 980 Pro, velocidade de leitura 7450MB/s)
5. Placa de vídeo: NVIDIA GeForce RTX 3060 (12GB de memória de vídeo)
Fontes do conjunto de dados e detalhes de acesso1. Conjunto de dados da plataforma superstar:
-Localizador Uniforme de Recursos de Fonte (URL): https://www.chaoxing.com/
- Método de aquisição: candidatar-se pela plataforma aberta de big data educacional Chaoxing (caminho de aplicação: site oficial da plataforma → centro de desenvolvimento → interface de dados → conjunto de dados de comportamento de aprendizagem)
2. Conjunto de dados de comentários da plataforma MOOC:
-URL da fonte: https://www.icourse163.org/.cn
-Método de aquisição: Candidatar-se pelo canal de "suporte à pesquisa de dados" da plataforma MOOC
Scripts ou modelos personalizados1. Script de pré-processamento de dados
2. Script modelo MPFR
3. Script modelo IGWO-XGBoost
 

Tabela 1: Versões específicas de software, sementes aleatórias, especificações de hardware, especificações ambientais e fontes de conjunto de dados utilizadas na pesquisa. Forneça uma lista detalhada do ambiente de software e hardware necessário, configurações aleatórias de semente, fontes de conjunto de dados e alcance de busca por hiperparâmetros XGBoost para o estudo, a fim de garantir a reprodutibilidade e padronização do experimento.

A Tabela 1 mostra que o estudo adota o XGBoost 1.7.5 como a estrutura central do modelo de classificação de sentimento e introduz o Scikit learn 1.2.2 para pré-processamento de dados, extração de características e avaliação do modelo. Além disso, o estudo define uniformemente a semente aleatória em 42 para garantir a reprodutibilidade do particionamento de dados, superamostragem SMOTE, otimização de hiperparâmetros IGWO e resultados do treinamento do modelo IGWO-XGBoost. Além disso, o algoritmo IGWO define o espaço de busca para hiperparâmetros XGBoost. O intervalo de busca para a taxa de aprendizado é [0,001, 0,3] na escala logarítmica, e a profundidade máxima da árvore é pesquisada no conjunto inteiro {3, 4,..., 15}. A faixa de otimização do termo de regularização L2 é [0,1, 5,0], e a razão amostral de cada subconjunto de características da árvore é otimizada dentro da faixa de [0,6, 1,0]. A faixa de sintonia para o peso mínimo dos nós folhas é [1, 10].

O conjunto de dados e o código de pré-processamento e análise de dados relacionados foram gerados e analisados pela própria equipe. Os scripts principais para pré-processamento de dados são mostrados na Tabela 2.

Pandas importados como PD, Jieba, RE, Numpy, como NP
do nltk.tokenize import word_tokenize; from nltk.stem import PorterStemmer
Definitivamente limpo (texto, L):
return re.sub(r"[^\u4e00-\u9fa5]" se l=="zh" else r"[^a-zA-Z]", " ", text).strip()
Def Process (texto, L):
t = jieba.lcut(texto) se l=="zh" else word_tokenize(texto)
return " ".join([PorterStemmer().stem(w) se l=="en" senão w for w em t se w não estiver em open("hit_stopwords.txt").read().split()])
def main(c,m,l):
cx=pd.read_csv(c).query("duração do curso>=1 & resultados do exame.notna()"); mc=pd.read_csv(m).query("text do comentário.str.len()>=5")
mc["t"]=mc["comentário text"].apply(clean,args=("zh",)).apply(process,args=(zh",))
np.savez("out.npz",**{k:v for k,v in locals().items()})

Tabela 2: Script central para pré-processamento de dados. Apresente as informações centrais do script para pré-processamento de dados, esclareça as etapas de pré-processamento correspondentes ao script e forneça referências técnicas para a replicação dos métodos de pesquisa.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Resultados do LBA considerando classificação multi-perspectiva e sentimento

Para verificar o desempenho, o ambiente experimental é montado e o conjunto de dados experimental é descrito. Além disso, este estudo seleciona o algoritmo comparativo IGWO-XGBoost e o analisa e verifica usando indicadores como precisão, consumo de tempo e taxa de recordação. Na análise de resultados, o estudo a divide em duas seções claras: os resultados do LBA via MP...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para a análise do SOLB, este estudo desenvolveu modelos MPFR e IGWO-XGBoost e utilizou dados de plataformas de ensino online. No experimento, houve alta consistência entre a avaliação do modelo de inferência e a pontuação real, indicando a eficácia do modelo de inferência. Cerca de 25% dos alunos tiveram um tempo de estudo de 1 a 10 horas no curso. A proporção de estudantes com horas de estudo entre 11 e 20 anos, 21 e 30 anos, 31 a 40 horas e mais de 41 horas foi de 30%, 20%, 15% e 10%. ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm interesses financeiros ou não financeiros relevantes a divulgar.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Modelo de linguagem pré-treinado em BERTPesquisa no Googlehttps://github.com/google-research/bert
Dicionário de emoções CNKICNKIhttps://www.cnki.net/
Plataforma de Chaoxing aprende dados comportamentaisChaoxing INFORMATION TECHNOLOGY DEVELOPMENT Co., Ltdhttps://www.chaoxing.com/
Memória de ComputadorFornecedor universal de hardware (sem modelo específico)
Lista de termos descontinuados do Instituto de Tecnologia de HarbinInstituto de Tecnologia de Harbinhttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF Intel CorporationBX8071512600KF
Ferramenta de segmentação de palavras Jieba (modo de precisão)Comunidade de código aberto de terceiroshttps://github.com/fxsjy/jieba.
Dados de avaliação estudantil da plataforma MOOCRede de Cursos do Amorhttps://www.icourse163.org/
Biblioteca NLTKEquipe de desenvolvimento do NLTKhttps://www.nltk.org/
Linguagem de programação PythonFundação de Software Pythonhttps://www.python.org/
Scikit-learn 1.2.2Equipe de aprendizado Scikithttps://scikit-learn.org/stable/
A plataforma Smart Tree aprende dados comportamentaisRede de Árvores Inteligenteshttps://www.zhihuishu.com/
Tecnologia SMOTEEquipe de Desenvolvimento de Aprendizagem DesequilibradaIntegrado à biblioteca Imbalanced Learn, https://imbalanced-learn.org/stable/
Sistema operacional Windows 10Microsoft Corporationhttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5Equipe de desenvolvimento do XGBoosthttps://xgboost.readthedocs.io/

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Errata

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

Etiquetas

XGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

Artigos relacionados