Articolo di ricerca

Ragionamento Fuzzy Multi-Prospettiva e Analisi basata su XGBoost del Comportamento di Apprendimento Online

DOI:

10.3791/69515

17 marzo 2026

In questo articolo

Avviso di errata corrige

Important: There has been an erratum issued for this article. View Erratum Notice

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio utilizza un modello di ragionamento fuzzy multi-prospettiva e un algoritmo di aumento del gradiente estremo migliorato (XGBoost) (ottimizzato da un algoritmo di ottimizzazione di grey wolf migliorato) per analizzare il comportamento di apprendimento online e classificare le emozioni dei commenti degli studenti, offrendo supporto per un insegnamento personalizzato e interventi tempestivi.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il rapido sviluppo dell'istruzione online ha reso le classi online una componente importante del campo dell'istruzione. Un'analisi approfondita del comportamento di apprendimento degli studenti nell'insegnamento online può aiutare gli insegnanti a ottimizzare le strategie didattiche e a fornire supporto personalizzato per gli studenti. Pertanto, per condurre un'analisi approfondita del comportamento di apprendimento degli studenti, questo studio raccoglie dati dalle piattaforme didattiche online e li pre-elabora. Successivamente, questo studio costruisce un modello di ragionamento fuzzy multi-prospettiva che copre tre dimensioni: curriculum, individuale e classe, per considerare in modo completo le prestazioni di apprendimento degli studenti da diversi livelli. Questo modello elabora informazioni incerte nei dati sui comportamenti di apprendimento tramite insiemi fuzzy e regole fuzzy, ottenendo una valutazione multidimensionale delle prestazioni di apprendimento. Un algoritmo XGBoost migliorato è progettato per classificare le emozioni dei commenti degli studenti. Questo algoritmo migliorato ottimizza gli iperparametri dell'algoritmo XGBoost migliorando l'algoritmo di ottimizzazione del lupo grigio. L'algoritmo migliora l'accuratezza della classificazione delle emozioni ed esplora ulteriormente le tendenze emotive e il feedback sugli atteggiamenti dietro il loro comportamento di apprendimento. I risultati hanno mostrato che, dal punto di vista del curriculum, il tasso di completamento dei compiti del corso 3 settimane prima dell'esame era sostanzialmente superiore al 45%, molto più alto del tasso di completamento tre settimane dopo il rilascio del compito (entrambi inferiori al 18%). Questi risultati indicavano che gli studenti erano più inclini a completare i compiti prima della scadenza e avevano una chiara procrastinazione. L'accuratezza massima dell'algoritmo di classificazione migliorata era del 98,78%, ovvero l'8,57%, il 7,55%, il 6,38% e il 6,01% superiore rispetto al modello di confronto, e il suo consumo medio di tempo era di 58 ms. I tassi di richiamo sulle emozioni negative, positive e neutre erano del 98,35%, 97,69% e 98,02%. Il modello di ricerca può analizzare efficacemente il comportamento di apprendimento online degli studenti e consentire l'identificazione precoce degli studenti a rischio, facilitando l'insegnamento personalizzato e un intervento preciso nell'istruzione online.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La profonda integrazione tra Internet e tecnologia educativa ha fatto sì che l'istruzione online passasse da un semplice supplemento marginale a una forma mainstream. Alla fine del 2023, il numero di studenti online registrati nel mondo aveva superato 1,2 miliardi e la Cina si era costantemente classificata prima al mondo sia per numero di Corsi Online Aperti di Massiccità (MOOC) sia per studenti 1,2. Tuttavia, sebbene l'insegnamento online porti comodità, mette anche in luce sfide come il processo di apprendimento opaco, la separazione tra insegnanti e studenti in termini di tempo e spazio, e un ritardo feedback normativo. Esiste una correlazione positiva tra i dati sui comportamenti di apprendimento e il rendimento accademico. La regolazione dinamica basata sui dati può aumentare i tassi di completamento dei corsi di oltre il 20% e ridurre significativamente il rischio di abbandono 3,4,5. Pertanto, condurre l'Analisi del Comportamento di Apprendimento (LBA) è fondamentale. A proposito di questo tema, i metodi attuali includono statistica descrittiva, extraction di regole di associazione e la classificazione tradizionale del machinelearning 6. Molti studiosi hanno studiato questa questione.

Per condurre LBA, Li Y et al. hanno utilizzato dati sui comportamenti di apprendimento provenienti da piattaforme didattiche online presso la Harvard University e il Massachusetts Institute of Technology per costruire una Rete Neurale a Impulsi (PNN) per prevedere i risultati di apprendimento. Hanno analizzato la correlazione tra il comportamento di apprendimento e i risultati. Il modello di previsione del comportamento di apprendimento online basato su PNN ha raggiunto un'accuratezza del 99,80%7. Zeng B ha progettato un modello efficiente per visualizzare il comportamento di apprendimento dell'inglese online utilizzando analisi di sequenze laggate, metodi combinati di data mining e l'algoritmo del minimal spanning tree. Inoltre, lo studio ha anche istituito una piattaforma online di apprendimento intelligente per i servizi di costruzione Group Learning Path (GLP). Il metodo progettato poteva costruire con successo un GLP8. Zhao M et al. hanno progettato una memoria a lungo termine a doppio strato (LSTM) per evidenziare potenziali problemi nell'apprendimento online degli studenti. Utilizzavano il framework TensorFlow e il linguaggio Python, e utilizzavano dati dalle piattaforme online Kaggle, edX e dall'Open University del Regno Unito. Questa rete ha avuto buone prestazioni, con una precisione massima dell'83,4%. Li F et al. hanno raccolto e analizzato dati sui comportamenti di apprendimento da 109 studenti universitari per comprendere le caratteristiche comportamentali di gruppo dei diversi studenti online. Questo studio ha introdotto l'analisi a componenti principali per ridurre la dimensionalità dei dati e ha utilizzato il clustering gerarchico agglomerativo per classificare gli studenti in varie categorie. Tra questi, 15 gruppi erano raggruppati e il metodo proposto aveva una buona accuratezza diraggruppamento 10.

In sintesi, la ricerca attuale sulla LBA è piuttosto varia e impiega una vasta gamma di metodi. Tuttavia, questi studi e metodi presentano anche alcune carenze. Ad esempio, non c'è sufficiente estrazione di informazioni emotive nei testi di revisione degli studenti, e le statistiche descrittive non possono rivelare i complessi meccanismi di interazione dietro i comportamenti. La classificazione del machine learning si basa spesso su caratteristiche a prospettiva singola, che separano le informazioni multidimensionali di corsi, individui e classi. Per migliorare la LBA, questo studio progetta un modello Multi-Perspective Fuzzy Reasoning (MPFR) e costruisce un modello di classificazione delle emozioni basato sugli algoritmi Improved Grey Wolf Optimization (IGWO) ed eXtreme Gradient Boosting (XGBoost).

Nelle ricerche esistenti sulla LBA, sebbene la LSTM possa catturare la correlazione temporale dei comportamenti di apprendimento, la sua capacità di gestire dati di apprendimento vaghi e incerti è debole. La Rete Neurale Convoluzionale (CNN) presenta alcuni vantaggi nell'estrazione di caratteristiche testuali, ma è migliore nel catturare le caratteristiche locali ed è difficile integrare informazioni globali multidimensionali di corsi, individui e classi. Rispetto ai metodi di deep learning come CNN e LSTM, il modello MPFR può catturare informazioni incerte nel comportamento di apprendimento tramite ragionamento fuzzy. Ad esempio, la "partecipazione moderata" e la "padronanza di base" degli studenti degli stati fuzzy compensano i limiti dell'estrazione di funzionalità locali di CNN. IGWO-XGBoost bilancia accuratezza ed efficienza nella classificazione del sentiment, compensando la lunga classificazione del sentiment LSTM e la debole elaborazione semantica fuzzy del CNN. Questo studio mira a fornire supporto informativo tridimensionale per l'intervento didattico online combinando i risultati dell'analisi comportamentale ed emotiva. L'innovazione della ricerca risiede nella costruzione di un modello MPFR che copre tre dimensioni: curriculum, individuale e di classe. Questa considerazione completa da molteplici prospettive può riflettere in modo completo e stereoscopico le prestazioni di apprendimento degli studenti, evitando informazioni importanti che potrebbero essere trascurate da una sola prospettiva. Questo metodo ha una buona scalabilità della piattaforma e può essere adattato alle piattaforme di apprendimento online mainstream come Chaoxing e MOOC, cioè tramite un'interfaccia unificata di preprocessing dati senza la necessità di ulteriori funzioni di sviluppo della piattaforma. Allo stesso tempo, questo metodo è stato racchiuso come uno strumento di analisi semplice, e gli educatori devono solo caricare i dati di base esportati dalla piattaforma per generare automaticamente report LBA senza operazioni tecniche complesse.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Progettazione del metodo LBA considerando prospettive MPFR ed emotive

Viene costruito un sistema di valutazione multi-prospettiva per analizzare il Comportamento di Apprendimento Online degli Studenti (SOLB) e viene progettato un modello MPFR. Per analizzare ulteriormente i sentimenti soggettivi degli studenti durante l'apprendimento, questo studio adotta l'algoritmo XGBoost e progetta l'algoritmo IGWO per l'ottimizzazione degli iperparametri al fine di migliorare l'accuratezza della classificazione.

Costruzione del modello MPFR per LBA

Per analizzare SOLB, questo studio parte principalmente da due prospettive per formare un piano di analisi completo. Innanzitutto, in termini di performance di apprendimento, questo studio considera tre prospettive: curriculum, individuale e di classe, per formare il modello MPFR. In secondo luogo, in termini di analisi sentimentale dei commenti degli studenti, questo studio progetta un algoritmo XGBoost migliorato. Attraverso l'analisi delle prestazioni di apprendimento e del feedback delle emozioni degli studenti, questo studio può analizzare meglio la SOLB. Per quanto riguarda i dettagli tecnici specifici dell'analisi delle prestazioni di apprendimento, questo studio utilizza inizialmente dati provenienti da una piattaforma di apprendimento online e li pre-elabora. In secondo luogo, questo studio seleziona indicatori fondamentali di valutazione delle prestazioni di apprendimento da diverse prospettive per costruire un sistema di valutazione completo. Successivamente, viene costruito un corrispondente modello MPFR per valutare il comportamento di apprendimento.

Questo studio seleziona dati dalla piattaforma Superstar (fonte da: https://www.chaoxing.com/). Contiene informazioni provenienti da molteplici dimensioni, come attività in classe e valutazione dei voti, che possono fornire una buona base per una successiva LBA. Dopo aver ottenuto i dati, devono essere pre-elaborati, includendo principalmente la cancellazione di campi irrilevanti, il filtraggio dei dati e i controlli di integrità dei dati. Ad esempio, nei dati degli insegnanti, informazioni irrilevanti come il numero e il dipartimento a cui appartiene il corso devono essere rimossi. Successivamente, questo studio costruisce l'ingegneria delle funzionalità di LBA basandosi sui dati sui comportamenti di apprendimento della piattaforma Superstar. L'indice LBA degli studenti fornisce una base di ingegneria delle caratteristiche per il modello MPFR successivo, e il contenuto di questo indice è mostrato nella Figura 1.

figure-protocol-1
Figura 1: Indicatori per l'LBA degli studenti. La figura chiarisce le tre dimensioni fondamentali (curriculum, individuale, classe) dell'LBA degli studenti e gli indicatori specifici di valutazione sotto ciascuna dimensione, fornendo supporto alle funzionalità per il modello MPFR. Clicca qui per visualizzare una versione più grande di questa figura.

Nella Figura 1, gli indicatori LBA degli studenti ruotano principalmente attorno a tre prospettive: corso, individuale e classe, con un chiaro focus su ogni dimensione, fornendo un supporto preciso alle caratteristiche per la costruzione di modelli MPFR. Tra questi, in termini di indicatori di dimensione del corso, questo studio seleziona il tasso di completamento dei compiti del corso, la durata dell'apprendimento del corso e la frequenza delle interazioni con i corsi. La preoccupazione centrale di questa dimensione è la qualità complessiva del completamento dei compiti del corso e la tempestività della partecipazione all'apprendimento. Ad esempio, il tasso di completamento dei compiti del corso viene utilizzato per tracciare la differenza tra i tassi di completamento prima e dopo la scadenza; La durata dello studio del corso viene utilizzata per distinguere i diversi intervalli di intensità di apprendimento; La frequenza dell'interazione del corso viene utilizzata per filtrare comportamenti interattivi efficaci. A livello personale, i progressi nell'apprendimento personale, la qualità del completamento dei compiti e i punteggi degli esami sono selezionati come indicatori di valutazione. Questa dimensione si concentra sul grado di corrispondenza tra il progresso dell'apprendimento personale e i risultati della padronanza della conoscenza. Esempi includono il confronto dei progressi personali dell'apprendimento con i piani di corso, la valutazione dell'accuratezza e dell'efficienza dei compiti completati e la classificazione dei livelli di padronanza delle conoscenze in base ai punteggi dei test. Inoltre, in termini di dimensione della classe, gli indicatori selezionati includono il punteggio medio della classe, l'attività di interazione della classe e l'atmosfera di apprendimento della classe. Questa dimensione si concentra principalmente sull'impatto dell'ambiente di apprendimento complessivo sul comportamento individuale. Ad esempio, il voto medio viene utilizzato per individuare il livello relativo di prestazione individuale nel gruppo; L'attività di interazione di classe è utilizzata per riflettere il grado di partecipazione collettiva; L'atmosfera di apprendimento viene utilizzata per analizzare l'effetto motore dell'ambiente di gruppo sul comportamento di apprendimento. Per analizzare il comportamento di apprendimento degli studenti, si costruisce un modello di ragionamento fuzzy e si ottengono le caratteristiche comportamentali da diverse prospettive. Il ragionamento fuzzy è un metodo di ragionamento che utilizza la logica fuzzy, che elabora informazioni imprecise o incerte tramite insiemi fuzzy e regole fuzzy, e presenta i vantaggi di una forte flessibilità e facilecomprensione 11,12. Il ragionamento fuzzy, come meccanismo di calcolo centrale dei modelli MPFR, viene applicato dopo l'ingegneria delle caratteristiche. Il principale processo di ragionamento fuzzy è mostrato nella Figura 2.

figure-protocol-2
Figura 2: Il principale diagramma di flusso del ragionamento fuzzy. La figura mostra il processo centrale del ragionamento fuzzy, includendo quattro passaggi chiave: fuzzificazione, costruzione della base di regole fuzzy, ragionamento fuzzy e deblurring, e chiarisce la logica del modello MPFR nel gestire dati di comportamento di apprendimento incerti. Clicca qui per visualizzare una versione più grande di questa figura.

Il ragionamento fuzzy riguarda principalmente la fuzzificazione, l'istituzione di una libreria di regole fuzzy (FRL), il ragionamento fuzzy e la debluring. Tra queste, la fuzzificazione richiede la conversione precisa di dati di input in insiemi fuzzy e implica la definizione di funzioni di appartenenza. Il FRL contiene una serie di regole fuzzy ed è principalmente utilizzato per descrivere la relazione tra input e output. Nella costruzione della base di regole fuzzy, lo studio invita tre professori associati di tecnologia educativa con esperienza didattica di ≥ 8 anni a sviluppare congiuntamente 28 regole, e determina le regole finali attraverso tre round di iterazione utilizzando il "metodo Delphi". Ad esempio, Regola 1: SE il tasso di completamento del compito del corso è inferiore al 30% e il progresso individuale è in ritardo di 2 settimane rispetto ai tempi previsti → ALLORA lo stato ad alto rischio. Il ragionamento fuzzy è il processo di dedurre dati di input fuzzy costruiti su un FRL e ottenere risultati di output fuzzy. Infine, la deblurring convertirà il risultato fuzzy in un valore di output accurato. Lo studio seleziona una funzione di appartenenza triangolare, che è una funzione ampiamente utilizzata nei sistemi logici fuzzy e presenta vantaggi come forte flessibilità e alta efficienza computazionale. L'espressione della funzione μA(x) è mostrata nell'equazione (1).

figure-protocol-3 (1)

Nell'equazione (1), x è il valore specifico dell'input. a, b e c sono i tre vertici di un triangolo. Nel deblurring, questo articolo utilizza il metodo del centroide per convertire i risultati di output. Il metodo del centroide è una tecnica di debluring comunemente utilizzata nella logica fuzzy, che presenta vantaggi come una forte intuitività, calcolo semplice estabilità 13. L'espressione del metodo del centroide è mostrata nell'equazione (2)14.

figure-protocol-4 (2)

Nell'equazione (2), f* è il valore di uscita dopo la debluring, che è il baricentroide dell'insieme fuzzy. μ(x) è la funzione di appartenenza. figure-protocol-5 è la somma pesata di tutti i punti in un insieme fuzzy. figure-protocol-6 è l'integrale della funzione di appartenenza su tutti i possibili valori di x. La razionalità dell'uso di regole e funzioni di appartenenza definite manualmente nel modello MPFR si riflette in tre aspetti. Innanzitutto, garanzia di qualifica esperta: i regolatori sono tre professori associati di tecnologia educativa e sono stati certificati dall'"Online Learning Behavior Analyst" del "Online Education Research Center del Ministero dell'Istruzione" per garantire che le regole siano conformi alle leggi dell'istruzione e dell'insegnamento. In secondo luogo, vantaggio di efficienza: il tempo di inferenza delle regole manuali è molto inferiore rispetto a quello dei metodi basati sui dati, rendendolo più adatto alle esigenze di "inferenza in tempo reale" delle piattaforme di educazione online e non richiedendo una grande quantità di dati annotati, riducendo i costi di raccoltadati 15. In terzo luogo, adattandosi al requisito fondamentale di "interpretabilità" negli scenari di istruzione online, regole definite manualmente e funzioni di appartenenza triangolari (Equazione 1) possono corrispondere direttamente alla cognizione intuitiva negli scenari didattici. Gli educatori non hanno bisogno di un background tecnico complesso per comprendere le ragioni dietro il rischio di uno studente. Metodi basati sui dati come i sistemi neuro-fuzzy possono ottimizzare automaticamente le regole. Tuttavia, la maggior parte delle regole generate sono espressioni matematiche complesse, difficili da interpretare per gli educatori, il che riduce l'accettabilità del modello nell'intervento didattico effettivo.

Progettazione di un modello migliorato di analisi del sentiment dei commenti degli studenti per XGBoost

Il modello MPFR progettato può analizzare SOLB da tre aspetti: corso, individuale e classe. Tuttavia, l'analisi esterna dei dati comportamentali presenta limiti nell'esprimere i sentimenti soggettivi degli studenti. Pertanto, per analizzare ulteriormente i sentimenti soggettivi degli studenti riguardo all'apprendimento, vengono raccolti e preprocessati dati aggiuntivi provenienti dalle piattaforme di apprendimento MOOC contenenti informazioni sui commenti degli studenti. Successivamente, l'XGBoost viene utilizzato per costruire il modello di classificazione sentimentale. L'IGWO è progettato per ottimizzare i propri parametri al fine di migliorare l'accuratezza del modello di classificazione. Il miglioramento di XGBoost si riflette nell'ottimizzazione dei parametri tramite l'algoritmo IGWO. La pre-elaborazione dei dati è un primo passo cruciale prima della costruzione e dell'analisi del modello. Il processo di pre-elaborazione dei dati è mostrato nella Figura 3.

figure-protocol-7
Figura 3: Il processo di pre-elaborazione dei dati. Il processo di pre-elaborazione dei dati in nove fasi include pulizia del testo, segmentazione delle parole, rimozione delle stop-word, estrazione di stemmi e riconoscimento delle parole sentimentali, fornendo dati di alta qualità per l'analisi comportamentale successiva e la classificazione del sentiment. Clicca qui per visualizzare una versione più grande di questa figura.

I passaggi di pre-elaborazione dei dati sono i seguenti: Il primo passo consiste nell'eseguire la pulizia del testo per rimuovere campi irrilevanti nei dati della piattaforma Chaoxing e filtrare campioni non validi. Allo stesso tempo, i campi non testuali e le brevi recensioni vengono rimossi dai dati delle recensioni sulla piattaforma MOOC. Il secondo passo è eseguire l'elaborazione della segmentazione. Tra questi, i commenti cinesi utilizzano la "modalità precisa" di Jieba per l'elaborazione della segmentazione delle parole, mentre i commenti in inglese utilizzano la funzione di segmentazione delle parole della libreria NLTK per l'elaborazione. Il terzo passo è rimuovere le parole di stop comuni come ''de'', ''yes'', ''in'', ecc. Tra queste, le parole stop cinesi utilizzano la lista delle parole stop (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) dell'Istituto di Tecnologia di Harbin. Le parole di stop vengono eliminate tramite corrispondenza di parole. Le parole stop inglesi utilizzano la lista universale delle parole stop integrata nella libreria NLTK, che viene anch'essa eliminata tramite il matching parola per parola. Il quarto passo è utilizzare lo stemmer della libreria NLTK per estrarre stemmi dal testo e ripristinare i verbi nei dati inglesi nella loro forma stem. Il quinto passo è identificare le parole emotive positive e negative nei commenti basandosi sul dizionario emotivo CNKI per fornire una base pre-annotazione per la classificazione emotiva successiva. Il sesto passo è eseguire l'estrazione delle caratteristiche. Tra questi, i dati strutturati nella piattaforma Chaoxing sono standardizzati, mentre gli indicatori di classificazione sono codificati separatamente. Allo stesso tempo, questi dati di commento della piattaforma MOOC utilizzano un modello linguistico pre-addestrato (Bidirectional Encoder Representation from Transformers, BERT) per estrarre le caratteristiche del testo. Il vantaggio principale del modello BERT nell'estrazione delle caratteristiche di testo è che può generare dinamicamente vettori di parola consapevoli del contesto tramite un'architettura Transformer bidirezionale profonda, affrontando efficacemente l'ambiguità che i modelli tradizionali di incorporamento statico di parole non riescono a gestire. Il settimo passo è affrontare il problema delle categorie di sentiment squilibrate nei dati dei commenti. La Sintetica Tecnica di Sovracampionamento delle Minoranze (SMOTE) viene impiegata per processarla. Cinque campioni di vicino più prossimo vengono selezionati per l'interpolazione e generare campioni di classe minoritaria sintetica, con un seed casuale fisso di 42 per garantire la riproducibilità dell'esperimento. L'ottavo passo è annotare e partizionare i dati. Il nono passo è compilare i valori mancanti nei dati delle superstelle e rimuovere gli outlier. Durante l'elaborazione del bilanciamento dei dati, SMOTE crea nuovi campioni compositi interpolando tra campioni di classi minoritarie, aumentando così il numero di campioni di classi minoritarie e rendendo la distribuzione di classi del set di dati piùbilanciata 16,17. L'espressione di SMOTE è mostrata nell'equazione (3).

Bmn = dm + rand(0,1) x (dmn -d m) (3)

Nell'equazione (3), Bmn è un campione di classe minoritaria costruito artificialmente, dm è il i-esimo campione di classe minoritaria e dmn è il n-esimo campione tra i k vicini più prossimi di dm. rand(0,1) è un numero casuale compreso tra 0 e 1. XGBoost migliora le prestazioni predittive aggiungendo iterativamente alberi di previsione. Presenta vantaggi come alta precisione, grande flessibilità e facilità d'uso 18,19. I passaggi per costruire iterativamente un modello ad albero usando XGBoost includono principalmente: inizializzare il modello, costruire iterativamente l'albero, la funzione obiettivo e il termine di regolarizzazione. L'output figure-protocol-8 previsto nella t-esima iterazione è mostrato nell'equazione (4).

figure-protocol-9   (4)

Nell'equazione (4), figure-protocol-10 è il valore di previsione del modello dopo la t - 1ª iterazione, ft(h) è la funzione di previsione del modello ad albero aggiunta nella t-esima iterazione, e h è il vettore di caratteristica in ingresso. La funzione obiettivo per minimizzare XGBoost è mostrata nell'equazione (5).

figure-protocol-11 (5)

Nell'equazione (5), i è il numero di campione. I e J sono il numero totale di campioni e alberi, e j è il numero di alberi. figure-protocol-12 è la funzione di perdita, e gi è la vera etichetta del campione i -esimo. figure-protocol-13 è il valore previsto del modello per il i -esimo campione dopo la t -esima iterazione. Ω(ft) è il termine di regolarizzazione, e (ft) è la funzione di previsione dell'albero j -esimo. L'espressione generale Ω(f) per la regolarizzazione è mostrata nell'equazione (6).

figure-protocol-14 (6)

Nell'equazione (6), γ significa il coefficiente di penalità per la quantità di nodi foglia, λ è il coefficiente di regolarizzazione L2 per il peso dei nodi foglia, e w è il peso dei nodi foglia. Tuttavia, la scelta degli iperparametri XGBoost ha un effetto diretto e significativo sulle prestazioni. Gli iperparametri comuni di XGBoost includono la velocità di apprendimento, la profondità massima dell'albero e i parametri di regolarizzazione. A causa del potenziale ampio spazio degli iperparametri, regolare manualmente questi parametri non solo richiede tempo, ma è anche difficile trovare la combinazione ottimale di parametri. Pertanto, questo studio progetta IGWO per ottimizzare gli iperparametri di XGBoost. GWO cerca soluzioni ottimali simulando la gerarchia sociale e le strategie di caccia dei lupi grigi, con vantaggi come minori parametri e forte adattabilità20,21. In GWO, la posizione iniziale della popolazione viene generata come mostrato nell'equazione (7).

figure-protocol-15(7)

Nell'equazione (7), Puv è la posizione dell'u-esimo individuo nella v-esima dimensione. figure-protocol-16 e figure-protocol-17 sono i limiti superiore e inferiore dello spazio di ricerca v-esimo. rand() è un numero casuale tra [0,1]. Tuttavia, l'algoritmo GWO può incontrare problemi come velocità di convergenza lenta e blocchi negli ottimi locali nelle fasi intermedie e successive. Ciò significa anche che, a questo punto, GWO potrebbe non essere in grado di esplorare efficacemente l'intero spazio delle soluzioni, rendendo difficile trovare la soluzione globale ottimale. Per affrontare questo problema, questo studio migliora GWO da due aspetti, ovvero l'introduzione della Tend Chaotic Map (TCM) e del Fattore di Convergenza Non Lineare (NCF). La MTC è una semplice mappatura caotica che garantisce che le regioni potenzialmente ottimali della soluzione non vengano trascurate durante il processo di ricerca ed evita ricerche ripetute della stessa regione22. Pertanto, attraverso la MTC, si può generare una popolazione iniziale più uniforme e casuale, e la capacità dell'algoritmo di superare ottimi locali può essere migliorata. Il calcolo della MTC è mostrato nell'equazione (8).

figure-protocol-18 (8)

Nell'equazione (8), y è il parametro di controllo.  Rt e Rt+1 sono le variabili di stato del sistema nelle t-esime e t+1-esima iterazioni. La formula per NCF z è mostrata nell'equazione (9).

figure-protocol-19(9)

Nell'equazione (9), zmax è il fattore massimo di convergenza e tmax è il numero massimo di iterazioni. Questo metodo decrescente non lineare permette a GWO di mantenere una grande dimensione di passo per la ricerca globale nelle prime fasi iniziali. Nella fase intermedia della ricerca, la velocità di convergenza accelera, mentre nella fase successiva la ricerca locale viene eseguita con passaggi più piccoli, bilanciando efficacemente le capacità di ricerca globale e locale e migliorando le prestazioni di ottimizzazione. L'algoritmo IGWO è utilizzato specificamente per la fase di ottimizzazione degli iperparametri del classificatore di sentiment XGBoost, e il suo processo principale è mostrato nella Figura 4.

figure-protocol-20
Figura 4: Il processo principale dell'IGWO. La figura delinea il processo di esecuzione di IGWO, inclusa l'inizializzazione della popolazione basata sulla mappatura caotica della tenda, l'aggiornamento della posizione dei fattori di convergenza non lineari e lo screening ottimale individuale, e chiarisce la logica per ottimizzare gli iperparametri XGBoost. Clicca qui per visualizzare una versione più grande di questa figura.

Nella Figura 4, il processo IGWO include: inizializzare l'algoritmo; l'uso della MTC per inizializzare la popolazione; calcolare il valore iniziale di fitness di ogni individuo; usando NCF per aggiornare le posizioni dei lupi grigi; selezionare la soluzione con la migliore forma fisica come nuovo individuo ottimale; e produrre l'individuo ottimale. La combinazione ottimale degli iperparametri XGBoost può essere prodotta tramite IGWO. Il processo complessivo di classificazione del sentiment integra la preelaborazione dei dati, l'ottimizzazione IGWO e il modello finale XGBoost. Il processo di classificazione basato su IGWO-XGBoost è mostrato nella Figura 5.

figure-protocol-21
Figura 5: Il processo del modello di classificazione basato su IGWO-XGBoost. La figura mostra l'intero processo del modello di classificazione del sentiment IGWO-XGBoost, dall'input e preprocessing dei dati alla partizione del dataset, all'ottimizzazione degli iperparametri IGWO, alla costruzione del modello XGBoost e all'output dei risultati della classificazione, presentando chiaramente la catena operativa del modello. Clicca qui per visualizzare una versione più grande di questa figura.

Il modello basato su IGWO-XGBoost include processi come dati di input, preprocessing dei dati, partizionamento dei dataset, ottimizzazione degli iperparametri dell'algoritmo IGWO, combinazione ottimale di iperparametri, costruzione di XGBoost basata sulla combinazione ottimale di iperparametri e output dei risultati di classificazione. Attraverso questo modello di classificazione, le emozioni nei commenti degli studenti possono essere classificate, ottenendo così una comprensione più intuitiva dei sentimenti soggettivi degli studenti riguardo all'apprendimento. Le versioni specifiche del software, i seed casuali, le specifiche hardware, le specifiche ambientali e le fonti di dataset utilizzate nello studio sono mostrate nella Tabella 1.

Tipo di setModello e contenuto specifici
Software di basePython 3.9.7
Libreria baseXGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1
Seme casualeImposta il seed casuale globale a 42
Specifiche hardware/ambiente1. Sistema operativo: Windows 10 Professional Edition (64 bit, numero di versione 22H2)
2. Processore: Intel Core i5-12600KF (con frequenza principale di 3,7GHz e frequenza di accelerazione dinamica di 4,9GHz)
3. Memoria: 64GB DDR4 (frequenza 3200MHz, supporta fino a 128GB di memoria)
4. Archiviazione: SSD da 1TB (Samsung 980 Pro, velocità di lettura 7450MB/s)
5. Scheda grafica: NVIDIA GeForce RTX 3060 (12GB di memoria video)
Fonti del dataset e dettagli di accesso1. Dataset della piattaforma superstar:
-Source Uniform Resource Locator (URL): https://www.chaoxing.com/
-Metodo di acquisizione: candidatura tramite la piattaforma aperta big data di Chaoxing Education (percorso applicativo: sito ufficiale della piattaforma → centro sviluppatori → interfaccia dati → dataset di comportamento di apprendimento)
2. Dataset di commenti della piattaforma MOOC:
-URL sorgente: https://www.icourse163.org/.cn
-Metodo di acquisizione: Fare domanda tramite il canale "supporto alla ricerca dati" della piattaforma MOOC
Script o modelli personalizzati1. Script di preelaborazione dei dati
2. Script modello MPFR
3. Script modello IGWO-XGBoost
 

Tabella 1: Versioni specifiche del software, seed casuali, specifiche hardware, specifiche ambientali e fonti di dataset utilizzate nella ricerca. Fornire un elenco dettagliato dell'ambiente software e hardware richiesto, impostazioni di seed casuali, sorgenti di dataset e intervallo di ricerca degli iperparametri XGBoost per lo studio, al fine di garantire la riproducibilità e la standardizzazione dell'esperimento.

La Tabella 1 mostra che lo studio adotta XGBoost 1.7.5 come quadro centrale del modello di classificazione del sentiment e introduce Scikit learn 1.2.2 per la preelaborazione dei dati, l'estrazione delle caratteristiche e la valutazione del modello. Inoltre, lo studio imposta uniformemente il seed casuale a 42 per garantire la riproducibilità della partizionazione dei dati, del sovracampionamento SMOTE, dell'ottimizzazione degli iperparametri IGWO e dei risultati dell'addestramento del modello IGWO-XGBoost. Inoltre, l'algoritmo IGWO imposta lo spazio di ricerca per gli iperparametri XGBoost. L'intervallo di ricerca per la velocità di apprendimento è [0,001, 0,3] sulla scala logaritmica, e la profondità massima dell'albero viene ricercata nell'insieme intero {3, 4,..., 15}. L'intervallo di ottimizzazione del termine di regolarizzazione L2 è [0.1, 5.0], e il rapporto di campionamento di ogni sottoinsieme di caratteristiche dell'albero è ottimizzato nell'intervallo di [0.6, 1.0]. L'intervallo di accordatura per il peso minimo dei nodi fogliare è [1, 10].

Il dataset e il codice correlato per la preelaborazione e l'analisi dei dati sono stati generati e analizzati dallo stesso team. Gli script principali per la preelaborazione dei dati sono mostrati nella Tabella 2.

Importato Pandas come PD, Jieba, RE, NumPy come NP
da nltk.tokenize import word_tokenize; da nltk.stem import PorterStemmer
Decisamente pulito (testo, l):
return re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip()
Def Process(testo, L):
t = jieba.lcut(testo) se l=="zh" altrimenti word_tokenize(testo)
return " ".join([PorterStemmer().stem(w) se l=="en" altrimenti w per w in t se w non in open("hit_stopwords.txt").read().split()])
difesa main(c,m,l):
cx=pd.read_csv(c).query("durata di apprendimento del corso>=1 & risultati dell'esame.notna()"); mc=pd.read_csv(m).query("commento testo.str.len()>=5")
mc["t"]=mc["commento text"].apply(clean,args=("zh",).apply(process,args=("zh",))
np.savez("out.npz",**{k:v for k,v in locals().items()})

Tabella 2: Script core per la pre-elaborazione dei dati. Presentare le informazioni fondamentali dello script per la pre-elaborazione dei dati, chiarire i passaggi di preprocessing corrispondenti allo script e fornire riferimenti tecnici per la replica dei metodi di ricerca.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I risultati LBA considerano la classificazione multi-prospettiva e sentiment

Per verificare le prestazioni, viene configurato l'ambiente sperimentale e viene descritto il dataset sperimentale. Inoltre, questo studio seleziona l'algoritmo comparativo IGWO-XGBoost e lo analizza e verifica utilizzando indicatori come accuratezza, consumo di tempo e tasso di richiamo. Nell'analisi dei risultati, lo studio lo divide in due sezioni chiare: i risulta...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Per l'analisi di SOLB, questo studio ha progettato modelli MPFR e IGWO-XGBoost e ha utilizzato dati provenienti da piattaforme didattiche online. Nell'esperimento vi è stata un'alta coerenza tra la valutazione del modello di inferenza e il punteggio effettivo, indicando l'efficacia del modello di inferenza. Circa il 25% degli studenti ha avuto un tempo di studio di 1-10 ore nel corso. La percentuale di studenti con ore di studio tra 11 e 20 anni, 21 e 30 anni, 31-40 ore e oltre 41 ore er...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno interessi finanziari o non finanziari rilevanti da divulgare.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Modello linguistico pre-addestrato BERTRicerca su Googlehttps://github.com/google-research/bert
Dizionario delle emozioni CNKICNKIhttps://www.cnki.net/
La piattaforma Chaoxing apprende i dati comportamentaliChaoxing INFORMATION TECHNOLOGY DEVELOPMENT Co., Ltdhttps://www.chaoxing.com/
Memoria del computerFornitore di hardware universale (senza modello specifico)
Elenco dei termini dismessi dell'Harbin Institute of TechnologyIstituto di Tecnologia di Harbinhttps://github.com/goto456/stopwords/blob/master/hit_s 
Intel Core i5-12600KF Intel CorporationBX8071512600KF
Strumento di segmentazione delle parole Jieba (modalità precisione)Comunità open source di terze partihttps://github.com/fxsjy/jieba.
Dati sulle recensioni degli studenti della piattaforma MOOCLove Course Networkhttps://www.icourse163.org/
Biblioteca NLTKTeam di sviluppo NLTKhttps://www.nltk.org/
Linguaggio di programmazione PythonPython Software Foundationhttps://www.python.org/
Scikit-learn 1.2.2Team Scikit Learnhttps://scikit-learn.org/stable/
La piattaforma Smart Tree apprende i dati comportamentaliRete Intelligente per Alberihttps://www.zhihuishu.com/
Tecnologia SMOTETeam di Sviluppo Imparata SquilibratoIntegrato nella libreria Imbalanced Learn, https://imbalanced-learn.org/stable/
Sistema operativo Windows 10Microsoft Corporationhttps://www.microsoft.com/zh-cn/windows/windows-10
XGBoost 1.7.5Team di sviluppo XGBoosthttps://xgboost.readthedocs.io/

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cebi, A., Araujo, R. D., Brusilovsky, P. Do individual characteristics affect online learning behaviors? An analysis of learners sequential patterns. J Res Technol Educ. 55 (4), 663-683 (2023).
  2. Wang, Y. Affective state analysis during online learning based on learning behavior data. Tech Knowl Learn. 28 (3), 1063-1078 (2023).
  3. Wang, K., Zheng, K., Wang, Y. Construction and empirical research of a subjective-and-objective-analysis model of the online learning behavior. Soft Comput. 29 (6), 2971-2982 (2025).
  4. Yang, J. Accurate prediction and analysis of college students' performance from online learning behavior data. IEIE Trans Smart Process Comput. 12 (5), 404-411 (2023).
  5. Du, K., et al. Image-Based Intelligent Classroom Monitoring and Learning Behavior Analysis via Joint Object Detection and Semantic Segmentation. Traitement Signal. 42 (4), 2323-2332 (2025).
  6. Alqahtani, S. Leveraging techniques of epistemic network analysis to discover behaviors of student learning reflections in online learning environments. Eng Technol Appl Sci Res. 14 (3), 14191-14199 (2024).
  7. Li, Y., Wang, X., Chen, F., Zhao, B., Fu, Q. Online learning behavior analysis and prediction based on spiking neural networks. J Social Comput. 5 (2), 180-193 (2024).
  8. Zeng, B. Visual interactive mobile analysis of online English learning behavior based on lagged sequence analysis approach. Int J Interact Mob Technol. 18 (10), 34-47 (2024).
  9. Zhao, M., Zhang, Z. Prediction of online learning behavior in universities based on long short-term memory networks. J Comput Methods Sci Eng. 25 (1), 502-513 (2025).
  10. Li, F., et al. SPOC online video learning clustering analysis: Identifying learners' group behavior characteristics. Comput Appl Eng Educ. 31 (4), 1059-1077 (2023).
  11. Atenyi, J. M., Wang, C. J. Fractional fuzzy inference system design and implementation for temperature control. Iran J Fuzzy Syst. 22 (2), 171-186 (2025).
  12. Alves, K., Ballini, R., Eduardo, P. Financial series forecasting: A new fuzzy inference system for crisp values and interval-valued predictions. Comput Econ. 65 (6), 3673-3721 (2025).
  13. TuuSzabo, B., Koczy, L. T. A highly accurate Mamdani fuzzy inference system for tennis match predictions. Fuzzy Optim Decis Making. 24 (1), 99-127 (2025).
  14. Chen, Y., Li, C. Study on sensible beginning divided-search enhanced Karnik-Mendel algorithms for centroid type-reduction of general type-2 fuzzy logic systems. AIMS Math. 9 (5), 11851-11876 (2024).
  15. Fumanal-Idocin, J., Andreu-Perez, J., Cordon, O., Hagras, H., Bustince, H. ARTxAI: Explainable Artificial Intelligence Curates Deep Representation Learning for Artistic Images Using Fuzzy Techniques. IEEE Trans. Fuzzy Syst. 32 (4), 1915-1926 (2024).
  16. Duan, L., Paknejad, J., Kim, H. Employee attrition prediction with convolutional neural network and synthetic minority over-sampling technique. J Bus Analytics. 8 (1), 24-35 (2025).
  17. Luo, H., Zeng, X., Chen, Y. Research on text classification of coal mine safety hazards based on SMOTE+ENN. China Mining Mag. 34 (1), 116-125 (2025).
  18. Binbusayyis, A., Mohemmed, S. Stability prediction in smart grid using PSO optimized XGBoost algorithm with dynamic inertia weight updation. CMES - Comput Model Eng Sci. 142 (1), 909-931 (2025).
  19. Mosa, M. A. Optimizing text classification accuracy: a hybrid strategy incorporating enhanced NSGA-II and XGBoost techniques for feature selection. Prog Artif Intell. 14 (2), 275-299 (2025).
  20. Luo, S. An interior design method based on the coupling of I-GWO and self-updating neural network under the background of green interaction. Int J Sustain Dev. 28 (1), 43-57 (2025).
  21. Prabhakar, K., Jain, S. K., Padhy, P. K. Virtual inertia control of isolated microgrids using GWO-optimized modified IMC controller. Trans Inst Meas Control. 47 (4), 733-745 (2025).
  22. Lai, Y., Kang, L., Cao, W. A multi-objective particle swarm optimization using logistics-tent chaotic map with GOBL and non-inertial Lévy flight. J Comput (Taiwan). 36 (1), 59-74 (2025).
  23. Hasibur, R., Uddin, M. A., Ria, Z. F., Rahman, R. M. Optimizing BERT for Bengali Emotion Classification: Evaluating Knowledge Distillation, Pruning, and Quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  24. Liang, G., Jiang, C., Ping, Q., Jiang, X. Academic performance prediction associated with synchronous online interactive learning behaviors based on the machine learning approach Interact. Learn. Environ. 32 (6), 3092-3107 (2024).
  25. Mei, L. Model Construction of Higher Education Quality Assurance System Based on Fuzzy Neural Network. Informatica. 10 (10), 153-164 (2024).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Errata corrige

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Formal Correction: Erratum: Multi-Perspective Fuzzy Reasoning and XGBoost-Based Analysis of Online Learning Behavior
Posted by JoVE Editors on 5/25/2026. Citeable Link.

This corrects the article 10.3791/69515

Tag

Online Learning BehaviorFuzzy ReasoningXGBoost AlgorithmEmotion ClassificationLearning PerformanceGrey Wolf OptimizationPersonalized TeachingLearning Behavior AnalysisProcrastination BehaviorOnline Education

Articoli correlati