$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Progettazione del metodo LBA considerando prospettive MPFR ed emotive
Viene costruito un sistema di valutazione multi-prospettiva per analizzare il Comportamento di Apprendimento Online degli Studenti (SOLB) e viene progettato un modello MPFR. Per analizzare ulteriormente i sentimenti soggettivi degli studenti durante l'apprendimento, questo studio adotta l'algoritmo XGBoost e progetta l'algoritmo IGWO per l'ottimizzazione degli iperparametri al fine di migliorare l'accuratezza della classificazione.
Costruzione del modello MPFR per LBA
Per analizzare SOLB, questo studio parte principalmente da due prospettive per formare un piano di analisi completo. Innanzitutto, in termini di performance di apprendimento, questo studio considera tre prospettive: curriculum, individuale e di classe, per formare il modello MPFR. In secondo luogo, in termini di analisi sentimentale dei commenti degli studenti, questo studio progetta un algoritmo XGBoost migliorato. Attraverso l'analisi delle prestazioni di apprendimento e del feedback delle emozioni degli studenti, questo studio può analizzare meglio la SOLB. Per quanto riguarda i dettagli tecnici specifici dell'analisi delle prestazioni di apprendimento, questo studio utilizza inizialmente dati provenienti da una piattaforma di apprendimento online e li pre-elabora. In secondo luogo, questo studio seleziona indicatori fondamentali di valutazione delle prestazioni di apprendimento da diverse prospettive per costruire un sistema di valutazione completo. Successivamente, viene costruito un corrispondente modello MPFR per valutare il comportamento di apprendimento.
Questo studio seleziona dati dalla piattaforma Superstar (fonte da: https://www.chaoxing.com/). Contiene informazioni provenienti da molteplici dimensioni, come attività in classe e valutazione dei voti, che possono fornire una buona base per una successiva LBA. Dopo aver ottenuto i dati, devono essere pre-elaborati, includendo principalmente la cancellazione di campi irrilevanti, il filtraggio dei dati e i controlli di integrità dei dati. Ad esempio, nei dati degli insegnanti, informazioni irrilevanti come il numero e il dipartimento a cui appartiene il corso devono essere rimossi. Successivamente, questo studio costruisce l'ingegneria delle funzionalità di LBA basandosi sui dati sui comportamenti di apprendimento della piattaforma Superstar. L'indice LBA degli studenti fornisce una base di ingegneria delle caratteristiche per il modello MPFR successivo, e il contenuto di questo indice è mostrato nella Figura 1.

Figura 1: Indicatori per l'LBA degli studenti. La figura chiarisce le tre dimensioni fondamentali (curriculum, individuale, classe) dell'LBA degli studenti e gli indicatori specifici di valutazione sotto ciascuna dimensione, fornendo supporto alle funzionalità per il modello MPFR. Clicca qui per visualizzare una versione più grande di questa figura.
Nella Figura 1, gli indicatori LBA degli studenti ruotano principalmente attorno a tre prospettive: corso, individuale e classe, con un chiaro focus su ogni dimensione, fornendo un supporto preciso alle caratteristiche per la costruzione di modelli MPFR. Tra questi, in termini di indicatori di dimensione del corso, questo studio seleziona il tasso di completamento dei compiti del corso, la durata dell'apprendimento del corso e la frequenza delle interazioni con i corsi. La preoccupazione centrale di questa dimensione è la qualità complessiva del completamento dei compiti del corso e la tempestività della partecipazione all'apprendimento. Ad esempio, il tasso di completamento dei compiti del corso viene utilizzato per tracciare la differenza tra i tassi di completamento prima e dopo la scadenza; La durata dello studio del corso viene utilizzata per distinguere i diversi intervalli di intensità di apprendimento; La frequenza dell'interazione del corso viene utilizzata per filtrare comportamenti interattivi efficaci. A livello personale, i progressi nell'apprendimento personale, la qualità del completamento dei compiti e i punteggi degli esami sono selezionati come indicatori di valutazione. Questa dimensione si concentra sul grado di corrispondenza tra il progresso dell'apprendimento personale e i risultati della padronanza della conoscenza. Esempi includono il confronto dei progressi personali dell'apprendimento con i piani di corso, la valutazione dell'accuratezza e dell'efficienza dei compiti completati e la classificazione dei livelli di padronanza delle conoscenze in base ai punteggi dei test. Inoltre, in termini di dimensione della classe, gli indicatori selezionati includono il punteggio medio della classe, l'attività di interazione della classe e l'atmosfera di apprendimento della classe. Questa dimensione si concentra principalmente sull'impatto dell'ambiente di apprendimento complessivo sul comportamento individuale. Ad esempio, il voto medio viene utilizzato per individuare il livello relativo di prestazione individuale nel gruppo; L'attività di interazione di classe è utilizzata per riflettere il grado di partecipazione collettiva; L'atmosfera di apprendimento viene utilizzata per analizzare l'effetto motore dell'ambiente di gruppo sul comportamento di apprendimento. Per analizzare il comportamento di apprendimento degli studenti, si costruisce un modello di ragionamento fuzzy e si ottengono le caratteristiche comportamentali da diverse prospettive. Il ragionamento fuzzy è un metodo di ragionamento che utilizza la logica fuzzy, che elabora informazioni imprecise o incerte tramite insiemi fuzzy e regole fuzzy, e presenta i vantaggi di una forte flessibilità e facilecomprensione 11,12. Il ragionamento fuzzy, come meccanismo di calcolo centrale dei modelli MPFR, viene applicato dopo l'ingegneria delle caratteristiche. Il principale processo di ragionamento fuzzy è mostrato nella Figura 2.

Figura 2: Il principale diagramma di flusso del ragionamento fuzzy. La figura mostra il processo centrale del ragionamento fuzzy, includendo quattro passaggi chiave: fuzzificazione, costruzione della base di regole fuzzy, ragionamento fuzzy e deblurring, e chiarisce la logica del modello MPFR nel gestire dati di comportamento di apprendimento incerti. Clicca qui per visualizzare una versione più grande di questa figura.
Il ragionamento fuzzy riguarda principalmente la fuzzificazione, l'istituzione di una libreria di regole fuzzy (FRL), il ragionamento fuzzy e la debluring. Tra queste, la fuzzificazione richiede la conversione precisa di dati di input in insiemi fuzzy e implica la definizione di funzioni di appartenenza. Il FRL contiene una serie di regole fuzzy ed è principalmente utilizzato per descrivere la relazione tra input e output. Nella costruzione della base di regole fuzzy, lo studio invita tre professori associati di tecnologia educativa con esperienza didattica di ≥ 8 anni a sviluppare congiuntamente 28 regole, e determina le regole finali attraverso tre round di iterazione utilizzando il "metodo Delphi". Ad esempio, Regola 1: SE il tasso di completamento del compito del corso è inferiore al 30% e il progresso individuale è in ritardo di 2 settimane rispetto ai tempi previsti → ALLORA lo stato ad alto rischio. Il ragionamento fuzzy è il processo di dedurre dati di input fuzzy costruiti su un FRL e ottenere risultati di output fuzzy. Infine, la deblurring convertirà il risultato fuzzy in un valore di output accurato. Lo studio seleziona una funzione di appartenenza triangolare, che è una funzione ampiamente utilizzata nei sistemi logici fuzzy e presenta vantaggi come forte flessibilità e alta efficienza computazionale. L'espressione della funzione μA(x) è mostrata nell'equazione (1).
(1)
Nell'equazione (1), x è il valore specifico dell'input. a, b e c sono i tre vertici di un triangolo. Nel deblurring, questo articolo utilizza il metodo del centroide per convertire i risultati di output. Il metodo del centroide è una tecnica di debluring comunemente utilizzata nella logica fuzzy, che presenta vantaggi come una forte intuitività, calcolo semplice estabilità 13. L'espressione del metodo del centroide è mostrata nell'equazione (2)14.
(2)
Nell'equazione (2), f* è il valore di uscita dopo la debluring, che è il baricentroide dell'insieme fuzzy. μ(x) è la funzione di appartenenza.
è la somma pesata di tutti i punti in un insieme fuzzy.
è l'integrale della funzione di appartenenza su tutti i possibili valori di x. La razionalità dell'uso di regole e funzioni di appartenenza definite manualmente nel modello MPFR si riflette in tre aspetti. Innanzitutto, garanzia di qualifica esperta: i regolatori sono tre professori associati di tecnologia educativa e sono stati certificati dall'"Online Learning Behavior Analyst" del "Online Education Research Center del Ministero dell'Istruzione" per garantire che le regole siano conformi alle leggi dell'istruzione e dell'insegnamento. In secondo luogo, vantaggio di efficienza: il tempo di inferenza delle regole manuali è molto inferiore rispetto a quello dei metodi basati sui dati, rendendolo più adatto alle esigenze di "inferenza in tempo reale" delle piattaforme di educazione online e non richiedendo una grande quantità di dati annotati, riducendo i costi di raccoltadati 15. In terzo luogo, adattandosi al requisito fondamentale di "interpretabilità" negli scenari di istruzione online, regole definite manualmente e funzioni di appartenenza triangolari (Equazione 1) possono corrispondere direttamente alla cognizione intuitiva negli scenari didattici. Gli educatori non hanno bisogno di un background tecnico complesso per comprendere le ragioni dietro il rischio di uno studente. Metodi basati sui dati come i sistemi neuro-fuzzy possono ottimizzare automaticamente le regole. Tuttavia, la maggior parte delle regole generate sono espressioni matematiche complesse, difficili da interpretare per gli educatori, il che riduce l'accettabilità del modello nell'intervento didattico effettivo.
Progettazione di un modello migliorato di analisi del sentiment dei commenti degli studenti per XGBoost
Il modello MPFR progettato può analizzare SOLB da tre aspetti: corso, individuale e classe. Tuttavia, l'analisi esterna dei dati comportamentali presenta limiti nell'esprimere i sentimenti soggettivi degli studenti. Pertanto, per analizzare ulteriormente i sentimenti soggettivi degli studenti riguardo all'apprendimento, vengono raccolti e preprocessati dati aggiuntivi provenienti dalle piattaforme di apprendimento MOOC contenenti informazioni sui commenti degli studenti. Successivamente, l'XGBoost viene utilizzato per costruire il modello di classificazione sentimentale. L'IGWO è progettato per ottimizzare i propri parametri al fine di migliorare l'accuratezza del modello di classificazione. Il miglioramento di XGBoost si riflette nell'ottimizzazione dei parametri tramite l'algoritmo IGWO. La pre-elaborazione dei dati è un primo passo cruciale prima della costruzione e dell'analisi del modello. Il processo di pre-elaborazione dei dati è mostrato nella Figura 3.

Figura 3: Il processo di pre-elaborazione dei dati. Il processo di pre-elaborazione dei dati in nove fasi include pulizia del testo, segmentazione delle parole, rimozione delle stop-word, estrazione di stemmi e riconoscimento delle parole sentimentali, fornendo dati di alta qualità per l'analisi comportamentale successiva e la classificazione del sentiment. Clicca qui per visualizzare una versione più grande di questa figura.
I passaggi di pre-elaborazione dei dati sono i seguenti: Il primo passo consiste nell'eseguire la pulizia del testo per rimuovere campi irrilevanti nei dati della piattaforma Chaoxing e filtrare campioni non validi. Allo stesso tempo, i campi non testuali e le brevi recensioni vengono rimossi dai dati delle recensioni sulla piattaforma MOOC. Il secondo passo è eseguire l'elaborazione della segmentazione. Tra questi, i commenti cinesi utilizzano la "modalità precisa" di Jieba per l'elaborazione della segmentazione delle parole, mentre i commenti in inglese utilizzano la funzione di segmentazione delle parole della libreria NLTK per l'elaborazione. Il terzo passo è rimuovere le parole di stop comuni come ''de'', ''yes'', ''in'', ecc. Tra queste, le parole stop cinesi utilizzano la lista delle parole stop (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt) dell'Istituto di Tecnologia di Harbin. Le parole di stop vengono eliminate tramite corrispondenza di parole. Le parole stop inglesi utilizzano la lista universale delle parole stop integrata nella libreria NLTK, che viene anch'essa eliminata tramite il matching parola per parola. Il quarto passo è utilizzare lo stemmer della libreria NLTK per estrarre stemmi dal testo e ripristinare i verbi nei dati inglesi nella loro forma stem. Il quinto passo è identificare le parole emotive positive e negative nei commenti basandosi sul dizionario emotivo CNKI per fornire una base pre-annotazione per la classificazione emotiva successiva. Il sesto passo è eseguire l'estrazione delle caratteristiche. Tra questi, i dati strutturati nella piattaforma Chaoxing sono standardizzati, mentre gli indicatori di classificazione sono codificati separatamente. Allo stesso tempo, questi dati di commento della piattaforma MOOC utilizzano un modello linguistico pre-addestrato (Bidirectional Encoder Representation from Transformers, BERT) per estrarre le caratteristiche del testo. Il vantaggio principale del modello BERT nell'estrazione delle caratteristiche di testo è che può generare dinamicamente vettori di parola consapevoli del contesto tramite un'architettura Transformer bidirezionale profonda, affrontando efficacemente l'ambiguità che i modelli tradizionali di incorporamento statico di parole non riescono a gestire. Il settimo passo è affrontare il problema delle categorie di sentiment squilibrate nei dati dei commenti. La Sintetica Tecnica di Sovracampionamento delle Minoranze (SMOTE) viene impiegata per processarla. Cinque campioni di vicino più prossimo vengono selezionati per l'interpolazione e generare campioni di classe minoritaria sintetica, con un seed casuale fisso di 42 per garantire la riproducibilità dell'esperimento. L'ottavo passo è annotare e partizionare i dati. Il nono passo è compilare i valori mancanti nei dati delle superstelle e rimuovere gli outlier. Durante l'elaborazione del bilanciamento dei dati, SMOTE crea nuovi campioni compositi interpolando tra campioni di classi minoritarie, aumentando così il numero di campioni di classi minoritarie e rendendo la distribuzione di classi del set di dati piùbilanciata 16,17. L'espressione di SMOTE è mostrata nell'equazione (3).
Bmn = dm + rand(0,1) x (dmn -d m) (3)
Nell'equazione (3), Bmn è un campione di classe minoritaria costruito artificialmente, dm è il i-esimo campione di classe minoritaria e dmn è il n-esimo campione tra i k vicini più prossimi di dm. rand(0,1) è un numero casuale compreso tra 0 e 1. XGBoost migliora le prestazioni predittive aggiungendo iterativamente alberi di previsione. Presenta vantaggi come alta precisione, grande flessibilità e facilità d'uso 18,19. I passaggi per costruire iterativamente un modello ad albero usando XGBoost includono principalmente: inizializzare il modello, costruire iterativamente l'albero, la funzione obiettivo e il termine di regolarizzazione. L'output
previsto nella t-esima iterazione è mostrato nell'equazione (4).
(4)
Nell'equazione (4),
è il valore di previsione del modello dopo la t - 1ª iterazione, ft(h) è la funzione di previsione del modello ad albero aggiunta nella t-esima iterazione, e h è il vettore di caratteristica in ingresso. La funzione obiettivo per minimizzare XGBoost è mostrata nell'equazione (5).
(5)
Nell'equazione (5), i è il numero di campione. I e J sono il numero totale di campioni e alberi, e j è il numero di alberi.
è la funzione di perdita, e gi è la vera etichetta del campione i -esimo.
è il valore previsto del modello per il i -esimo campione dopo la t -esima iterazione. Ω(ft) è il termine di regolarizzazione, e (ft) è la funzione di previsione dell'albero j -esimo. L'espressione generale Ω(f) per la regolarizzazione è mostrata nell'equazione (6).
(6)
Nell'equazione (6), γ significa il coefficiente di penalità per la quantità di nodi foglia, λ è il coefficiente di regolarizzazione L2 per il peso dei nodi foglia, e w è il peso dei nodi foglia. Tuttavia, la scelta degli iperparametri XGBoost ha un effetto diretto e significativo sulle prestazioni. Gli iperparametri comuni di XGBoost includono la velocità di apprendimento, la profondità massima dell'albero e i parametri di regolarizzazione. A causa del potenziale ampio spazio degli iperparametri, regolare manualmente questi parametri non solo richiede tempo, ma è anche difficile trovare la combinazione ottimale di parametri. Pertanto, questo studio progetta IGWO per ottimizzare gli iperparametri di XGBoost. GWO cerca soluzioni ottimali simulando la gerarchia sociale e le strategie di caccia dei lupi grigi, con vantaggi come minori parametri e forte adattabilità20,21. In GWO, la posizione iniziale della popolazione viene generata come mostrato nell'equazione (7).
(7)
Nell'equazione (7), Puv è la posizione dell'u-esimo individuo nella v-esima dimensione.
e
sono i limiti superiore e inferiore dello spazio di ricerca v-esimo. rand() è un numero casuale tra [0,1]. Tuttavia, l'algoritmo GWO può incontrare problemi come velocità di convergenza lenta e blocchi negli ottimi locali nelle fasi intermedie e successive. Ciò significa anche che, a questo punto, GWO potrebbe non essere in grado di esplorare efficacemente l'intero spazio delle soluzioni, rendendo difficile trovare la soluzione globale ottimale. Per affrontare questo problema, questo studio migliora GWO da due aspetti, ovvero l'introduzione della Tend Chaotic Map (TCM) e del Fattore di Convergenza Non Lineare (NCF). La MTC è una semplice mappatura caotica che garantisce che le regioni potenzialmente ottimali della soluzione non vengano trascurate durante il processo di ricerca ed evita ricerche ripetute della stessa regione22. Pertanto, attraverso la MTC, si può generare una popolazione iniziale più uniforme e casuale, e la capacità dell'algoritmo di superare ottimi locali può essere migliorata. Il calcolo della MTC è mostrato nell'equazione (8).
(8)
Nell'equazione (8), y è il parametro di controllo. Rt e Rt+1 sono le variabili di stato del sistema nelle t-esime e t+1-esima iterazioni. La formula per NCF z è mostrata nell'equazione (9).
(9)
Nell'equazione (9), zmax è il fattore massimo di convergenza e tmax è il numero massimo di iterazioni. Questo metodo decrescente non lineare permette a GWO di mantenere una grande dimensione di passo per la ricerca globale nelle prime fasi iniziali. Nella fase intermedia della ricerca, la velocità di convergenza accelera, mentre nella fase successiva la ricerca locale viene eseguita con passaggi più piccoli, bilanciando efficacemente le capacità di ricerca globale e locale e migliorando le prestazioni di ottimizzazione. L'algoritmo IGWO è utilizzato specificamente per la fase di ottimizzazione degli iperparametri del classificatore di sentiment XGBoost, e il suo processo principale è mostrato nella Figura 4.

Figura 4: Il processo principale dell'IGWO. La figura delinea il processo di esecuzione di IGWO, inclusa l'inizializzazione della popolazione basata sulla mappatura caotica della tenda, l'aggiornamento della posizione dei fattori di convergenza non lineari e lo screening ottimale individuale, e chiarisce la logica per ottimizzare gli iperparametri XGBoost. Clicca qui per visualizzare una versione più grande di questa figura.
Nella Figura 4, il processo IGWO include: inizializzare l'algoritmo; l'uso della MTC per inizializzare la popolazione; calcolare il valore iniziale di fitness di ogni individuo; usando NCF per aggiornare le posizioni dei lupi grigi; selezionare la soluzione con la migliore forma fisica come nuovo individuo ottimale; e produrre l'individuo ottimale. La combinazione ottimale degli iperparametri XGBoost può essere prodotta tramite IGWO. Il processo complessivo di classificazione del sentiment integra la preelaborazione dei dati, l'ottimizzazione IGWO e il modello finale XGBoost. Il processo di classificazione basato su IGWO-XGBoost è mostrato nella Figura 5.

Figura 5: Il processo del modello di classificazione basato su IGWO-XGBoost. La figura mostra l'intero processo del modello di classificazione del sentiment IGWO-XGBoost, dall'input e preprocessing dei dati alla partizione del dataset, all'ottimizzazione degli iperparametri IGWO, alla costruzione del modello XGBoost e all'output dei risultati della classificazione, presentando chiaramente la catena operativa del modello. Clicca qui per visualizzare una versione più grande di questa figura.
Il modello basato su IGWO-XGBoost include processi come dati di input, preprocessing dei dati, partizionamento dei dataset, ottimizzazione degli iperparametri dell'algoritmo IGWO, combinazione ottimale di iperparametri, costruzione di XGBoost basata sulla combinazione ottimale di iperparametri e output dei risultati di classificazione. Attraverso questo modello di classificazione, le emozioni nei commenti degli studenti possono essere classificate, ottenendo così una comprensione più intuitiva dei sentimenti soggettivi degli studenti riguardo all'apprendimento. Le versioni specifiche del software, i seed casuali, le specifiche hardware, le specifiche ambientali e le fonti di dataset utilizzate nello studio sono mostrate nella Tabella 1.
| Tipo di set | Modello e contenuto specifici |
| Software di base | Python 3.9.7 |
| Libreria base | XGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1 |
| Seme casuale | Imposta il seed casuale globale a 42 |
| Specifiche hardware/ambiente | 1. Sistema operativo: Windows 10 Professional Edition (64 bit, numero di versione 22H2) |
| 2. Processore: Intel Core i5-12600KF (con frequenza principale di 3,7GHz e frequenza di accelerazione dinamica di 4,9GHz) |
| 3. Memoria: 64GB DDR4 (frequenza 3200MHz, supporta fino a 128GB di memoria) |
| 4. Archiviazione: SSD da 1TB (Samsung 980 Pro, velocità di lettura 7450MB/s) |
| 5. Scheda grafica: NVIDIA GeForce RTX 3060 (12GB di memoria video) |
| Fonti del dataset e dettagli di accesso | 1. Dataset della piattaforma superstar: |
| -Source Uniform Resource Locator (URL): https://www.chaoxing.com/ |
| -Metodo di acquisizione: candidatura tramite la piattaforma aperta big data di Chaoxing Education (percorso applicativo: sito ufficiale della piattaforma → centro sviluppatori → interfaccia dati → dataset di comportamento di apprendimento) |
| 2. Dataset di commenti della piattaforma MOOC: |
| -URL sorgente: https://www.icourse163.org/.cn |
| -Metodo di acquisizione: Fare domanda tramite il canale "supporto alla ricerca dati" della piattaforma MOOC |
| Script o modelli personalizzati | 1. Script di preelaborazione dei dati |
| 2. Script modello MPFR |
3. Script modello IGWO-XGBoost
|
Tabella 1: Versioni specifiche del software, seed casuali, specifiche hardware, specifiche ambientali e fonti di dataset utilizzate nella ricerca. Fornire un elenco dettagliato dell'ambiente software e hardware richiesto, impostazioni di seed casuali, sorgenti di dataset e intervallo di ricerca degli iperparametri XGBoost per lo studio, al fine di garantire la riproducibilità e la standardizzazione dell'esperimento.
La Tabella 1 mostra che lo studio adotta XGBoost 1.7.5 come quadro centrale del modello di classificazione del sentiment e introduce Scikit learn 1.2.2 per la preelaborazione dei dati, l'estrazione delle caratteristiche e la valutazione del modello. Inoltre, lo studio imposta uniformemente il seed casuale a 42 per garantire la riproducibilità della partizionazione dei dati, del sovracampionamento SMOTE, dell'ottimizzazione degli iperparametri IGWO e dei risultati dell'addestramento del modello IGWO-XGBoost. Inoltre, l'algoritmo IGWO imposta lo spazio di ricerca per gli iperparametri XGBoost. L'intervallo di ricerca per la velocità di apprendimento è [0,001, 0,3] sulla scala logaritmica, e la profondità massima dell'albero viene ricercata nell'insieme intero {3, 4,..., 15}. L'intervallo di ottimizzazione del termine di regolarizzazione L2 è [0.1, 5.0], e il rapporto di campionamento di ogni sottoinsieme di caratteristiche dell'albero è ottimizzato nell'intervallo di [0.6, 1.0]. L'intervallo di accordatura per il peso minimo dei nodi fogliare è [1, 10].
Il dataset e il codice correlato per la preelaborazione e l'analisi dei dati sono stati generati e analizzati dallo stesso team. Gli script principali per la preelaborazione dei dati sono mostrati nella Tabella 2.
| Importato Pandas come PD, Jieba, RE, NumPy come NP |
| da nltk.tokenize import word_tokenize; da nltk.stem import PorterStemmer |
| Decisamente pulito (testo, l): |
| return re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" else r"[^a-zA-Z]", " ", text).strip() |
| Def Process(testo, L): |
| t = jieba.lcut(testo) se l=="zh" altrimenti word_tokenize(testo) |
| return " ".join([PorterStemmer().stem(w) se l=="en" altrimenti w per w in t se w non in open("hit_stopwords.txt").read().split()]) |
| difesa main(c,m,l): |
| cx=pd.read_csv(c).query("durata di apprendimento del corso>=1 & risultati dell'esame.notna()"); mc=pd.read_csv(m).query("commento testo.str.len()>=5") |
| mc["t"]=mc["commento text"].apply(clean,args=("zh",).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v for k,v in locals().items()}) |
Tabella 2: Script core per la pre-elaborazione dei dati. Presentare le informazioni fondamentali dello script per la pre-elaborazione dei dati, chiarire i passaggi di preprocessing corrispondenti allo script e fornire riferimenti tecnici per la replica dei metodi di ricerca.