$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ontwerp van de LBA-methode met oog op MPFR en emotionele perspectieven
Er wordt een multi-perspectief evaluatiesysteem opgebouwd voor het analyseren van het Online Leergedrag van Studenten (SOLB), en er wordt een MPFR-model ontworpen. Om de subjectieve gevoelens van studenten tijdens het leren verder te analyseren, gebruikt deze studie het XGBoost-algoritme en ontwerpt het het IGWO-algoritme voor hyperparameteroptimalisatie om de classificatienauwkeurigheid te verbeteren.
Constructie van het MPFR-model voor LBA
Om SOLB te analyseren, begint deze studie voornamelijk vanuit twee perspectieven om een volledig analyseplan te vormen. Ten eerste, wat betreft leerprestaties, kijkt deze studie naar drie perspectieven: curriculum, individueel en klas, om het MPFR-model te vormen. Ten tweede, wat betreft sentimentanalyse van studentenreacties, ontwerpt deze studie een verbeterd XGBoost-algoritme. Door de analyse van leerprestaties en feedback van studenten kan deze studie SOLB beter analyseren. Wat betreft specifieke technische details van leerprestatieanalyse gebruikt deze studie eerst data van een online leerplatform en verwerkt deze vooraf. Ten tweede selecteert deze studie kernindicatoren voor evaluatie van leerprestaties vanuit verschillende perspectieven om een uitgebreid evaluatiesysteem te bouwen. Vervolgens wordt een overeenkomstig MPFR-model opgesteld om leergedrag te evalueren.
Deze studie selecteert gegevens van het Superstar-platform (bron van: https://www.chaoxing.com/). Het bevat informatie uit meerdere dimensies, zoals klasactiviteiten en beoordeling van cijfers, wat een goede basis kan bieden voor een vervolg van de LBA. Na het verkrijgen van de data moet deze worden voorbewerkt, voornamelijk inclusief het verwijderen van irrelevante velden, datafiltering en controles op gegevensintegriteit. Bijvoorbeeld, in lerarendata moet irrelevante informatie zoals het nummer en de afdeling waartoe de cursus behoort worden verwijderd. Vervolgens construeert deze studie de feature engineering van LBA op basis van de leergedragsgegevens van het Superstar-platform. De student LBA-index biedt een feature engineering-basis voor het daaropvolgende MPFR-model, en de inhoud van deze index wordt weergegeven in Figuur 1.

Figuur 1: Indicatoren voor de LBA van studenten. De figuur verduidelijkt de drie kerndimensies (curriculum, individueel, klas) van student LBA en de specifieke evaluatie-indicatoren onder elke dimensie, en biedt functie-ondersteuning voor het MPFR-model. Klik hier om een grotere versie van deze figuur te bekijken.
In Figuur 1 draaien de LBA-indicatoren van studenten voornamelijk om drie perspectieven: cursus, individueel en klasse, met een duidelijke focus op elke dimensie, die precieze feature-ondersteuning biedt voor de constructie van MPFR-modellen. Daaronder selecteert deze studie qua cursusdimensie-indicatoren het voltooiingspercentage van cursusopdrachten, de leerduur van de cursus en de frequentie van de interactie. De kernzorg van deze dimensie is de algehele voltooiingskwaliteit van cursustaken en de tijdigheid van de leerdeelname. Zo wordt het voltooiingspercentage van cursustaken gebruikt om het verschil in voltooiingspercentages vóór en na de deadline bij te houden; De duur van de cursusstudie wordt gebruikt om verschillende leerintensiteitsintervallen te onderscheiden; De frequentie van cursusinteractie wordt gebruikt om effectief interactief gedrag te filteren. Op persoonlijk vlak worden persoonlijke leervooruitgang, kwaliteit van huiswerkvoltooiing en examenscores geselecteerd als evaluatieindicatoren. Deze dimensie richt zich op de mate van overeenstemming tussen persoonlijke leervoortgang en resultaten van kennisbeheersing. Voorbeelden zijn het vergelijken van persoonlijke leervoortgang met cursusplannen, het beoordelen van de nauwkeurigheid en efficiëntie van voltooide opdrachten, en het classificeren van kennisbeheersingsniveaus op basis van testresultaten. Daarnaast omvatten de geselecteerde indicatoren qua klasdimensie de gemiddelde klassescore, de interactie-activiteit van de klas en de leeromgeving in de klas. Deze dimensie richt zich vooral op de impact van de algehele leeromgeving op individueel gedrag. Zo wordt het gemiddelde cijfer gebruikt om het relatieve niveau van individuele prestaties in de groep te bepalen; De activiteit van klasseninteractie wordt gebruikt om de mate van collectieve participatie te weerspiegelen; De leeromgeving wordt gebruikt om het drijvende effect van de groepsomgeving op leergedrag te analyseren. Om het leergedrag van leerlingen te analyseren, wordt een fuzzy redeneermodel opgesteld en worden leergedragskenmerken verkregen vanuit verschillende perspectieven. Fuzzy redeneren is een redeneermethode met fuzzy logica, waarbij onnauwkeurige of onzekere informatie verwerkt via fuzzy sets en fuzzy regels, en het voordeel heeft van sterke flexibiliteit en gemakkelijk begrijpen11,12. Fuzzy redeneren, als het kernmechanisme van MPFR-modellen, wordt toegepast na feature engineering. Het hoofdproces van fuzzy redeneren wordt weergegeven in Figuur 2.

Figuur 2: Het hoofdstroomdiagram van fuzzy redenering. De figuur toont het kernproces van fuzzy redeneren, inclusief vier belangrijke stappen: fuzzificatie, het opbouwen van fuzzy rule base, fuzzy redeneren en het deblurren, en verduidelijkt de logica van het MPFR-model bij het omgaan met onzeker leergedrag. Klik hier om een grotere versie van deze figuur te bekijken.
Fuzzy redeneren omvat voornamelijk fuzzificatie, het opzetten van een Fuzzy Rule Library (FRL), fuzzy redeneren en het deblurren. Fuzzificatie vereist onder andere het omzetten van nauwkeurige invoerdata in fuzzy-sets en omvat het definiëren van lidmaatschapsfuncties. De FRL bevat een reeks fuzzy-regels en wordt voornamelijk gebruikt om de relatie tussen input en output te beschrijven. Bij de opbouw van de fuzzy rule base nodigt de studie drie universitair hoofddocenten onderwijstechnologie uit met onderwijservaring van ≥ 8 jaar om gezamenlijk 28 regels te ontwikkelen, en bepaalt de definitieve regels via drie rondes van iteratie met de "Delphi-methode". Bijvoorbeeld, Regel 1: ALS het voltooiingspercentage van de cursusopdracht minder dan 30% is en de individuele leervoortgang 2 weken achterloopt → DAN een risicovolle toestand. Fuzzy redeneren is het proces waarbij fuzzy inputdata wordt afgeleid op basis van een FRL en fuzzy output resultaten wordt verzind. Tot slot zal deblurren het fuzzy outputresultaat omzetten in een nauwkeurige outputwaarde. De studie selecteert een driehoekige lidmaatschapsfunctie, een veelgebruikte functie in fuzzy logicasystemen, en die voordelen heeft zoals sterke flexibiliteit en hoge rekenefficiëntie. De uitdrukking van functie μA(x) wordt weergegeven in vergelijking (1).
(1)
In vergelijking (1) is x de specifieke invoerwaarde. A, B en C zijn de drie hoekpunten van een driehoek. Bij het deblurren gebruikt dit artikel de centroid-methode om de uitvoerresultaten om te zetten. De centroid-methode is een veelgebruikte deblurring-techniek in fuzzy logica, die voordelen heeft zoals sterke intuïtiviteit, eenvoudige berekening en stabiliteit13. De uitdrukking van de centroïdemethode wordt weergegeven in vergelijking (2)14.
(2)
In vergelijking (2) is f* de uitvoerwaarde na het deblurnen, wat het zwaartepunt van de fuzzy-verzameling is. μ(x) is de lidmaatschapsfunctie.
is de gewogen som van alle punten in een fuzzy verzameling.
is de integraal van de lidmaatschapsfunctie over alle mogelijke waarden van x. De rationaliteit van het gebruik van handmatig gedefinieerde regels en lidmaatschapsfuncties in het MPFR-model wordt weerspiegeld in drie aspecten. Ten eerste, garantie voor deskundige kwalificatie: de regelmakers zijn drie universitair hoofddocenten onderwijstechnologie en zijn gecertificeerd door de "Online Learning Behavior Analyst" van het "Online Education Research Center van het Ministerie van Onderwijs" om te waarborgen dat de regels voldoen aan de wetten van onderwijs en onderwijs. Ten tweede, efficiëntievoordeel: De inferentietijd van handmatige regels is veel korter dan die van datagedreven methoden, waardoor het geschikter is voor de "real-time inferentie" behoeften van online onderwijsplatforms en niet veel geannoteerde data vereist, waardoor het verminderen van dataverzameling15 keer kost. Ten derde kunnen het aanpassen aan de kernvereiste van "interpreteerbaarheid" in online onderwijsscenario's, handmatig gedefinieerde regels en driehoekslidmaatschapsfuncties (Vergelijking 1) direct overeenkomen met intuïtieve cognitie in onderwijsscenario's. Docenten hebben geen complexe technische achtergrond nodig om de reden te begrijpen waarom een leerling als risicovol wordt beschouwd. Datagedreven methoden zoals neuro-fuzzy-systemen kunnen regels automatisch optimaliseren. De meeste gegenereerde regels zijn echter complexe wiskundige uitdrukkingen, die moeilijk te interpreteren zijn voor docenten, wat de acceptatie van het model in daadwerkelijke onderwijsinterventie vermindert.
Ontwerp van een verbeterd model voor sentimentanalyse van studentencommentaren voor XGBoost
Het ontworpen MPFR-model kan SOLB analyseren vanuit drie aspecten: cursus, individueel en klasse. Externe gedragsdata-analyse heeft echter beperkingen in het uitdrukken van de subjectieve gevoelens van leerlingen. Daarom worden aanvullende gegevens van MOOC-leerplatforms met commentaarinformatie verzameld en vooraf verwerkt om de subjectieve gevoelens van studenten over leren verder te analyseren. Vervolgens wordt de XGBoost gebruikt om het sentimentclassificatiemodel te construeren. De IGWO is ontworpen om zijn parameters te optimaliseren en zo de nauwkeurigheid van het classificatiemodel te verbeteren. De verbetering van XGBoost wordt weerspiegeld in de parameteroptimalisatie via het IGWO-algoritme. Datapreprocessing is een cruciale eerste stap vóór het bouwen en analyseren van modellen. Het proces van gegevensvoorverwerking wordt weergegeven in Figuur 3.

Figuur 3: Het proces van gegevensvoorbewerking. Het negenstappen-voorverwerkingsproces omvat tekstopschoning, woordsegmentatie, stopwoordverwijdering, stamextractie en sentimentwoordherkenning, waarmee hoogwaardige data wordt geleverd voor latere gedragsanalyse en sentimentclassificatie. Klik hier om een grotere versie van deze figuur te bekijken.
De preprocessing-stappen voor data zijn als volgt: De eerste stap is het uitvoeren van tekstopschoning om irrelevante velden uit de Chaoxing-platformdata te verwijderen en ongeldige voorbeelden te filteren. Tegelijkertijd worden niet-tekstvelden en korte recensies verwijderd uit de reviewgegevens op het MOOC-platform. De tweede stap is het uitvoeren van segmentatieverwerking. Onder hen gebruiken Chinese reacties Jieba's "precieze modus" voor woordsegmentatieverwerking, terwijl Engelse reacties de woordsegmentatiefunctie van de NLTK-bibliotheek gebruiken voor verwerking. De derde stap is het verwijderen van veelvoorkomende stopwoorden zoals ''de'', ''yes'', ''in'', enzovoort. Onder hen gebruiken de Chinese stopwoorden de stopwoordenlijst van het Harbin Institute of Technology (https://github.com/goto456/stopwords/blob/master/hit_stopwords.txt). Stopwoorden worden verwijderd door woordmatching. Engelse stopwoorden gebruiken de universele stopwoordenlijst die is ingebouwd in de NLTK-bibliotheek, die ook wordt verwijderd door woord-voor-woord matching. De vierde stap is het gebruik van de stemmer van de NLTK-bibliotheek om stammen uit de tekst te halen en werkwoorden in de Engelse data terug te brengen naar hun stamvorm. De vijfde stap is het identificeren van de positieve en negatieve emotionele woorden in de reacties op basis van het CNKI emotionele woordenboek om een pre-annotatiebasis te bieden voor latere emotionele classificatie. De zesde stap is het uitvoeren van feature-extractie. Daaronder zijn de gestructureerde gegevens in het Chaoxing-platform gestandaardiseerd, terwijl de classificatie-indicatoren apart worden gecodeerd. Tegelijkertijd gebruiken deze commentaargegevens van het MOOC-platform een vooraf getraind taalmodel (Bidirectional Encoder Representation from Transformers, BERT) methode om tekstkenmerken te extraheren. Het belangrijkste voordeel van het BERT-model bij tekstfeature-extractie is dat het dynamisch contextbewuste woordvectoren kan genereren via een diepe bidirectionele Transformer-architectuur, waarmee effectief de ambiguïteit wordt aangepakt die traditionele statische woord-embeddingmodellen niet kunnen verwerken. De zevende stap is het aanpakken van het probleem van onevenwichtige sentimentcategorieën in commentaargegevens. De Synthetic Minority Over-sampling Technique (SMOTE) wordt gebruikt om het te verwerken. Vijf dichtstbijzijnde buurmonsters worden geselecteerd voor interpolatie om synthetische minderheidsklasse-monsters te genereren, met een vast willekeurig zaad van 42 om reproduceerbaarheid van het experiment te waarborgen. De achtste stap is het annoteren en partitioneren van de gegevens. De negende stap is het invullen van ontbrekende waarden in de superstergegevens en het verwijderen van uitschieters. Bij het uitvoeren van databalanceringsverwerking creëert SMOTE nieuwe samengestelde steekproeven door te interpoleren tussen minderheidsklassesteekproeven, waardoor het aantal minderheidsklassesteekproeven toeneemt en de klassenverdeling van de dataset meer gebalanceerd wordt16,17. De uitdrukking van SMOTE wordt weergegeven in vergelijking (3).
Bmn = dm + rand(0,1) x (dmn - dm) (3)
In vergelijking (3) is Bmn een kunstmatig geconstrueerde minderheidsklassesteekproef, dm is de i-de minderheidsklassesteekproef, en dmn is de n-de steekproef onder de k-dichtstbijzijnde buren van dm. rand(0,1) is een willekeurig getal tussen 0 en 1. XGBoost verbetert de voorspellende prestaties door iteratief voorspellingsbomen toe te voegen. Het heeft voordelen zoals hoge nauwkeurigheid, sterke flexibiliteit en gebruiksgemak18,19. De stappen van het iteratief construeren van een boommodel met XGBoost omvatten hoofdzakelijk: het initialiseren van het model, het iteratief construeren van de boom, de doelfunctie en de regularisatieterm. De voorspelde output
in de t-de iteratie wordt weergegeven in vergelijking (4).
(4)
In vergelijking (4)
is de voorspellingswaarde van het model na de t - 1e iteratie, ft(h) is de voorspellingsfunctie van het boommodel dat in de t-de iteratie is toegevoegd, en h is de invoerkenmerkvector. De doelfunctie voor het minimaliseren van XGBoost wordt weergegeven in vergelijking (5).
(5)
In vergelijking (5) is i het steekproefnummer. I en J zijn het totale aantal monsters en bomen, en j is het aantal bomen.
is de verliesfunctie, en gi is het ware label van de i -de steekproef.
is de voorspelde waarde van het model voor de i-de steekproef na de t-de iteratie. Ω(ft) is de regularisatieterm, en (ft) is de voorspellingsfunctie van de j -de boom. De algemene uitdrukking Ω(f) voor regularisatie wordt weergegeven in vergelijking (6).
(6)
In vergelijking (6) betekent γ de strafcoëfficiënt voor het aantal bladknopen, λ is de L2-regularisatiecoëfficiënt voor het gewicht van bladknopen, en w is het gewicht van bladknopen. De keuze van XGBoost-hyperparameters heeft echter een directe en significante invloed op de prestaties. Veelvoorkomende hyperparameters van XGBoost zijn leersnelheid, maximale diepte van de boom en regularisatieparameters. Door de potentieel grote hyperparameterruimte is het handmatig aanpassen van deze parameters niet alleen tijdrovend, maar ook moeilijk om de optimale parametercombinatie te vinden. Daarom ontwerpt deze studie IGWO om de hyperparameters van XGBoost te optimaliseren. GWO zoekt naar optimale oplossingen door de sociale hiërarchie en jachtstrategieën van grijze wolven te simuleren, met voordelen zoals minder parameters en sterke aanpassingsvermogen20,21. In GWO wordt de beginpositie van de populatie gegenereerd zoals weergegeven in vergelijking (7).
(7)
In vergelijking (7) is Puv de positie van het u-de individu in de v-de dimensie.
en
zijn de boven- en ondergrenzen van de v-de zoekruimte. rand() is een willekeurig getal tussen [0,1]. Het GWO-algoritme kan echter problemen ondervinden zoals trage convergentiesnelheid en vastlopen in lokale optima in de midden- en latere fasen. Dit betekent ook dat GWO op dit moment mogelijk niet in staat is om de volledige oplossingsruimte effectief te verkennen, waardoor het moeilijk wordt om de globale optimale oplossing te vinden. Om dit probleem aan te pakken, verbetert deze studie GWO vanuit twee aspecten, namelijk door de Tent Chaotic Map (TCM) en Nonlinear Convergence Factor (NCF) te introduceren. TCM is een eenvoudige chaotische mapping die ervoor zorgt dat potentiële optimale oplossingsregio's niet worden gemist tijdens het zoekproces en herhaalde zoekopdrachten in hetzelfde gebied22 vermijden. Daarom kan via TCM een uniformere en willekeuriger initiële populatie worden gegenereerd, en kan het vermogen van het algoritme om lokale optima te overwinnen worden verbeterd. De berekening van TCM wordt weergegeven in vergelijking (8).
(8)
In vergelijking (8) is y de controleparameter. R, t en R,t+1 zijn de systeemtoestandsvariabelen bij de t-de en t+1-de iteraties. De formule voor NCF z wordt weergegeven in vergelijking (9).
(9)
In vergelijking (9) is zmax de maximale convergentiefactor en tmax het maximale aantal iteraties. Deze niet-lineaire afnemende methode stelt GWO in staat om in de vroege fase een grote stapgrootte te behouden voor globale zoekopdrachten. In de middenfase van de zoekopdracht versnelt de convergentiesnelheid, terwijl in de latere fase lokale zoekopdrachten met kleinere stappen worden uitgevoerd, waardoor de wereldwijde en lokale zoekmogelijkheden effectief in balans worden gebracht en de optimalisatieprestaties worden verbeterd. Het IGWO-algoritme wordt specifiek gebruikt voor de hyperparameteroptimalisatiefase van de XGBoost sentimentclassifier, en het hoofdproces wordt weergegeven in Figuur 4.

Figuur 4: Het hoofdproces van IGWO. De figuur beschrijft het uitvoeringsproces van IGWO, inclusief populatieinitialisatie op basis van tentchaotische mapping, positie-update van niet-lineaire convergentiefactoren en optimale individuele screening, en verduidelijkt de logica voor het optimaliseren van XGBoost-hyperparameters. Klik hier om een grotere versie van deze figuur te bekijken.
In Figuur 4 omvat het IGWO-proces: het initialiseren van het algoritme; het gebruik van TCM om de populatie te initialiseren; het berekenen van de initiële fitnesswaarde van elk individu; het gebruik van NCF om de posities van de grijze wolven bij te werken; het kiezen van de oplossing met de beste fitheid als het nieuwe optimale individu; en het leveren van het optimale individu. De optimale combinatie van XGBoost-hyperparameters kan via IGWO worden uitgevoerd. Het algehele proces van sentimentclassificatie integreert data-preprocessing, IGWO-optimalisatie en het uiteindelijke XGBoost-model. Het classificatiemodelproces gebaseerd op IGWO-XGBoost wordt weergegeven in Figuur 5.

Figuur 5: Het classificatiemodelproces gebaseerd op IGWO-XGBoost. De figuur toont het volledige proces van het IGWO-XGBoost sentimentclassificatiemodel, van data-invoer en -preprocessing tot dataset-partitionering, IGWO-hyperparameteroptimalisatie, XGBoost-modelconstructie en classificatieresultaatoutput, en toont duidelijk de operationele keten van het model. Klik hier om een grotere versie van deze figuur te bekijken.
Het model gebaseerd op IGWO-XGBoost omvat processen zoals invoergegevens, datavoorverwerking, dataset-partitionering, hyperparameteroptimalisatie van het IGWO-algoritme, optimale hyperparametercombinaties, de constructie van XGBoost op basis van optimale hyperparametercombinatie, en het uitvoeren van classificatieresultaten. Via dit classificatiemodel kunnen emoties in leerlingreacties worden geclassificeerd, waardoor een intuïtiever begrip wordt verworven van de subjectieve gevoelens van studenten over leren. De specifieke softwareversies, willekeurige seeds, hardwarespecificaties, milieuspecificaties en datasetbronnen die in de studie zijn gebruikt, worden weergegeven in Tabel 1.
| Settype | Specifiek model en inhoud |
| Basissoftware | Python 3.9.7 |
| Kernbibliotheek | XGBoost 1.7.5、Scikit-learn 1.2.2、Jieba 0.42.1、NLTK 3.8.1、Pandas 1.5.3、NumPy 1.24.3、Matplotlib 3.7.1、Imbalanced-learn 0.10.1 |
| Willekeurig zaad | Stel het globale willekeurige seed in op 42 |
| Hardware-/omgevingsspecificaties | 1. Besturingssysteem: Windows 10 Professional Edition (64 bit, versienummer 22H2) |
| 2. Processor: Intel Core i5-12600KF (met een hoofdfrequentie van 3,7GHz en een dynamische versnellingsfrequentie van 4,9GHz) |
| 3. Geheugen: 64GB DDR4 (frequentie 3200MHz, ondersteunt tot 128GB geheugen) |
| 4. Opslag: 1TB SSD (Samsung 980 Pro, leessnelheid 7450MB/s) |
| 5. Grafische kaart: NVIDIA GeForce RTX 3060 (12GB videogeheugen) |
| Datasetbronnen en toegangsgegevens | 1. Superstar-platformdataset: |
| -Bron Uniform Resource Locator (URL): https://www.chaoxing.com/ |
| -Acquisitiemethode: toepassing via het Chaoxing Education Big Data Open Platform (applicatiepad: officiële website van het platform → ontwikkelcentrum → data-interface → leergedragsdataset) |
| 2. MOOC-platform commentaardataset: |
| -Bron URL: https://www.icourse163.org/.cn |
| -Verwervingsmethode: Solliciteer via het "data research support"-kanaal van het MOOC-platform |
| Aangepaste scripts of modellen | 1. Voorverwerkingsscript voor gegevens |
| 2. MPFR-modelscript |
3. IGWO-XGBoost modelscript
|
Tabel 1: Specifieke softwareversies, willekeurige seeds, hardwarespecificaties, milieuspecificaties en datasetbronnen die in het onderzoek zijn gebruikt. Geef een gedetailleerde lijst van de benodigde software- en hardwareomgeving, willekeurige seedinstellingen, datasetbronnen en het XGBoost hyperparameterzoekbereik voor de studie om de reproduceerbaarheid en standaardisatie van het experiment te waarborgen.
Tabel 1 toont aan dat de studie XGBoost 1.7.5 adopteert als het kernkader van het sentimentclassificatiemodel en introduceert Scikit learn 1.2.2 voor datapreprocessing, feature-extractie en modelevaluatie. Daarnaast stelt de studie de random seed uniform in op 42 om de reproduceerbaarheid van data-partitionering, SMOTE oversampling, IGWO hyperparameteroptimalisatie en IGWO-XGBoost modeltrainingsresultaten te waarborgen. Daarnaast stelt het IGWO-algoritme de zoekruimte in voor XGBoost-hyperparameters. Het zoekbereik voor de leersnelheid is [0,001, 0,3] op de logaritmische schaal, en de maximale diepte van de boom wordt doorzocht in de gehele verzameling {3, 4,..., 15}. Het optimalisatiebereik van de L2-regularisatieterm is [0.1, 5.0], en de steekproefverhouding van elke boomfeature-subset is geoptimaliseerd binnen het bereik van [0.6, 1.0]. Het afstembereik voor het minimale gewicht van bladknopen is [1, 10].
De dataset en de bijbehorende preprocessing- en analysecode werden door het team zelf gegenereerd en geanalyseerd. De kernscripts voor gegevensvoorverwerking worden weergegeven in Tabel 2.
| Importeer panda's als PD, Jieba, RE, Numpy als NP |
| Van nltk.tokenize import word_tokenize; van nltk.stem import PorterStemmer |
| def clean(tekst, l): |
| return re.sub(r"[^\u4e00-\u9fa5]" if l=="zh" anders r"[^a-zA-Z]", " ", text).strip() |
| def process(tekst, l): |
| t = jieba.lcut(tekst) als l=="zh" anders word_tokenize(tekst) |
| return " ".join([PorterStemmer().stem(w) if l=="en" anders w voor w in t als w niet in open("hit_stopwords.txt").read().split()]) |
| def main(c,m,l): |
| cx=pd.read_csv(c).query("cursus leerduur>=1 & exam results.notna()"); mc=pd.read_csv(m).query("comment text.str.len()>=5") |
| mc["t"]=mc["comment text"].apply(clean,args=("zh",)).apply(process,args=("zh",)) |
| np.savez("out.npz",**{k:v for k,v in locals().items()}) |
Tabel 2: Kernscript voor data-voorbewerking. Presenteer de kerninformatie van het script voor de voorverwerking van data, verduidelijkt de voorverwerkingsstappen die bij het script horen, en geef technische referenties voor de replicatie van onderzoeksmethoden.