Onderzoeksartikel

Het Onderzoek Van Het Effect Van Geautomatiseerde Schrijfevaluatie Via Deep Neural Network En Schriftelijke Evaluatie Door Docenten Op Engelse Schrijfprestaties Op Engelse Schrijfprestaties

DOI:

10.3791/69995

8 mei 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het geven van feedback in de vorm van twee NLP-semantiek-gebaseerde functies via het computersysteem en de schriftelijke feedback van de docent werd gebruikt om de Engelse schrijfvaardigheid en correctheid van leerlingen te verbeteren. De resultaten toonden positieve resultaten met betrekking tot het eerste.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Computerondersteunde taalleertechnologieën hebben de afgelopen jaren de grootste vooruitgang geboekt in taalverwerven, vooral in de context van kunstmatige intelligentie (AI). Er zijn verschillende technologieën, zoals geautomatiseerde schrijfevaluatie (hierna AWE) en geautomatiseerde essaybeoordeling (AES), die worden beschouwd als pijlers van taalverwerving, niet alleen in computerdisciplines maar ook in het onderwijs. De evaluatie kan alleen worden uitgevoerd in de vorm van holistische scores met behulp van AWE-technologie, die zeer effectief is geweest in het verbeteren van taalverwerving en daarom geen gedetailleerde of diepgaande feedback kan geven. Om gedetailleerde schrijffeedback te geven over twee hoofdelementen van een taal (namelijk grammatica en vloeiendheid), zijn een computerondersteund implementatiesysteem met neurale netwerkmodellen en twee semantisch-gebaseerde methoden voor natuurlijke taalverwerking (hierna NLP) overwogen. Daartoe werden 90 Pakistaanse universiteitsstudenten die Engels als tweede taal leerden (ESL) willekeurig toegewezen aan de controlegroepen, feedback van docenten en experimentele groepen. De computerondersteunde evaluatie omvatte een neuraal netwerk. De resultaten van de vergelijkingstest tussen het AWE-baselinemodel en de instructeurs die beoordeelden, toonden een correlatie tussen de computerondersteunde feedback die deze neurale netwerken gebruikte. De implicaties van dergelijke resultaten liggen in de ESL-schrijfpedagogiek, vooral in situaties waarin taalkundige nauwkeurigheid en vloeiendheid een uitdaging vormen.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Feedback in schrift richt zich op verschillende kenmerken van taal, zoals organisatie, grammatica, vloeiendheid, inhoud en techniek, waardoor leerlingen een nieuw stuk geschreven tekst kunnen herschrijven of maken 1,2,3. Tegenwoordig zijn docenten Engels schrijven een grote profiteur geweest dankzij de snelle veranderingen en ontwikkelingen van computerondersteund taalleren (CALL hierna) en computerondersteund schrijven in de vorm van AWE of AES en de beoordeling van geschreven essays4. Daarnaast geeft computerondersteunde beoordeling van Engels schrijven diagnostische feedback op taalkundige elementen zoals inhoud, grammatica, woordenschat, enzovoort, en levert tijdige, individuele en objectieve antwoorden op de geschreven tekst van de leerlingen. Het AWE-systeem kan ook duidelijke schriftelijke antwoorden aan studenten geven, zodat zij de kennis die via deze schriftelijke antwoorden zijn opgedaan internaliseren en de cognitievecapaciteit vande studenten vergroten.

De huidige studie was gebaseerd op een onderzoek4, dat het concept bood van een multi-strategie, computergebaseerd Engels schrijven leren met de feedbacktheorie van Engels schrijven in perspectief en het proces van analytische beoordeling in gedachten. Dit omvatte andere NLP-semantiekmodellen die deep learning in schriftelijke feedback verwerkten om uitgebreide geschreven feedbackscores te bieden. Het pakt de beperking van eerdere AWE-technologie aan, die alleen de holistische nadruk legt maar niet op de analytische, specifieke score. Daarom heeft het meer te maken met nauwkeurige en directe beoordeling met sub- en totaalpunten voor een reeks elementen van taalkundige indicatoren om het schrijven van Engels onder studenten te verbeteren. Onder de verschillende kenmerken van de taalkunde (d.w.z. inhoud, complexiteit, correctheid, vloeiendheid) zal deze studie alleen de vloeiendheid en het grammaticale aspect van ESL-leerlingen in Pakistan onderzoeken. Daartoe suggereert de huidige studie een strategie van NLP-technologie die het gebruik van neurale netwerken omvat, vergezeld van evaluatie door leraren.

In de context van het Pakistaanse taalleren ondervinden Pakistaanse leerlingen problemen bij het leren van Engels schrijven, hoewel ze Engels als verplicht vak beschouwen vanaf groep 1 en doorgaan tot en met klas 14. Daar komen tal van factoren om de hoek kijken, zoals verkeerde cursussen en het gebruik van oude methoden om de grammatica uit te leggen.7. Op universitair niveau is het aantal studenten dat leraren moeten onderwijzen vrij groot, omdat de studenten een verscheidenheid aan achtergronden hebben die verschillende hogescholen en scholen omvatten. Dit dwingt leraren om veel tijd te besteden aan het corrigeren van schrijffouten van leerlingen, waardoor de werklast veel te hoog wordt. Aan de andere kant namen studenten de schriftelijke feedback van de docenten als vanzelfsprekend aan en deden ze geen moeite om de fouten te herkennenen te corrigeren.

Een studie stelde dat vloeiendheid vooral wordt beïnvloed door het feit dat, omdat studenten bang zijn om een fout te maken, het een belemmering vormt om vloeiend te schrijven, en daarom vermijden ze liever vaker fouten dan dat ze zich met gedachten bezighouden. Er is af en toe interferentie van de Urdu-taal met het Engelse schrift, naast andere contextuele factoren. Bovendien is de Urdu-taal de nationale taal. Als gevolg van deze contextuele factoren vinden docenten het moeilijk om precieze, tijdige en consistente feedback aan elke leerling te geven wanneer de leerlingen schriftelijke output genereren of de manuscripten bewerken. Met het oog op de theorie van schrijfevaluatie zal deze studie in staat zijn de studie te volgen die een automatische feedbackstrategie voor machine schrijven toepast tijdens de vergelijking van de traditionele lerarenevaluatie en de analytische in plaats van de holistische beoordeling toepast om ervoor te zorgen dat studenten direct feedback krijgen over de twee belangrijke taalkundige dimensies (namelijk grammatica en vloeiendheid)4.

Verschillende industriële AWE- en AES-producten zijn ontstaan, waaronder Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion, enzovoort. AES/AWE wordt in de vroege ontwikkelingsfase vooral gekenmerkt door het traditionele machine learning-systeem gebaseerd op Bayes-stelling10, lineaire regressie11 , enzovoort. Momenteel heeft de uitgebreide ontwikkeling van deep learning, met name de technologie van neurale netwerken, ook het vakgebied van het schrijven van feedback aanzienlijk geholpen, zoals recurrent neurale netwerken of RNN12, long short-term memory13, Convolutional Neural Networks (CNN)14, BERT-benadering15. AWE profiteerde ook van de pretrainingsstrategieën die aan het begin van NLP16 werden toegepast. Veel studies hebben verschillende oplossingen overwogen die zich richten op neurale netwerken, zoals het genereren van adversariële samples voor het leren, leren via Multitask17, leren via Zelfsupervisie18 en GraphAlgorithms 19. Sommigen hebben verschillende technieken voorgesteld om het gebrek aan trainingsdata voor het schrijven van feedbackaan te pakken. Er zijn ook scoringsmodellen die bijdragen aan veel neurale netwerkmodellen21.

Grammaticale foutcorrectie (hierna GEC) is een onafhankelijke methode van NLP-missies, die in staat is om automatisch compositiefouten te detecteren en vervolgens te corrigeren. De taakinhoud van GEC is onderling verbonden met die van de AWE-aspecten. AWE-taken worden beschouwd als het meenemen van de diagnose van grammaticale fouten, waarvan de meeste in de juiste vorm moeten worden gemarkeerd. De AWE-studies hebben echter minder aandacht besteed aan de GEC, en slechts enkele onderzoeken integreerden het vroege GEC-model in de AWE-technologie. Aanvankelijk kiest onderzoek naar GEC meestal voor N-gram22, en taalmodel23 inclusief BERT24 om grammaticale fouten te identificeren en te corrigeren. De bovenstaande oplossingen konden echter problemen zoals wanorde en weglating van componenten niet volledig oplossen. De architectuur van encoder-decoder25 heeft hetzelfde succes behaald in GEC door problemen aan te pakken die andere modellen voorheen niet konden aanpakken. Het is belangrijk op te merken dat geavanceerde GEC-architecturen meerdere modellen gebruikten om problemen op te lossen, waaronder de op Transformer gebaseerde benaderingen26.

Verschillende studies bevestigden de effectiviteit van AES ten opzichte van menselijke beoordelingen bij het beoordelen van essaysschrijven 27,28. Een studie29 toonde het effect van geautomatiseerde evaluatie aan op de Engelse vloeiendheid van leerlingen. De bevindingen gaven aan dat automatische evaluatie een positief effect had op de vloeiendheid van Engels schrijven. Ter vergelijking: sommigeandere studiesnegeren de hoge foutdetectie door AES vergeleken met menselijke beoordelingen. Recente studies benadrukken de toenemende effectiviteit van AI-ondersteunde tools voor schrijfevaluatie in taalonderwijs. Een van deze studies31 maakte een vergelijking tussen geautomatiseerde beoordeling en feedback van docenten in de context van de Chinese studenten die leren kennen.

De revolutionaire rol van AI-gebaseerde tools in academisch schrijven is actief gerapporteerd in de recente literatuur. Onderzoek naar de toepassing van AI-gestuurde schrijftools als aanvulling op het traditionele EFL-schrijfonderwijs benadrukt het grote belang van gelijke kansen en proactieve ondersteuning van leraren bij de succesvolle implementatie van technologie32. De studies die AWE onderzochten, zoals Pigai, gaven een sterke correlatie aan tussen de feedback onder ondersteuning van computers en de verbetering van ESL-schrijven, revisie en nieuwe teksten33. Een andere studie heeft de voordelen van variatie-autoencoders (VAE's) benadrukt, die het aspect van het trainen van Engels schrijven bij leerlingen positief beïnvloeden en feedback krijgen op hogere niveaus van deep learning, met specialisatie in de verschillende taalkundige kenmerken34. Een ander onderzoek suggereerde dat neurale AWE-systemen effectief zouden zijn om te gebruiken met NLP-gebaseerde GEC, dat deep learning gebruikt om een directe evaluatiete bieden.

De verbetering van multi-agent systemen is een belangrijke stap in de ontwikkeling van technologieën die het schrijven ondersteunen. Een voorbeeld van het zijn van een multi-agent, een assistent voor academisch schrijven, de AcademyCraft, gebaseerd op deep learning, heeft aangetoond dat hij kan schrijven en gedetailleerde feedback kan geven, waardoor AI-gebaseerde EFL/ESL-schrijfondersteuning wordt gefaciliteerd, op complexe analytische schema's36. In feite hebben technologiegebaseerde taalleerstudies ook diverse opkomende patronen geïdentificeerd, zoals deep learning, automatische beoordeling en semantische feedback met prestatie-analyse, die een geleidelijke en consistente toename van schrijfnauwkeurigheid en betrokkenheid van leerlingenliet zien.

Transformer-LSTM-modellen hebben een zekere neiging getoond voor automatische beoordeling en feedback op Engels schrijven. Dergelijke hybride architecturen namen samen het contextuele begrip van transformatoren over samen met de sequentiële verwerking van LSTM-systemen, wat tot de conclusie leidde dat de nauwkeurigheid van grammatica- en coherentiebeoordeling werd verbeterd en meer genuanceerde feedbackgeneratie38 werd geleverd. De perceptie van EFL-docenten op AI-schrijftools rapporteert consequent meetbare verbeteringen in de organisatie van inhoud en de schrijfkwaliteit, met de nadruk op de cruciale rol van pedagogische hulp bij het stimuleren van het nut van technologische integratie39. Er zijn minder studies die een vergelijking maken tussen feedback van docenten en computerondersteunde feedback, wat impliceert dat deep learning-modellen het effect op het Engelse schrijven van ESL-leerlingen op vloeiendheid en grammatica onderzoeken.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alle software en hulpmiddelen die in de studie worden gebruikt, staan vermeld in de Materiaalkundige Tabel Materiaal.

Beoordelingscriteria

De classificatie van evaluatie die in deze studie is aangenomen, behandelt twee hoofddomeinen, namelijk vloeiendheid en correctheid, die alle vereisten omvatten voor een uitgebreide evaluatie van schrijven in het Engels als vreemde taal (EFL). Deze dimensies zijn bedoeld om de belangrijkste punten van de schrijfkwaliteit te meten die effectieve communicatie en het tonen van taalvaardigheid bevorderen. De Fluency module meet natuurlijkheid, expressiviteit en samenhang in schrijven door de soepelheid van ideeën te meten, evenals hoe goed woorden en zinsstructuren worden gebruikt. De Correctheidsmodule richt zich op nauwkeurige grammaticale nauwkeurigheid, mechanische perfectie en naleving van standaard Engelse conventies en meet hypothetisch de fouten van de taal op verschillende niveaus. (zie Tabel 1)

Taakdefinitie

Naar aanleiding van de voorwaarden van geautomatiseerde schrijfbeoordeling van studenten die de Engelse taal leren, suggereert de huidige studie een nieuw model van een EG-computerondersteund Engels schrijfevaluatiesysteem. In vergelijking met eerdere studies, die beperkt waren door de reikwijdte van geautomatiseerde schrijfevaluatiesystemen, zal het voorgestelde systeem helpen deze beperkingen op te lossen door innovatieve deep learning-technieken te introduceren, zodat gebruikers een niveau van taalkundige analyse, aanpassingsmogelijkheden en systeembrede feedbackanalyse op basis van uitgebreide gegevensverwerking kunnen krijgen. Met twee van de belangrijkste indicatoren van een compositie, namelijk vloeiendheid (hoe natuurlijk, coherent en expressief het stuk van aard is), of correctheid (hoe correct de tekst is geschreven, vol grammaticale, mechanische en taalfouten), moet het dual-model systeem met de afzonderlijke componenten van de neurale netwerken een aantal evaluaties uitvoeren. Daarnaast identificeert het fouten op verschillende taalniveaus, beveelt het correctiemaatregelen aan en geeft het feedback in lijstvorm om gebruikers in staat te stellen het taalverwerven van leerlingen op een methodische manier te verbeteren. Om het proces van het berekenen van het computerondersteunde automatische evaluatiesysteem te beschrijven, stellen we het volgende wiskundige model voor in formules (1)–(4) (zie Tabel 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

waarbij: Eindscore = de samengestelde schrijfbeoordelingsscore; w1 = gewicht toegekend aan de vloeiendheidsscore; w2 = gewicht toegekend aan correctheidsscore; Sf = BERT-gebaseerde vloeiendheidsscore (genormaliseerd tot [0, 1]); Sc = exponentiële correctheidsscore voor verval; λ = vervalconstante controlefoutstraf; σ(x) = logistische sigmoïde activatiefunctie; ErrorRatio = verhouding van fouten tot totaal aantal tokens in de tekst. De vloeiendheidsscores worden genormaliseerd tot [0, 1] door de logistische sigmoidfunctie σ(x), terwijl de exponentiële vervalfunctie wordt gebruikt om de correctheid te scoren om een passende straf op de foutfrequentie op te leggen.

Systeemarchitectuur en ontwerp

De systeemarchitectuur maakt gebruik van een tweemodelsysteem met een parallelle verwerkingsarchitectuur, waarbij de analyse van invoeressays parallel wordt uitgevoerd via parallelle evaluatiepaden. De modules Vloeiendheid en Correctheid leveren op hun beurt respectievelijke scores op, en de uiteindelijke samengestelde score is het gewogen gemiddelde van de twee subscores. De correctheidsmodule biedt ook een suggestie voor foutdetectie en correctie, naast het scoren (zie Figuur 1).

De vloeiendheidsmodule

Schrijfvloeiendheid kan worden gedefinieerd als de aard of het patroon van het gebruik van een taal met betrekking tot de juiste keuze van woordenschat, variëteit in zinsstructuur, syntactische complexiteit, samenhang, enzovoort. 4. Vloeiendheidsbeoordelingsmodellen leggen ideeën vast die worden overgebracht zonder te stotteren of ongemakkelijk te zijn, en klinken benaderend als de nativistische communicatietrends. Traditionele vloeiendheidsmeting is gebaseerd op schalen, wat zorgen over betrouwbaarheid tussen beoordelaars benadrukt. Het voorgestelde systeem overwint dit nadeel doordat het een op BERT gebaseerd neuraal netwerk bevat om semantische coherentie en taalkundige natuurlijkheid automatisch te induceren door diepgaande situationele begrip. Deze architectonische beslissing is genomen met het oog op de sterke punten van BERT, dat effectief is gebleken bij het identificeren van contextuele relaties en semantische patronen die noodzakelijk zijn bij vloeiendheidsmeting. Invoersequenties worden in het systeem gevoerd en door 12 transformatorlagen geleid met multi-head self-attention om langeafstandsafhankelijkheden en contextuele relaties te identificeren (zie Figuur 2).

Het mechanisme van aandacht zou als volgt zijn:

figure-protocol-5(5)

Laat Q, K en V respectievelijk de matrices zijn die query, sleutel en waarde vertegenwoordigen, en d en k de dimensies van de sleutelvectoren. De CLS-token-embedding is de samenvattende inbedding, die de algehele semantische coherentie van de gehele invoersequentie registreert.

De berekening van de vloeiendheidsscore is als volgt:

figure-protocol-6(6)

Waarin hCLS de BERT [CLS] token embedding is, en Wreg breg de parameters van de regressiekop zijn, en σ de sigmoïde activatiefunctie is die de output normaliseert naar [0, 1].

De correctheidsmodule

Correctheidsbeoordeling richt zich op grammaticale nauwkeurigheid, mechanische nauwkeurigheid en het naleven van standaard Engelse conventies. Deze dimensie behandelt de technische aspecten van het schrijven, waaronder syntaxis, morfologie, interpunctie en spellingnauwkeurigheid. De correctheidscomponent evalueert niet alleen het aantal taalkundige fouten, maar onderzoekt ook de impact op de algehele kwaliteit van de tekst. In tegenstelling tot vloeiendheidsbeoordeling, die de nadruk legt op semantische coherentie en natuurlijke flow, vereist de correctheidsevaluatiemodule nauwkeurige foutidentificatie en systematische correctie. De module maakt onderscheid tussen verschillende fouttypes, beoordeelt de ernst en biedt gerichte correcties ter ondersteuning van leerverbetering. Het correctheidsverlies gebruikt het FLAN-T5-model, dat is verfijnd voor grammaticale foutdetectie en correctie. Deze keuze wordt geïnformeerd door de tekst-naar-tekst transformeerbaarheid van T5, waardoor het systeem niet alleen fouten kan vinden, maar ook relevante correcties binnen één systeem kan uitvoeren. Het systeem is een encoder-decoder vorm, en de tekst wordt gevoed in de vorm van deze transformatie: (zie Figuur 3)

figure-protocol-7(7)

Het encoderelement genereert contextgevoelige representaties die niet alleen de grammaticale tendensen vastleggen, maar ook potentiële tekortkomingen:

figure-protocol-8(8)

Met behulp van het genereren van passende grammaticale variaties op foutief geïdentificeerde fouten, genereert de decoder gecorrigeerde sequenties:

figure-protocol-9(9)

Dit soort tweerichtingsverwerking stelt het systeem in staat om bewust te zijn van de contexten van fouten en hoe deze contexten moeten worden gecorrigeerd, zodat de hints semantisch coherent zijn, maar zich toch richten op elke correctie in grammatica.

Kwantificering van fout en scoringsalgoritme

De nauwkeurigheidsscore vergeleek het oorspronkelijke schrift met de correcte versie van het schrift, waarbij rekening werd gehouden met taalkundige fouten en de ernst op basis van de positie binnen de tekst en de interferentie met de betekenis. Deze methode legt het onderscheid vast tussen soorten fouten in vergelijking met de impact op het tekstuele begrip van de tekst. De relatie tussen foutenfrequentie en slechte tekstkwaliteit werd op logaritmische wijze benadrukt in het beoordelingssysteem. Een fundamentele stap in tokenvergelijking van de originele tekst en de gecorrigeerde tekst is twee graden van vergelijking die gebaseerd zijn op de bitwijze techniek van string-uitlijning. De tweede fase omvat het identificeren en classificeren van fouttypen op basis van enkele bekende linguïstische taxonomieën die onderscheid maken tussen grammaticale fouten (overeenkomst tussen onderwerp en werkwoord, consistentie van de tijd en betrouwbaarheid van syntactische structuur), mechanische (hoofdletters, interpunctie en spelling) en gebruiksfouten (woordkeuze, idiomatische uitdrukking en geschiktheid van registers). De derde fase is de berekening van de foutverhouding op basis van de totale lengte van de tekst. De vierde stap maakt gebruik van het exponentiële decay scoring-algoritme dat de foutverhoudingen omzet in direct interpreteerbare correctheidsscores om de niet-additieve en niet-lineaire afhankelijkheid tussen foutfrequentie en tekstkwaliteit te benaderen.

De wiskundige behandeling van het foutkwantificatieproces begint met de berekening van de verhouding van geïnstalleerde fouten, wat een genormaliseerde foutinstallatiesnelheid oplevert, die op zijn beurt een eerlijke vergelijking mogelijk maakt van teksten van verschillende lengtes:

figure-protocol-10(10)

figure-protocol-11(11)

Er werd een kalibratieparameter van 2,5 vastgesteld op empirische basis door deze volledig te valideren met menselijke experts, zodat de scorefunctie resultaten kan leveren die in lijn zijn met het menselijk begrip met betrekking tot de afname van tekstkwaliteit naarmate de frequentie van fouten toeneemt. Door deze parameterwaarde op deze manier in te stellen, wordt gegarandeerd dat elke tekst met een laag foutpercentage (Error_Ratio < 0,1) een hoge correctheidsscore heeft, omdat deze nauwgezet de regels van het standaard Engels volgt; elke tekst met een matige foutmarge (0,1 < Error_Ratio ≤ 0,3) heeft een tussenscore van correctheid, wat aangeeft dat er enkele taalkundige zorgen zijn die echter niet ronduit rampzalig zijn, en elke tekst met een hoge foutmarge (Error_Ratio > 0,3) heeft een lage correctheidsscore gekregen omdat er kritieke taalkundige zorgen zijn die de mogelijkheid tot begrip aanzienlijk beïnvloeden.

Het correctheidsscorealgoritme voor de correctheidsevaluatie houdt systematisch rekening met alle fouten die door het T5-systeem zijn gelokaliseerd en gecorrigeerd als strafitems bij de berekening van de uiteindelijke foutverhouding. Het strafkredietmechanisme dat wordt gebruikt voor grammaticale fouten wordt weergegeven door de exponentiële afname van de met de groei van de foutverhouding naar hoge waarden, wat betekent dat de kwaliteit van de tekst zeer slecht is, en wordt 100 wanneer de foutverhouding gelijk is aan 0, wat betekent dat er absoluut geen fouten worden gedetecteerd. Het is een perfect gebruik van de Engelse standaardconventies. Zo'n wiskundige relatie zorgt ervoor dat de correctheidscode een significant onderscheid biedt binnen het gehele spectrum van linguïstische vaardigheidsniveaus en reageert op kleine opeenvolgende vooruitgang, wat wijst op echte verwervingen.

Datasets: trainings- en evaluatiecorpus

Trainingsgegevens van voldoende kwaliteit en omvang zijn van groot belang voor de prestaties van het dual-model systeem. De huidige studie maakte gebruik van een goed ontworpen dataset van door studenten geschreven teksten om het model te ontwikkelen en te beoordelen, dat werd geproduceerd door verschillende schrijfopdrachten toe te passen. De steekproef bestond uit 45 mannelijke en 45 vrouwelijke Pakistaanse universiteitsstudenten met een gemiddelde leeftijd van 19 jaar, die 'Functioneel Engels' als verplichte cursus volgden. Elke student schreef acht essays gedurende acht weken, inclusief pre-test, interventie-essays en post-test-gelegenheden. Leerlingen mochten voor elke schrijfopdracht 400–450 woorden produceren. De statistieken van de datasets geven de volgende kenmerken:

70.500 woorden

Gemiddelde zinslengte: 15,7 woorden (SD = 3,2)

Het bereik van woordenschat (Type-Token Ratio): 0,64 (SD 0,08) Grammaticale foutdichtheid: 2,3 in 100 woorden (SD = 1,1)

De rechtvaardiging en datakwaliteitsborging van de geselecteerde data

De gekozen dataset werd gedreven door enkele belangrijke overwegingen die de rijkdom en relevantie van onderzoekswerk over geautomatiseerde schrijfevaluatie mogelijk maakten. Aanvankelijk werd de Economie-studentenpopulatie geselecteerd vanwege de aard, vergelijkbaar met EFL-leerlingen in het Pakistaanse hoger onderwijs, waardoor meer authentieke schrijfvoorbeelden konden worden getoond die echte situaties weerspiegelen. Ten tweede werd de vaststelling van het maximale en minimale potentiële woordbereik, 400–450 woorden, gebaseerd op pilotstudies waaruit bleek dat dit bereik taalkundig complex genoeg is om betrouwbaar door een machine te worden geanalyseerd, en tegelijkertijd een beheersbare omvang bleef in termen van consistente menselijke beoordelingen. Elk van de composities werd geëvalueerd door drie getrainde Engelse docenten (inter-rater betrouwbaarheid κ = 0,847, vloeiendheidsdimensie en 0,823, correctheidsdimensie) op gestandaardiseerde 10-punts vloeiendheids- en correctheidsschaal. De training van de menselijke beoordelaars was intensief en was afhankelijk van ontwikkelde beoordelingsrubrics met betrekking tot IELTS- en TOEFL-schrijfbeoordelingen. De data bestaat uit een door mensen geannoteerde dataset, die kan worden gebruikt voor het trainen en valideren van modellen die getraind moeten worden op mens-geannoteerde data.

Procedures voor gegevensvoorverwerking en validatie

De dataset werd systematisch vooraf verwerkt en omvatte tekstnormalisatie, het tokeniseren van de tekst met de BERT WordPiece-tokenizer en het uitvoeren van kwaliteitscontroles. Degenen die onvolledig werk hebben ingediend en geplagieerde tekst hebben geproduceerd, werden niet meegenomen om de gegevensintegriteit te bepalen. De laatste gegevens werden willekeurig verdeeld in training (70%, n = 189), validatie (15%, n = 41) en testsets (15%, n = 40) via gestratificeerde steekproeven om het in balans te brengen tussen vaardigheidsniveaus en het type taken. Taalkundige analyse van een groot naslagwerk met professioneel bewerkte academische teksten, artikelen uit kranten en gepubliceerde essays, met ongeveer 50 miljoen woorden. Dit corpus levert taalpatronen die nodig zijn om de vloeiendheidstests uit te voeren en ondersteunt bij de procedures voor foutdetectie door deze te vergelijken met het standaardgebruik. In het referentiecorpus zijn de stappen vóór preprocessing en indexering tokenisatie, woordsoorttagging, syntaxisparsing en semantische labeling om efficiënte toegang tijdens realtime beoordeling te vergemakkelijken.

Vloeiendheidsmodeltrainingsstrategie

Er wordt een sequentieel optimalisatiesysteem voorgesteld om de data te trainen tot vloeiendheid. De training maakte gebruik van geavanceerde functies, waaronder adaptieve leersnelheidsplanning, progressieve batchgrootte en geavanceerde regulariseringsmethoden die overfitting tijdens de training voorkomen, waardoor de effectiviteit van het model behouden blijft bij het identificeren van taalkundige patronen die wijzen op taalvaardigheid. De leersnelheid is 5 × 10-4 met een lineair decay-schema, geconfigureerd om te zorgen dat convergentie stabiel blijft en niet oscilleert rond de optimale parameterwaarden. Deze leersnelheid wordt gekozen via rasterzoektocht in [1 x 10-6, 1 x 10-4], waarbij 5 x 10-5 de meest geschikte afweging is tussen de convergentiesnelheid en de stabiliteit. De echte training zal beperkt zijn tot slechts 3 epochs, een configuratie die is geoptimaliseerd op basis van empirische voordelen door validatieverliestracking om overfitting te voorkomen zonder voldoende parameterupdates te verhinderen om leren effectief te maken. Vroegtijdig stopzetten van mechanismen met een geduld van 2 epochs en een minimale delta van 0,001 is uitgevoerd om degradatie te voorkomen.

Optimalisatie wordt uitgevoerd door een AdamW-optimizer, met vereenvoudigde keuzes zoals β₁ = 0,9 (impuls, die exponentieel het verval van eerste momentschattingen regelt), β₂ = 0,999 (tweede-moment schatting, die de exponentieel afname van tweede moment-schattingen regelt), en ε = 1 × 10⁻8 (numerieke stabiliteitsterm). Gewichtsafneemregularisatie (λ = 0,01) voorkomt dat parametergroottes buitensporig groot worden, waarbij deze waarde wordt geselecteerd via validatieprestatie-analyse over het bereik [0,001, 0,1]. Complexe monitoring kan verschillende meetwaarden over de training monitoren om de beste prestaties van een model te garanderen en overfitting te voorkomen. In het monitoringskader zijn inbegrepen:

Verliestracking: Training en validatieverlies worden binnen elk tijdperk bijgehouden, en het vroege stoppen gebeurt automatisch wanneer validatieverlies niet meer verbetert gedurende twee opeenvolgende epochen.

Prestatie-metrics: De validatiegegevens worden gebruikt bij het berekenen van Pearson-correlatiecoëfficiënten tussen voorspelde en werkelijke scores elke 100 trainingsstappen.

Gradiëntdetectie: Gradiëntnormen worden gemonitord om verdwijnende en exploderende gradiënten te detecteren, en bij een gradiëntnorm van 1,0 wordt gradiëntclipping toegepast.

Planning van leersnelheid: Validatie-gebaseerde afname van leersnelheid (factor = 0,5) bij meer dan 1 epochplateau wordt gedetecteerd.

Regularisatie-gerelateerd: Uitvalpercentages (0,1 voor BERT's, 0,3 voor regressiehoofd) werden gevonden door systematische ablatie. Tijdens het trainingsproces worden verschillende regularisatiemethoden gebruikt die gebaseerd zijn op het voorkomen van overfitting: (1) dropout-regularisatie met geoptimaliseerde dropoutpercentages per type laag in het netwerk, (2) gewichtsafname zoals hierboven uitgelegd, (3) vroegtijdige stop, bepaald door de validatieprestatie, en (4) data-augmentatie gebaseerd op het parafraseren van 15 procent van de trainingsvoorbeelden met behulp van terugvertaalmethoden. Checkpoints van het best presterende model werden na elk tijdperk opgeslagen, en de hoogst scorende modellen werden geselecteerd op basis van validatiecorrelatiescores. De verliesfunctie die wordt gebruikt in het vloeiendheidsbeoordelingsgedeelte is de Mean Squared Error (MSE), die de belangrijkste doelstelling is van de regressietaak om de continue vloeiendheidsscores te voorspellen. De verliesformulering wordt wiskundig gegeven als:

figure-protocol-12(12)

N is de totale trainingssteekproefgrootte, y_pred, i is de voorspelde vloeiendheidsscore van de i-de steekproef, en y_true, i is de overeenkomstige grondwaarheidsscore zoals gegeven door menselijke expertbeoordelaars. Dit verlies is zeer nuttig om voorspelling-werkelijke fouten kwadratisch te ontmoedigen, zodat grotere fouten een grotere straf opleveren, en is ook differentieerbaar. Het leersnelheidsplanningsmechanisme is zeer geavanceerd met een tweefasenproces en begint met een lineaire opwarmfase, gevolgd door een systematisch vervalproces om optimale convergentiekenmerken te creëren. Dit gebeurt in de warmupfase, waarbij de leersnelheid bij nul begint en geleidelijk verandert naar de maximale snelheid, waarna de modelparameters worden geoptimaliseerd ten opzichte van de trainingsdataset. De wiskundige uitdrukking van de warming-up fase is:

figure-protocol-13(13)

Na de warmupfase neemt de leersnelheid systematisch lineair af om te voorkomen dat de optimale parameterwaarden worden overschreden, wat resulteert in een gestage convergentie. Wiskundig gezien luidt de vervalfase als:

figure-protocol-14(14)

Waarin t de huidige trainingsstap is, lr max de maximale leersnelheid die tijdens de warming-up wordt bereikt, warming het aantal stappen dat aan de warming-up fase is toegewezen, en totaal het totale aantal trainingsstappen over alle epochs is. De genoemde planningsprocedure zorgt voor agressief leren van het model op de lagere niveaus en stabiliteit op de convergentieniveaus.

Correctheidsmodeltrainingsstrategie

Het correctheidsmodel was gebaseerd op de transfer learning-strategie met het vooraf getrainde FLAN-T5-model om optimaal gebruik te maken van alle beschikbare grammaticale kennis waar nodig. Dit was bedoeld om het algemene taalbegrip te onderzoeken, evenals de specifieke informatie over de fouten die door ESL-leerlingen zijn gemaakt. De gebruikte transfer learning-methode maakt gebruik van het pszemraj/flan-t5-large-grammar-synthesis checkpoint als basismodel, met verschillende opmerkelijke voordelen op het gebied van correctheid. Omdat het model al getraind is en beschikt over een hoog taalbegrip dat in verschillende tekstvelden is getraind, zal het zich aanpassen aan veel schrijfstijlen en schrijfonderwerpen. Met name is grammatica-specifieke fijnafstelling uitgevoerd op grote correctiedatasets die meerdere soorten grammaticale fouten beslaan, zoals ze ook bij tweedetaalschrijven voorkomen. Bovendien omvat het checkpoint krachtige foutdetectiesystemen die worden getest op verschillende soorten fouten (d.w.z. morfologische fouten, syntactische en semantische fouten), waardoor een perfecte standaard van vergelijking ontstaat met de parameters van de aangeboren correctietest van de studie.

Het domeinadaptatieproces weerspiegelt de systematische parameterwijzigingen die de algemene mogelijkheden van taalbegrip van het vooraf getrainde model niet veranderen, maar de specifieke kenmerken van de schrijfopdrachtoplossing introduceren. Dit aanpassingsproces heeft de wiskundige afleiding als:

figure-protocol-15(15)

Hier vertegenwoordigt θpretrained de parameters van het voorgetrainde model dat algemeen taalbegrip en grammaticale kennis codeert, en het domein δθvertegenwoordigt de specifieke parameterupdates die worden geleerd bij de doel-schrijvende beoordelingstaak. De domeinspecifieke updates worden berekend door gradiëntgebaseerde optimalisatie op de doeldataset, zodat het model taakspecifieke gevoeligheid ontwikkelt voor fouttypen die vaak voorkomen in EFL-schrijven zonder de bredere taalkundige mogelijkheden te verstoren.

Experimenten met vergelijkingen

Om de functionaliteit van de EG te bewijzen, wordt de Pearson-correlatiecoëfficiënt voorgesteld als de belangrijkste meetwaarde, die de lineaire verbinding bepaalt tussen geautomatiseerde scores en de expertise van mensen. De correlatiecoëfficiënt wordt gevonden door de formule:

figure-protocol-16(16)

Waarbij xi de geautomatiseerde scores vertegenwoordigt, de menselijke beoordelingen vertegenwoordigt, en figure-protocol-17 en figure-protocol-18 en de respectievelijke middelen zijn. De correlatiecoëfficiënt varieert van −1 tot 1, met waarden rond 1 die wijzen op een sterke positieve relatie tussen geautomatiseerde en menselijke beoordeling.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Basismodelvergelijkingen

Om de prestaties van de EG te evalueren en de superioriteit ten opzichte van bestaande methoden aan te tonen, worden diepgaande vergelijkingen gemaakt met gevestigde AWE- en traditionele single-metric benaderingen. Deze basisvergelijkingen zijn essentieel om de toegevoegde waarde van de EG-architectuur te valideren en aan te tonen dat de integratie van vloeiendheids- en correctheidsbeoordeling meetbare verbeteringen biedt ten opzichte van benaderingen die zich op individuele dimensies in isolatie richten. De selectie van basismodellen omvat vier categorieën van AWE, elk met een eigen oriëntatie op hoe schrijven beoordeeld moet worden. De eerste heeft een enkel BERT-gebaseerd model om vloeiendheid te evalueren. Deze modellen gebruiken transformer-architecturen om de tekstuele patronen van soepelheid en coherentie te beoordelen. De tweede categorie, ingebed in traditionele taalkundige methodologieën, richt zich op regelgebaseerde systemen voor grammaticale foutdetectie. Daarom bleef de focus liggen op correctheid, waarbij andere aspecten van schrijfkwaliteit, zoals samenhang en inhoud, werden over het hoofd gezien. De derde categorie zijn feature-based AWE-systemen, die indicatoren van taalkundige complexiteit omvatten—zoals variatiezinslengte, diversificatie van lexis en syntactische complexiteit om de algehele kwaliteitsscores te genereren. De vierde houdt hybride systemen in aanmerking door verschillende oppervlakkige taalkundige kenmerken te combineren, vaak met behulp van ensemblemethoden of gewogen gemiddelden. Deze modellen bereiken niet het niveau van geïntegreerde verfijning dat door EG-neurale architecturen wordt bereikt. De prestaties van het basismodel worden geëvalueerd met drie hoofddimensies. De eerste meet de afstemming van door het systeem gegenereerde cijfers met de beoordelingen van getrainde menselijke experts (Engelse docenten) met behulp van gestandaardiseerde rubrics. De tweede bepaalt de generaliseerbaarheid, waarbij wordt vastgesteld of de prestaties consistent blijven over drie essays met uiteenlopende onderwerpen en complexiteit. De derde dimensie is gebaseerd op voorspellende betrouwbaarheid, waarbij de nauwkeurigheid en stabiliteit van de scoring wordt beoordeeld met behulp van statistische instrumenten zoals gemiddelde absolute fout, wortelgemiddelde kwadraatfout en betrouwbaarheidsintervalanalyse. Gezamenlijk vormen deze dimensies een robuust kader voor vergelijking en benadrukken ze de superioriteit van EG-systemen, met name in het bereiken van grotere precisie en stabiliteit dan traditionele benaderingen.

Experimentele en controlegroepen

Deze studie bestond uit 90 bachelorstudenten economie die een functionele Engelse cursus volgden in twee intacte klassen. De gegevens werden op drie momenten verzameld: pre-test, interventie en post-test om de voortgang van schrijfnauwkeurigheid en vloeiendheid in de loop van de tijd te volgen. Deze studie op mensen werd goedgekeurd door de Departmental Advisory Board van COMSATS University Islamabad, Lahore Campus, Pakistan. Deelnemers werden blootgesteld aan twee condities: traditionele menselijke feedback en computerondersteunde feedback. De controlegroep bestond uit 45 studenten, die de traditionele schriftelijke feedback ontvingen van een getrainde Engelse instructeur. Deelnemers ontvingen schriftelijke feedback op de essays van studenten in de vorm van holistische beoordelingen, het identificeren van fouten en aanbevelingen in de vorm van opmerkingen van een docent over hoe het werk verbeterd kon. De experimentele groep bestond op haar beurt uit 45 studenten die op dezelfde manier in de klas werden onderwezen, maar het schrijven van de studenten werd aangevuld met behulp van snelle geautomatiseerde feedback van de EG, die hen binnen ongeveer 30 seconden na de inlevering diagnostische informatie gaf, zowel qua vloeiendheid als correctheid.

Deze studie werd uitgevoerd over een duur van 8 weken, waarbij een pre-test (week 1) werd afgenomen om de initiële schrijfprestaties van de proefpersonen te bepalen voordat de studenten een interventie kregen. Computergebaseerde feedback met NLP-semantische markers in de experimentele groep en lerarenevaluatie in de controlegroep werden zes weken lang aan de deelnemers gegeven. Uiteindelijk werd de post-test (in week 8) uitgevoerd om het verschil tussen pre- en post-test metingen van nauwkeurigheid en vloeiendheidsscores te begrijpen. Om vergelijkbare resultaten in vergelijkbaarheid te behalen, werd respondenten gevraagd om bij elke beoordelingsperiode soortgelijke taken schriftelijk uit te voeren, waardoor mogelijke verstorende variabelen van de moeilijkheidsgraad en vertrouwdheid van de inhoud in het schrijven werden geminimaliseerd. Om ervoor te zorgen dat de schrijfopdrachten consistent zijn met het moeilijkheidsniveau en om de geldigheid van de inhoud te bepalen, zijn de schrijfopdrachten op een overeenkomende manier gekozen. Essayonderwerpen zijn gekozen op basis van het feit dat de studenten verschillende inhoudelijke onderwerpen behandelen om te voorkomen dat de deelnemers oefenen en zich vervelen door het langdurig moeten uitvoeren van een soortgelijke taak.

Tijdens de pre-testfase werd van de deelnemers gevraagd een essay van 400–450 woorden te schrijven en te schrijven over hun academische en carrièredoelen. Deze beschrijvende opdracht was gebaseerd op persoonlijke ervaring en toekomstprojecties, wat impliceert dat het schrijven georganiseerd moet worden, duidelijke voorbeelden moet worden gegeven en een logische verklaring van persoonlijke doelen en motivatie moet worden gemaakt. De schrijfopdracht voor interventies was gebaseerd op verschillende onderwerpen, zoals schrijven over de dagelijkse routine van het leven, hobby's, reizen, de eerste dag aan de universiteit, memorabele levensdagen en momenten van beste vrienden. De opdracht na de toets was gekoppeld aan het onderwerp 'Effect van technologie op communicatie', en de vereiste essaylengte was 400–450 woorden.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Geldigheid en betrouwbaarheid van de statistische benadering

Het systeem werd getest op verschillende complementaire statistische methoden die allemaal uitgebreid bewijs leveren van de effecten van de EG op de ontwikkeling van het schrijven. Dit is een veelzijdige analytische methode die erkent dat onderwijsinterventies onderworpen zijn aan complexe statistische analyses die niet kunnen worden teruggebracht tot loutere groepsvergelijkingen, ma...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De experimentele resultaten tonen verschillende belangrijke prestaties. Ten eerste bereikte het dual-model systeem een sterke correlatie met menselijke experts (r = 0,923), waarmee het de single-model benaderingen en hedendaagse AWE-systemen aanzienlijk overtrof. Ten tweede toonde de gecontroleerde interventiestudie significante verbeteringen in de schrijfprestaties van ESL-studenten, met grote effectgroottes (d = 1,28) die hoger zijn dan die in recente literatuur. Ten derde toonde het s...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Er zijn geen belangenconflicten tussen alle auteurs.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wij erkennen de steun van COMSATS University Islamabad, campus Lahore, de faculteit Engels, bij het helpen verzamelen van gegevens van de studenten.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

```html

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
SOFTWARE / BIBLIOTHEKEN DIE IN HET ONDERZOEK ZIJN GEBRUIKT
Deep Learning FrameworkPyTorch1.13.1Deep learning framework voor de implementatie van neurale netwerken
Vooraf getrainde modellenTransformers (Hugging Face)4.21.3Vooraf getrainde modellen laden, BERT- en T5-modelimplementaties
TaalmodelBERT (Bidirectional Encoder Representations from Transformers)bert-base-uncasedVloeiendheidsbeoordeling, evaluatie van semantische samenhang, contextueel begrip
TaalmodelFLAN-T5 (Fine-tuned Language Net T5)pszemraj/flan-t5-large-grammar-synthesisCorrectie van grammaticale fouten, tekst-naar-tekst transformatie, foutdetectie
Numerieke berekeningenNumPy1.23.5Numerieke berekeningen, array-operaties voor wiskundige functies
GegevensanalysePandas1.5.2Gegevensmanipulatie, statistische analyse en voorverwerking
Machine LearningScikit-learn1.1.3Berekening van statistische metrics, correlatieanalyse, evaluatiemetrics
VisualisatieMatplotlib3.6.2Gegevensvisualisatie, plots voor trainingsvoortgang, prestatiegrafieken
VisualisatieSeaborn0.12.1Statistische gegevensvisualisatie, correlatieheatmaps
NLP ToolkitNLTK (Natural Language Toolkit)3.7Tekstvoorverwerking, tokenisatie, linguïstische analyse
NLP VerwerkingSpaCy3.4.4Geavanceerde NLP voorverwerking, POS-tagging, syntactische analyse
TokenisatieTokenizers0.13.2Snelle tokenisatie voor BERT WordPiece en T5 tokenisatie
STATISTISCHE EN ANALYSESOFTWARE
Statistische SoftwareSPSS Statistical SoftwareVersie 26.0Statistische analyse, onafhankelijke steekproeven t-tests, ANOVA, correlatieanalyse
TrainingsdatasetKaggle ASAP Dataset2012 versieTrainingscorpus referentie (90% van AWE-modellen gebruikt deze dataset)
PYTHON OPTIMISATIE EN TRAINING BIBLIOTHEKEN
Optimizertorch.optim.AdamWPyTorch 1.13.1Modeloptimalisatie met weight decay regularisatie (λ=0.01), β1=0.9, β2=0.999, ε=1×10-8
Verlies / Activeringtorch.nn.functionalPyTorch 1.13.1Sigmoid activering, verliesfuncties, dropout regularisatie
Gegevens ladentorch.utils.data.DataLoaderPyTorch 1.13.1Progressieve batchgrootte (4→16), gegevens laden en batchen
Tokenisatietransformers.AutoTokenizerTransformers 4.21.3BERT WordPiece tokenisatie, tekstvoorverwerking
Model ladentransformers.AutoModelTransformers 4.21.3Vooraf getrainde modellen laden voor BERT en T5 architectuur
Gradiëntcontroletorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Gradiënt clipping (drempel: 1.0) voor trainingsstabiliteit
LR Schedulingtorch.optim.lr_schedulerPyTorch 1.13.1Leercurveplanning met lineaire afname en opwarming
Metricssklearn.metricsScikit-learn 1.1.3Pearson correlatie, MAE, RMSE berekening voor evaluatie
PYTHON NEURAL NETWORK IMPLEMENTATIE
Basisklassetorch.nn.ModulePyTorch 1.13.1Basisklasse voor aangepaste neurale netwerkarchitecturen (Vloeiendheid & Correctheid modules)
Lineaire lagentorch.nn.LinearPyTorch 1.13.1Implementatie van lineaire regressiekop (768→512→256→128→1 neuronen)
Regularisatietorch.nn.DropoutPyTorch 1.13.1Dropout regularisatie (0.1 voor BERT, 0.3 voor regressiekop)
Activeringtorch.nn.functional.sigmoidPyTorch 1.13.1Sigmoid activering voor normalisatie van vloeiendheidsscore [0,1]
Activeringtorch.nn.functional.reluPyTorch 1.13.1ReLU activering in regressielagen voor niet-lineaire transformaties
Transformertransformers.BertModelTransformers 4.21.312 transformerlagen met multi-head self-attention voor vloeiendheidsbeoordeling
Seq2Seqtransformers.T5For
ConditionalGeneration
Transformers 4.21.3Encoder-decoder architectuur voor correctie van grammaticale fouten
Verliesfunctietorch.nn.MSELossPyTorch 1.13.1Mean Squared Error verliesfunctie voor training van vloeiendheidsregressie
PYTHON EVALUATIE EN METRICS BIBLIOTHEKEN
Correlatiescipy.stats.pearsonrSciPy 1.9.3Pearson correlatiecoëfficiënt voor overeenstemming tussen model en mens
Foutmetricsklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Berekening van Mean Absolute Error (MAE) voor voorspellingsnauwkeurigheid
Foutmetricsklearn.metrics.mean_squared_errorScikit-learn 1.1.3Root Mean Square Error (RMSE) voor beoordeling van foutmagnitude
Statistische testscipy.stats.ttest_indSciPy 1.9.3Onafhankelijke steekproeven t-test voor statistisch significantietesten
Correlatiematrixnumpy.corrcoefNumPy 1.23.5Berekening van correlatiematrix voor betrouwbaarheid tussen beoordelaars
Gegevenscorrelatiepandas.DataFrame.corrPandas 1.5.2Gegevenscorrelatieanalyse en statistische rapportage
Visualisatiematplotlib.pyplotMatplotlib 3.6.2Prestatievisualisatie, correlatieplots, trainingsvoortgangsgrafieken
Heatmapseaborn.heatmapSeaborn 0.12.1Visualisatie van correlatiematrix en statistische gegevenspresentatie
PYTHON TEKSTVERWERKING EN NLP BIBLIOTHEKEN

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Computerondersteund taalonderwijsneurale netwerkmodellennatuurlijke taalverwerkinggeautomatiseerde essaybeoordelingESL schrijfpedagogiekgrammaticafeedbackschrijfvaardigheid

Gerelateerde artikelen