Methodenartikel

Een dynamisch schriftelijk corrigerende feedbackkader dat AI-agentlevering integreert voor gestructureerde en iteratieve essayondersteuning

DOI:

10.3791/71992

24 juli 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie meet STEP-DWCF-R (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent) om de schrijfprestaties van IELTS te verbeteren door middel van meerronde AI en door docenten ondersteunde revisies.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Geautomatiseerde feedbacksystemen voor schrijven zijn wijdverbreid, maar de meeste leveren statische, gefragmenteerde opmerkingen die beperkte ondersteuning bieden voor revisie. Deze studie evalueert het STEP-DWCF-R-raamwerk (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent), waarbij AI-gegenereerde feedback, gemodereerd door een docent, via een robotische AI-agent wordt gegeven over meerdere iteratieve rondes binnen een taakcyclus van een week. In een acht weken durende quasi-experimentele studie werden 32 EFL-leerlingen gerandomiseerd naar ofwel traditionele schriftelijke corrigerende feedback (één ronde per taak) of STEP-DWCF-R. Beide groepen voltooiden IELTS Task 2-essays aan de basis en na de test, die werden geanonimiseerd, gerandomiseerd en gescoord door twee onafhankelijke beoordelaars (ICC = 0,86–0,93). Lineaire mixed-effects modellen toonden aan dat de STEP-DWCF-R groep significant grotere winsten vertoonde in de totale bandscore (Δ = 1,03 versus 0,31 banden) en over alle vier de analytische dimensies, met de grootste verbetering in coherentie en cohesie. Procesgegevens gaven aan dat STEP-DWCF-R-leerlingen gemiddeld 2,26 revisierondes per taak voltooiden, waarbij het aantal fouten lineair afnam over de rondes. Deze bevindingen suggereren dat het geïntegreerde STEP-DWCF-R-raamwerk, dat AI-gegenereerde feedback, lerarenmoderatie en iteratieve robotische AI-agentenlevering omvat, geassocieerd is met een grotere verbetering in IELTS-schrijven dan traditionele feedback in één ronde, wat wijst op praktische toepassingen voor AI-verbeterde dynamische feedback in EFL-contexten.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Schriftelijke corrigerende feedback (WCF) blijft centraal in de L2-schrijfdidactiek. Bewijs toont aan dat uitgebreide WCF de nauwkeurigheid van leerlingen in de loop van de tijd verbetert en, wanneer het in lijn is met de praktijk in de klas, kan samengaan met gerichte benaderingen die haalbaar zijn in authentieke contexten 1,2,3. Recente klasstudies tonen blijvende verbeteringen in nauwkeurigheid en vloeiendheid door aanhoudende, uitgebreide WCF. Onderzoek naar feedbackscope waarschuwt dat leraren formulieren strategisch moeten aanpakken in plaats van alles te markerenals 4,5,6,7,8,9. Tegelijkertijd zijn geautomatiseerde schrijfevaluatie (AWE) en geautomatiseerde schriftelijke corrigerende feedback (AWCF) snel gegroeid. De bevindingen zijn gemengd: sommige studies tonen verbeteringen in taakprestaties en grammaticaal bereik met AWCF- of Criterion-achtige programma's, terwijl andere geen significant voordeel vinden ten opzichte van feedback alleen van leraren of grotendeels lokale, oppervlakkige herzieningen noteren. Om deze heterogeniteit te weerspiegelen, trianguleren we bewust over meerdere AWCF-studies in plaats van te leunen op één enkele bron 10,11,12,13.

De overtuigingen van leerlingen over wie feedback geeft is ook belangrijk: quasi-experimenteel werk aan waargenomen bron geeft aan dat prestaties en vertrouwen kunnen verschuiven wanneer identieke feedback wordt gepresenteerd als "leraar" versus "geautomatiseerd", wat de noodzaak onderstreept om rekening te houden met perceptie-effecten in AWCF-ontwerpen14,15. Voortzettend op deze lijn suggereren nieuwe studies dat onderwijsrobots, vanwege hun belichaamde aanwezigheid, ook als feedbackaanbieders kunnen fungeren, wat mogelijk de betrokkenheid en het vertrouwen van leerlingen op unieke manieren kan beïnvloeden16.

Een aanvullende onderzoekslijn, dynamische schriftelijke corrigerende feedback (DWCF), legt de nadruk op frequente, beheersbare en uitgebreide feedbackcycli met codering en snelle revisie. Bewijs uit meerdere settings suggereert dat DWCF de nauwkeurigheid betrouwbaar verbetert (met frequentie-effecten op vloeiendheid), hoewel de resultaten kunnen variëren per cursusdoel en leerlingpopulatie 17,18,19,20. Ten slotte rapporteren vroege studies naar generatief-AI-gemedieerde feedback gelijkheid met feedback van leraren over schrijfresultaten en potentiële voordelen in combinatie met expliciete metalinguïstische begeleiding, wat motiveert tot nauwere integratie van menselijke en AI-feedback in L2-contexten21,22.

Om deze uitdagingen aan te pakken, stellen we het STEP-DWCF-R (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent) framework voor, een nieuw meerfasig DWCF-feedbacksysteem dat is ontworpen om gestructureerde, iteratieve en procesgerichte schrijfondersteuning te bieden. Ons systeem maakt gebruik van de voorspellende en generatieve kracht van Large Language Models (LLM's), met levering via een robotische AI-agentinterface en lerarenmoderatie, om complexe schrijfproblemen in beheersbare categorieën te segmenteren, feedback te geven via meerdere interactierondes en de effectiviteit te evalueren met zowel resultaat- als procesgebaseerde meetmethoden. Door feedback om te zetten in een gestructureerd en interactief proces, bevordert STEP-DWCF-R geautomatiseerde schrijfondersteuning van statische foutcorrectie naar een meer boeiend, belichaamd en leergericht systeem.

Onze bijdragen draaien om drie geïntegreerde vooruitgangen. Ten eerste stellen we een gestructureerd feedbackrepresentatieschema voor dat fouten categoriseert (bijv. grammatica, coherentie), zodat robotische AI-feedback van agent-geleverde LLM's zowel uitvoerbaar als pedagogisch interpreteerbaar is. Ten tweede introduceren we een iteratief meerfasenproces dat feedback over taal, structuur en redenering over meerdere rondes heen rijdt om de cognitieve belasting te verminderen en de betrokkenheid te verdiepen. Ten derde breiden we evaluatie uit voorbij post-scores en omvatten procesgerichte meetwaarden zoals foutvermindering en feedbackacceptatie, waardoor we een rijker beeld van de impact van leren bieden. WCF-kaders vormen de vroegste pogingen om schriftelijke corrigerende feedback binnen onderwijstechnologie te systematiseren. Deze systemen zijn oorspronkelijk in Automated Writing Evaluation (AWE) en Automated Essay Scoring (AES) en legden de nadruk op foutdetectie en vaardigheidsscore13,14. Hun bijdrage ligt in schaalbaarheid: duizenden leerlingen zouden feedback kunnen ontvangen zonder de bottleneck van menselijke beoordeling. Deze kaders boden echter doorgaans statische en gefragmenteerde opmerkingen, zoals grammaticale controles, lexicale suggesties of globale scores die leerlingen moeilijk konden omzetten in betekenisvolle revisies 23,24,25,26.

In de loop der tijd evolueerde het WCF-onderzoek met meer technologie-gemedieerde benaderingen. Deze nieuwere systemen probeerden bredere aspecten van schrijven te vangen door gebruik te maken van computationele methoden13,21. Meer recentelijk is de reikwijdte verder uitgebreid met belichaamde technologieën, waarbij educatieve robots zijn gaan fungeren als feedbackaanbieders in schrijf- of bijlescontexten. Hun fysieke aanwezigheid en interactieve mogelijkheden introduceren nieuwe dynamieken van vertrouwen, betrokkenheid en leerlingmotivatie. Toch is ondanks deze ontwikkelingen de dominante richting van WCF uitkomstgericht gebleven 8,27: het produceren van scores of geïsoleerde opmerkingen in één korte volgorde. Pedagogisch gezien is deze oriëntatie niet op lijn met formatieve beoordeling, waarbij feedback revisie over concepten zou moeten ondersteunen en metacognitieve betrokkenheid zou moeten ondersteunen 16,28,29,30,31. Zo onthult de conceptuele grens van WCF een blijvende kloof: feedback wordt gegeven, maar niet gestructureerd of gestructureerd om leerprocessen te sturen.

Als reactie op deze beperkingen zijn wetenschappers begonnen met het verkennen van dynamischere benaderingen van het schrijven van feedback. Vroege onderzoeken benadrukten het belang van iteratieve feedbackcycli, waarbij leerlingen meerdere keren herhalen onder gestructureerde richtlijnen17,32. Gestructureerde foutcategorisering is ook voorgesteld om de interpreteerbaarheid van feedback te verbeteren en deze af te stemmen op pedagogische doelstellingen33,34. Het begrip DWCF-framework consolideert deze richtingen door drie ontwerpprincipes in te bettelen: expliciete foutschema's, gefaseerde en iteratieve levering, en procesgerichte evaluatiemetrieken19,35. In plaats van studenten te overweldigen met een massa correcties in één keer, verdeelt DWCF de aandacht over lagen van schrijven—oppervlakkige nauwkeurigheid, structurele samenhang en argumentatieve diepgang—via opeenvolgende rondes17,33. De evaluatie strekt zich uit voorbij de eindscores en omvat procesindicatoren zoals foutreductiepercentages, feedbackacceptatie en revisiediepte 10,19,25. Ondanks de belofte blijven de praktische toepassingen van DWCF schaars, en de meeste studies schieten niet in om het operationeel te maken in grootschalige, technologie-gemedieerde contexten 10,36,37. Deze kloof benadrukt de noodzaak van kaders die niet alleen DWCF theoretiseren, maar ook de haalbaarheid ervan in echte onderwijsomgevingen aantonen. Figuur 1 toont het bredere theoretische kader van DWCF dat in de literatuur wordt voorgesteld. De figuur geeft een algemene verklaring voor hoe dynamische schriftelijke corrigerende feedback op meerdere niveaus kan werken, inclusief zowel gemeten uitkomsten (bijv. nauwkeurigheid, coherentie) als getheoretiseerde maar niet-gemeten constructies in de huidige studie (bijv. vermindering van schrijfangst, vloeiendheid en complexiteit). Het is opgenomen voor theoretische oriëntatie en niet als direct model van deze proef. Elementen die overeenkomen met de hier geanalyseerde uitkomsten en procesmetrieken zijn in de figuur weergegeven; Andere routes zijn illustratief en werden in deze studie niet geëvalueerd.

De opkomst van LLM's en multimodale systemen biedt een krachtig middel om DWCF op grote schaal operationeel te maken. LLM's, met hun zero-shot en few-shot mogelijkheden, kunnen contextgevoelige feedback genereren zonder taakspecifieke training21,22. Recente experimenten suggereren hun potentieel voor directieve segmentatie, gefaseerde verfijning en het genereren van verklaringen, die nauw aansluiten bij de principes van DWCF 13,37,38,39. Complementair onderzoek naar samenwerking tussen mens en AI heeft aangetoond dat iteratieve loops van het omgaan met, aanpassen en selectief adopteren van AI-feedback zowel de opname als de revisiekwaliteit kunnen verbeteren25,30. Wanneer deze processen via robots worden belichaamd, heeft de interactie theoretisch het potentieel om multimodaal te worden—waarbij gebaar, stem en aanwezigheid worden gecombineerd—wat de perceptie en motivatie van de leerling verder kan versterken.

Geworteld in de Zone van Proximale Ontwikkeling (ZPD)41, de Input Hypothesis42 en de Skill AcquisitionTheory 43, positioneren we STEP-DWCF-R als een controller die lerenondersteuning, inputverwerking en vaardigheidsontwikkeling verbindt. Concreet werken rubric-linked itemization, tijdige geconsolideerde lijsten en meerronde-door leraren gemodereerde AI-, mens- en robotcycli op een integratielaag die revisie bemiddelt en de hier geanalyseerde observeerbare eindpunten oplevert (IELTS Overall en TR/CC/LR/GRA; rondes, opname, persistente fouten, tijd). Constructies zoals het verminderen van schrijfangst worden in deze proef getheoretiseerd, maar niet gemeten.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol werd goedgekeurd door de Ethische Commissie van de School voor Basisonderwijs, Shangrao Preschool Education College. Alle deelnemers waren volwassenen (≥18 jaar) en gaven schriftelijke geïnformeerde toestemming voorafgaand aan het onderzoek.

1. Studieontwerp

OPMERKING: Vanwege de beperkingen van het beschikbare EFL-klaslokaal (totaal aantal leerlingen N = 32) werden deelnemers gerandomiseerd in twee groepen van elk 16. Deze steekproefgrootte, hoewel bescheiden, werd als voldoende beschouwd voor een pilotonderzoek gezien het pre-post ontwerp binnen het onderwerp en de verwachte grote effectgroottes op basis van eerdere DWCF-studies 17,18,19,20.

  1. Randomiseer deelnemers in twee groepen (n = 16 elk) met behulp van eenvoudige randomisatie. Genereer de allocatievolgorde met behulp van een computergegenereerde willekeurige nummerlijst. Houd de toewijzing geheim voor de instructeur totdat de basisbeoordeling is afgerond.
  2. Zorg ervoor dat beide groepen door dezelfde instructeur worden onderwezen, met identieke materialen en contacturen.
  3. Geef feedback via directe menselijke correctie (WCF) of via de STEP-DWCF-R workflow, waarbij AI en feedback van docenten worden gepresenteerd via een robotische AI-agent.

2. Schrijfopdrachten

  1. Administreer een basisessay voor IELTS Taak 2 in week 1 onder examenomstandigheden (≥250 woorden, 40 min).
  2. Voer zes wekelijkse schrijfopdrachten uit (weken 2–7). Voor elke taak:
    1. Geef in WCF één ronde menselijke feedback op het essay.
    2. In STEP-DWCF-R genereer je AI-feedback, modereer je deze met een menselijke docent en geef je de robotische AI-agent de instructie om de feedback interactief aan de leerling te presenteren.
    3. In STEP-DWCF-R herhaal je de STEP-DWCF-R feedbackcyclus voor 2–3 rondes totdat de revisie voltooid is.
  3. Administreer een IELTS Taak 2-essay na de toets in week 8 onder dezelfde examenvoorwaarden. Volg dezelfde eenweekse kalender voor elke taak in beide groepen. Geef feedback van Ronde 1 binnen 24 uur na het indienen van het concept in STEP-DWCF-R. Verplicht leerlingen om binnen 48 uur te herzien en opnieuw in te dienen. Volg hetzelfde schema voor volgende rondes en voltooi alle cycli binnen het wekelijkse venster.

3. Feedbackworkflow

  1. Verwerk elk concept van de leerling met de GPT-5 API (model = "gpt-5", temperatuur = 0,7, max_output_tokens = 2048) om gespecificeerde feedback te genereren over vier vaste categorieën: grammatica, woordenschat, organisatie en redenering. De exacte systeemprompt en het JSON-uitvoerschema worden geleverd in de open-source repository (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, functie build_prompt() en normalize_reasoning()).
  2. Matig de door AI gegenereerde feedback volgens de volgende criteria: verwijder valse positieven of onjuiste opmerkingen; voeg gemiste kritieke kwesties toe die aansluiten bij de IELTS-rubriek; ervoor te zorgen dat de opmerkingen bruikbaar en bemoedigend zijn; en handhaaf consistentie met het vier-categorie schema. Registreer moderatiebeslissingen handmatig.
  3. Sla de gemodereerde feedback op in JSON-formaat en upload deze naar de robotic AI agent interface (een lichtgewicht Flask-webapplicatie).
  4. Geef feedback via de webinterface. Toon gestructureerde tabellen voor elke categorie (samenvatting, uitgaven en revisietips). Registreer bevestigingen en verduidelijkingsverzoeken van leerlingen via systeemlogboeken. Instructeer leerlingen om hun concepten te herzien en opnieuw in te dienen. Herhaal de cyclus tot drie keer per taak.
  5. Verificatie en probleemoplossing.
    1. Verifieer succesvolle AI-feedbackgeneratie door te bevestigen dat de output een geldig JSON is, inclusief alle vier de vereiste categorieën: grammatica, woordenschat, organisatie en redenering. Bevestig het voltooien van de moderatie van de leraar door ervoor te zorgen dat vals-positieven zijn verwijderd, ontbrekende problemen zijn toegevoegd en het gemodereerde JSON-bestand is opgeslagen.
    2. Upload het gemodereerde JSON-bestand via het upload-endpoint naar de Flask-gebaseerde robotische AI-agentinterface. Bevestig succesvolle upload via het bevestigingsbericht van de interface en de databaselogboekinvoer. Registreer automatisch herindieningen van leerlingen via formulierinleverlogboeken.
    3. Verwerk niet-conforme AI-uitvoer (bijv. misvormde JSON, ontbrekende categorieën of onnauwkeurige feedback) met behulp van de ensure_json() en normalize_reasoning()-functies. Regenereer de API-uitvoer met aangepaste promptparameters indien nodig. Corrigeer de JSON handmatig tijdens de moderatie van de docent, indien nodig, om ervoor te zorgen dat alle vier de categorieën aanwezig zijn vóór upload.
      OPMERKING: Voorbeelden van ruwe AI-feedback, door de docent gemodereerde versies en de geleverde interface-output zijn beschikbaar in de repository (data/map en notitieboeken/).

4. Uitkomstmeting

  1. Definieer het primaire resultaat als de verandering in de IELTS totale bandscore (week 1 tot week 8).
  2. Definieer secundaire uitkomsten als veranderingen in Taakrespons, Coherentie en Cohesie, Lexicale Bron, en Grammaticale Reikwijdte en Nauwkeurigheid.
  3. Wijs twee onafhankelijke beoordelaars met ervaring in IELTS Taak 2 beoordeling toe om alle essays te beoordelen. Verwijder namen en groepsidentificaties uit alle essays. Randomiseer de essayvolgorde en blind beoordelaars naar groepsopdracht en tijdstip. Gebruik dezelfde IELTS Taak 2-prompt voor zowel de Week 1 baseline als de week 8 post-test. Los het scoren van meningsverschillen groter dan 0,5 banden op via discussie totdat consensus is bereikt. Beoordeel de betrouwbaarheid van inter-raters met behulp van de gemiddelde metingen intraclass correlatiecoëfficiënt (ICC[2,2]).

5. Procesmeting

  1. Noteer het aantal revisierondes per taak.
  2. Recordopname van feedback (aangenomen, gewijzigd, afgewezen) door leerlingen.
  3. Houd persistente fouten bij tussen cycli.
  4. Noteer feedback van de leraar, de tijd voor de robotlevering en de tijd voor het herhalen van de leerling.

6. Data-analyse

  1. Pas lineaire mixed-effects modellen aan met interactie tussen Groep, Tijd en Groep × Tijd.
  2. Pas gegeneraliseerde mixed-effects modellen toe voor procesmaten.
  3. Rapporteffectgroottes, 95% betrouwbaarheidsintervallen en aangepaste p-waarden.
  4. Voer robuustheidscontroles uit met ANCOVA, rater-specifieke modellen en robuuste SE's.

7. Codebeschikbaarheid

Alle code, prompts, JSON-schema's en voorbeeldimplementatiebestanden die nodig zijn om het STEP-DWCF-R-systeem te reproduceren, zijn open beschikbaar op https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimenten en Analyse

Alle 32 leerlingen leverden basisgegevens. Na de test waren gegevens beschikbaar voor 16 leerlingen in elke groep (WCF en STEP-DWCF-R; Figuur 2). De studietijdlijn en de metingen worden weergegeven in Figuur 3, en de end-to-end feedbackworkflow is geïllustreerd in Figuur 4. Experimentele opzet- en implementatieparameters voor ons AI-systeem worden weergegeven in Tabel 1. De analyses volgden het vooraf gespecificeerde plan met intentie-om-behandeling. We beoordelen eerst de basislijn-equivalentie (Tabel 2), rapporteren vervolgens de primaire uitkomst (Figuur 5 en Tabel 3), gevolgd door secundaire uitkomsten (Tabel 4) met robuustheids- en betrouwbaarheidscontroles.

Baseline-equivalentie

Bij de basislijn (week 1) waren de groepen beschrijvend vergelijkbaar op vooraf bepaalde covariaten, inclusief demografie en IELTS-schrijfprestaties voordat er feedback werd gegeven (Tabel 2). Individuele IELTS-componentscores worden toegewezen in stappen van 0,5 banden, terwijl de tabel groepsgemiddelden weergeeft. De algemene gemiddelden van week 1 (WCF = 5,625, STEP-DWCF-R = 5,500) worden berekend uit dezelfde arrays die zijn gebruikt om Figuur 5 te genereren. We voeren geen hypothesetests uit bij de basislijn; eventuele restonevenwichtigheden worden aangepakt door het pre-post ontwerp en de Group × Time-term in het mixed-effects model, en een post-test vergelijking aangepast voor de basislijn wordt gerapporteerd in de Protocolsectie.

Primaire uitkomst

Figuur 5 vat de veranderingen vóór de test samen, terwijl Tabel 3 en Tabel 5 modelschattingen en prestaties na de test tonen. Bij de uitgangsfase (week 1) waren de groepsgemiddelden 5,625 voor WCF en 5,500 voor STEP-DWCF-R, wat resulteerde in een niet-significant groepsverschil van −0,125 banden (SE = 0,133, t = − .939, df = 29,90, p = .355, 95% BI [−0,397, 0,147]). De basislijn in Tabel 3 schat daarom het WCF-gemiddelde van week 1 op 5,625 met 95% BI [5,419, 5,831] (SE = 0,097, df = 15). Van week 1 tot week 8 verbeterde de WCF met 0,3125 banden (SE = 0,128, t = 2,44, df = 15, p = .028, 95% BI [0,039, 0,586]; gestandaardiseerd binnen groep effect dz = 0,61). STEP-DWCF-R verbeterde met 1,0313 banden (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, 95% BI [0,732, 1,331]; dz = 1,84). Het lineaire gemengde effecten contrast voor de Group × Time-interactie—oftewel het verschil in verschillen—was 0,7188 banden (SE = 0,190, t = 3,78, df = 29,75, p = .0007, 95% BI [0,330, 1,107]; Tabel 3), wat grotere winsten onder STEP-DWCF-R aangeeft. Bij de post-test (week 8) gaven de geschatte marginale gemiddelden de voorkeur aan STEP-DWCF-R met 0,5938 banden (Welch-test op groepsgemiddelden: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, 95% BI [0,359, 0,829]). In overeenstemming hiermee toont de prestatietabel (Tabel 5) dat in week 8 13% van de WCF-leerlingen Overall ≥ 6,5 behaalde en 0% ≥ 7,0 (getallen 2/16 en 0/16), terwijl 81% van de STEP-DWCF-R-leerlingen ≥ 6,5 bereikte en 25% ≥ 7,0 bereikte (tellingen 13/16 en 4/16). Tabel 3 toont de bijbehorende fixed-effect schattingen en hun onzekerheid.

Uitkomsten op dimensieniveau

Tabel 4 vat de wijzigingen vóór de post samen over de vier dimensies van Taak 2. Task Response (TR) toonde een toename van Δ = 0,25 banden onder WCF versus Δ = 0,95 onder STEP-DWCF-R, wat resulteerde in ΔΔ = 0,70 met 95% BI [0,28, 1,12] en Holm-gecorrigeerde p = .006. Coherentie en cohesie (CC) vertoonden het grootste contrast: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, dus ΔΔ = 0,85 (95% BI [0,44, 1,26], adj-p = .002). Lexical Resource (LR) volgde hetzelfde patroon met WCF Δ = 0,35 en STEP-DWCF-R Δ = 0,95, wat ΔΔ = 0,60 opleverde (95% BI [0,18, 1,02], adj-p = .012). Grammaticaal bereik en nauwkeurigheid (GRA) verbeterd met Δ = 0,25 in WCF en Δ = 0,97 in STEP-DWCF-R; de resulterende ΔΔ = 0,72 droeg een 95% BI van [0,31, 1,13] met adj-p = .004. Over alle vier de dimensies heen bevoordeelt de Group×Time de STEP-DWCF-R na de Holm–Bonferroni-aanpassing.

Procesbewijs

Figuur 6 en Figuur 7 visualiseren de kernresultaten van het proces. Over weken 2–7 voltooide STEP-DWCF-R gemiddeld 2,26 revisierondes per taak (95% BI [2,17, 2,35]; n = 96), terwijl WCF 1,00 rondes was voor alle taken (n = 96). Het gemiddelde verschil was 1,26 rondes (95% BI [1,17, 1,35]); een Mann–Whitney-test bevestigde de scheiding van de verdelingen (U = 9216, z = 11,97, p < 10−30). Binnen STEP-DWCF-R daalden de gemiddelde fouten per ronde: 13,78 bij ronde 1 (95% BI [13,02, 14,54]; n = 96), 8,94 bij ronde 2 (95% BI [8,42, 9,46]; n = 96), en 6,16 bij ronde 3 (95% BI [5,20, 7,12]; n = 25). Een lineaire trend toegepast op waarnemingen per ronde schatte een afname van 4,14 fouten per ronde (95% BI [3,51, 4,78] in absolute magnitude; p < 10−12). Metingen van feedbackopname en tijd-op-taak zijn niet gecodeerd in Figuur 6 en Figuur 7 en worden daarom gerapporteerd in Tabel 7.

Betrouwbaarheid en robuustheid

De overeenstemming tussen beoordelaars voor de essays van week 1 en week 8 was van god tot uitstekend. Twee getrainde beoordelaars beoordeelden alle scripts onafhankelijk en waren blind voor groep en tijd; met gemiddelde metingen intraclass correlatiecoëfficiënt (ICC[2,2]) op de beoordelaarsgemiddelden varieerde de betrouwbaarheid van 0,86–0,93 over de Overall en de vier dimensies, en alle lagere 95% betrouwbaarheidslimieten overschreden 0,80 (Tabel 6). Diagnostische controles voor het primaire mixed-effects model gaven ongeveer normale residuen aan zonder materiaal-heteroscedasticiteit, en modellen die werden aangepast aan processamenvattingen op taakniveau toonden een dispersie dicht bij één. Gevoeligheidsanalyses gebaseerd op dezelfde dataset van week 1/week 8 leverden consistente conclusies op: een lineaire regressie die groepen na de test vergeleek en corrigeerde voor baselinescores schatte een aangepast verschil tussen groepen van 0,575 banden in week 8 (95% BI [0,336, 0,814], p = 3,15 × 10−5), en een beoordelaar-specifiek gemengd model met een willekeurig effect voor beoordelaar en gebruikte niet-gemiddelde scores leverde een groeps-× tijdschatting van 0,72 banden op (95% BI [0,33, 1.11], p = .0007), uitgelijnd met Tabel 3. De resultaten bleven ongewijzigd bij gebruik van robuuste standaardfouten en wanneer analyses beperkt waren tot volledige casussen, wat de conclusie versterkt dat STEP-DWCF-R grotere pre-post winsten oplevert dan WCF.

Kwalitatieve bevindingen

Voor kwalitatieve analyse onderzochten we STEP-DWCF-R revisietraces over alle zes taken en afsluitende schriftelijke reflecties van de 16 deelnemers in de STEP-DWCF-R groep. Twee programmeurs codeerden onafhankelijk de materialen met een gefocust deductief kader gebaseerd op de vier feedbackcategorieën (grammatica, woordenschat, organisatie, redeneren) en opnameredeneringen. De overeenstemming tussen coders was aanzienlijk met Cohens kappa van 0,78, en meningsverschillen werden door overleg opgelost.

Analyse onthulde vijf kernthema's: opname volgde een gefaseerd patroon, waarbij leerlingen oppervlaktekenmerken oplossen voordat ze organisatie en redeneren aanpakken; Span-specifieke, rubric-gekoppelde items waren uitvoerbaarder en werden vaak toegepast dan narratieve suggesties; De complementariteit tussen AI en leraren vormde prioriteit, met overlappende signalen die de focus verhoogden en lerarenmoderatie die conflicten oploste; De voordelen bereikten vroeg een piek, met hergebruik van organisatiesjablonen en lexicale patronen die op nieuwe prompts werden genoteerd; en leerlingen pasten strategieën aan over taken heen. Deze thema's informeren de procesdynamiek die wordt onderzocht in de sectie procesbewijs. Feedbackopname, aanhoudende fouten en time-on-task-metingen werden ook geregistreerd. Een samenvatting van deze aanvullende procesindicatoren wordt gepresenteerd in Tabel 7.

Interpretatie van representatieve resultaten

Gezamenlijk geven de uitkomst- en procesgegevens aan dat het STEP-DWCF-R-raamwerk geassocieerd is met een grotere verbetering in IELTS-schrijven dan traditionele feedback voor één ronde. De primaire uitkomst toont een verschil tussen groepen van 0,72 banden, waarbij de STEP-DWCF-R groep in totaal met 1,03 banden verbetert vergeleken met 0,31 banden in de WCF-groep. Dit voordeel was consistent over alle vier de analytische dimensies, met het grootste verschil in coherentie en cohesie bij 0,85 banden, wat suggereert dat gestructureerde, met rubrics gekoppelde, meerfasige feedback vooral de organisatieontwikkeling ondersteunde. Procesbewijs wijst verder uit dat iteratieve betrokkenheid ten grondslag ligt aan dit voordeel. STEP-DWCF-R leerlingen voltooiden gemiddeld 2,26 revisierondes per taak, en het aantal fouten daalde lineair met ongeveer 4,1 fouten per ronde. Zo omvatte een representatieve workflowcyclus GPT-5 die gestructureerde JSON-feedback genereerde over de vier categorieën, gevolgd door lerarenmoderatie om valse positieven te elimineren en de actiebaarheid te vergroten, en daaropvolgende levering via de robotic AI-agentinterface voor meerronde leerderrevisie. Deze bevindingen ondersteunen de haalbaarheid en potentiële effectiviteit van de geïntegreerde multicomponentenworkflow die AI-gegenereerde feedback, lerarenmoderatie en iteratieve robotische AI-agentlevering combineert, maar ze moeten niet worden geïnterpreteerd als bewijs van een enkel onderdeel op zichzelf. De dosisonbalans van 2–3 rondes versus één ronde en de bescheiden steekproefgrootte van 32 betekenen dat de waargenomen winsten het gecombineerde effect weerspiegelen van meer revisiemogelijkheden en gestructureerde feedback. Deze resultaten moeten worden gezien als veelbelovend pilotbewijs dat wacht op bevestiging in grotere, componentgecontroleerde onderzoeken.

figure-results-1
Figuur 1. Theoretisch kader van DWCF (dynamische schriftelijke corrigerende feedback). De figuur geeft een bredere onderbouwing voor hoe DWCF mogelijk opereert; Het is opgenomen voor oriëntatie en niet als direct model van deze proef. Elementen die overeenkomen met de hier geanalyseerde uitkomsten en procesmetrieken zijn in de figuur weergegeven; Andere paden zijn illustratief en zijn niet geëvalueerd. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-2
Figuur 2. CONSORT stroomdiagram van deelnemers. Tweeëndertig leerlingen werden beoordeeld op geschiktheid; geen enkele werd uitgesloten. Alle deelnemers gaven toestemming en werden vervolgens in een verhouding van 1:1 gerandomiseerd naar ofwel de WCF-groep (n = 16) of de DWCF-groep (n = 16). Alle gerandomiseerde deelnemers ontvingen de toegewezen interventie; er waren geen verliezen door follow-up of stopzettingen, en alle 32 werden meegenomen in de eindanalyse. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-3
Figuur 3. Studietijdlijn en metingen. De proef duurde 8 weken: bij W1 voltooiden deelnemers de baseline IELTS Task 2 en werden gescoord; zes wekelijkse schrijfopdrachten werden uitgevoerd van W2 tot W7 (Taak 1–Taak 6), met groepsspecifieke feedback (WCF of DWCF) en revisies na elke taak. Procesmetingen, waaronder revisierondes, feedbackopname, persistent-error percentage en tijd op taak, werden voor elke taak geregistreerd tijdens W2–W7. Bij W8 werd de post-test IELTS Task 2 afgenomen en gescoord. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-4
Figuur 4. End-to-end feedbackworkflow. Leerlingen maken een begeleide eerste versie en ontvangen vervolgens groepsspecifieke feedback: WCF (één menselijke feedbackronde) of STEP-DWCF-R (AI-gegenereerde feedback met lerarenmoderatie, geleverd via robotische AI-agenten, met 2–3 iteratieve rondes). Leerlingen voltooien de revisierons(en) dienovereenkomstig. Het resultaat is de IELTS Task 2 bandscore; Procesmaten omvatten het aantal rondes, feedbackopname (aangenomen/gewijzigd/afgewezen), het percentage persistente fouten en de tijd die je op de taak bevindt. Het systeem registreert itemniveau-ID's, categorie/ernst, bron (AI vs. mens vs. robot), moderatieacties en opnamestatus. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-5
Figuur 5. Verandering van de IELTS-totale band van week 1 naar week 8 per groep. Punten geven de geschatte groepsgemiddelden met 95% betrouwbaarheidsintervallen, en de trajecten geven een grotere winst aan onder STEP-DWCF-R Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-6
Figuur 6. Revisierondes per taak per groep (weken 2–7). Datapunten vertegenwoordigen individuele taakrevisierondes voor de WCF (blauw) en STEP-DWCF-R (oranje) groepen. Horizontale lijnen en foutbalken geven groepsgemiddelden aan met 95% betrouwbaarheidsintervallen. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-7
Figuur 7. Gemiddelde fouttellingen per ronde binnen STEP-DWCF-R met 95% BI. Punten geven het gemiddelde foutaantal aan bij elke feedbackronde (Ronde 1, Ronde 2, Ronde 3), en verticale lijnen vertegenwoordigen 95% betrouwbaarheidsintervallen (CI's). Klik hier om een grotere versie van deze figuur te bekijken.

ComponentSpecificatie
HardwarePC met 12e generatie Intel(R) Core(TM) i7-12700H (2,30 GHz), 32GB RAM, NVIDIA RTX 3080Ti GPU (16GB)
BesturingssysteemWindows 11
BackendFlask~2.1 (Python~3.10)
FrontendJinja2 server-rendered templates
AI-modellenOpenAI GPT-5 API (voor feedbackgeneratie), schema-gebaseerde nabewerking
FeedbackplannerAangepaste controller die meertrapsfeedback beheert (3 cycli)
FoutschemaGrammatica, woordenschat, organisatie, redeneren
VersiebeheerGitHub
HoutkapAutomatische registratie van inzendingen, feedback en revisies voor analyse

Tabel 1: Parameters voor experimentele opstelling en implementatie. Technische specificaties van het AI-feedbacksysteem, waaronder hardwareconfiguratie, besturingssysteem, backend en frontend frameworks, AI-modelinstellingen, feedbackplanner, foutschemacategorieën, versiebeheer en logginginfrastructuur.

VariabeleWCF (n=16)STEP-DWCF-R (n=16)
Leeftijd (jaren), gemiddelde (SD)20.9 (1.5)21.1 (1.6)
Vrouwelijk, n (%)9 (56%)8 (50%)
Eerdere IELTS-voorbereiding (ja), n (%)7 (44%)6 (38%)
Jaren van eerdere schrijfinstructie3.1 (1.2)3.2 (1.1)
Baseline IELTS Overall (band)5.625 (0.387)5.500 (0.365)
Baseline TR (band)5.56 (0.50)5.50 (0.50)
Baseline CC (band)5.62 (0.49)5.53 (0.49)
Baseline LR (band)5.60 (0.46)5.52 (0.46)
Baseline GRA (band)5.56 (0.48)5.49 (0.45)

Tabel 2: Basislijnkenmerken van deelnemers per groep (Week 1). Demografische variabelen en pre-test International English Language Testing System (IELTS) Task 2 schrijfprestaties voor de WCF- en STEP-DWCF-R-groepen. Waarden zijn gemiddeld (standaarddeviatie) of n (%).

Vast effectSchattingSEDFtp95% BI
Intercept (WCF, Week~1)5.6250.0971558.1<.001[5.419, 5.831]
Groep (STEP-DWCF-R vs. WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Tijd (Week~8 vs. Week~1)0.31250.128152.44.028[0.039, 0.586]
Groep × Tijd0.71880.1929.753.78.0007[0.330, 1.107]

Tabel 3: Lineair mixed-effects model voor de IELTS totale band vanaf de scores van week 1/week 8. Fixed-effect schattingen, standaardfouten (SE), vrijheidsgraden (df), t-waarden, p-waarden en 95% betrouwbaarheidsintervallen (CI's) voor de Group × Time interactie en modeltermen.

DimensieWCF Δ (bands)STEP-DWCF-R Δ (banden)ΔΔ (95% BI)ADJ-P
Taakrespons (TR)0.250.950.70 (0.28, 1.12).006
Samenhang en cohesie (CC)0.31.150.85 (0.44, 1.26).002
Lexicale Bron (LR)0.350.950.60 (0.18, 1.02).012
Grammaticaal bereik en nauwkeurigheid (GRA)0.250.970.72 (0.31, 1.13).004

Tabel 4: Uitkomsten op dimensieniveau (Taak 2): veranderingen vóór en na de groep en verschillen tussen groepen. Pre-post veranderingen (Δ) en verschil-in-verschillen (ΔΔ) met 95% betrouwbaarheidsintervallen (BI's) en Holm-gecorrigeerde p-waarden voor Taakrespons (TR), Coherentie en Cohesie (CC), Lexicale Bron (LR) en Grammaticaal Bereik en Nauwkeurigheid (GRA).

DrempelWCF (%)STEP-DWCF-R (%)
Totaal ≥ 6,51381
Totaal ≥ 7,0025

Tabel 5: Besteding van de band na de test (week 8). Andeel leerlingen in de WCF- en STEP-DWCF-R-groepen dat IELTS bereikt Algemene bandscoredrempels van minstens 6,5 en minstens 7,0.

UitkomstICC95% BI
Algemeen0.91[0.86, 0.94]
Taakrespons (TR)0.88[0.82, 0.92]
Samenhang en cohesie (CC)0.9[0.85, 0.94]
Lexicale Bron (LR)0.89[0.83, 0.93]
Grammaticaal bereik en nauwkeurigheid (GRA)0.87[0.80, 0.91]

Tabel 6: Inter-rater betrouwbaarheid voor IELTS-uitkomsten. Twee blinde beoordelaars op N = 64 essays (Week 1 en Week 8 samen). Gemiddeld meet intraclass correlatiecoëfficiënten (ICC[2,2]) met 95% betrouwbaarheidsintervallen (BI's) voor de totale en dimensiescores.

MetingWCF GroupSTEP-DWCF-R Groep
Revisierondes per taak12.26
Feedbackopnamepercentage (aangenomen of gewijzigd, %)68.582.3
Persistent foutpercentage na de laatste ronde (%)67.445.6
Tijd voor lerarenmoderatie (minimaal per taak)23.513.8
Levertijd voor AI-agenten (minimaal per taak)3.9
Studietijd voor leerlingen (minimaal per taak)44.871.2
Totale tijd aan feedback + revisie (min/taak)68.388.9

Tabel 7: Betekent over 96 taken (6 taken × 16 leerlingen). Opname- en persistente foutpercentages werden berekend op het feedbackpuntniveau. Tijdmetingen werden vastgelegd via lerarenlogboeken en systeemtijdstempels. De levertijd van AI-agenten is niet van toepassing voor de WCF-groep.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie vergeleek STEP-DWCF-R, een multicomponent dynamisch schriftelijk corrigerende feedbackframework met een robotic AI-agent, met een enkelronde WCF in een acht weken durende IELTS-schrijfcursus. STEP-DWCF-R leverde grotere pre-post winsten op in de totale band en over TR, CC, LR en GRA. Leerlingen onder STEP-DWCF-R voltooiden ook meer revisierondes en vertoonden snellere foutvermindering, waarbij modellen een daling van ongeveer 4,1 fouten per ronde schatten. De grootste verbetering was in coherentie en cohesie (ΔΔ = 0,85), wat aangeeft dat gestructureerde, rubriekgekoppelde feedback zowel een hoger niveau van organisatie als nauwkeurigheid bevordert. Deze bevindingen komen overeen met eerder DWCF-onderzoek waaruit blijkt dat iteratieve, uitgebreide feedback de schrijfnauwkeurigheid in de loop van de tijd verbetert 14,15,16,17.

De STEP-DWCF-R workflow omvat drie kritieke stappen. Ten eerste genereert het AI-systeem gespecificeerde feedback over vier categorieën (grammatica, woordenschat, organisatie, redeneren) met behulp van een beperkt JSON-schema en een gestandaardiseerde systeemprompt. Ten tweede moderateert een docent de output om valse positieven te verwijderen, gemiste kritieke kwesties toe te voegen die aansluiten bij de IELTS-rubric, te zorgen voor uitvoerbare en stimulerende formuleringen, en consistentie te behouden met het vier-categorie schema. Deze moderatiestap dient als het primaire probleemoplossingsmechanisme en corrigeert AI-hallucinaties of overbeoordeling die leerders anders zouden kunnen overweldigen. Opvallend is dat de moderatietijd per taak van de leraar lager was in STEP-DWCF-R dan in WCF (13,8 min versus 23,5 min), omdat de AI de initiële gestructureerde feedback genereerde en de docent deze alleen modereerde. Ten derde wordt de gemodereerde feedback gegeven via de webgebaseerde robotische AI-agentinterface, die bevestigingen en herinzendingen van leerlingen registreert over meerdere rondes.

In vergelijking met bestaande benaderingen pakt STEP-DWCF-R duidelijke beperkingen aan. Conventionele enkelronde WCF blijft beperkt door instructeurtijd en biedt doorgaans beperkte mogelijkheden voor langdurige revisie. Geautomatiseerde schrijfbeoordelingstools bieden schaalbaarheid, maar leveren vaak statische, gefragmenteerde opmerkingen op die leerlingen moeilijk kunnen vertalen naar betekenisvolle revisies 20,21,22. Vroege DWCF-studies toonden de effectiviteit van meerronde feedbackcycli aan, maar hun afhankelijkheid van door instructeurs geschreven correcties riep de haalbaarheid op in grote groepen 14,15,16,17. Recente generatieve AI-feedbackstudies rapporteren gelijkheid met feedback van leraren over schrijfresultaten, maar zonder gestructureerde moderatie of iteratieve presentatie18,19. STEP-DWCF-R combineert AI-schaalbaarheid met toezicht op leraren en iteratieve robotische AI-agentlevering, waardoor de werklast van leraren wordt verlaagd en de frequentie van revisies toeneemt.

We erkennen verschillende beperkingen. De relatief kleine steekproefgrootte (N = 32) beperkt de generaliseerbaarheid van onze bevindingen, en de studie moet worden gezien als een pilotonderzoek. De twee aandoeningen verschilden in feedbackdosering: de WCF-groep kreeg slechts één ronde feedback per taak, terwijl de STEP-DWCF-R groep 2–3 iteratieve rondes doorliep. Daarom weerspiegelt de superieure prestaties van de STEP-DWCF-R groep de gecombineerde effecten van meerdere revisiecycli, door AI gegenereerde feedback en moderatie van leraren, in plaats van het geïsoleerde effect van de robotische AI-agent of zijn leveringsmodaliteit. De robotische AI-agent is een puur virtuele webgebaseerde interface, waardoor de effecten niet los kunnen worden gescheiden van die van de iteratieve structuur zelf. Multimodale menselijke feedback (bijvoorbeeld spraak plus gebaar) werd niet opgenomen als controlevoorwaarde omdat het geen standaardpraktijk is in conventionele EFL-schrijflokalen en een apart experimenteel paradigma vereist. Toekomstige studies zouden dosis-gematchte controlegroepen moeten opnemen (bijvoorbeeld feedback van meerdere rondes van leraren) om deze componenten verder te ontwarren.

Ondanks deze beperkingen biedt het STEP-DWCF-R framework praktische richtlijnen voor AI-ondersteunde schrijfinstructie. De modulaire architectuur maakt integratie in leermanagementsystemen voor grootschalige EFL-cursussen mogelijk, en het gestructureerde vier-categorieschema kan worden aangepast voor academisch schrijven of disciplinespecifieke genres. Toekomstige iteraties kunnen multimodale levering verkennen om de theoretische betrokkenheidsvoordelen van belichaamde agenten te benutten, hoewel de huidige pilot de haalbaarheid van tekstgebaseerde iteratieve samenwerking tussen AI en leraren aantoont. Desalniettemin ondersteunt het consistente patroon tussen uitkomstmaten, procesindicatoren en sterke betrouwbaarheid tussen beoordelaars de haalbaarheid en potentiële effectiviteit van deze meercomponentenbenadering in vergelijkbare EFL-contexten.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben geen concurrerende belangen.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk werd gefinancierd door een Universiti Sains Malaysia Bridging Grant, projectnr: R501-LR-RND003-0000001342-00000.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersie 2.1; gebruikt voor webinterface van robotische AI-agent
GPT-5 APIOpenAIhttps://platform.openai.comModel gpt-5, temperatuur=0,7; voor gestructureerde JSON-feedbackgeneratie
Jinja2Pallets Projectshttps://jinja.palletsprojects.comServer-rendered templates voor webinterface
PythonPython Software Foundationhttps://www.python.orgVersie 3.10; backend-scripting
Windows 11Microsofthttps://www.microsoft.com/windowsBesturingssysteem voor AI-feedbacksysteem

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

Gerelateerde artikelen