$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Experimenten en Analyse
Alle 32 leerlingen leverden basisgegevens. Na de test waren gegevens beschikbaar voor 16 leerlingen in elke groep (WCF en STEP-DWCF-R; Figuur 2). De studietijdlijn en de metingen worden weergegeven in Figuur 3, en de end-to-end feedbackworkflow is geïllustreerd in Figuur 4. Experimentele opzet- en implementatieparameters voor ons AI-systeem worden weergegeven in Tabel 1. De analyses volgden het vooraf gespecificeerde plan met intentie-om-behandeling. We beoordelen eerst de basislijn-equivalentie (Tabel 2), rapporteren vervolgens de primaire uitkomst (Figuur 5 en Tabel 3), gevolgd door secundaire uitkomsten (Tabel 4) met robuustheids- en betrouwbaarheidscontroles.
Baseline-equivalentie
Bij de basislijn (week 1) waren de groepen beschrijvend vergelijkbaar op vooraf bepaalde covariaten, inclusief demografie en IELTS-schrijfprestaties voordat er feedback werd gegeven (Tabel 2). Individuele IELTS-componentscores worden toegewezen in stappen van 0,5 banden, terwijl de tabel groepsgemiddelden weergeeft. De algemene gemiddelden van week 1 (WCF = 5,625, STEP-DWCF-R = 5,500) worden berekend uit dezelfde arrays die zijn gebruikt om Figuur 5 te genereren. We voeren geen hypothesetests uit bij de basislijn; eventuele restonevenwichtigheden worden aangepakt door het pre-post ontwerp en de Group × Time-term in het mixed-effects model, en een post-test vergelijking aangepast voor de basislijn wordt gerapporteerd in de Protocolsectie.
Primaire uitkomst
Figuur 5 vat de veranderingen vóór de test samen, terwijl Tabel 3 en Tabel 5 modelschattingen en prestaties na de test tonen. Bij de uitgangsfase (week 1) waren de groepsgemiddelden 5,625 voor WCF en 5,500 voor STEP-DWCF-R, wat resulteerde in een niet-significant groepsverschil van −0,125 banden (SE = 0,133, t = − .939, df = 29,90, p = .355, 95% BI [−0,397, 0,147]). De basislijn in Tabel 3 schat daarom het WCF-gemiddelde van week 1 op 5,625 met 95% BI [5,419, 5,831] (SE = 0,097, df = 15). Van week 1 tot week 8 verbeterde de WCF met 0,3125 banden (SE = 0,128, t = 2,44, df = 15, p = .028, 95% BI [0,039, 0,586]; gestandaardiseerd binnen groep effect dz = 0,61). STEP-DWCF-R verbeterde met 1,0313 banden (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, 95% BI [0,732, 1,331]; dz = 1,84). Het lineaire gemengde effecten contrast voor de Group × Time-interactie—oftewel het verschil in verschillen—was 0,7188 banden (SE = 0,190, t = 3,78, df = 29,75, p = .0007, 95% BI [0,330, 1,107]; Tabel 3), wat grotere winsten onder STEP-DWCF-R aangeeft. Bij de post-test (week 8) gaven de geschatte marginale gemiddelden de voorkeur aan STEP-DWCF-R met 0,5938 banden (Welch-test op groepsgemiddelden: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, 95% BI [0,359, 0,829]). In overeenstemming hiermee toont de prestatietabel (Tabel 5) dat in week 8 13% van de WCF-leerlingen Overall ≥ 6,5 behaalde en 0% ≥ 7,0 (getallen 2/16 en 0/16), terwijl 81% van de STEP-DWCF-R-leerlingen ≥ 6,5 bereikte en 25% ≥ 7,0 bereikte (tellingen 13/16 en 4/16). Tabel 3 toont de bijbehorende fixed-effect schattingen en hun onzekerheid.
Uitkomsten op dimensieniveau
Tabel 4 vat de wijzigingen vóór de post samen over de vier dimensies van Taak 2. Task Response (TR) toonde een toename van Δ = 0,25 banden onder WCF versus Δ = 0,95 onder STEP-DWCF-R, wat resulteerde in ΔΔ = 0,70 met 95% BI [0,28, 1,12] en Holm-gecorrigeerde p = .006. Coherentie en cohesie (CC) vertoonden het grootste contrast: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, dus ΔΔ = 0,85 (95% BI [0,44, 1,26], adj-p = .002). Lexical Resource (LR) volgde hetzelfde patroon met WCF Δ = 0,35 en STEP-DWCF-R Δ = 0,95, wat ΔΔ = 0,60 opleverde (95% BI [0,18, 1,02], adj-p = .012). Grammaticaal bereik en nauwkeurigheid (GRA) verbeterd met Δ = 0,25 in WCF en Δ = 0,97 in STEP-DWCF-R; de resulterende ΔΔ = 0,72 droeg een 95% BI van [0,31, 1,13] met adj-p = .004. Over alle vier de dimensies heen bevoordeelt de Group×Time de STEP-DWCF-R na de Holm–Bonferroni-aanpassing.
Procesbewijs
Figuur 6 en Figuur 7 visualiseren de kernresultaten van het proces. Over weken 2–7 voltooide STEP-DWCF-R gemiddeld 2,26 revisierondes per taak (95% BI [2,17, 2,35]; n = 96), terwijl WCF 1,00 rondes was voor alle taken (n = 96). Het gemiddelde verschil was 1,26 rondes (95% BI [1,17, 1,35]); een Mann–Whitney-test bevestigde de scheiding van de verdelingen (U = 9216, z = 11,97, p < 10−30). Binnen STEP-DWCF-R daalden de gemiddelde fouten per ronde: 13,78 bij ronde 1 (95% BI [13,02, 14,54]; n = 96), 8,94 bij ronde 2 (95% BI [8,42, 9,46]; n = 96), en 6,16 bij ronde 3 (95% BI [5,20, 7,12]; n = 25). Een lineaire trend toegepast op waarnemingen per ronde schatte een afname van 4,14 fouten per ronde (95% BI [3,51, 4,78] in absolute magnitude; p < 10−12). Metingen van feedbackopname en tijd-op-taak zijn niet gecodeerd in Figuur 6 en Figuur 7 en worden daarom gerapporteerd in Tabel 7.
Betrouwbaarheid en robuustheid
De overeenstemming tussen beoordelaars voor de essays van week 1 en week 8 was van god tot uitstekend. Twee getrainde beoordelaars beoordeelden alle scripts onafhankelijk en waren blind voor groep en tijd; met gemiddelde metingen intraclass correlatiecoëfficiënt (ICC[2,2]) op de beoordelaarsgemiddelden varieerde de betrouwbaarheid van 0,86–0,93 over de Overall en de vier dimensies, en alle lagere 95% betrouwbaarheidslimieten overschreden 0,80 (Tabel 6). Diagnostische controles voor het primaire mixed-effects model gaven ongeveer normale residuen aan zonder materiaal-heteroscedasticiteit, en modellen die werden aangepast aan processamenvattingen op taakniveau toonden een dispersie dicht bij één. Gevoeligheidsanalyses gebaseerd op dezelfde dataset van week 1/week 8 leverden consistente conclusies op: een lineaire regressie die groepen na de test vergeleek en corrigeerde voor baselinescores schatte een aangepast verschil tussen groepen van 0,575 banden in week 8 (95% BI [0,336, 0,814], p = 3,15 × 10−5), en een beoordelaar-specifiek gemengd model met een willekeurig effect voor beoordelaar en gebruikte niet-gemiddelde scores leverde een groeps-× tijdschatting van 0,72 banden op (95% BI [0,33, 1.11], p = .0007), uitgelijnd met Tabel 3. De resultaten bleven ongewijzigd bij gebruik van robuuste standaardfouten en wanneer analyses beperkt waren tot volledige casussen, wat de conclusie versterkt dat STEP-DWCF-R grotere pre-post winsten oplevert dan WCF.
Kwalitatieve bevindingen
Voor kwalitatieve analyse onderzochten we STEP-DWCF-R revisietraces over alle zes taken en afsluitende schriftelijke reflecties van de 16 deelnemers in de STEP-DWCF-R groep. Twee programmeurs codeerden onafhankelijk de materialen met een gefocust deductief kader gebaseerd op de vier feedbackcategorieën (grammatica, woordenschat, organisatie, redeneren) en opnameredeneringen. De overeenstemming tussen coders was aanzienlijk met Cohens kappa van 0,78, en meningsverschillen werden door overleg opgelost.
Analyse onthulde vijf kernthema's: opname volgde een gefaseerd patroon, waarbij leerlingen oppervlaktekenmerken oplossen voordat ze organisatie en redeneren aanpakken; Span-specifieke, rubric-gekoppelde items waren uitvoerbaarder en werden vaak toegepast dan narratieve suggesties; De complementariteit tussen AI en leraren vormde prioriteit, met overlappende signalen die de focus verhoogden en lerarenmoderatie die conflicten oploste; De voordelen bereikten vroeg een piek, met hergebruik van organisatiesjablonen en lexicale patronen die op nieuwe prompts werden genoteerd; en leerlingen pasten strategieën aan over taken heen. Deze thema's informeren de procesdynamiek die wordt onderzocht in de sectie procesbewijs. Feedbackopname, aanhoudende fouten en time-on-task-metingen werden ook geregistreerd. Een samenvatting van deze aanvullende procesindicatoren wordt gepresenteerd in Tabel 7.
Interpretatie van representatieve resultaten
Gezamenlijk geven de uitkomst- en procesgegevens aan dat het STEP-DWCF-R-raamwerk geassocieerd is met een grotere verbetering in IELTS-schrijven dan traditionele feedback voor één ronde. De primaire uitkomst toont een verschil tussen groepen van 0,72 banden, waarbij de STEP-DWCF-R groep in totaal met 1,03 banden verbetert vergeleken met 0,31 banden in de WCF-groep. Dit voordeel was consistent over alle vier de analytische dimensies, met het grootste verschil in coherentie en cohesie bij 0,85 banden, wat suggereert dat gestructureerde, met rubrics gekoppelde, meerfasige feedback vooral de organisatieontwikkeling ondersteunde. Procesbewijs wijst verder uit dat iteratieve betrokkenheid ten grondslag ligt aan dit voordeel. STEP-DWCF-R leerlingen voltooiden gemiddeld 2,26 revisierondes per taak, en het aantal fouten daalde lineair met ongeveer 4,1 fouten per ronde. Zo omvatte een representatieve workflowcyclus GPT-5 die gestructureerde JSON-feedback genereerde over de vier categorieën, gevolgd door lerarenmoderatie om valse positieven te elimineren en de actiebaarheid te vergroten, en daaropvolgende levering via de robotic AI-agentinterface voor meerronde leerderrevisie. Deze bevindingen ondersteunen de haalbaarheid en potentiële effectiviteit van de geïntegreerde multicomponentenworkflow die AI-gegenereerde feedback, lerarenmoderatie en iteratieve robotische AI-agentlevering combineert, maar ze moeten niet worden geïnterpreteerd als bewijs van een enkel onderdeel op zichzelf. De dosisonbalans van 2–3 rondes versus één ronde en de bescheiden steekproefgrootte van 32 betekenen dat de waargenomen winsten het gecombineerde effect weerspiegelen van meer revisiemogelijkheden en gestructureerde feedback. Deze resultaten moeten worden gezien als veelbelovend pilotbewijs dat wacht op bevestiging in grotere, componentgecontroleerde onderzoeken.

Figuur 1. Theoretisch kader van DWCF (dynamische schriftelijke corrigerende feedback). De figuur geeft een bredere onderbouwing voor hoe DWCF mogelijk opereert; Het is opgenomen voor oriëntatie en niet als direct model van deze proef. Elementen die overeenkomen met de hier geanalyseerde uitkomsten en procesmetrieken zijn in de figuur weergegeven; Andere paden zijn illustratief en zijn niet geëvalueerd. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2. CONSORT stroomdiagram van deelnemers. Tweeëndertig leerlingen werden beoordeeld op geschiktheid; geen enkele werd uitgesloten. Alle deelnemers gaven toestemming en werden vervolgens in een verhouding van 1:1 gerandomiseerd naar ofwel de WCF-groep (n = 16) of de DWCF-groep (n = 16). Alle gerandomiseerde deelnemers ontvingen de toegewezen interventie; er waren geen verliezen door follow-up of stopzettingen, en alle 32 werden meegenomen in de eindanalyse. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3. Studietijdlijn en metingen. De proef duurde 8 weken: bij W1 voltooiden deelnemers de baseline IELTS Task 2 en werden gescoord; zes wekelijkse schrijfopdrachten werden uitgevoerd van W2 tot W7 (Taak 1–Taak 6), met groepsspecifieke feedback (WCF of DWCF) en revisies na elke taak. Procesmetingen, waaronder revisierondes, feedbackopname, persistent-error percentage en tijd op taak, werden voor elke taak geregistreerd tijdens W2–W7. Bij W8 werd de post-test IELTS Task 2 afgenomen en gescoord. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4. End-to-end feedbackworkflow. Leerlingen maken een begeleide eerste versie en ontvangen vervolgens groepsspecifieke feedback: WCF (één menselijke feedbackronde) of STEP-DWCF-R (AI-gegenereerde feedback met lerarenmoderatie, geleverd via robotische AI-agenten, met 2–3 iteratieve rondes). Leerlingen voltooien de revisierons(en) dienovereenkomstig. Het resultaat is de IELTS Task 2 bandscore; Procesmaten omvatten het aantal rondes, feedbackopname (aangenomen/gewijzigd/afgewezen), het percentage persistente fouten en de tijd die je op de taak bevindt. Het systeem registreert itemniveau-ID's, categorie/ernst, bron (AI vs. mens vs. robot), moderatieacties en opnamestatus. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5. Verandering van de IELTS-totale band van week 1 naar week 8 per groep. Punten geven de geschatte groepsgemiddelden met 95% betrouwbaarheidsintervallen, en de trajecten geven een grotere winst aan onder STEP-DWCF-R Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6. Revisierondes per taak per groep (weken 2–7). Datapunten vertegenwoordigen individuele taakrevisierondes voor de WCF (blauw) en STEP-DWCF-R (oranje) groepen. Horizontale lijnen en foutbalken geven groepsgemiddelden aan met 95% betrouwbaarheidsintervallen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7. Gemiddelde fouttellingen per ronde binnen STEP-DWCF-R met 95% BI. Punten geven het gemiddelde foutaantal aan bij elke feedbackronde (Ronde 1, Ronde 2, Ronde 3), en verticale lijnen vertegenwoordigen 95% betrouwbaarheidsintervallen (CI's). Klik hier om een grotere versie van deze figuur te bekijken.
| Component | Specificatie |
| Hardware | PC met 12e generatie Intel(R) Core(TM) i7-12700H (2,30 GHz), 32GB RAM, NVIDIA RTX 3080Ti GPU (16GB) |
| Besturingssysteem | Windows 11 |
| Backend | Flask~2.1 (Python~3.10) |
| Frontend | Jinja2 server-rendered templates |
| AI-modellen | OpenAI GPT-5 API (voor feedbackgeneratie), schema-gebaseerde nabewerking |
| Feedbackplanner | Aangepaste controller die meertrapsfeedback beheert (3 cycli) |
| Foutschema | Grammatica, woordenschat, organisatie, redeneren |
| Versiebeheer | GitHub |
| Houtkap | Automatische registratie van inzendingen, feedback en revisies voor analyse |
Tabel 1: Parameters voor experimentele opstelling en implementatie. Technische specificaties van het AI-feedbacksysteem, waaronder hardwareconfiguratie, besturingssysteem, backend en frontend frameworks, AI-modelinstellingen, feedbackplanner, foutschemacategorieën, versiebeheer en logginginfrastructuur.
| Variabele | WCF (n=16) | STEP-DWCF-R (n=16) |
| Leeftijd (jaren), gemiddelde (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Vrouwelijk, n (%) | 9 (56%) | 8 (50%) |
| Eerdere IELTS-voorbereiding (ja), n (%) | 7 (44%) | 6 (38%) |
| Jaren van eerdere schrijfinstructie | 3.1 (1.2) | 3.2 (1.1) |
| Baseline IELTS Overall (band) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (band) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (band) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (band) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (band) | 5.56 (0.48) | 5.49 (0.45) |
Tabel 2: Basislijnkenmerken van deelnemers per groep (Week 1). Demografische variabelen en pre-test International English Language Testing System (IELTS) Task 2 schrijfprestaties voor de WCF- en STEP-DWCF-R-groepen. Waarden zijn gemiddeld (standaarddeviatie) of n (%).
| Vast effect | Schatting | SE | DF | t | p | 95% BI |
| Intercept (WCF, Week~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Groep (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Tijd (Week~8 vs. Week~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Groep × Tijd | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tabel 3: Lineair mixed-effects model voor de IELTS totale band vanaf de scores van week 1/week 8. Fixed-effect schattingen, standaardfouten (SE), vrijheidsgraden (df), t-waarden, p-waarden en 95% betrouwbaarheidsintervallen (CI's) voor de Group × Time interactie en modeltermen.
| Dimensie | WCF Δ (bands) | STEP-DWCF-R Δ (banden) | ΔΔ (95% BI) | ADJ-P |
| Taakrespons (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Samenhang en cohesie (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Lexicale Bron (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Grammaticaal bereik en nauwkeurigheid (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tabel 4: Uitkomsten op dimensieniveau (Taak 2): veranderingen vóór en na de groep en verschillen tussen groepen. Pre-post veranderingen (Δ) en verschil-in-verschillen (ΔΔ) met 95% betrouwbaarheidsintervallen (BI's) en Holm-gecorrigeerde p-waarden voor Taakrespons (TR), Coherentie en Cohesie (CC), Lexicale Bron (LR) en Grammaticaal Bereik en Nauwkeurigheid (GRA).
| Drempel | WCF (%) | STEP-DWCF-R (%) |
| Totaal ≥ 6,5 | 13 | 81 |
| Totaal ≥ 7,0 | 0 | 25 |
Tabel 5: Besteding van de band na de test (week 8). Andeel leerlingen in de WCF- en STEP-DWCF-R-groepen dat IELTS bereikt Algemene bandscoredrempels van minstens 6,5 en minstens 7,0.
| Uitkomst | ICC | 95% BI |
| Algemeen | 0.91 | [0.86, 0.94] |
| Taakrespons (TR) | 0.88 | [0.82, 0.92] |
| Samenhang en cohesie (CC) | 0.9 | [0.85, 0.94] |
| Lexicale Bron (LR) | 0.89 | [0.83, 0.93] |
| Grammaticaal bereik en nauwkeurigheid (GRA) | 0.87 | [0.80, 0.91] |
Tabel 6: Inter-rater betrouwbaarheid voor IELTS-uitkomsten. Twee blinde beoordelaars op N = 64 essays (Week 1 en Week 8 samen). Gemiddeld meet intraclass correlatiecoëfficiënten (ICC[2,2]) met 95% betrouwbaarheidsintervallen (BI's) voor de totale en dimensiescores.
| Meting | WCF Group | STEP-DWCF-R Groep |
| Revisierondes per taak | 1 | 2.26 |
| Feedbackopnamepercentage (aangenomen of gewijzigd, %) | 68.5 | 82.3 |
| Persistent foutpercentage na de laatste ronde (%) | 67.4 | 45.6 |
| Tijd voor lerarenmoderatie (minimaal per taak) | 23.5 | 13.8 |
| Levertijd voor AI-agenten (minimaal per taak) | — | 3.9 |
| Studietijd voor leerlingen (minimaal per taak) | 44.8 | 71.2 |
| Totale tijd aan feedback + revisie (min/taak) | 68.3 | 88.9 |
Tabel 7: Betekent over 96 taken (6 taken × 16 leerlingen). Opname- en persistente foutpercentages werden berekend op het feedbackpuntniveau. Tijdmetingen werden vastgelegd via lerarenlogboeken en systeemtijdstempels. De levertijd van AI-agenten is niet van toepassing voor de WCF-groep.