$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Esperimenti e analisi
Tutti e 32 gli studenti hanno fornito dati di base. I dati post-test erano disponibili per 16 studenti in ciascun gruppo (WCF e STEP-DWCF-R; Figura 2). La timeline e le misure dello studio sono presentate nella Figura 3, e il flusso di lavoro di feedback end-to-end è illustrato nella Figura 4. I parametri sperimentali di configurazione e implementazione del nostro sistema di IA sono mostrati nella Tabella 1. Le analisi hanno seguito il piano predefinito con intenzione di trattare. Prima valutiamo l'equivalenza basale (Tabella 2), poi riportiamo l'esito primario (Figura 5 e Tabella 3), seguito dagli esiti secondari (Tabella 4) con controlli di robustezza e affidabilità.
Equivalenza di base
Alla fase di partenza (Settimana 1), i gruppi erano descrittivamente simili su covariate predefinite, inclusi dati demografici e performance di scrittura IELTS prima di qualsiasi feedback (Tabella 2). I punteggi individuali dei componenti IELTS sono assegnati in passaggi di 0,5 bande, mentre i rapporti della tabella sono i mezzi di gruppo. Le medie complessive della Settimana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) sono calcolate dagli stessi array utilizzati per generare la Figura 5. Non eseguiamo test di ipotesi al momento della base; qualsiasi squilibrio residuo viene affrontato dal progetto pre-post e dal termine Group × Time nel modello a effetti misti, e un confronto post-test aggiustato per la linea di base è riportato nella sezione Protocollo.
Risultato delle primarie
La Figura 5 riassume i cambiamenti pre-post-post, mentre le Tabelle 3 e 5 riportano le stime del modello e il raggiungimento post-test. Alla fase di partenza (Settimana 1), le medie dei gruppi erano 5,625 per WCF e 5,500 per STEP-DWCF-R, risultando una differenza di gruppo non significativa di −0,125 bande (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). La base nella Tabella 3, quindi, stima la media della WCF Settimana 1 a 5,625 con IC del 95% [5,419, 5,831] (SE = 0,097, df = 15). Dalla settimana 1 alla settimana 8, la WCF è migliorata di 0,3125 bande (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; effetto standardizzato all'interno del gruppo dz = 0,61). STEP-DWCF-R migliorato di 1,0313 bande (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). Il contrasto degli effetti misti lineari per l'interazione Gruppo × Tempo—cioè la differenza nelle differenze—era di 0,7188 bande (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabella 3), che indicano guadagni maggiori sotto STEP-DWCF-R. Al post-test (Settimana 8), le medie marginali stimate favorivano STEP-DWCF-R di 0,5938 bande (test di Welch sulle medie di gruppo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). In linea con ciò, la tabella dei risultati (Tabella 5) mostra che alla settimana 8 il 13% degli studenti WCF ha raggiunto ≥ complessivo 6,5 e lo 0% ha raggiunto ≥ 7,0 (conteggi 2/16 e 0/16), mentre l'81% degli studenti STEP-DWCF-R ha raggiunto ≥ 6,5 e il 25% ha raggiunto ≥ 7,0 (conteggi 13/16 e 4/16). La Tabella 3 riporta le corrispondenti stime degli effetti fissi e la loro incertezza.
Risultati a livello dimensionale
La Tabella 4 riassume i cambiamenti pre-post nelle quattro dimensioni del Compito 2. La Risposta al Compito (TR) ha mostrato un guadagno di Δ = 0,25 bande sotto WCF rispetto a Δ = 0,95 sotto STEP-DWCF-R, ottenendo ΔΔ = 0,70 con IC 95% [0,28, 1,12] e p aggiustato per Holm = 0,006. Coerenza e Coesione (CC) hanno mostrato il maggiore contrasto: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, quindi ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). La Risorsa Lessicale (LR) ha seguito lo stesso schema con WCF Δ = 0,35 e STEP-DWCF-R Δ = 0,95, dando ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). Grammatical Range and Accuracy (GRA) migliorate di Δ = 0,25 in WCF e Δ = 0,97 in STEP-DWCF-R; il risultante ΔΔ = 0,72 ha portato un IC del 95% di [0,31, 1,13] con adj-p = 0,004. In tutte e quattro le dimensioni, i contrasti Gruppo×Temporale hanno favorito STEP-DWCF-R dopo l'aggiustamento di Holm–Bonferroni.
Prove di Processo
La Figura 6 e la Figura 7 visualizzano i risultati del processo principale. Tra le settimane 2 e 7, STEP-DWCF-R ha completato in media 2,26 turni di revisione per compito (IC 95% [2,17, 2,35]; n = 96), mentre WCF è stato di 1,00 round per tutti i compiti (n = 96). La differenza media era di 1,26 round (IC 95% [1,17, 1,35]); un test di Mann–Whitney ha confermato la separazione delle distribuzioni (U = 9216, z = 11,97, p < 10−30). All'interno del STEP-DWCF-R, i conteggi medi degli errori sono diminuiti per round: 13,78 al primo round (IC 95% [13,02, 14,54]; n = 96), 8,94 al round 2 (IC 95% [8,42, 9,46]; n = 96) e 6,16 al round 3 (IC 95% [5,20, 7,12]; n = 25). Una tendenza lineare adattata alle osservazioni per round ha stimato un calo di 4,14 errori per round (IC 95% [3,51, 4,78] in grandezza assoluta; p < 10−12). Le misure di captazione del feedback e tempo sul compito non sono codificate nella Figura 6 e nella Figura 7 e sono quindi riportate nella Tabella 7.
Affidabilità e robustezza
L'accordo tra valutatori per i saggi della Settimana 1 e della Settimana 8 è stato da buono a eccellente. Due valutatori addestrati valutavano tutti gli script in modo indipendente e erano accepati al gruppo e al tempo; utilizzando misure medie del coefficiente di correlazione intraclasse (ICC[2,2]) sulle medie del valutatore, l'affidabilità variava da 0,86 a 0,93 in tutto il complesso, e le quattro dimensioni e tutti i limiti inferiori di confidenza del 95% superavano 0,80 (Tabella 6). I controlli diagnostici per il modello primario a effetti misti indicarono residui approssimativamente normali senza eterocedasticità materiale, e i modelli adattati a riassunti di processo a livello di compito mostrarono una dispersione vicina a uno. Le analisi di sensibilità basate sullo stesso dataset della Settimana 1/Settimana 8 hanno prodotto inferenze coerenti: una regressione lineare che ha confrontato i gruppi al post-test mentre aggiustava per i punteggi basali ha stimato una differenza aggiustata tra gruppi di 0,575 bande alla settimana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), e un modello misto specifico per valutatore che includeva un effetto casuale per il valutatore e utilizzava punteggi non medi hanno prodotto una stima Group × Time di 0,72 bande (IC 95% [0,33, 1.11], p = .0007), allineata con la Tabella 3. I risultati sono rimasti invariati utilizzando errori standard robusti e quando le analisi sono state limitate a casi completi, rafforzando la conclusione che STEP-DWCF-R produce guadagni pre-post maggiori rispetto al WCF.
Risultati qualitativi
Per l'analisi qualitativa, abbiamo esaminato le tracce di revisione STEP-DWCF-R in tutti e sei i compiti e le riflessioni scritte di fine corso dei 16 partecipanti del gruppo STEP-DWCF-R. Due programmatori hanno codificato indipendentemente i materiali utilizzando un quadro deduttivo focalizzato basato sulle quattro categorie di feedback (grammatica, vocabolario, organizzazione, ragionamento) e sulle ragioni di assorbimento. L'accordo tra codificatori era sostanziale con il kappa di Cohen di 0,78, e i disaccordi venivano risolti tramite discussione.
L'analisi ha rivelato cinque temi chiave: l'adcaptazione seguiva un modello a fasi, con gli studenti che risolvevano le caratteristiche superficiali prima di affrontare l'organizzazione e il ragionamento; gli elementi specifici per span, collegati alla rubrica di rubrica, erano più pratici e frequentemente adottati rispetto ai suggerimenti narrativi; La complementarità tra IA e insegnanti ha modellato la priorità, con segnali sovrapposti che aumentano l'attenzione e la moderazione degli insegnanti che risolve i conflitti; i benefici raggiunsero il picco precoce, con il riutilizzo di modelli organizzativi e modelli lessicali annotati nei nuovi prompt; e gli studenti hanno adattato strategie tra i compiti. Questi temi informano le dinamiche di processo esplorate nella sezione sulle prove di processo. Sono stati inoltre registrati l'assorbimento del feedback, gli errori persistenti e le misure di tempo sul compito. Un riassunto di questi indicatori aggiuntivi di processo è presentato nella Tabella 7.
Interpretazione dei risultati rappresentativi
Nel complesso, i dati di risultato e di processo indicano che il framework STEP-DWCF-R è associato a un miglioramento della scrittura IELTS maggiore rispetto al feedback tradizionale a singolo round. L'esito primario mostra una differenza tra gruppi di 0,72 bande, con il gruppo STEP-DWCF-R che migliora complessivamente di 1,03 bande rispetto a 0,31 bande nel gruppo WCF. Questo vantaggio è stato coerente in tutte e quattro le dimensioni analitiche, con il maggiore contrasto tra Coerenza e Coesione a bande di 0,85, suggerendo che un feedback strutturato, legato a rubriche e multi-stadio abbia particolarmente facilitato lo sviluppo organizzativo. Le evidenze di processo indicano inoltre che l'impegno iterativo è alla base di questo vantaggio. Gli studenti STEP-DWCF-R hanno completato in media 2,26 turni di revisione per compito, e il numero di errori è diminuito linearmente di circa 4,1 errori per turno. Ad esempio, un ciclo di workflow rappresentativo includeva GPT-5 che generava feedback JSON strutturato nelle quattro categorie, seguito dalla moderazione degli insegnanti per eliminare falsi positivi e migliorare l'azione, e la successiva erogazione tramite l'interfaccia dell'agente AI robotico per revisioni a più round da parte degli studenti. Questi risultati supportano la fattibilità e la potenziale efficacia del flusso di lavoro integrato multi-componente che combina feedback generato dall'IA, moderazione degli insegnanti e consegna iterativa di agenti robotici IA, ma non devono essere interpretati come prova di un singolo componente isolato. Lo squilibrio di dose di 2–3 round rispetto a un round e la modesta dimensione del campione di 32 significano che i guadagni osservati riflettano l'effetto combinato di maggiori opportunità di revisione e di feedback strutturato. Questi risultati dovrebbero essere considerati prove pilota promettenti in attesa di conferma in studi più ampi controllati su componenti.

Figura 1. Quadro teorico del DWCF (feedback correttivo scritto dinamico). La figura fornisce una motivazione più ampia su come il DWCF potrebbe operare; È incluso per orientamento piuttosto che come modello diretto di questo studio. Gli elementi corrispondenti ai risultati e alle metriche di processo qui analizzate sono indicati nella figura; Altri percorsi sono illustrativi e non sono stati valutati. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 2. Diagramma di flusso CONSORT dei partecipanti. Trentadue studenti sono stati valutati per l'idoneità; nessuno è stato escluso. Tutti i partecipanti hanno fornito il consenso e sono stati poi randomizzati in un rapporto 1:1 tra il gruppo WCF (n = 16) o il gruppo DWCF (n = 16). Tutti i partecipanti randomizzati hanno ricevuto l'intervento assegnato; Non ci furono perdite per follow-up o interruzioni, e tutte e 32 furono incluse nell'analisi finale. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 3. Cronologia e misure dello studio. La sperimentazione è durata 8 settimane: al W1, i partecipanti hanno completato il Compito IELTS 2 di base e sono stati valutati; sei compiti settimanali di scrittura sono stati somministrati da W2 a W7 (Task 1–Task 6), con feedback specifici per gruppo (WCF o DWCF) e revisioni dopo ogni task. Le misure di processo, inclusi round di revisione, rilevamento di feedback, tasso di errore persistente e tempo di utilizzo del compito, sono state registrate per ogni task durante W2–W7. Al W8, è stato somministrato e valutato il Compito IELTS 2 post-test. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 4. Flusso di lavoro di feedback end-to-end. Gli studenti producono una bozza iniziale sorvegliata, poi ricevono feedback specifici per gruppo: WCF (un round di feedback umano) o STEP-DWCF-R (feedback generato dall'IA con moderazione degli insegnanti, fornito tramite agenti AI robotici, con 2–3 turni iterativi). Gli studenti completano di conseguenza i round di revisione. Il risultato è il punteggio di fascia del Compito 2 dell'IELTS; Le misure di processo includono il numero di round, l'assorbimento del feedback (adottato/modificato/rifiutato), il tasso di errore persistente e il tempo di utilizzo del compito. Il sistema registra ID a livello di oggetto, categoria/gravità, origine (AI vs. umano vs. robot), azioni di moderazione e stato di rilevamento. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 5. Variazione della fascia complessiva IELTS dalla settimana 1 alla settimana 8 per gruppo. I punti indicano le medie di gruppo stimate con intervalli di confidenza del 95%, e le traiettorie indicano un guadagno maggiore sotto STEP-DWCF-R . Si prega di cliccare qui per visualizzare una versione più grande di questa figura.

Figura 6. Round di revisione per compito per gruppo (settimane 2–7). I punti dati rappresentano i singoli turni di revisione dei compiti per i gruppi WCF (blu) e STEP-DWCF-R (arancione). Le linee orizzontali e le barre di errore indicano medie di gruppo con intervalli di confidenza del 95%. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 7. Conteggio medio degli errori per ciclo all'interno di STEP-DWCF-R con IC al 95%. I punti indicano i conteggi medi degli errori a ogni round di feedback (Round 1, Round 2, Round 3), e le linee verticali rappresentano intervalli di confidenza (IC) al 95%. Clicca qui per visualizzare una versione più grande di questa figura.
| Componente | Specifiche |
| Hardware | PC con Intel(R) Core(TM) di 12ª generazione i7-12700H (2,30 GHz), 32GB RAM, GPU NVIDIA RTX 3080Ti (16GB) |
| Sistema operativo | Windows 11 |
| Backend | Flask~2.1 (Python~3.10) |
| Frontend | Modelli renderizzati per server Jinja2 |
| Modelli di IA | OpenAI GPT-5 API (per generazione di feedback), post-elaborazione basata su schema |
| Feedback Scheduler | Controller personalizzato che gestisce feedback multistadio (3 cicli) |
| Schema di errore | Grammatica, Vocabolario, Organizzazione, Ragionamento |
| Controllo delle versioni | GitHub |
| Disboscamento | Registrazione automatica delle sottomissioni, dei feedback e delle revisioni per l'analisi |
Tabella 1: Parametri di configurazione e implementazione sperimentale. Specifiche tecniche del sistema di feedback AI, inclusi la configurazione hardware, il sistema operativo, i framework backend e frontend, le impostazioni del modello AI, lo scheduler di feedback, le categorie di schema di errore, il controllo delle versioni e l'infrastruttura di loging.
| Variabile | WCF (n=16) | STEP-DWCF-R (n=16) |
| Età (anni), media (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Femmina, n (%) | 9 (56%) | 8 (50%) |
| Preparazione precedente all'IELTS (sì), n (%) | 7 (44%) | 6 (38%) |
| Anni di precedente formazione nella scrittura | 3.1 (1.2) | 3.2 (1.1) |
| Base IELTS Overall (band) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (band) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (band) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (band) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (band) | 5.56 (0.48) | 5.49 (0.45) |
Tabella 2: Caratteristiche di base dei partecipanti per gruppo (Settimana 1). Variabili demografiche e performance di scrittura del Task 2 del Sistema Internazionale di Testaggio Inglese (IELTS) pre-test per i gruppi WCF e STEP-DWCF-R. I valori sono media (deviazione standard) o n (%).
| Effetto fisso | Stima | SE | df | t | p | IC al 95% |
| Intercept (WCF, Settimana~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Gruppo (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Tempo (Settimana~8 vs. Settimana~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Tempo × Gruppo | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tabella 3: Modello lineare a effetti misti per la banda complessiva IELTS dai punteggi della Settimana 1/Settimana 8. Stime a effetto fisso, errori standard (SE), gradi di libertà (df), valori t, valori p e intervalli di confidenza (CI) al 95% per l'interazione temporale × Gruppo e i termini del modello.
| Dimensione | WCF Δ (bande) | STEP-DWCF-R Δ (bande) | ΔΔ (IC 95%) | ADJ-P |
| Risposta al Compito (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Coerenza e Coesione (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Risorsa lessicale (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Gamma e accuratezza grammaticale (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tabella 4: Risultati a livello di dimensione (Compito 2): cambiamenti pre-post e differenze tra gruppi. Cambiamenti pre-post (Δ) e differenze nelle differenze (ΔΔ) con intervalli di confidenza (IC) al 95% e valori p aggiustati per Task Response (TR), Coerenza e Coesione (CC), Risorsa Lessicale (LR) e Grammatical Range and Accuracy (GRA).
| Soglia | WCF (%) | STEP-DWCF-R (%) |
| Complessivo ≥ 6,5 | 13 | 81 |
| Complessivo ≥ 7.0 | 0 | 25 |
Tabella 5: Rendimento della fascia post-test (Settimana 8). Percentuale di studenti nei gruppi WCF e STEP-DWCF-R che raggiungono soglie complessive di punteggio IELTS di almeno 6,5 e almeno 7,0.
| Esito | ICC | IC al 95% |
| Complessivo | 0.91 | [0.86, 0.94] |
| Risposta al Compito (TR) | 0.88 | [0.82, 0.92] |
| Coerenza e Coesione (CC) | 0.9 | [0.85, 0.94] |
| Risorsa lessicale (LR) | 0.89 | [0.83, 0.93] |
| Gamma e accuratezza grammaticale (GRA) | 0.87 | [0.80, 0.91] |
Tabella 6: Affidabilità inter-valutatori per i risultati IELTS. Due valutatori in cieca su N = 64 saggi (Settimana 1 e Settimana 8 combinate). La media misura i coefficienti di correlazione intraclasse (ICC[2,2]) con intervalli di confidenza (IC) del 95% per i punteggi complessivi e dimensionali.
| Misura | Gruppo WCF | GRUPPO STEP-DWCF-R |
| Turni di revisione per compito | 1 | 2.26 |
| Tasso di rilevamento del feedback (adottato o modificato, %) | 68.5 | 82.3 |
| Tasso di errore persistente dopo il turno finale (%) | 67.4 | 45.6 |
| Tempo di moderazione per l'insegnante (minimo per compito) | 23.5 | 13.8 |
| Tempo di consegna dell'agente AI (minimo per compito) | — | 3.9 |
| Tempo di revisione dello studente (minimo per compito) | 44.8 | 71.2 |
| Tempo totale su feedback + revisione (min/compito) | 68.3 | 88.9 |
Tabella 7: Significa su 96 compiti (6 compiti × 16 studenti). I tassi di assorbimento e di errore persistente sono stati calcolati a livello di punto di retroazione. Le misurazioni del tempo venivano registrate tramite registri degli insegnanti e timestamp di sistema. I tempi di consegna degli agenti AI non sono applicabili per il gruppo WCF.