Articolo metodologico

Un Framework Dinamico di Feedback Correttivo Scritto che Integra la Consegna di Agenti AI per un supporto strutturato e iterativo di saggi

DOI:

10.3791/71992

24 luglio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio confronta il STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Correctione Feedback with Robotic AI Agent) per migliorare le prestazioni di scrittura IELTS attraverso AI multi-round e revisioni supportate dagli insegnanti.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I sistemi automatizzati di feedback per la scrittura sono diffusi, ma la maggior parte fornisce commenti statici e frammentati che forniscono un supporto limitato per la revisione. Questo studio valuta il framework STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Correctione Feedback with Robotic AI Agent), in cui il feedback generato dall'IA, moderato da un insegnante, viene fornito tramite un agente AI robotico attraverso più round iterativi all'interno di un ciclo di lavoro di una settimana. In uno studio quasi-sperimentale di otto settimane, 32 studenti EFL sono stati randomizzati sia per feedback correttivo scritto tradizionale (un round per compito) sia per STEP-DWCF-R. Entrambi i gruppi hanno completato i saggi IELTS Task 2 al basamento e al post-test, che sono stati anonimizzati, randomizzati e valutati da due valutatori indipendenti (ICC = 0,86–0,93). I modelli lineari a effetti misti hanno dimostrato che il gruppo STEP-DWCF-R ha mostrato guadagni significativamente maggiori nel punteggio complessivo delle bande (Δ = 1,03 vs. 0,31 bande) e in tutte e quattro le dimensioni analitiche, con il miglioramento più significativo osservato in Coerenza e Coesione. I dati di processo indicavano che gli studenti STEP-DWCF-R completavano in media 2,26 turni di revisione per compito, con il numero di errori che diminuiva linearmente tra i turni. Questi risultati suggeriscono che il framework integrato STEP-DWCF-R, che comprende feedback generato dall'IA, la moderazione degli insegnanti e la consegna iterativa di agenti AI robotici, è associato a un miglioramento della scrittura IELTS maggiore rispetto al feedback tradizionale a round singolo, indicando applicazioni pratiche per il feedback dinamico potenziato dall'IA nei contesti EFL.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il feedback correttivo scritto (WCF) rimane centrale nella pedagogia della scrittura di L2. Le evidenze mostrano che la WCF completa migliora la precisione degli studenti nel tempo e, quando allineata alla pratica in classe, può coesistere con approcci mirati, possibili in contesti autentici 1,2,3. Studi recenti in classe mostrano progressi duraturi in accuratezza e fluidità grazie a una WCF sostenuta e completa. La ricerca sull'ambito del feedback avverte che gli insegnanti dovrebbero indirizzare le forme in modo strategico invece di puntaretutto a 4,5,6,7,8,9. Parallelamente, la valutazione automatica della scrittura (AWE) e il feedback correttivo scritto automatizzato (AWCF) sono cresciuti rapidamente. I risultati sono contrastanti: alcuni studi mostrano miglioramenti nel rendimento dei compiti e nella gamma grammaticale con programmi in stile AWCF o Criterion, mentre altri non trovano vantaggi significativi rispetto al feedback riservato solo agli insegnanti o annotano revisioni prevalentemente locali e superficiali. Per riflettere questa eterogeneità, triangoliamo deliberatamente tra più studi AWCF invece di affidarci a una singola fonte 10,11,12,13.

Anche le convinzioni degli studenti su chi fornisce feedback sono importanti: un lavoro quasi-sperimentale su una fonte percepita indica che prestazioni e fiducia possono cambiare quando un feedback identico viene inquadrato come "insegnante" contro "automatizzato", sottolineando la necessità di tenere conto degli effetti di percezione nei progetti AWCF14,15. Estendendo questa linea, studi emergenti suggeriscono che i robot educativi, grazie alla loro presenza incarnata, possono anche agire come fornitori di feedback, influenzando potenzialmente il coinvolgimento e la fiducia degli studenti in modiunici 16.

Una linea di ricerca complementare, il feedback correttivo scritto dinamico (DWCF), enfatizza cicli di feedback frequenti, gestibili e completi con codifica e revisioni rapide. Evidenze provenienti da più contesti suggeriscono che il DWCF migliora in modo affidabile l'accuratezza (con effetti sulla frequenza sulla fluidità), anche se i risultati possono variare in base agli obiettivi del corso e alla popolazionedi studenti 17, 18, 19, 20. Infine, i primi studi sul feedback mediato dall'IA generativa riportano parità con il feedback degli insegnanti sui risultati di scrittura e sui potenziali benefici quando abbinati a una guida metalinguistica esplicita, stimolando una maggiore integrazione del feedback umano e AI nei contesti L221,22.

Per affrontare queste sfide, proponiamo il framework STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent), un innovativo sistema di feedback DWCF a più stadi progettato per fornire supporto di scrittura strutturato, iterativo e orientato ai processi. Il nostro sistema sfrutta il potere predittivo e generativo dei Large Language Models (LLM), con la distribuzione tramite un'interfaccia robotica di agenti AI e la moderazione degli insegnanti, per segmentare questioni di scrittura complesse in categorie gestibili, fornire feedback attraverso più round di interazione e valutarne l'efficacia utilizzando sia metriche basate sui risultati che basate sui processi. Trasformando il feedback in un processo strutturato e interattivo, STEP-DWCF-R promuove il supporto automatico della scrittura dalla correzione statica degli errori a un sistema più coinvolgente, integrato e orientato all'apprendimento.

I nostri contributi si concentrano su tre progressi integrati. Innanzitutto, proponiamo uno schema di rappresentazione strutturata del feedback che categorizza gli errori (ad esempio, grammatica, coerenza) in modo che il feedback LLM fornito da agenti tramite IA robotica sia sia applicabile sia pedagogicamente interpretabile. In secondo luogo, introduciamo un processo iterativo a più fasi che sequenzia feedback attraverso linguaggio, struttura e ragionamento su più turni per ridurre il carico cognitivo e approfondire il coinvolgimento. In terzo luogo, estendiamo la valutazione oltre i post-scores includendo metriche orientate al processo come la riduzione degli errori e l'adozione del feedback, offrendo una visione più ricca dell'impatto sull'apprendimento. I framework WCF rappresentano i primi tentativi di sistematizzare il feedback correttivo scritto all'interno della tecnologia educativa. Originati nella Valutazione Automatizzata della Scrittura (AWE) e nella Valutazione Automatica dei Saggi (AES), questi sistemi enfatizzavano il rilevamento degli errori e il punteggio di competenza13,14. Il loro contributo risiede nella scalabilità: migliaia di studenti potrebbero ricevere feedback senza il collo di bottiglia della valutazione umana. Tuttavia, questi quadri fornivano tipicamente commenti statici e frammentati, come controlli grammaticali, suggerimenti lessicali o punteggi globali che gli studenti faticavano a trasformare in revisionisignificative 23,24,25,26.

Col tempo, la ricerca WCF si è evoluta includendo approcci più mediati dalla tecnologia. Questi sistemi più recenti cercavano di cogliere aspetti più ampi della scrittura sfruttando metodicomputazionali 13,21. Più recentemente, il campo si è ulteriormente ampliato con tecnologie incorporate, dove i robot educativi hanno iniziato ad agire come fornitori di feedback in contesti scritti o di tutoraggio. La loro presenza fisica e le possibilità interattive introducono nuove dinamiche di fiducia, coinvolgimento e motivazione degli apprendisti. Eppure, nonostante questi sviluppi, l'orientamento dominante della WCF è rimasto focalizzatosull'esito 8,27: produrre punteggi o commenti isolati in modo one-shot. Pedagogicamente, questo orientamento è disallineato con la valutazione formativa, dove il feedback dovrebbe accompagnare la revisione attraverso le bozze e supportare il coinvolgimento metacognitivo 16,28,29,30,31. Così, il confine concettuale della WCF rivela un divario duraturo: il feedback viene fornito, ma non strutturato o sequenziato per guidare i processi di apprendimento.

In risposta a queste limitazioni, gli studiosi hanno iniziato a esplorare approcci più dinamici alla scrittura dei feedback. Le prime indagini hanno evidenziato l'importanza dei cicli di feedback iterativi, in cui gli studenti rivedono più volte sotto una guidastrutturata 17,32. È stata inoltre proposta una categorizzazione strutturata degli errori per migliorare l'interpretabilità del feedback e allinearla agli obiettivipedagogici 33,34. La nozione di framework DWCF consolida queste direzioni incorporando tre principi di progettazione: schemi di errore espliciti, consegna a stadi e iterativa, e metriche di valutazione orientate alprocesso 19,35. Invece di sopraffare gli studenti con una massa di correzioni contemporaneamente, DWCF distribuisce l'attenzione su strati di scrittura—accuratezza superficiale, coerenza strutturale e profondità argomentativa—attraverso i turnisuccessivi 17,33. La valutazione si estende oltre i punteggi finali includendo indicatori di processo come tassi di riduzione degli errori, adozione del feedback e profondità dellerevisioni 10, 19, 25. Nonostante il suo potenziale, le applicazioni pratiche della DWCF restano scarse, e la maggior parte degli studi non la mette in pratica in contesti su larga scala, mediati dalla tecnologia. 10,36,37. Questa lacuna evidenzia la necessità di quadri che non solo teorizzino la DWCF, ma ne dimostrino anche la fattibilità in contesti educativi reali. La Figura 1 mostra il quadro teorico più ampio della DWCF proposto nella letteratura. La figura fornisce una motivazione generale su come il feedback correttivo scritto dinamico possa operare a più livelli, includendo sia gli esiti misurati (ad esempio, accuratezza, coerenza) sia i costrutti teorizzati ma non misurati nel presente studio (ad esempio, riduzione dell'ansia nella scrittura, fluidità e complessità). È incluso per orientamento teorico piuttosto che come modello diretto di questo saggio. Gli elementi corrispondenti ai risultati e alle metriche di processo qui analizzate sono indicati nella figura; Altri percorsi sono illustrativi e non sono stati valutati in questo studio.

L'emergere degli LLM e dei sistemi multimodali offre un potente mezzo per operazionalizzare il DWCF su larga scala. Gli LLM, con le loro capacità zero-shot e few-shot, possono generare feedback contestualmente sensibili senza addestramento specifico percompito 21,22. Esperimenti recenti suggeriscono il loro potenziale per la segmentazione direttiva, il raffinamento a stadi e la generazione di spiegazioni, che sono strettamente allineati ai principi del DWCF 13,37,38,39. Ricerche complementari nella collaborazione umano-IA hanno dimostrato che i cicli iterativi di coinvolgimento, adattamento e adozione selettiva del feedback dell'IA possono migliorare sia la qualità dell'adozione che dellarevisione 25,30. Quando questi processi sono incarnati dai robot, l'interazione ha il potenziale teorico di diventare multimodale—combinando gesto, voce e presenza—il che può ulteriormente migliorare la percezione e la motivazione dellostudente 40.

Basati sulla Zona di Sviluppo Prossimale (ZPD)41, sull'Ipotesidell'Input 42 e sulla Teoria dell'Acquisizionedelle Competenze 43, posizionaamo STEP-DWCF-R come un controller che collega il supporto dello studente, l'elaborazione degli input e lo sviluppo delle competenze. Concretamente, la listazione collegata a rubriche, le liste consolidate tempestive e i cicli di IA, umani e robotici a più round moderati dall'insegnante operano a uno strato di integrazione che media la revisione e produce gli endpoint osservabili qui analizzati (IELTS Overall e TR/CC/LR/GRA; round, rilevamento, errori persistenti, tempo). Costrutti come la riduzione dell'ansia da scrittura sono teorizzati ma non misurati in questo studio.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo è stato approvato dal Comitato Etico della Scuola di Educazione Primaria, Shangrao Preschool Education College. Tutti i partecipanti erano adulti (≥18 anni) e avevano fornito un consenso informato scritto prima dello studio.

1. Progettazione dello studio

NOTA: A causa dei vincoli della classe di EFL disponibile (iscrizione totale N = 32), i partecipanti sono stati randomizzati in due gruppi da 16 ciascuno. Questa dimensione del campione, sebbene modesta, è stata ritenuta sufficiente per un'indagine pilota dato il pre-post design all'interno del soggetto e le grandi dimensioni d'effetto previste basate su studi DWCFprecedenti 17,18,19,20.

  1. Randomizzare i partecipanti in due gruppi (n = 16 ciascuno) usando una semplice randomizzazione. Genera la sequenza di allocazione utilizzando una lista di numeri casuali generata al computer. Nascondere l'assegnazione all'istruttore fino al completamento della valutazione di base.
  2. Assicurati che entrambi i gruppi siano insegnati dallo stesso docente utilizzando materiali identici e ore di contatto.
  3. Fornire feedback tramite correzione umana diretta (WCF) o tramite il flusso di lavoro STEP-DWCF-R, dove il feedback di IA e insegnanti viene presentato tramite un agente AI robotico.

2. Compiti di scrittura

  1. Somministrare un saggio di base per il Compito 2 IELTS nella Settimana 1 in condizioni d'esame (≥250 parole, 40 min).
  2. Svolgere sei compiti settimanali di scrittura (Settimane 2–7). Per ogni compito:
    1. In WCF, fornisci un solo round di feedback umano sul saggio.
    2. Nel STEP-DWCF-R, genera feedback dell'IA, moderalo con un insegnante umano e istrui l'agente AI robotico a presentare il feedback in modo interattivo allo studente.
    3. Nel STEP-DWCF-R, si ripete il ciclo di feedback STEP-DWCF-R per 2–3 round fino al completamento della revisione.
  3. Somministra un saggio post-test IELTS Task 2 nella settimana 8 alle stesse condizioni dell'esame. Segui lo stesso calendario settimanale per ogni compito in entrambi i gruppi. Fornire feedback del Round 1 entro 24 ore dalla bozza di invio nel STEP-DWCF-R. Richiedere agli studenti di rivedere e ripresentare entro 48 ore. Segui lo stesso programma per i round successivi e completa tutti i cicli entro la finestra settimanale.

3. Flusso di lavoro di feedback

  1. Elaborare ogni bozza di studente con l'API GPT-5 (modello = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) per generare feedback dettagliati in quattro categorie fisse: Grammatica, Vocabolario, Organizzazione e Ragionamento. Il prompt di sistema esatto e lo schema di output JSON sono forniti nel repository open-source (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, funzione build_prompt() e normalize_reasoning()).
  2. Moderare il feedback generato dall'IA secondo i seguenti criteri: rimuovere falsi positivi o commenti inaccurati; aggiungere questioni critiche trascurate in linea con la rubrica IELTS; assicurati che i commenti siano concreti e incoraggianti; e mantenere la coerenza con lo schema a quattro categorie. Registra manualmente le decisioni di moderazione.
  3. Salva il feedback moderato in formato JSON e caricalo sull'interfaccia dell'agente AI robotico (un'applicazione web leggera di Flask).
  4. Presenta feedback tramite l'interfaccia web. Visualizza tabelle strutturate per ogni categoria (riassunto, problemi e consigli per la revisione). Registra i ricevimenti e le richieste di chiarimenti degli studenti tramite i log di sistema. Istruisci gli studenti a rivedere e ripresentare le loro bozze. Ripeti il ciclo fino a tre volte per compito.
  5. Verifica e risoluzione dei problemi.
    1. Verifica la generazione di feedback con successo dell'IA confermando che l'output sia JSON valido contenente tutte e quattro le categorie richieste: Grammatica, Vocabolario, Organizzazione e Ragionamento. Conferma il completamento della moderazione degli insegnanti assicurandoti che i falsi positivi siano stati rimossi, che siano stati aggiunti i problemi mancanti e che il file JSON moderato sia stato salvato.
    2. Carica il file JSON moderato sull'interfaccia dell'agente AI robotico basato su Flask tramite l'endpoint di upload. Conferma il caricamento riuscito tramite il messaggio di conferma dell'interfaccia e la voce del registro del database. Registra automaticamente le ripresentazioni degli studenti tramite i registri di invio dei moduli.
    3. Processare output IA non conformi (ad esempio, JSON malformato, categorie mancanti o feedback impreciso) utilizzando le funzioni ensure_json() e normalize_reasoning(). Rigenerare l'output API con parametri di prompt modificati secondo necessità. Correggi manualmente il JSON durante la moderazione dell'insegnante, se necessario, per assicurarti che tutte e quattro le categorie siano presenti prima del carico.
      NOTA: Esempi di feedback grezzo dell'IA, versioni moderate dall'insegnante e l'output dell'interfaccia consegnata sono disponibili nel repository (dati/cartelle e quaderni/).

4. Misurazione degli Esiti

  1. Definisci l'esito primario come la variazione del punteggio complessivo della fascia IELTS (dalla Settimana 1 alla Settimana 8).
  2. Definire gli esiti secondari come cambiamenti nella Risposta al Compito, Coerenza e Coesione, Risorsa Lessicale e Gamma e Accuratezza Gramaticale.
  3. Assegna due valutatori indipendenti con esperienza nella valutazione del Compito 2 IELTS per valutare tutti i saggi. Rimuovi nomi e identificatori di gruppo da tutti i saggi. Randomizza l'ordine dei saggi e valutatori alla cieca per compiti di gruppo e tempi. Usa lo stesso prompt del Compito 2 IELTS sia per la base della settimana 1 che per la settimana 8 post-test. Risolvere i disaccordi di punteggio superiore a 0,5 bande attraverso la discussione fino a raggiungere il consenso. Valutare l'affidabilità inter-valutatori utilizzando il coefficiente di correlazione intraclasse delle misure medie (ICC[2,2]).

5. Misurazione del processo

  1. Registra il numero di turni di revisione per compito.
  2. Registrazione dell'acquisizione dei feedback (adottati, modificati, rifiutati) da parte degli studenti.
  3. Monitorare gli errori persistenti tra un ciclo e l'altro.
  4. Annota il tempo di feedback dell'insegnante, il tempo di consegna del robot e il tempo di revisione dello studente.

6. Analisi dei Dati

  1. Adattare i modelli di effetti misti lineari con interazioni Gruppo, Tempo e Gruppo × Tempo.
  2. Applicare modelli generalizzati a effetti misti per le misure di processo.
  3. Riportate le dimensioni degli effetti, gli intervalli di confidenza al 95% e i valori p corretti.
  4. Effettuare controlli di robustezza con ANCOVA, modelli specifici per valutatori e SE robusti.

7. Disponibilità del codice

Tutto il codice, i prompt, gli schemi JSON e i file di implementazione di esempio necessari per riprodurre il sistema STEP-DWCF-R sono disponibili apertamente su https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esperimenti e analisi

Tutti e 32 gli studenti hanno fornito dati di base. I dati post-test erano disponibili per 16 studenti in ciascun gruppo (WCF e STEP-DWCF-R; Figura 2). La timeline e le misure dello studio sono presentate nella Figura 3, e il flusso di lavoro di feedback end-to-end è illustrato nella Figura 4. I parametri sperimentali di configurazione e implementazione del nostro sistema di IA sono mostrati nella Tabella 1. Le analisi hanno seguito il piano predefinito con intenzione di trattare. Prima valutiamo l'equivalenza basale (Tabella 2), poi riportiamo l'esito primario (Figura 5 e Tabella 3), seguito dagli esiti secondari (Tabella 4) con controlli di robustezza e affidabilità.

Equivalenza di base

Alla fase di partenza (Settimana 1), i gruppi erano descrittivamente simili su covariate predefinite, inclusi dati demografici e performance di scrittura IELTS prima di qualsiasi feedback (Tabella 2). I punteggi individuali dei componenti IELTS sono assegnati in passaggi di 0,5 bande, mentre i rapporti della tabella sono i mezzi di gruppo. Le medie complessive della Settimana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) sono calcolate dagli stessi array utilizzati per generare la Figura 5. Non eseguiamo test di ipotesi al momento della base; qualsiasi squilibrio residuo viene affrontato dal progetto pre-post e dal termine Group × Time nel modello a effetti misti, e un confronto post-test aggiustato per la linea di base è riportato nella sezione Protocollo.

Risultato delle primarie

La Figura 5 riassume i cambiamenti pre-post-post, mentre le Tabelle 3 e 5 riportano le stime del modello e il raggiungimento post-test. Alla fase di partenza (Settimana 1), le medie dei gruppi erano 5,625 per WCF e 5,500 per STEP-DWCF-R, risultando una differenza di gruppo non significativa di −0,125 bande (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). La base nella Tabella 3, quindi, stima la media della WCF Settimana 1 a 5,625 con IC del 95% [5,419, 5,831] (SE = 0,097, df = 15). Dalla settimana 1 alla settimana 8, la WCF è migliorata di 0,3125 bande (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; effetto standardizzato all'interno del gruppo dz = 0,61). STEP-DWCF-R migliorato di 1,0313 bande (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). Il contrasto degli effetti misti lineari per l'interazione Gruppo × Tempo—cioè la differenza nelle differenze—era di 0,7188 bande (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabella 3), che indicano guadagni maggiori sotto STEP-DWCF-R. Al post-test (Settimana 8), le medie marginali stimate favorivano STEP-DWCF-R di 0,5938 bande (test di Welch sulle medie di gruppo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). In linea con ciò, la tabella dei risultati (Tabella 5) mostra che alla settimana 8 il 13% degli studenti WCF ha raggiunto ≥ complessivo 6,5 e lo 0% ha raggiunto ≥ 7,0 (conteggi 2/16 e 0/16), mentre l'81% degli studenti STEP-DWCF-R ha raggiunto ≥ 6,5 e il 25% ha raggiunto ≥ 7,0 (conteggi 13/16 e 4/16). La Tabella 3 riporta le corrispondenti stime degli effetti fissi e la loro incertezza.

Risultati a livello dimensionale

La Tabella 4 riassume i cambiamenti pre-post nelle quattro dimensioni del Compito 2. La Risposta al Compito (TR) ha mostrato un guadagno di Δ = 0,25 bande sotto WCF rispetto a Δ = 0,95 sotto STEP-DWCF-R, ottenendo ΔΔ = 0,70 con IC 95% [0,28, 1,12] e p aggiustato per Holm = 0,006. Coerenza e Coesione (CC) hanno mostrato il maggiore contrasto: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, quindi ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). La Risorsa Lessicale (LR) ha seguito lo stesso schema con WCF Δ = 0,35 e STEP-DWCF-R Δ = 0,95, dando ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). Grammatical Range and Accuracy (GRA) migliorate di Δ = 0,25 in WCF e Δ = 0,97 in STEP-DWCF-R; il risultante ΔΔ = 0,72 ha portato un IC del 95% di [0,31, 1,13] con adj-p = 0,004. In tutte e quattro le dimensioni, i contrasti Gruppo×Temporale hanno favorito STEP-DWCF-R dopo l'aggiustamento di Holm–Bonferroni.

Prove di Processo

La Figura 6 e la Figura 7 visualizzano i risultati del processo principale. Tra le settimane 2 e 7, STEP-DWCF-R ha completato in media 2,26 turni di revisione per compito (IC 95% [2,17, 2,35]; n = 96), mentre WCF è stato di 1,00 round per tutti i compiti (n = 96). La differenza media era di 1,26 round (IC 95% [1,17, 1,35]); un test di Mann–Whitney ha confermato la separazione delle distribuzioni (U = 9216, z = 11,97, p < 10−30). All'interno del STEP-DWCF-R, i conteggi medi degli errori sono diminuiti per round: 13,78 al primo round (IC 95% [13,02, 14,54]; n = 96), 8,94 al round 2 (IC 95% [8,42, 9,46]; n = 96) e 6,16 al round 3 (IC 95% [5,20, 7,12]; n = 25). Una tendenza lineare adattata alle osservazioni per round ha stimato un calo di 4,14 errori per round (IC 95% [3,51, 4,78] in grandezza assoluta; p < 10−12). Le misure di captazione del feedback e tempo sul compito non sono codificate nella Figura 6 e nella Figura 7 e sono quindi riportate nella Tabella 7.

Affidabilità e robustezza

L'accordo tra valutatori per i saggi della Settimana 1 e della Settimana 8 è stato da buono a eccellente. Due valutatori addestrati valutavano tutti gli script in modo indipendente e erano accepati al gruppo e al tempo; utilizzando misure medie del coefficiente di correlazione intraclasse (ICC[2,2]) sulle medie del valutatore, l'affidabilità variava da 0,86 a 0,93 in tutto il complesso, e le quattro dimensioni e tutti i limiti inferiori di confidenza del 95% superavano 0,80 (Tabella 6). I controlli diagnostici per il modello primario a effetti misti indicarono residui approssimativamente normali senza eterocedasticità materiale, e i modelli adattati a riassunti di processo a livello di compito mostrarono una dispersione vicina a uno. Le analisi di sensibilità basate sullo stesso dataset della Settimana 1/Settimana 8 hanno prodotto inferenze coerenti: una regressione lineare che ha confrontato i gruppi al post-test mentre aggiustava per i punteggi basali ha stimato una differenza aggiustata tra gruppi di 0,575 bande alla settimana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), e un modello misto specifico per valutatore che includeva un effetto casuale per il valutatore e utilizzava punteggi non medi hanno prodotto una stima Group × Time di 0,72 bande (IC 95% [0,33, 1.11], p = .0007), allineata con la Tabella 3. I risultati sono rimasti invariati utilizzando errori standard robusti e quando le analisi sono state limitate a casi completi, rafforzando la conclusione che STEP-DWCF-R produce guadagni pre-post maggiori rispetto al WCF.

Risultati qualitativi

Per l'analisi qualitativa, abbiamo esaminato le tracce di revisione STEP-DWCF-R in tutti e sei i compiti e le riflessioni scritte di fine corso dei 16 partecipanti del gruppo STEP-DWCF-R. Due programmatori hanno codificato indipendentemente i materiali utilizzando un quadro deduttivo focalizzato basato sulle quattro categorie di feedback (grammatica, vocabolario, organizzazione, ragionamento) e sulle ragioni di assorbimento. L'accordo tra codificatori era sostanziale con il kappa di Cohen di 0,78, e i disaccordi venivano risolti tramite discussione.

L'analisi ha rivelato cinque temi chiave: l'adcaptazione seguiva un modello a fasi, con gli studenti che risolvevano le caratteristiche superficiali prima di affrontare l'organizzazione e il ragionamento; gli elementi specifici per span, collegati alla rubrica di rubrica, erano più pratici e frequentemente adottati rispetto ai suggerimenti narrativi; La complementarità tra IA e insegnanti ha modellato la priorità, con segnali sovrapposti che aumentano l'attenzione e la moderazione degli insegnanti che risolve i conflitti; i benefici raggiunsero il picco precoce, con il riutilizzo di modelli organizzativi e modelli lessicali annotati nei nuovi prompt; e gli studenti hanno adattato strategie tra i compiti. Questi temi informano le dinamiche di processo esplorate nella sezione sulle prove di processo. Sono stati inoltre registrati l'assorbimento del feedback, gli errori persistenti e le misure di tempo sul compito. Un riassunto di questi indicatori aggiuntivi di processo è presentato nella Tabella 7.

Interpretazione dei risultati rappresentativi

Nel complesso, i dati di risultato e di processo indicano che il framework STEP-DWCF-R è associato a un miglioramento della scrittura IELTS maggiore rispetto al feedback tradizionale a singolo round. L'esito primario mostra una differenza tra gruppi di 0,72 bande, con il gruppo STEP-DWCF-R che migliora complessivamente di 1,03 bande rispetto a 0,31 bande nel gruppo WCF. Questo vantaggio è stato coerente in tutte e quattro le dimensioni analitiche, con il maggiore contrasto tra Coerenza e Coesione a bande di 0,85, suggerendo che un feedback strutturato, legato a rubriche e multi-stadio abbia particolarmente facilitato lo sviluppo organizzativo. Le evidenze di processo indicano inoltre che l'impegno iterativo è alla base di questo vantaggio. Gli studenti STEP-DWCF-R hanno completato in media 2,26 turni di revisione per compito, e il numero di errori è diminuito linearmente di circa 4,1 errori per turno. Ad esempio, un ciclo di workflow rappresentativo includeva GPT-5 che generava feedback JSON strutturato nelle quattro categorie, seguito dalla moderazione degli insegnanti per eliminare falsi positivi e migliorare l'azione, e la successiva erogazione tramite l'interfaccia dell'agente AI robotico per revisioni a più round da parte degli studenti. Questi risultati supportano la fattibilità e la potenziale efficacia del flusso di lavoro integrato multi-componente che combina feedback generato dall'IA, moderazione degli insegnanti e consegna iterativa di agenti robotici IA, ma non devono essere interpretati come prova di un singolo componente isolato. Lo squilibrio di dose di 2–3 round rispetto a un round e la modesta dimensione del campione di 32 significano che i guadagni osservati riflettano l'effetto combinato di maggiori opportunità di revisione e di feedback strutturato. Questi risultati dovrebbero essere considerati prove pilota promettenti in attesa di conferma in studi più ampi controllati su componenti.

figure-results-1
Figura 1. Quadro teorico del DWCF (feedback correttivo scritto dinamico). La figura fornisce una motivazione più ampia su come il DWCF potrebbe operare; È incluso per orientamento piuttosto che come modello diretto di questo studio. Gli elementi corrispondenti ai risultati e alle metriche di processo qui analizzate sono indicati nella figura; Altri percorsi sono illustrativi e non sono stati valutati. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-2
Figura 2. Diagramma di flusso CONSORT dei partecipanti. Trentadue studenti sono stati valutati per l'idoneità; nessuno è stato escluso. Tutti i partecipanti hanno fornito il consenso e sono stati poi randomizzati in un rapporto 1:1 tra il gruppo WCF (n = 16) o il gruppo DWCF (n = 16). Tutti i partecipanti randomizzati hanno ricevuto l'intervento assegnato; Non ci furono perdite per follow-up o interruzioni, e tutte e 32 furono incluse nell'analisi finale. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-3
Figura 3. Cronologia e misure dello studio. La sperimentazione è durata 8 settimane: al W1, i partecipanti hanno completato il Compito IELTS 2 di base e sono stati valutati; sei compiti settimanali di scrittura sono stati somministrati da W2 a W7 (Task 1–Task 6), con feedback specifici per gruppo (WCF o DWCF) e revisioni dopo ogni task. Le misure di processo, inclusi round di revisione, rilevamento di feedback, tasso di errore persistente e tempo di utilizzo del compito, sono state registrate per ogni task durante W2–W7. Al W8, è stato somministrato e valutato il Compito IELTS 2 post-test. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-4
Figura 4. Flusso di lavoro di feedback end-to-end. Gli studenti producono una bozza iniziale sorvegliata, poi ricevono feedback specifici per gruppo: WCF (un round di feedback umano) o STEP-DWCF-R (feedback generato dall'IA con moderazione degli insegnanti, fornito tramite agenti AI robotici, con 2–3 turni iterativi). Gli studenti completano di conseguenza i round di revisione. Il risultato è il punteggio di fascia del Compito 2 dell'IELTS; Le misure di processo includono il numero di round, l'assorbimento del feedback (adottato/modificato/rifiutato), il tasso di errore persistente e il tempo di utilizzo del compito. Il sistema registra ID a livello di oggetto, categoria/gravità, origine (AI vs. umano vs. robot), azioni di moderazione e stato di rilevamento. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-5
Figura 5. Variazione della fascia complessiva IELTS dalla settimana 1 alla settimana 8 per gruppo. I punti indicano le medie di gruppo stimate con intervalli di confidenza del 95%, e le traiettorie indicano un guadagno maggiore sotto STEP-DWCF-R . Si prega di cliccare qui per visualizzare una versione più grande di questa figura.

figure-results-6
Figura 6. Round di revisione per compito per gruppo (settimane 2–7). I punti dati rappresentano i singoli turni di revisione dei compiti per i gruppi WCF (blu) e STEP-DWCF-R (arancione). Le linee orizzontali e le barre di errore indicano medie di gruppo con intervalli di confidenza del 95%. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-7
Figura 7. Conteggio medio degli errori per ciclo all'interno di STEP-DWCF-R con IC al 95%. I punti indicano i conteggi medi degli errori a ogni round di feedback (Round 1, Round 2, Round 3), e le linee verticali rappresentano intervalli di confidenza (IC) al 95%. Clicca qui per visualizzare una versione più grande di questa figura.

ComponenteSpecifiche
HardwarePC con Intel(R) Core(TM) di 12ª generazione i7-12700H (2,30 GHz), 32GB RAM, GPU NVIDIA RTX 3080Ti (16GB)
Sistema operativoWindows 11
BackendFlask~2.1 (Python~3.10)
FrontendModelli renderizzati per server Jinja2
Modelli di IAOpenAI GPT-5 API (per generazione di feedback), post-elaborazione basata su schema
Feedback SchedulerController personalizzato che gestisce feedback multistadio (3 cicli)
Schema di erroreGrammatica, Vocabolario, Organizzazione, Ragionamento
Controllo delle versioniGitHub
DisboscamentoRegistrazione automatica delle sottomissioni, dei feedback e delle revisioni per l'analisi

Tabella 1: Parametri di configurazione e implementazione sperimentale. Specifiche tecniche del sistema di feedback AI, inclusi la configurazione hardware, il sistema operativo, i framework backend e frontend, le impostazioni del modello AI, lo scheduler di feedback, le categorie di schema di errore, il controllo delle versioni e l'infrastruttura di loging.

VariabileWCF (n=16)STEP-DWCF-R (n=16)
Età (anni), media (SD)20.9 (1.5)21.1 (1.6)
Femmina, n (%)9 (56%)8 (50%)
Preparazione precedente all'IELTS (sì), n (%)7 (44%)6 (38%)
Anni di precedente formazione nella scrittura3.1 (1.2)3.2 (1.1)
Base IELTS Overall (band)5.625 (0.387)5.500 (0.365)
Baseline TR (band)5.56 (0.50)5.50 (0.50)
Baseline CC (band)5.62 (0.49)5.53 (0.49)
Baseline LR (band)5.60 (0.46)5.52 (0.46)
Baseline GRA (band)5.56 (0.48)5.49 (0.45)

Tabella 2: Caratteristiche di base dei partecipanti per gruppo (Settimana 1). Variabili demografiche e performance di scrittura del Task 2 del Sistema Internazionale di Testaggio Inglese (IELTS) pre-test per i gruppi WCF e STEP-DWCF-R. I valori sono media (deviazione standard) o n (%).

Effetto fissoStimaSEdftpIC al 95%
Intercept (WCF, Settimana~1)5.6250.0971558.1<.001[5.419, 5.831]
Gruppo (STEP-DWCF-R vs. WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Tempo (Settimana~8 vs. Settimana~1)0.31250.128152.44.028[0.039, 0.586]
Tempo × Gruppo0.71880.1929.753.78.0007[0.330, 1.107]

Tabella 3: Modello lineare a effetti misti per la banda complessiva IELTS dai punteggi della Settimana 1/Settimana 8. Stime a effetto fisso, errori standard (SE), gradi di libertà (df), valori t, valori p e intervalli di confidenza (CI) al 95% per l'interazione temporale × Gruppo e i termini del modello.

DimensioneWCF Δ (bande)STEP-DWCF-R Δ (bande)ΔΔ (IC 95%)ADJ-P
Risposta al Compito (TR)0.250.950.70 (0.28, 1.12).006
Coerenza e Coesione (CC)0.31.150.85 (0.44, 1.26).002
Risorsa lessicale (LR)0.350.950.60 (0.18, 1.02).012
Gamma e accuratezza grammaticale (GRA)0.250.970.72 (0.31, 1.13).004

Tabella 4: Risultati a livello di dimensione (Compito 2): cambiamenti pre-post e differenze tra gruppi. Cambiamenti pre-post (Δ) e differenze nelle differenze (ΔΔ) con intervalli di confidenza (IC) al 95% e valori p aggiustati per Task Response (TR), Coerenza e Coesione (CC), Risorsa Lessicale (LR) e Grammatical Range and Accuracy (GRA).

SogliaWCF (%)STEP-DWCF-R (%)
Complessivo ≥ 6,51381
Complessivo ≥ 7.0025

Tabella 5: Rendimento della fascia post-test (Settimana 8). Percentuale di studenti nei gruppi WCF e STEP-DWCF-R che raggiungono soglie complessive di punteggio IELTS di almeno 6,5 e almeno 7,0.

EsitoICCIC al 95%
Complessivo0.91[0.86, 0.94]
Risposta al Compito (TR)0.88[0.82, 0.92]
Coerenza e Coesione (CC)0.9[0.85, 0.94]
Risorsa lessicale (LR)0.89[0.83, 0.93]
Gamma e accuratezza grammaticale (GRA)0.87[0.80, 0.91]

Tabella 6: Affidabilità inter-valutatori per i risultati IELTS. Due valutatori in cieca su N = 64 saggi (Settimana 1 e Settimana 8 combinate). La media misura i coefficienti di correlazione intraclasse (ICC[2,2]) con intervalli di confidenza (IC) del 95% per i punteggi complessivi e dimensionali.

MisuraGruppo WCFGRUPPO STEP-DWCF-R
Turni di revisione per compito12.26
Tasso di rilevamento del feedback (adottato o modificato, %)68.582.3
Tasso di errore persistente dopo il turno finale (%)67.445.6
Tempo di moderazione per l'insegnante (minimo per compito)23.513.8
Tempo di consegna dell'agente AI (minimo per compito)3.9
Tempo di revisione dello studente (minimo per compito)44.871.2
Tempo totale su feedback + revisione (min/compito)68.388.9

Tabella 7: Significa su 96 compiti (6 compiti × 16 studenti). I tassi di assorbimento e di errore persistente sono stati calcolati a livello di punto di retroazione. Le misurazioni del tempo venivano registrate tramite registri degli insegnanti e timestamp di sistema. I tempi di consegna degli agenti AI non sono applicabili per il gruppo WCF.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha confrontato STEP-DWCF-R, un framework di feedback correttivo scritto dinamico multicomponente, con un agente AI robotico, con WCF a round singolo in un corso di scrittura IELTS di otto settimane. Il STEP-DWCF-R ha prodotto maggiori guadagni pre-post nella fascia complessiva e tra TR, CC, LR e GRA. Anche gli studenti con STEP-DWCF-R hanno completato più turni di revisione e mostrato una riduzione degli errori più rapida, con modelli che stimavano un calo di circa 4,1 errori per turno. Il miglioramento maggiore è stato nella coerenza e coesione (ΔΔ = 0,85), indicando che un feedback strutturato e legato a una rubrica favorisce un'organizzazione e una precisione di livello superiore. Questi risultati sono in linea con ricerche precedenti del DWCF che hanno mostrato che il feedback iterativo e completo migliora la precisione della scrittura neltempo 14,15,16,17.

Il flusso di lavoro STEP-DWCF-R prevede tre fasi critiche. Innanzitutto, il sistema di IA genera feedback dettagliati in quattro categorie (Grammatica, Vocabolario, Organizzazione, Ragionamento) utilizzando uno schema JSON vincolato e un prompt di sistema standardizzato. In secondo luogo, un insegnante modera il risultato per rimuovere i falsi positivi, aggiungere le questioni critiche trascurate in linea con la griglia IELTS, garantire formulazioni pratiche e incoraggianti e mantenere la coerenza con lo schema a quattro categorie. Questo passaggio di moderazione funge da principale meccanismo di risoluzione dei problemi, correggendo allucinazioni o sovra-valutazione dell'IA che altrimenti potrebbero sopraffare gli studenti. È importante notare che il tempo di moderazione per compito per insegnante era inferiore in STEP-DWCF-R rispetto a WCF (13,8 min contro 23,5 min), perché l'IA generava il feedback strutturato iniziale e l'insegnante lo moderava soltanto. In terzo luogo, il feedback moderato viene fornito tramite l'interfaccia web dell'agente robotico IA, che registra confermi e riinvii degli studenti su più round.

Rispetto agli approcci esistenti, STEP-DWCF-R affronta limitazioni distinte. Il WCF convenzionale a singolo turno rimane vincolato dal tempo dell'istruttore e offre tipicamente opportunità limitate per una revisione prolungata. Gli strumenti automatizzati di valutazione della scrittura offrono scalabilità ma spesso forniscono commenti statici e frammentati che gli studenti faticano a tradurre in revisioni significative 20,21,22. I primi studi DWCF hanno dimostrato l'efficacia dei cicli di feedback a più round, ma la loro dipendenza da correzioni scritte dagli istruttori ha sollevato preoccupazioni di fattibilità nelle classinumerose 14, 15, 16, 17. Recenti studi sul feedback sull'IA generativa riportano parità con il feedback degli insegnanti sui risultati della scrittura, ma senza moderazione strutturata o consegnaiterativa 18,19. STEP-DWCF-R combina la scalabilità dell'IA con la supervisione dell'insegnante e la consegna iterativa di agenti AI robotici, ottenendo un carico di lavoro minore e aumentando la frequenza delle revisioni.

Riconosciamo diverse limitazioni. La dimensione relativamente piccola del campione (N = 32) limita la generalizzabilità dei nostri risultati, e lo studio dovrebbe essere considerato un'indagine pilota. Le due condizioni differivano per dosaggio di feedback: il gruppo WCF riceveva solo un round di feedback per compito, mentre il gruppo STEP-DWCF-R subiva 2–3 round iterativi. Pertanto, le prestazioni superiori del gruppo STEP-DWCF-R riflettono gli effetti combinati di più cicli di revisione, feedback generato dall'IA e moderazione degli insegnanti, piuttosto che l'effetto isolato dell'agente robotico IA o della sua modalità di erogazione. L'agente AI robotico è un'interfaccia web puramente virtuale, quindi i suoi effetti non possono essere separati da quelli della struttura iterativa stessa. Il feedback umano multimodale (ad esempio, parlato più gesto) non è stato incluso come condizione di controllo perché non è una prassi standard nelle classi convenzionali di scrittura EFL e richiederebbe un paradigma sperimentale separato. Studi futuri dovrebbero includere gruppi di controllo abbinati al dosaggio (ad esempio, feedback degli insegnanti su più round) per districare ulteriormente questi componenti.

Nonostante queste limitazioni, il framework STEP-DWCF-R offre indicazioni pratiche per l'istruzione della scrittura assistita dall'IA. La sua architettura modulare consente l'integrazione nei sistemi di gestione dell'apprendimento per corsi EFL su larga scala, e lo schema strutturato a quattro categorie potrebbe essere adattato per la scrittura accademica o per generi specifici di disciplina. Le future iterazioni potrebbero esplorare la consegna multimodale per sfruttare i benefici teorici dell'impegno degli agenti incorporati, anche se l'attuale progetto pilota stabilisce la fattibilità della collaborazione iterativa tra IA e insegnanti basata su testo. Tuttavia, il modello coerente tra le misure di risultato, gli indicatori di processo e la forte affidabilità tra valutatori supportano la fattibilità e la potenziale efficacia di questo approccio multi-componente in contesti EFL simili.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno interessi in conflitto.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato finanziato da una Universiti Sains Malaysia Bridging Grant, Progetto N: R501-LR-RND003-0000001342-0000.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersione 2.1; utilizzato per l'interfaccia web dell'agente AI robotico
API GPT-5OpenAIhttps://platform.openai.comModello gpt-5, temperatura=0.7; per la generazione di feedback JSON strutturati
Jinja2Pallets Projectshttps://jinja.palletsprojects.comModelli server-renderizzati per l'interfaccia web
PythonPython Software Foundationhttps://www.python.orgVersione 3.10; scripting del backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operativo per il sistema di feedback AI

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

Articoli correlati