$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Expériences et analyses
Les 32 apprenants ont fourni des données de référence. Les données post-test étaient disponibles pour 16 apprenants dans chaque groupe (WCF et STEP-DWCF-R ; Figure 2). La chronologie de l’étude et les mesures sont présentées à la Figure 3, et le flux de retour de retour de bout en bout est illustré à la Figure 4. Les paramètres expérimentaux de mise en place et de mise en œuvre de notre système d’IA sont présentés dans le Tableau 1. Les analyses suivaient le plan prédéfini avec intention de traiter. Nous évaluons d’abord l’équivalence de base (Tableau 2), puis rapportons le critère principal (Figure 5 et Tableau 3), suivi des résultats secondaires (Tableau 4) avec des contrôles de robustesse et de fiabilité.
Équivalence de base
Au départ (semaine 1), les groupes étaient descriptivement similaires sur les covariables prédéfinies, incluant les données démographiques et la performance à la rédaction de l’IELTS avant tout retour (Tableau 2). Les scores individuels des composantes IELTS sont attribués par étapes de 0,5 bande, tandis que les rapports de tableau signifient par groupe. Les moyennes globales de la semaine 1 (WCF = 5,625, STEP-DWCF-R = 5,500) sont calculées à partir des mêmes tableaux utilisés pour générer la Figure 5. Nous ne réalisons pas de tests d’hypothèse au départ ; tout déséquilibre résiduel est traité par la conception pré-post-pos et le terme Group × Time dans le modèle à effets mixtes, et une comparaison post-test ajustée à la base est rapportée dans la section Protocole.
Résultat primaire
La figure 5 résume les changements avant et post, tandis que les tableaux 3 et 5 rapportent les estimations des modèles et l’obtention après le test. Au départ (semaine 1), les moyennes de groupe étaient de 5,625 pour la WCF et 5,500 pour le STEP-DWCF-R, ce qui donne une différence de groupe non significative de −0,125 bandes (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC à 95 % [−0,397, 0,147]). La référence du tableau 3 estime donc la moyenne de la semaine 1 du WCF à 5,625 avec un IC à 95 % [5,419, 5,831] (SE = 0,097, df = 15). De la semaine 1 à la semaine 8, la WCF s’est améliorée de 0,3125 bande (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC à 95 % [0,039, 0,586] ; effet standardisé dans le groupe dz = 0,61). L’étape DWCF-R s’est améliorée de 1,0313 bandes (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC à 95 % [0,732, 1,331] ; dz = 1,84). Le contraste linéaire des effets mixtes pour l’interaction temps du groupe × — c’est-à-dire la différence dans les différences — était de 0,7188 bandes (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95 % [0,330, 1,107] ; Tableau 3), indiquant des gains plus importants sous STEP-DWCF-R. Au post-test (semaine 8), les moyennes marginales estimées favorisaient STEP-DWCF-R de 0,5938 bandes (test de Welch sur les moyennes de groupe : SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC à 95 % [0,359, 0,829]). Conformément à cela, le tableau des résultats (Tableau 5) montre qu’à la semaine 8, 13 % des apprenants WCF ont atteint un ≥ global de 6,5 et 0 % ≥ 7,0 (décomptes 2/16 et 0/16), tandis que 81 % des apprenants STEP-DWCF-R ont atteint ≥ 6,5 et 25 % ont atteint ≥ 7,0 (comptages 13/16 et 4/16). Le tableau 3 rapporte les estimations correspondantes de l’effet fixe et leur incertitude.
Résultats au niveau dimensionnel
Le tableau 4 résume les changements avant la publication à travers les quatre dimensions de la Tâche 2. La réponse à la tâche (TR) a montré un gain de Δ = 0,25 bande sous WCF contre Δ = 0,95 sous STEP-DWCF-R, donnant ΔΔ = 0,70 avec IC à 95 % [0,28, 1,12] et p ajusté par Holm = 0,006. La cohérence et la cohésion (CC) ont montré le plus grand contraste : WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, donc ΔΔ = 0,85 (IC 95 % [0,44, 1,26], adj-p = 0,002). La ressource lexicale (LR) suivait le même schéma avec WCF Δ = 0,35 et STEP-DWCF-R Δ = 0,95, donnant ΔΔ = 0,60 (IC à 95 % [0,18, 1,02], adj-p = 0,012). La plage grammaticale et la précision (GRA) améliorées de Δ = 0,25 en WCF et Δ = 0,97 dans STEP-DWCF-R ; le ΔΔ = 0,72 donnait un IC à 95 % de [0,31, 1,13] avec ADJ-p = 0,004. Dans les quatre dimensions, les contrastes Group×Time favorisaient STEP-DWCF-R après l’ajustement de Holm–Bonferroni.
Preuves de procédure
Les figures 6 et 7 visualisent les résultats du processus principal. Entre les semaines 2 et 7, le STEP-DWCF-R a effectué en moyenne 2,26 tours de révision par tâche (IC à 95 % [2,17, 2,35] ; n = 96), tandis que le WCF était de 1,00 tour pour toutes les tâches (n = 96). La différence moyenne était de 1,26 coups (IC à 95 % [1,17, 1,35]) ; un test de Mann–Whitney a confirmé la séparation des distributions (U = 9216, z = 11,97, p < 10−30). Au sein du STEP-DWCF-R, les comptages d’erreurs moyens ont diminué par tour : 13,78 au premier tour (IC à 95 % [13,02, 14,54] ; n = 96), 8,94 au deuxième tour (IC à 95 % [8,42, 9,46] ; n = 96), et 6,16 au troisième tour (IC à 95 % [5,20, 7,12] ; n = 25). Une tendance linéaire adaptée aux observations par tour a estimé une baisse de 4,14 erreurs par tour (IC à 95 % [3,51, 4,78] en magnitude absolue ; p < 10−12). Les mesures de captation de rétroaction et de temps sur la tâche ne sont pas codées dans les figures 6 et 7 et sont donc indiquées dans le tableau 7.
Fiabilité et robustesse
L’accord entre évaluateurs pour les essais de la semaine 1 et de la semaine 8 était bon à excellent. Deux évaluateurs formés ont noté tous les scripts indépendamment et ont été aveuglés par le groupe et le temps ; en utilisant les mesures moyennes du coefficient de corrélation intraclasse (ICC[2,2]) sur les moyennes de l’évaluateur, la fiabilité variait de 0,86 à 0,93 pour l’ensemble global, et les quatre dimensions ainsi que toutes les limites inférieures de confiance à 95 % dépassaient 0,80 (Tableau 6). Les contrôles diagnostiques pour le modèle primaire à effets mixtes ont indiqué des résidus approximativement normaux sans hétéroscédasticité matérielle, et les modèles adaptés aux résumés de processus au niveau de la tâche ont montré une dispersion proche de un. Les analyses de sensibilité basées sur le même ensemble de données semaine 1/semaine 8 ont donné des inférences cohérentes : une régression linéaire comparant les groupes post-test tout en ajustant pour les scores de base a estimé une différence ajustée entre groupes de 0,575 bande à la semaine 8 (IC 95 % [0,336, 0,814], p = 3,15 × 10−5), et un modèle mixte spécifique à chaque évaluateur incluant un effet aléatoire pour l’évaluateur et utilisant des scores non moyens ont produit une estimation Group × Time de 0,72 bande (IC 95 % [0,33, 1.11], p = 0,0007), alignée avec le tableau 3. Les résultats sont restés inchangés lors de l’utilisation d’erreurs standard robustes et lorsque les analyses étaient limitées à des cas complets, renforçant la conclusion que STEP-DWCF-R produit des gains pré-post-postérieur plus importants que la WCF.
Résultats qualitatifs
Pour l’analyse qualitative, nous avons examiné les traces de révision STEP-DWCF-R sur les six tâches ainsi que les réflexions écrites de fin de cours des 16 participants du groupe STEP-DWCF-R. Deux codeurs ont codé indépendamment les matériaux en utilisant un cadre déductif ciblé basé sur les quatre catégories de rétroaction (grammaire, vocabulaire, organisation, raisonnement) et les justifications d’absorption. L’accord intercodeurs était substantiel avec le kappa de Cohen de 0,78, et les désaccords étaient résolus par discussion.
L’analyse a révélé cinq thèmes clés : l’adoption suivait un schéma étape, les apprenants résolvant les caractéristiques de surface avant d’aborder l’organisation et le raisonnement ; les éléments spécifiques à chaque étendue et liés à la grille étaient plus exploitables et fréquemment adoptés que les suggestions narratives ; La complémentarité IA-enseignant a façonné la priorité, avec des signaux qui se chevauchent augmentant la concentration et la modération enseignante résolvant les conflits ; Les bénéfices ont atteint leur pic tôt, avec la réutilisation des modèles d’organisation et des schémas lexicaux notés sur les nouvelles consignes ; et les apprenants ont adapté leurs stratégies à travers les tâches. Ces thèmes éclairent la dynamique du processus explorée dans la section preuves de procédé. La captation de la rétroaction, les erreurs persistantes et les mesures du temps sur la tâche ont également été enregistrées. Un résumé de ces indicateurs de processus supplémentaires est présenté dans le Tableau 7.
Interprétation des résultats représentatifs
Pris ensemble, les données sur les résultats et le processus indiquent que le cadre STEP-DWCF-R est associé à une amélioration de la rédaction IELTS plus importante que le retour traditionnel à une seule ronde. Le résultat principal montre une différence de différence entre les groupes de 0,72 bandes, le groupe STEP-DWCF-R s’améliorant de 1,03 bande au total contre 0,31 dans le groupe WCF. Cet avantage était cohérent dans les quatre dimensions analytiques, avec le plus grand contraste en cohérence et cohésion à 0,85 bande, suggérant que le retour structuré, lié à la grille et multi-étapes, a particulièrement facilité le développement organisationnel. Les preuves du processus indiquent en outre que l’engagement itératif sous-tend cet avantage. Les apprenants STEP-DWCF-R ont complété en moyenne 2,26 tours de révision par tâche, et le nombre d’erreurs a diminué linéairement d’environ 4,1 erreurs par tour. Par exemple, un cycle de flux de travail représentatif comprenait GPT-5 générant des retours JSON structurés dans les quatre catégories, suivi d’une modération enseignante pour éliminer les faux positifs et améliorer l’actionnabilité, puis une diffusion ultérieure via l’interface d’agent IA robotique pour une révision multi-tours par les apprenants. Ces résultats confirment la faisabilité et l’efficacité potentielle du flux de travail intégré multi-composantes combinant un retour généré par IA, la modération des enseignants et la livraison d’agents robotiques par IA itérative, mais ils ne doivent pas être interprétés comme une preuve d’un seul composant isolément. Le déséquilibre de dose de 2 à 3 tours par rapport à un seul cycle et la taille modeste de l’échantillon de 32 signifient que les gains observés reflètent l’effet combiné d’opportunités accrues de révision et de retour structuré. Ces résultats doivent être considérés comme des preuves pilotes prometteuses en attente de confirmation dans des essais plus larges contrôlés par composants.

Figure 1. Cadre théorique du DWCF (rétroaction corrective écrite dynamique). Le chiffre fournit une justification plus large de la manière dont le DWCF pourrait fonctionner ; il est inclus pour l’orientation plutôt que comme un modèle direct de cet essai. Les éléments correspondant aux résultats et aux métriques de processus analysés ici sont indiqués dans la figure ; D’autres parcours sont illustratifs et n’ont pas été évalués. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 2. Diagramme de flux CONSORT des participants. Trente-deux apprenants ont été évalués pour leur éligibilité ; aucun n’a été exclu. Tous les participants ont donné leur consentement et ont ensuite été randomisés dans un ratio 1:1 soit dans le groupe WCF (n = 16), soit dans le groupe DWCF (n = 16). Tous les participants randomisés ont reçu l’intervention allouée ; Il n’y a eu aucune perte de suivi ni d’arrêt, et les 32 ont tous été inclus dans l’analyse finale. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 3. Chronologie et mesures de l’étude. L’essai a duré 8 semaines : au W1, les participants ont complété la tâche IELTS 2 de référence et ont été notés ; six tâches d’écriture hebdomadaires étaient administrées de W2 à W7 (Tâche 1–Tâche 6), avec des retours spécifiques au groupe (WCF ou DWCF) et des révisions après chaque tâche. Les mesures de processus, y compris les rondes de révision, la prise de retours, le taux d’erreur persistante et le temps de travail sur la tâche, ont été enregistrées pour chaque tâche durant W2–W7. Au W8, la tâche 2 de l’IELTS post-test a été administrée et notée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 4. Flux de retours de bout en bout. Les apprenants produisent un premier brouillon surveillé, puis reçoivent des retours spécifiques au groupe : WCF (un tour de retour humain) ou STEP-DWCF-R (retour généré par IA avec modération enseignante, délivré via des agents IA robotiques, impliquant 2 à 3 tours itératifs). Les apprenants effectuent une ou plusieurs rondes de révision en conséquence. Le résultat est le score de la bande de la tâche 2 de l’IELTS ; Les mesures de processus incluent le nombre de manches, la captation de rétroaction (adoptée/modifiée/refusée), le taux d’erreur persistante et le temps passé sur la tâche. Le système enregistre les identifiants au niveau des items, la catégorie/sévérité, la source (IA vs. humain vs. robot), les actions de modération et l’état d’acceptation. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 5. Évolution de la bande globale de l’IELTS de la semaine 1 à la semaine 8 par groupe. Les points donnent les moyennes estimées du groupe avec des intervalles de confiance à 95 %, et les trajectoires indiquent un gain plus important sous le STEP-DWCF-R . Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 6. Rondes de révision par tâche par groupe (semaines 2–7). Les points de données représentent les tours de révision individuels des tâches pour les groupes WCF (bleu) et STEP-DWCF-R (orange). Les lignes horizontales et les barres d’erreur indiquent des moyennes de groupe avec des intervalles de confiance à 95 %. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 7. Nombre moyen d’erreur par cycle dans le STEP-DWCF-R avec IC à 95 %. Les points indiquent les moyennes d’erreurs à chaque tour de rétroaction (tour 1, tour 2, tour 3), et les lignes verticales représentent des intervalles de confiance (IC) à 95 %. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
| Composant | Spécification |
| Matériel | PC avec Intel(R) Core(TM) 12e génération i7-12700H (2,30 GHz), 32 Go de RAM, GPU Nvidia RTX 3080Ti (16 Go) |
| Système d’exploitation | Windows 11 |
| Backend | Flask~2.1 (Python~3.10) |
| Frontend | Modèles Jinja2 rendus par serveur |
| Modèles d’IA | API OpenAI GPT-5 (pour la génération de rétroaction), post-traitement basé sur le schéma |
| Ordonnanceur de rétroaction | Contrôleur personnalisé gérant le retour multi-étapes (3 cycles) |
| Schéma d’erreur | Grammaire, vocabulaire, organisation, raisonnement |
| Contrôle de version | GitHub |
| Exploitation forestière | Enregistrement automatique des soumissions, des retours et des révisions pour analyse |
Tableau 1 : Paramètres de mise en place et de mise en œuvre expérimentaux. Les spécifications techniques du système de rétroaction IA, incluant la configuration matérielle, le système d’exploitation, les cadres backend et frontend, les paramètres des modèles IA, le planificateur de rétroaction, les catégories de schémas d’erreur, le contrôle des versions et l’infrastructure de journalisation.
| Variable | WCF (n=16) | STEP-DWCF-R (n=16) |
| Âge (années), moyenne (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Femme, n ( %) | 9 (56%) | 8 (50%) |
| Préparation préalable à l’IELTS (oui), n ( %) | 7 (44%) | 6 (38%) |
| Années d’enseignement préalable en écriture | 3.1 (1.2) | 3.2 (1.1) |
| Base IELTS Globale (groupe) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (groupe) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (groupe) | 5.62 (0.49) | 5.53 (0.49) |
| LR de base (groupe) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (groupe) | 5.56 (0.48) | 5.49 (0.45) |
Tableau 2 : Caractéristiques de référence des participants par groupe (semaine 1). Variables démographiques et performance de rédaction de la tâche 2 du International English Language Testing System (IELTS) avant le test pour les groupes WCF et STEP-DWCF-R. Les valeurs sont la moyenne (écart-type) ou n ( %).
| Effet fixe | Estimation | SE | df | t | p | IC à 95 % |
| Intercept (WCF, Semaine~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Groupe (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Temps (Semaine~8 vs. Semaine~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Groupe × Temps | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tableau 3 : Modèle linéaire à effets mixtes pour la bande globale de l’IELTS à partir des scores de la semaine 1/semaine 8. Estimations à effets fixes, erreurs standard (SE), degrés de liberté (df), valeurs t, valeurs p et intervalles de confiance (IC) à 95 % pour les termes d’interaction et de modèles Group × Time.
| Dimension | WCF Δ (bandes) | STEP-DWCF-R Δ (bandes) | ΔΔ (IC 95 %) | ADJ-P |
| Réponse à la tâche (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Cohérence et cohésion (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Ressource lexicale (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Étendue grammaticale et précision (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tableau 4 : Résultats au niveau de la dimension (Tâche 2) : changements avant et après et différences entre groupes. Changements pré-post-changement (Δ) et différences dans les différences (ΔΔ) avec intervalles de confiance (IC) à 95 % et des valeurs p ajustées en Holm pour la réponse à la tâche (TR), la cohérence et la cohésion (CC), la ressource lexicale (LR), ainsi que la plage et la précision grammaticales (GRA).
| Seuil | WCF ( %) | STEP-DWCF-R ( %) |
| Au total ≥ 6,5 | 13 | 81 |
| Au ≥ global 7,0 | 0 | 25 |
Tableau 5 : Niveau de l’étreinte après l’examen (semaine 8). Proportion d’apprenants dans les groupes WCF et STEP-DWCF-R atteignant des seuils globaux de score IELTS d’au moins 6,5 et au moins 7,0.
| Conséquences | ICC | IC à 95 % |
| Globalisation | 0.91 | [0.86, 0.94] |
| Réponse à la tâche (TR) | 0.88 | [0.82, 0.92] |
| Cohérence et cohésion (CC) | 0.9 | [0.85, 0.94] |
| Ressource lexicale (LR) | 0.89 | [0.83, 0.93] |
| Étendue grammaticale et précision (GRA) | 0.87 | [0.80, 0.91] |
Tableau 6 : Fiabilité inter-évaluateurs pour les résultats IELTS. Deux évaluateurs aveugles sur N = 64 essais (semaine 1 et semaine 8 combinées). Mesure en moyenne les coefficients de corrélation intra-classe (ICC[2,2]) avec des intervalles de confiance (IC) à 95 % pour les scores globaux et dimensionnels.
| Mesure | Groupe WCF | Groupe STEP-DWCF-R |
| Tours de révision par tâche | 1 | 2.26 |
| Taux d’adoption de rétroaction (adopté ou modifié, %) | 68.5 | 82.3 |
| Taux d’erreur persistant après la dernière manche ( %) | 67.4 | 45.6 |
| Temps de modération de l’enseignant (minimum par tâche) | 23.5 | 13.8 |
| Délai de livraison de l’agent IA (minimum par tâche) | — | 3.9 |
| Temps de révision de l’apprenant (minimum par tâche) | 44.8 | 71.2 |
| Temps total de retour + révision (min/tâche) | 68.3 | 88.9 |
Tableau 7 : Moyennes sur 96 tâches (6 tâches × 16 apprenants). Les taux d’adoption et d’erreur persistante ont été calculés au niveau du point de rétroaction. Les mesures de temps étaient enregistrées via les journaux des enseignants et les horodatages du système. Le délai de livraison de l’agent IA n’est pas applicable au groupe WCF.