$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Experimentos y análisis
Los 32 alumnos proporcionaron datos de referencia. Los datos posteriores a la prueba estaban disponibles para 16 estudiantes de cada grupo (WCF y STEP-DWCF-R; Figura 2). La cronología y las medidas del estudio se presentan en la Figura 3, y el flujo de trabajo de retroalimentación de extremo a extremo se ilustra en la Figura 4. Los parámetros experimentales de configuración e implementación de nuestro sistema de IA se muestran en la Tabla 1. Los análisis siguieron el plan preestablecido con intención de tratar. Primero evaluamos la equivalencia basal (Tabla 2), luego informamos del resultado principal (Figura 5 y Tabla 3), seguido de los resultados secundarios (Tabla 4) con comprobaciones de robustez y fiabilidad.
Equivalencia de referencia
Al inicio (Semana 1), los grupos fueron descriptivamente similares en covariables predefinidas, incluyendo demografía y rendimiento en la redacción del IELTS antes de cualquier retroalimentación (Tabla 2). Las puntuaciones individuales de los componentes del IELTS se asignan en pasos de 0,5 bandas, mientras que las medias de grupos de informes de la tabla se asignan. Las medias generales de la Semana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) se calculan a partir de los mismos arrays usados para generar la Figura 5. No realizamos pruebas de hipótesis en la línea inicial; cualquier desequilibrio residual se aborda mediante el diseño pre-post y el término Group × Time en el modelo de efectos mixtos, y se informa en la sección de Protocolo una comparación post-prueba ajustada por la línea base.
Resultado de las primarias
La Figura 5 resume los cambios previos a la post-prueba, mientras que las Tablas 3 y la Tabla 5 informan de estimaciones del modelo y el rendimiento posterior a la prueba. Al inicio (Semana 1), las medias de grupo eran 5,625 para WCF y 5,500 para STEP-DWCF-R, lo que resulta en una diferencia de grupo no significativa de −0,125 bandas (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). Por tanto, la línea base de la Tabla 3 estima la media de la WCF de la Semana 1 en 5,625 con IC del 95% [5,419, 5,831] (SE = 0,097, df = 15). De la semana 1 a la semana 8, la WCF mejoró en 0,3125 bandas (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; efecto estandarizado dentro del grupo dz = 0,61). STEP-DWCF-R mejoró en 1,0313 bandas (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). El contraste lineal de efectos mixtos para la interacción Tiempo × Grupo —es decir, la diferencia en diferencias— fue de 0,7188 bandas (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabla 3), indicando mayores ganancias bajo STEP-DWCF-R. En la post-prueba (Semana 8), las medias marginales estimadas favorecían a STEP-DWCF-R en bandas de 0,5938 (test de Welch sobre medias de grupo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). En consonancia con esto, la tabla de rendimiento (Tabla 5) muestra que en la Semana 8, el 13% de los estudiantes de WCF alcanzaron el ≥ global 6,5 y el 0% alcanzó ≥ 7,0 (conteos 2/16 y 0/16), mientras que el 81% de los alumnos STEP-DWCF-R alcanzaron ≥ 6,5 y el 25% alcanzaron ≥ 7,0 (conteos 13/16 y 4/16). La Tabla 3 recoge las estimaciones correspondientes de efecto fijo y su incertidumbre.
Resultados a nivel dimensional
La Tabla 4 resume los cambios previos a la publicación a lo largo de las cuatro dimensiones de la Tarea 2. La respuesta a la tarea (TR) mostró una ganancia de Δ = 0,25 bandas bajo WCF frente a Δ = 0,95 bajo STEP-DWCF-R, lo que dio ΔΔ = 0,70 con IC del 95% [0,28, 1,12] y p ajustado por Holm = 0,006. La coherencia y cohesión (CC) mostró el mayor contraste: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, por lo tanto ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). El recurso léxico (LR) siguió el mismo patrón con WCF Δ = 0,35 y STEP-DWCF-R Δ = 0,95, dando ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). El rango gramatical y la precisión (GRA) mejorados en Δ = 0,25 en WCF y Δ = 0,97 en STEP-DWCF-R; el resultado ΔΔ = 0,72 tenía un IC del 95% de [0,31, 1,13] con adj-p = 0,004. En las cuatro dimensiones, los contrastes Grupo×Tiempo favorecieron STEP-DWCF-R tras el ajuste de Holm–Bonferroni.
Pruebas de Proceso
La Figura 6 y la Figura 7 visualizan los resultados del proceso principal. Durante las semanas 2–7, STEP-DWCF-R completó de media 2,26 rondas de revisión por tarea (IC 95% [2,17, 2,35]; n = 96), mientras que el WCF fue de 1,00 rondas para todas las tareas (n = 96). La diferencia media fue de 1,26 rondas (IC 95% [1,17, 1,35]); una prueba de Mann–Whitney confirmó la separación de las distribuciones (U = 9216, z = 11,97, p < 10−30). Dentro del STEP-DWCF-R, los recuentos de errores medios disminuyeron por ronda: 13,78 en la Ronda 1 (IC 95% [13,02, 14,54]; n = 96), 8,94 en la Ronda 2 (IC 95% [8,42, 9,46]; n = 96) y 6,16 en la Ronda 3 (IC 95% [5,20, 7,12]; n = 25). Una tendencia lineal ajustada a las observaciones por ronda estimó un descenso de 4,14 errores por ronda (IC 95% [3,51, 4,78] en magnitud absoluta; p < 10−12). Las medidas de captación de retroalimentación y tiempo de tarea no se codifican en la Figura 6 ni en la Figura 7, por lo que se informan en la Tabla 7.
Fiabilidad y robustez
El acuerdo entre evaluadores para los ensayos de la Semana 1 y 8 fue de bueno a excelente. Dos evaluadores entrenados calificaron todos los guiones de forma independiente y quedaron ciegos ante el grupo y el tiempo; utilizando medidas medias del coeficiente de correlación intraclase (ICC[2,2]) en las medias del evaluador, la fiabilidad osciló entre 0,86 y 0,93 en general, y las cuatro dimensiones, y todos los límites inferiores de confianza del 95% superaron el 0,80 (Tabla 6). Las comprobaciones diagnósticas para el modelo primario de efectos mixtos indicaron residuos aproximadamente normales sin heteroscedasticidad material, y los modelos ajustados a resúmenes de procesos a nivel de tarea mostraron una dispersión cercana a uno. Los análisis de sensibilidad basados en el mismo conjunto de datos de la Semana 1/Semana 8 arrojaron inferencias consistentes: una regresión lineal comparando grupos en la prueba posterior al ajustar por las puntuaciones iniciales estimó una diferencia ajustada entre grupos de 0,575 bandas en la semana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), y un modelo mixto específico del evaluador que incluía un efecto aleatorio para el evaluador y utilizaba puntuaciones no promediadas produjeron una estimación de tiempo × Grupo de 0,72 bandas (IC 95% [0,33, 1.11], p = 0,0007), alineándose con la Tabla 3. Los resultados no cambiaron al usar errores estándar robustos y cuando los análisis se restringieron a casos completos, reforzando la conclusión de que STEP-DWCF-R produce mayores ganancias antes del post que WCF.
Hallazgos cualitativos
Para el análisis cualitativo, examinamos los trazos de revisión STEP-DWCF-R en las seis tareas y reflexiones escritas al final del curso de los 16 participantes del grupo STEP-DWCF-R. Dos codificadores codificaron los materiales de forma independiente utilizando un marco deductivo enfocado basado en las cuatro categorías de retroalimentación (gramática, vocabulario, organización, razonamiento) y las justificaciones de adopción. El acuerdo entre codificadores fue sustancial con el kappa de Cohen de 0,78, y los desacuerdos se resolvieron mediante discusión.
El análisis reveló cinco temas clave: la captación seguía un patrón escalonado, con los alumnos resolviendo características superficiales antes de abordar la organización y el razonamiento; los ítems específicos de span, vinculados a rúbricas, eran más prácticos y adoptados con frecuencia que las sugerencias narrativas; La complementariedad IA-profesor moldeó la prioridad, con señales superpuestas que aumentaban el enfoque y la moderación del profesor resolvía conflictos; los beneficios alcanzaron su punto máximo temprano, con la reutilización de plantillas organizativas y patrones léxicos señalados en nuevas consignas; y los alumnos adaptaron estrategias a través de tareas. Estos temas informan la dinámica del proceso explorada en la sección de evidencia del proceso. También se registraron la captación de retroalimentación, errores persistentes y medidas de tiempo en la tarea. Un resumen de estos indicadores adicionales de proceso se presenta en la Tabla 7.
Interpretación de los resultados representativos
En conjunto, los datos de resultados y procesos indican que el marco STEP-DWCF-R está asociado a una mayor mejora en la redacción del IELTS que la retroalimentación tradicional de ronda única. El resultado principal muestra una diferencia entre grupos de 0,72 bandas, con el grupo STEP-DWCF-R mejorando en 1,03 bandas en total frente a 0,31 bandas en el grupo WCF. Esta ventaja fue consistente en las cuatro dimensiones analíticas, con el mayor contraste en Coherencia y Cohesión en las bandas de 0,85, lo que sugiere que la retroalimentación estructurada, vinculada a rúbricas y multietapa, particularmente favoreció el desarrollo organizativo. La evidencia del proceso indica además que el compromiso iterativo subyace a esta ventaja. Los alumnos del STEP-DWCF-R completaron una media de 2,26 rondas de revisión por tarea, y el número de errores disminuyó linealmente en aproximadamente 4,1 errores por ronda. Por ejemplo, un ciclo de flujo de trabajo representativo incluyó GPT-5 generando retroalimentación JSON estructurada en las cuatro categorías, seguido de moderación docente para eliminar falsos positivos y mejorar la capacidad de acción, y la posterior entrega a través de la interfaz de agente de IA robótica para la revisión de varias rondas por parte del alumno. Estos hallazgos apoyan la viabilidad y la posible efectividad del flujo de trabajo integrado multicomponente que combina retroalimentación generada por IA, moderación del profesorado y entrega iterativa de agentes robóticos de IA, pero no deben interpretarse como prueba de un componente individual por separado. El desequilibrio de dosis de 2–3 rondas frente a una ronda y el tamaño de muestra modesto de 32 hacen que las ganancias observadas reflejen el efecto combinado de un aumento de oportunidades de revisión y una retroalimentación estructurada. Estos resultados deben considerarse pruebas piloto prometedoras a la espera de confirmación en ensayos más grandes controlados por componentes.

Figura 1. Marco teórico de DWCF (retroalimentación correctiva escrita dinámica). La cifra ofrece una justificación más amplia sobre cómo puede operar la DWCF; se incluye para orientación más que como un modelo directo de este ensayo. Los elementos correspondientes a los resultados y métricas de proceso analizados aquí se indican en la figura; Otras vías son ilustrativas y no fueron evaluadas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2. Diagrama de flujo CONSORT de participantes. Se evaluó la elegibilidad de treinta y dos alumnos; ninguno fue excluido. Todos los participantes dieron su consentimiento y luego fueron aleatorizados en una proporción 1:1 al grupo WCF (n = 16) o al grupo DWCF (n = 16). Todos los participantes aleatorizados recibieron la intervención asignada; No hubo pérdidas por seguimiento ni interrupciones, y los 32 se incluyeron en el análisis final. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3. Cronología del estudio y medidas. El ensayo duró 8 semanas: en W1, los participantes completaron la tarea inicial IELTS 2 y fueron puntuados; se administraron seis tareas semanales de escritura desde W2 hasta W7 (Tarea 1–Tarea 6), con retroalimentación específica del grupo (WCF o DWCF) y revisiones tras cada tarea. Las medidas de proceso, incluyendo rondas de revisión, captación de retroalimentación, tasa de error persistente y tiempo de tarea, se registraron para cada tarea durante W2–W7. En W8, se administró y puntuó la tarea 2 del IELTS posterior al examen. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4. Flujo de trabajo de retroalimentación de extremo a extremo. Los alumnos elaboran un borrador inicial supervisado y luego reciben retroalimentación específica para cada grupo: WCF (una ronda de retroalimentación humana) o STEP-DWCF-R (retroalimentación generada por IA con moderación del profesor, entregada mediante agentes robóticos de IA, que implica 2–3 rondas iterativas). Los alumnos completan la ronda de revisión en consecuencia. El resultado es la puntuación de la banda de la Tarea 2 del IELTS; Las medidas de proceso incluyen el número de rondas, la captación de retroalimentación (adoptada/modificada/rechazada), la tasa de error persistente y el tiempo de tarea. El sistema registra los IDs a nivel de ítem, categoría/gravedad, origen (IA vs. humano vs. robot), acciones de moderación y estado de adopción. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 5. Cambio en la banda general del IELTS de la Semana 1 a la Semana 8 por grupo. Los puntos muestran las medias estimadas de grupo con intervalos de confianza del 95%, y las trayectorias indican una mayor ganancia bajo el STEP-DWCF-R . Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Figura 6. Rondas de revisión por tarea por grupo (Semanas 2–7). Los puntos de datos representan rondas individuales de revisión de tareas para los grupos WCF (azul) y STEP-DWCF-R (naranja). Las líneas horizontales y las barras de error indican medias de grupo con intervalos de confianza del 95%. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 7. Conteo medio de error por ronda dentro del STEP-DWCF-R con IC del 95%. Los puntos indican el número medio de errores en cada ronda de retroalimentación (Ronda 1, Ronda 2, Ronda 3), y las líneas verticales representan intervalos de confianza (IC) del 95%. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Componente | Especificaciones |
| Hardware | PC con Intel(R) Core(TM) de 12ª generación i7-12700H (2,30 GHz), 32GB DE RAM, GPU NVIDIA RTX 3080Ti (16GB) |
| Sistema operativo | Windows 11 |
| Backend | Flask~2.1 (Python~3.10) |
| Frontend | Plantillas renderizadas por servidor en Jinja2 |
| Modelos de IA | API OpenAI GPT-5 (para generación de retroalimentación), postprocesamiento basado en esquemas |
| Programador de retroalimentación | Controlador personalizado que gestiona retroalimentación en varias etapas (3 ciclos) |
| Esquema de error | Gramática, Vocabulario, Organización, Razonamiento |
| Control de versiones | GitHub |
| Tala | Registro automático de envíos, comentarios y revisiones para análisis |
Tabla 1: Parámetros de configuración e implementación experimental. Especificaciones técnicas del sistema de retroalimentación de IA, incluyendo configuración de hardware, sistema operativo, frameworks de backend y frontend, configuración de modelos de IA, programador de retroalimentación, categorías de esquemas de errores, control de versiones e infraestructura de registro.
| Variable | WCF (n=16) | STEP-DWCF-R (n=16) |
| Edad (años), media (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Femenina, n (%) | 9 (56%) | 8 (50%) |
| Preparación previa para el IELTS (sí), n (%) | 7 (44%) | 6 (38%) |
| Años de formación previa en escritura | 3.1 (1.2) | 3.2 (1.1) |
| Línea base de IELTS en general (banda) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (banda) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (banda) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (banda) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (banda) | 5.56 (0.48) | 5.49 (0.45) |
Tabla 2: Características de referencia de los participantes por grupo (Semana 1). Variables demográficas y rendimiento de redacción de la tarea 2 del Sistema Internacional de Pruebas de Lengua Inglesa (IELTS) previo al examen para los grupos WCF y STEP-DWCF-R. Los valores son la media (desviación estándar) o n (%).
| Efecto fijo | Estimación | SE | df | t | p | IC 95% |
| Intercept (WCF, Semana~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Grupo (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Tiempo (Semana~8 vs. Semana~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Grupo × Tiempo | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tabla 3: Modelo lineal de efectos mixtos para la banda global del IELTS a partir de las puntuaciones de la Semana 1/8. Estimaciones de efectos fijos, errores estándar (SE), grados de libertad (df), valores t, valores p e intervalos de confianza (IC) del 95% para la interacción y términos del modelo Group × Time.
| Dimensión | WCF Δ (bandas) | STEP-DWCF-R Δ (bandas) | ΔΔ (IC 95%) | ADJ-P |
| Respuesta a la Tarea (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Coherencia y Cohesión (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Recurso Léxico (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Rango Gramatical y Precisión (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tabla 4: Resultados a nivel dimensional (Tarea 2): cambios pre-post y diferencias entre grupos. Cambios pre-post (Δ) y diferencias en diferencias (ΔΔ) con intervalos de confianza (IC) del 95% y valores p ajustados por Holm para Respuesta a la Tarea (TR), Coherencia y Cohesión (CC), Recursos Léxicos (LR) y Rango y Precisión Gramatical (GRA).
| Umbral | WCF (%) | STEP-DWCF-R (%) |
| En general ≥ 6,5 | 13 | 81 |
| Nota ≥ global 7,0 | 0 | 25 |
Tabla 5: Obtención de la banda tras el examen (Semana 8). Proporción de alumnos en los grupos WCF y STEP-DWCF-R que alcanzan umbrales de puntuación global en IELTS de al menos 6,5 y al menos 7,0.
| Resultado | ICC | IC 95% |
| En general | 0.91 | [0.86, 0.94] |
| Respuesta a la Tarea (TR) | 0.88 | [0.82, 0.92] |
| Coherencia y Cohesión (CC) | 0.9 | [0.85, 0.94] |
| Recurso Léxico (LR) | 0.89 | [0.83, 0.93] |
| Rango Gramatical y Precisión (GRA) | 0.87 | [0.80, 0.91] |
Tabla 6: Fiabilidad entre evaluadores para los resultados del IELTS. Dos evaluadores a ciegas sobre N = 64 ensayos (Semana 1 y Semana 8 combinadas). El promedio mide los coeficientes de correlación intraclase (ICC[2,2]) con intervalos de confianza (IC) del 95% para las puntuaciones globales y dimensionales.
| Medida | Grupo WCF | Grupo STEP-DWCF-R |
| Rondas de repaso por tarea | 1 | 2.26 |
| Tasa de captación por retroalimentación (adoptada o modificada, %) | 68.5 | 82.3 |
| Tasa de error persistente tras la ronda final (%) | 67.4 | 45.6 |
| Tiempo de moderación del profesor (mínimo por tarea) | 23.5 | 13.8 |
| Tiempo de entrega del agente de IA (mínimo por tarea) | — | 3.9 |
| Tiempo de revisión del alumno (mínimo por tarea) | 44.8 | 71.2 |
| Tiempo total de feedback + revisión (min/tarea) | 68.3 | 88.9 |
Tabla 7: Medios a lo largo de 96 tareas (6 tareas × 16 alumnos). Las tasas de captación y errores persistentes se calcularon a nivel de punto de retroalimentación. Las medidas de tiempo se registraban a través de registros de profesores y marcas de tiempo del sistema. El tiempo de entrega de agentes de IA no es aplicable al grupo WCF.