Artículo de método

Un marco dinámico de retroalimentación correctiva escrita que integra la entrega de agentes con IA para soporte estructurado e iterativo de ensayos

DOI:

10.3791/71992

24 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio compara el STEP-DWCF-R (Proceso estructurado, escalonado, basado en evidencia para retroalimentación correctiva escrita dinámica con agente robótico de IA) para mejorar el rendimiento en redacción del IELTS mediante IA en varias rondas y revisiones apoyadas por el profesor.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los sistemas automatizados de retroalimentación por escritura son frecuentes, pero la mayoría emite comentarios estáticos y fragmentados que proporcionan un apoyo limitado para la revisión. Este estudio evalúa el marco STEP-DWCF-R (Proceso Estructurado, Escalonado, Basado en Evidencia para Retroalimentación Correctiva Escrita Dinámica con Agente de IA Robótico), en el que la retroalimentación generada por IA, moderada por un profesor, se entrega mediante un agente robótico de IA a lo largo de varias rondas iterativas en un ciclo de tareas de una semana. En un ensayo cuasi-experimental de ocho semanas, 32 estudiantes de EFL fueron aleatorizados a recibir retroalimentación correctiva tradicional por escrito (una ronda por tarea) o STEP-DWCF-R. Ambos grupos completaron ensayos de la Tarea 2 del IELTS tanto al inicio como después del examen, que fueron anonimizados, aleatorizados y puntuados por dos evaluadores independientes (ICC = 0,86–0,93). Los modelos lineales de efectos mixtos demostraron que el grupo STEP-DWCF-R mostró mejoras significativamente mayores en la puntuación global de bandas (Δ = 1,03 frente a 0,31 bandas) y en las cuatro dimensiones analíticas, con la mayor mejora observada en Coherencia y Cohesión. Los datos de proceso indicaron que los alumnos de STEP-DWCF-R completaron una media de 2,26 rondas de revisión por tarea, con un número de errores que disminuyó linealmente entre rondas. Estos hallazgos sugieren que el marco integrado STEP-DWCF-R, que abarca la retroalimentación generada por IA, la moderación del profesorado y la entrega iterativa de agentes robóticos de IA, está asociado a una mayor mejora en la redacción del IELTS que la retroalimentación tradicional de ronda única, apuntando a aplicaciones prácticas para la retroalimentación dinámica mejorada por IA en contextos de EFL.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La retroalimentación correctiva escrita (WCF) sigue siendo central en la pedagogía de la escritura de nivel 2. La evidencia muestra que la WCF integral mejora la precisión de los alumnos con el tiempo y, cuando se alinea con la práctica en el aula, puede coexistir con enfoques enfocados que son factibles en contextosauténticos 1,2,3. Estudios recientes en el aula muestran mejoras duraderas en precisión y fluidez gracias a una WCF sostenida y completa. La investigación sobre el alcance de la retroalimentación advierte que los profesores deben enfocar las formas de forma estratégica en lugar de calificartodo como 4,5,6,7,8,9. Paralelamente, la evaluación automática de escritura (AWE) y la retroalimentación correctiva automática por escrito (AWCF) han crecido rápidamente. Los resultados son mixtos: algunos estudios muestran mejoras en el rendimiento de tareas y en el rango gramatical con programas de tipo AWCF o Criterion, mientras que otros no encuentran ninguna ventaja significativa sobre la retroalimentación exclusiva del profesor o toman nota de revisiones mayormente locales y superficiales. Para reflejar esta heterogeneidad, triangulamos deliberadamente entre múltiples estudios de AWCF en lugar de basarnos en una única fuente 10,11,12,13.

También importan las creencias de los alumnos sobre quién proporciona retroalimentación: el trabajo cuasi-experimental sobre la fuente percibida indica que el rendimiento y la confianza pueden cambiar cuando la retroalimentación idéntica se presenta como "profesor" frente a "automatizada", subrayando la necesidad de tener en cuenta los efectos de percepción en los diseños AWCF14,15. Ampliando esta línea, estudios emergentes sugieren que los robots educativos, debido a su presencia incorporada, también pueden actuar como proveedores de retroalimentación, influyendo potencialmente en la implicación y confianza del aprendiz de formasdistintivas 16.

Una línea complementaria de investigación, la retroalimentación correctiva escrita dinámica (DWCF), enfatiza ciclos de retroalimentación frecuentes, manejables y completos con codificación y revisión rápida. La evidencia de múltiples entornos sugiere que el DWCF mejora de forma fiable la precisión (con efectos en la frecuencia sobre la fluidez), aunque los resultados pueden variar según los objetivos del curso y la poblaciónde estudiantes 17, 18, 19, 20. Finalmente, los primeros estudios sobre la retroalimentación mediada por IA generativa reportan paridad con la retroalimentación del profesor sobre los resultados de escritura y los posibles beneficios cuando se combinan con una orientación metalingüística explícita, motivando una integración más estrecha de la retroalimentación humana y de IA en contextos de L221,22.

Para abordar estos desafíos, proponemos el marco STEP-DWCF-R (Proceso estructurado, escalonado, basado en evidencia para retroalimentación correctiva escrita dinámica con agente de IA robótica), un novedoso sistema de retroalimentación DWCF de varias etapas diseñado para proporcionar soporte de escritura estructurado, iterativo y orientado al proceso. Nuestro sistema aprovecha el poder predictivo y generativo de los Grandes Modelos de Lenguaje (LLMs), con la entrega a través de una interfaz robótica de agente de IA y moderación del profesor, para segmentar problemas complejos de escritura en categorías manejables, ofrecer retroalimentación a través de múltiples rondas de interacción y evaluar su efectividad utilizando métricas tanto basadas en resultados como en procesos. Al transformar la retroalimentación en un proceso estructurado e interactivo, STEP-DWCF-R impulsa el soporte automatizado de escritura desde la corrección de errores estática hacia un sistema más atractivo, integrado y orientado al aprendizaje.

Nuestras contribuciones se centran en tres avances integrados. En primer lugar, proponemos un esquema estructurado de representación por retroalimentación que categoriza los errores (por ejemplo, gramática, coherencia) para que la retroalimentación de LLM entregada por agentes de IA robótica sea tanto accionable como pedagógicamente interpretable. En segundo lugar, introducimos un proceso iterativo de varias etapas que secuencia la retroalimentación a través del lenguaje, la estructura y el razonamiento a lo largo de varias rondas para reducir la carga cognitiva y profundizar la implicación. En tercer lugar, ampliamos la evaluación más allá de las puntuaciones posteriores para incluir métricas orientadas a procesos como la reducción de errores y la adopción de retroalimentación, ofreciendo una visión más amplia del impacto en el aprendizaje. Los marcos WCF representan los primeros intentos de sistematizar la retroalimentación correctiva escrita dentro de la tecnología educativa. Originarios de la Evaluación Automatizada de Escritura (AWE) y la Calificación Automatizada de Ensayos (AES), estos sistemas enfatizaban la detección de errores y la puntuación de competencia13,14. Su contribución radica en la escalabilidad: miles de estudiantes podrían recibir retroalimentación sin el cuello de botella de la calificación humana. Sin embargo, estos marcos suelen proporcionar comentarios estáticos y fragmentados, como revisiones gramaticales, sugerencias léxicas o puntuaciones globales que los estudiantes tuvieron dificultades para transformar en revisionessignificativas 23,24,25,26.

Con el tiempo, la investigación en la WCF evolucionó para incluir enfoques más mediados por la tecnología. Estos sistemas más recientes buscaron captar aspectos más amplios de la escritura aprovechando métodoscomputacionales 13,21. Más recientemente, el alcance se ha ampliado aún más con tecnologías incorporadas, donde los robots educativos han empezado a actuar como proveedores de retroalimentación en contextos de escritura o tutoría. Su presencia física y sus posibilidades interactivas introducen nuevas dinámicas de confianza, compromiso y motivación del alumno. Sin embargo, a pesar de estos desarrollos, la orientación dominante de la WCF se ha mantenido centrada enresultados 8,27: producir puntuaciones o comentarios aislados de forma puntual. Pedagogógicamente, esta orientación está desalineada con la evaluación formativa, donde la retroalimentación debe respaldar la revisión en los borradores y apoyar el compromisometacognitivo 16,28,29,30,31. Así, el límite conceptual de la WCF revela una brecha duradera: se proporciona retroalimentación, pero no se estructura ni secuencia para guiar los procesos de aprendizaje.

En respuesta a estas limitaciones, los estudiantes han comenzado a explorar enfoques más dinámicos para redactar feedback. Las primeras investigaciones destacaron la importancia de los ciclos iterativos de retroalimentación, donde los estudiantes revisan varias veces bajo directricesestructuradas 17,32. También se ha propuesto la categorización estructurada de errores para mejorar la interpretabilidad de la retroalimentación y alinearla con los objetivospedagógicos 33,34. La noción de marco DWCF consolida estas direcciones al incorporar tres principios de diseño: esquemas de error explícitos, entrega escalonada e iterativa, y métricas de evaluación orientadas aprocesos 19,35. En lugar de abrumar a los estudiantes con una gran cantidad de correcciones a la vez, DWCF distribuye la atención a través de capas de escritura—precisión superficial, coherencia estructural y profundidad argumentativa—a lo largo de rondassucesivas 17,33. La evaluación va más allá de las puntuaciones finales para incluir indicadores de proceso como tasas de reducción de errores, adopción de retroalimentación y profundidad de revisión10, 19 y 25. A pesar de su potencial, las aplicaciones prácticas de la DWCF siguen siendo escasas, y la mayoría de los estudios no llegan a operacionalizarla en contextos a gran escala mediados porla tecnología 10,36,37. Esta carencia pone de manifiesto la necesidad de marcos que no solo teoricen la DWCF, sino que también demuestren su viabilidad en entornos educativos reales. La Figura 1 muestra el marco teórico más amplio de DWCF propuesto en la literatura. La figura ofrece una justificación general de cómo la retroalimentación correctiva escrita dinámica puede operar en múltiples niveles, incluyendo tanto los resultados medidos (por ejemplo, precisión, coherencia) como los constructos teorizados pero no medidos en el presente estudio (por ejemplo, reducción de la ansiedad en la escritura, fluidez y complejidad). Se incluye para orientación teórica más que como un modelo directo de este ensayo. Los elementos correspondientes a los resultados y métricas de proceso analizados aquí se indican en la figura; Otras vías son ilustrativas y no fueron evaluadas en este estudio.

La aparición de los LLMs y los sistemas multimodales ofrece un medio poderoso para operacionalizar DWCF a gran escala. Los LLM, con sus capacidades de disparo cero y poco, pueden generar retroalimentación sensible al contexto sin entrenamiento específico de tarea21,22. Experimentos recientes sugieren su potencial para la segmentación directiva, el refinamiento escalonado y la generación de explicaciones, que se alinean estrechamente con los principios de DWCF 13,37,38,39. La investigación complementaria en colaboración humano-IA ha demostrado que los bucles iterativos de interacción, adaptación y adopción selectiva de retroalimentación de IA pueden mejorar tanto la calidad de la adopción como de la revisión25,30. Cuando estos procesos se incorporan a través de robots, la interacción tiene el potencial teórico de volverse multimodal —combinando gesto, voz y presencia— lo que puede mejorar aún más la percepción y motivación delaprendiz 40.

Basado en la Zona de Desarrollo Proximal (ZPD)41, la Hipótesis de Entrada42 y la Teoría de Adquisición de Habilidades43, posicionamos STEP-DWCF-R como un controlador que vincula el apoyo al aprendiz, el procesamiento de entradas y el desarrollo de habilidades. Concretamente, la enumeración vinculada a rúbricas, las listas consolidadas a tiempo y los ciclos de IA, humanos y robots moderados por profesores en varias rondas operan en una capa de integración que media la revisión y produce los puntos finales observables analizados aquí (IELTS Overall y TR/CC/LR/GRA; rondas, adopción, errores persistentes, tiempo). Constructos como la reducción de la ansiedad por escribir están teorizados pero no medidos en este ensayo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo fue aprobado por el Comité de Ética de la Escuela de Educación Primaria del Shangrao Preschool Education College. Todos los participantes eran adultos (≥18 años) y proporcionaron su consentimiento informado por escrito antes del estudio.

1. Diseño del estudio

NOTA: Debido a las limitaciones del aula de EFL disponible (matrícula total N = 32), los participantes fueron asignados aleatoriamente en dos grupos de 16 cada uno. Este tamaño de muestra, aunque modesto, se determinó suficiente para una investigación piloto dado el diseño pre-post dentro del sujeto y los tamaños de efecto grandes esperados basándose en estudios previos delDWCF 17,18,19,20.

  1. Aleatoriza a los participantes en dos grupos (n = 16 cada uno) usando aleatorización simple. Genera la secuencia de asignación usando una lista de números aleatorios generada por ordenador. Ocultar la asignación al instructor hasta que se complete la evaluación inicial.
  2. Asegúrate de que ambos grupos sean impartidos por el mismo instructor usando materiales y horas de contacto idénticos.
  3. Proporciona retroalimentación ya sea mediante corrección humana directa (WCF) o mediante el flujo de trabajo STEP-DWCF-R, donde la IA y el feedback del profesor se presentan mediante un agente robótico de IA.

2. Tareas de escritura

  1. Administrar un ensayo base de la Tarea 2 del IELTS en la Semana 1 bajo condiciones de examen (≥250 palabras, 40 min).
  2. Realiza seis tareas semanales de escritura (Semanas 2–7). Para cada tarea:
    1. En WCF, proporciona una ronda de comentarios humanos sobre el ensayo.
    2. En STEP-DWCF-R, genera retroalimentación de IA, modérala con un profesor humano e instruye al agente robótico de IA para que presente la retroalimentación de forma interactiva al alumno.
    3. En STEP-DWCF-R, repite el ciclo de retroalimentación STEP-DWCF-R durante 2–3 rondas hasta que la revisión esté completa.
  3. Administrar un ensayo de la tarea 2 del IELTS post-examen en la semana 8 bajo las mismas condiciones del examen. Sigue el mismo calendario semanal para cada tarea en ambos grupos. Entrega la retroalimentación de la Ronda 1 en un plazo de 24 horas desde la entrega del borrador en STEP-DWCF-R. Exigir a los alumnos que revisen y vuelvan a enviar en un plazo de 48 horas. Sigue el mismo horario para las rondas siguientes y completa todos los ciclos dentro de la ventana semanal.

3. Flujo de trabajo de retroalimentación

  1. Procesa cada borrador del aprendiz con la API GPT-5 (modelo = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) para generar retroalimentación detallada en cuatro categorías fijas: Gramática, Vocabulario, Organización y Razonamiento. El prompt exacto del sistema y el esquema de salida JSON se proporcionan en el repositorio de código abierto (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, función build_prompt() y normalize_reasoning()).
  2. Moderar la retroalimentación generada por IA según los siguientes criterios: eliminar falsos positivos o comentarios inexactos; añadir cuestiones críticas que se han pasado por alto alineadas con la rúbrica del IELTS; Asegúrate de que los comentarios sean accionables y alentadores; y mantener la consistencia con el esquema de cuatro categorías. Registra manualmente las decisiones de moderación.
  3. Guarda el feedback moderado en formato JSON y súbelo a la interfaz de agente de IA robótica (una aplicación web ligera de Flask).
  4. Presenta tus comentarios a través de la interfaz web. Muestra tablas estructuradas para cada categoría (resumen, números y consejos para revisiones). Registra los acuses de recibo y las solicitudes de aclaración de los alumnos a través de registros del sistema. Instruye a los alumnos a revisar y volver a enviar sus borradores. Repite el ciclo hasta tres veces por tarea.
  5. Verificación y resolución de problemas.
    1. Verifica la generación exitosa de retroalimentación por IA confirmando que la salida es JSON válida que contiene las cuatro categorías requeridas: Gramática, Vocabulario, Organización y Razonamiento. Confirma la finalización de la moderación del profesor asegurándote de que se hayan eliminado los falsos positivos, que se hayan añadido los problemas faltantes y que el archivo JSON moderado se haya guardado.
    2. Sube el archivo JSON moderado a la interfaz de agente robótico de IA basada en Flask a través del endpoint de subida. Confirma la subida exitosa a través del mensaje de confirmación de la interfaz y la entrada del registro de la base de datos. Registra automáticamente las reenvíos de los alumnos a través de los registros de envío de formularios.
    3. Procesar salidas de IA no conformes (por ejemplo, JSON mal formado, categorías faltantes o retroalimentación inexacta) utilizando las funciones ensure_json() y normalize_reasoning(). Regenera la salida de la API ajustando los parámetros del prompt según sea necesario. Corrige manualmente el JSON durante la moderación del profesor, si es necesario, para asegurarse de que las cuatro categorías estén presentes antes de subir.
      NOTA: Ejemplos de feedback en bruto de IA, versiones moderadas por profesores y la salida de la interfaz entregada están disponibles en el repositorio (datos/carpeta y cuadernos/).

4. Medición de resultados

  1. Define el resultado principal como el cambio en la puntuación global de la banda IELTS (de la semana 1 a la semana 8).
  2. Define los resultados secundarios como cambios en la Respuesta a la Tarea, Coherencia y Cohesión, Recursos Léxicos y Rango y Precisión Gramatical.
  3. Asigna a dos evaluadores independientes con experiencia en la calificación de la tarea 2 del IELTS para que evalúen todos los ensayos. Elimina nombres e identificadores de grupos de todos los ensayos. Aleatoriza el orden de los ensayos y los evaluadores a ciegas según la tarea grupal y el momento de tiempo. Usa el mismo prompt de la Tarea 2 del IELTS tanto para la línea de base de la Semana 1 como para la Semana 8 después del examen. Resolver los desacuerdos de puntuación superiores a 0,5 bandas mediante la discusión hasta alcanzar el consenso. Evalúa la fiabilidad entre evaluadores utilizando el coeficiente de correlación intraclase de medidas medias (ICC[2,2]).

5. Medición de procesos

  1. Registra el número de rondas de repaso por tarea.
  2. Recoger la captación de retroalimentación (adoptada, modificada, rechazada) por parte de los alumnos.
  3. Registra los errores persistentes entre ciclos.
  4. Registra el tiempo de feedback del profesor, el tiempo de entrega del robot y el tiempo de repaso del alumno.

6. Análisis de datos

  1. Ajustar modelos lineales de efectos mixtos con interacción de grupo, tiempo y grupo × tiempo.
  2. Aplicar modelos generalizados de efectos mixtos para las medidas de proceso.
  3. Informa sobre tamaños de efecto, intervalos de confianza del 95% y valores p ajustados.
  4. Realizar comprobaciones de robustez con ANCOVA, modelos específicos para evaluadores y SE robustos.

7. Disponibilidad de código

Todo el código, prompts, esquemas JSON y archivos de implementación de ejemplo necesarios para reproducir el sistema STEP-DWCF-R están disponibles abiertamente en https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentos y análisis

Los 32 alumnos proporcionaron datos de referencia. Los datos posteriores a la prueba estaban disponibles para 16 estudiantes de cada grupo (WCF y STEP-DWCF-R; Figura 2). La cronología y las medidas del estudio se presentan en la Figura 3, y el flujo de trabajo de retroalimentación de extremo a extremo se ilustra en la Figura 4. Los parámetros experimentales de configuración e implementación de nuestro sistema de IA se muestran en la Tabla 1. Los análisis siguieron el plan preestablecido con intención de tratar. Primero evaluamos la equivalencia basal (Tabla 2), luego informamos del resultado principal (Figura 5 y Tabla 3), seguido de los resultados secundarios (Tabla 4) con comprobaciones de robustez y fiabilidad.

Equivalencia de referencia

Al inicio (Semana 1), los grupos fueron descriptivamente similares en covariables predefinidas, incluyendo demografía y rendimiento en la redacción del IELTS antes de cualquier retroalimentación (Tabla 2). Las puntuaciones individuales de los componentes del IELTS se asignan en pasos de 0,5 bandas, mientras que las medias de grupos de informes de la tabla se asignan. Las medias generales de la Semana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) se calculan a partir de los mismos arrays usados para generar la Figura 5. No realizamos pruebas de hipótesis en la línea inicial; cualquier desequilibrio residual se aborda mediante el diseño pre-post y el término Group × Time en el modelo de efectos mixtos, y se informa en la sección de Protocolo una comparación post-prueba ajustada por la línea base.

Resultado de las primarias

La Figura 5 resume los cambios previos a la post-prueba, mientras que las Tablas 3 y la Tabla 5 informan de estimaciones del modelo y el rendimiento posterior a la prueba. Al inicio (Semana 1), las medias de grupo eran 5,625 para WCF y 5,500 para STEP-DWCF-R, lo que resulta en una diferencia de grupo no significativa de −0,125 bandas (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). Por tanto, la línea base de la Tabla 3 estima la media de la WCF de la Semana 1 en 5,625 con IC del 95% [5,419, 5,831] (SE = 0,097, df = 15). De la semana 1 a la semana 8, la WCF mejoró en 0,3125 bandas (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; efecto estandarizado dentro del grupo dz = 0,61). STEP-DWCF-R mejoró en 1,0313 bandas (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). El contraste lineal de efectos mixtos para la interacción Tiempo × Grupo —es decir, la diferencia en diferencias— fue de 0,7188 bandas (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabla 3), indicando mayores ganancias bajo STEP-DWCF-R. En la post-prueba (Semana 8), las medias marginales estimadas favorecían a STEP-DWCF-R en bandas de 0,5938 (test de Welch sobre medias de grupo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). En consonancia con esto, la tabla de rendimiento (Tabla 5) muestra que en la Semana 8, el 13% de los estudiantes de WCF alcanzaron el ≥ global 6,5 y el 0% alcanzó ≥ 7,0 (conteos 2/16 y 0/16), mientras que el 81% de los alumnos STEP-DWCF-R alcanzaron ≥ 6,5 y el 25% alcanzaron ≥ 7,0 (conteos 13/16 y 4/16). La Tabla 3 recoge las estimaciones correspondientes de efecto fijo y su incertidumbre.

Resultados a nivel dimensional

La Tabla 4 resume los cambios previos a la publicación a lo largo de las cuatro dimensiones de la Tarea 2. La respuesta a la tarea (TR) mostró una ganancia de Δ = 0,25 bandas bajo WCF frente a Δ = 0,95 bajo STEP-DWCF-R, lo que dio ΔΔ = 0,70 con IC del 95% [0,28, 1,12] y p ajustado por Holm = 0,006. La coherencia y cohesión (CC) mostró el mayor contraste: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, por lo tanto ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). El recurso léxico (LR) siguió el mismo patrón con WCF Δ = 0,35 y STEP-DWCF-R Δ = 0,95, dando ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). El rango gramatical y la precisión (GRA) mejorados en Δ = 0,25 en WCF y Δ = 0,97 en STEP-DWCF-R; el resultado ΔΔ = 0,72 tenía un IC del 95% de [0,31, 1,13] con adj-p = 0,004. En las cuatro dimensiones, los contrastes Grupo×Tiempo favorecieron STEP-DWCF-R tras el ajuste de Holm–Bonferroni.

Pruebas de Proceso

La Figura 6 y la Figura 7 visualizan los resultados del proceso principal. Durante las semanas 2–7, STEP-DWCF-R completó de media 2,26 rondas de revisión por tarea (IC 95% [2,17, 2,35]; n = 96), mientras que el WCF fue de 1,00 rondas para todas las tareas (n = 96). La diferencia media fue de 1,26 rondas (IC 95% [1,17, 1,35]); una prueba de Mann–Whitney confirmó la separación de las distribuciones (U = 9216, z = 11,97, p < 10−30). Dentro del STEP-DWCF-R, los recuentos de errores medios disminuyeron por ronda: 13,78 en la Ronda 1 (IC 95% [13,02, 14,54]; n = 96), 8,94 en la Ronda 2 (IC 95% [8,42, 9,46]; n = 96) y 6,16 en la Ronda 3 (IC 95% [5,20, 7,12]; n = 25). Una tendencia lineal ajustada a las observaciones por ronda estimó un descenso de 4,14 errores por ronda (IC 95% [3,51, 4,78] en magnitud absoluta; p < 10−12). Las medidas de captación de retroalimentación y tiempo de tarea no se codifican en la Figura 6 ni en la Figura 7, por lo que se informan en la Tabla 7.

Fiabilidad y robustez

El acuerdo entre evaluadores para los ensayos de la Semana 1 y 8 fue de bueno a excelente. Dos evaluadores entrenados calificaron todos los guiones de forma independiente y quedaron ciegos ante el grupo y el tiempo; utilizando medidas medias del coeficiente de correlación intraclase (ICC[2,2]) en las medias del evaluador, la fiabilidad osciló entre 0,86 y 0,93 en general, y las cuatro dimensiones, y todos los límites inferiores de confianza del 95% superaron el 0,80 (Tabla 6). Las comprobaciones diagnósticas para el modelo primario de efectos mixtos indicaron residuos aproximadamente normales sin heteroscedasticidad material, y los modelos ajustados a resúmenes de procesos a nivel de tarea mostraron una dispersión cercana a uno. Los análisis de sensibilidad basados en el mismo conjunto de datos de la Semana 1/Semana 8 arrojaron inferencias consistentes: una regresión lineal comparando grupos en la prueba posterior al ajustar por las puntuaciones iniciales estimó una diferencia ajustada entre grupos de 0,575 bandas en la semana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), y un modelo mixto específico del evaluador que incluía un efecto aleatorio para el evaluador y utilizaba puntuaciones no promediadas produjeron una estimación de tiempo × Grupo de 0,72 bandas (IC 95% [0,33, 1.11], p = 0,0007), alineándose con la Tabla 3. Los resultados no cambiaron al usar errores estándar robustos y cuando los análisis se restringieron a casos completos, reforzando la conclusión de que STEP-DWCF-R produce mayores ganancias antes del post que WCF.

Hallazgos cualitativos

Para el análisis cualitativo, examinamos los trazos de revisión STEP-DWCF-R en las seis tareas y reflexiones escritas al final del curso de los 16 participantes del grupo STEP-DWCF-R. Dos codificadores codificaron los materiales de forma independiente utilizando un marco deductivo enfocado basado en las cuatro categorías de retroalimentación (gramática, vocabulario, organización, razonamiento) y las justificaciones de adopción. El acuerdo entre codificadores fue sustancial con el kappa de Cohen de 0,78, y los desacuerdos se resolvieron mediante discusión.

El análisis reveló cinco temas clave: la captación seguía un patrón escalonado, con los alumnos resolviendo características superficiales antes de abordar la organización y el razonamiento; los ítems específicos de span, vinculados a rúbricas, eran más prácticos y adoptados con frecuencia que las sugerencias narrativas; La complementariedad IA-profesor moldeó la prioridad, con señales superpuestas que aumentaban el enfoque y la moderación del profesor resolvía conflictos; los beneficios alcanzaron su punto máximo temprano, con la reutilización de plantillas organizativas y patrones léxicos señalados en nuevas consignas; y los alumnos adaptaron estrategias a través de tareas. Estos temas informan la dinámica del proceso explorada en la sección de evidencia del proceso. También se registraron la captación de retroalimentación, errores persistentes y medidas de tiempo en la tarea. Un resumen de estos indicadores adicionales de proceso se presenta en la Tabla 7.

Interpretación de los resultados representativos

En conjunto, los datos de resultados y procesos indican que el marco STEP-DWCF-R está asociado a una mayor mejora en la redacción del IELTS que la retroalimentación tradicional de ronda única. El resultado principal muestra una diferencia entre grupos de 0,72 bandas, con el grupo STEP-DWCF-R mejorando en 1,03 bandas en total frente a 0,31 bandas en el grupo WCF. Esta ventaja fue consistente en las cuatro dimensiones analíticas, con el mayor contraste en Coherencia y Cohesión en las bandas de 0,85, lo que sugiere que la retroalimentación estructurada, vinculada a rúbricas y multietapa, particularmente favoreció el desarrollo organizativo. La evidencia del proceso indica además que el compromiso iterativo subyace a esta ventaja. Los alumnos del STEP-DWCF-R completaron una media de 2,26 rondas de revisión por tarea, y el número de errores disminuyó linealmente en aproximadamente 4,1 errores por ronda. Por ejemplo, un ciclo de flujo de trabajo representativo incluyó GPT-5 generando retroalimentación JSON estructurada en las cuatro categorías, seguido de moderación docente para eliminar falsos positivos y mejorar la capacidad de acción, y la posterior entrega a través de la interfaz de agente de IA robótica para la revisión de varias rondas por parte del alumno. Estos hallazgos apoyan la viabilidad y la posible efectividad del flujo de trabajo integrado multicomponente que combina retroalimentación generada por IA, moderación del profesorado y entrega iterativa de agentes robóticos de IA, pero no deben interpretarse como prueba de un componente individual por separado. El desequilibrio de dosis de 2–3 rondas frente a una ronda y el tamaño de muestra modesto de 32 hacen que las ganancias observadas reflejen el efecto combinado de un aumento de oportunidades de revisión y una retroalimentación estructurada. Estos resultados deben considerarse pruebas piloto prometedoras a la espera de confirmación en ensayos más grandes controlados por componentes.

figure-results-1
Figura 1. Marco teórico de DWCF (retroalimentación correctiva escrita dinámica). La cifra ofrece una justificación más amplia sobre cómo puede operar la DWCF; se incluye para orientación más que como un modelo directo de este ensayo. Los elementos correspondientes a los resultados y métricas de proceso analizados aquí se indican en la figura; Otras vías son ilustrativas y no fueron evaluadas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 2. Diagrama de flujo CONSORT de participantes. Se evaluó la elegibilidad de treinta y dos alumnos; ninguno fue excluido. Todos los participantes dieron su consentimiento y luego fueron aleatorizados en una proporción 1:1 al grupo WCF (n = 16) o al grupo DWCF (n = 16). Todos los participantes aleatorizados recibieron la intervención asignada; No hubo pérdidas por seguimiento ni interrupciones, y los 32 se incluyeron en el análisis final. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3. Cronología del estudio y medidas. El ensayo duró 8 semanas: en W1, los participantes completaron la tarea inicial IELTS 2 y fueron puntuados; se administraron seis tareas semanales de escritura desde W2 hasta W7 (Tarea 1–Tarea 6), con retroalimentación específica del grupo (WCF o DWCF) y revisiones tras cada tarea. Las medidas de proceso, incluyendo rondas de revisión, captación de retroalimentación, tasa de error persistente y tiempo de tarea, se registraron para cada tarea durante W2–W7. En W8, se administró y puntuó la tarea 2 del IELTS posterior al examen. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4. Flujo de trabajo de retroalimentación de extremo a extremo. Los alumnos elaboran un borrador inicial supervisado y luego reciben retroalimentación específica para cada grupo: WCF (una ronda de retroalimentación humana) o STEP-DWCF-R (retroalimentación generada por IA con moderación del profesor, entregada mediante agentes robóticos de IA, que implica 2–3 rondas iterativas). Los alumnos completan la ronda de revisión en consecuencia. El resultado es la puntuación de la banda de la Tarea 2 del IELTS; Las medidas de proceso incluyen el número de rondas, la captación de retroalimentación (adoptada/modificada/rechazada), la tasa de error persistente y el tiempo de tarea. El sistema registra los IDs a nivel de ítem, categoría/gravedad, origen (IA vs. humano vs. robot), acciones de moderación y estado de adopción. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5. Cambio en la banda general del IELTS de la Semana 1 a la Semana 8 por grupo. Los puntos muestran las medias estimadas de grupo con intervalos de confianza del 95%, y las trayectorias indican una mayor ganancia bajo el STEP-DWCF-R . Por favor, haga clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 6. Rondas de revisión por tarea por grupo (Semanas 2–7). Los puntos de datos representan rondas individuales de revisión de tareas para los grupos WCF (azul) y STEP-DWCF-R (naranja). Las líneas horizontales y las barras de error indican medias de grupo con intervalos de confianza del 95%. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-7
Figura 7. Conteo medio de error por ronda dentro del STEP-DWCF-R con IC del 95%. Los puntos indican el número medio de errores en cada ronda de retroalimentación (Ronda 1, Ronda 2, Ronda 3), y las líneas verticales representan intervalos de confianza (IC) del 95%. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

ComponenteEspecificaciones
HardwarePC con Intel(R) Core(TM) de 12ª generación i7-12700H (2,30 GHz), 32GB DE RAM, GPU NVIDIA RTX 3080Ti (16GB)
Sistema operativoWindows 11
BackendFlask~2.1 (Python~3.10)
FrontendPlantillas renderizadas por servidor en Jinja2
Modelos de IAAPI OpenAI GPT-5 (para generación de retroalimentación), postprocesamiento basado en esquemas
Programador de retroalimentaciónControlador personalizado que gestiona retroalimentación en varias etapas (3 ciclos)
Esquema de errorGramática, Vocabulario, Organización, Razonamiento
Control de versionesGitHub
TalaRegistro automático de envíos, comentarios y revisiones para análisis

Tabla 1: Parámetros de configuración e implementación experimental. Especificaciones técnicas del sistema de retroalimentación de IA, incluyendo configuración de hardware, sistema operativo, frameworks de backend y frontend, configuración de modelos de IA, programador de retroalimentación, categorías de esquemas de errores, control de versiones e infraestructura de registro.

VariableWCF (n=16)STEP-DWCF-R (n=16)
Edad (años), media (SD)20.9 (1.5)21.1 (1.6)
Femenina, n (%)9 (56%)8 (50%)
Preparación previa para el IELTS (sí), n (%)7 (44%)6 (38%)
Años de formación previa en escritura3.1 (1.2)3.2 (1.1)
Línea base de IELTS en general (banda)5.625 (0.387)5.500 (0.365)
Baseline TR (banda)5.56 (0.50)5.50 (0.50)
Baseline CC (banda)5.62 (0.49)5.53 (0.49)
Baseline LR (banda)5.60 (0.46)5.52 (0.46)
Baseline GRA (banda)5.56 (0.48)5.49 (0.45)

Tabla 2: Características de referencia de los participantes por grupo (Semana 1). Variables demográficas y rendimiento de redacción de la tarea 2 del Sistema Internacional de Pruebas de Lengua Inglesa (IELTS) previo al examen para los grupos WCF y STEP-DWCF-R. Los valores son la media (desviación estándar) o n (%).

Efecto fijoEstimaciónSEdftpIC 95%
Intercept (WCF, Semana~1)5.6250.0971558.1<.001[5.419, 5.831]
Grupo (STEP-DWCF-R vs. WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Tiempo (Semana~8 vs. Semana~1)0.31250.128152.44.028[0.039, 0.586]
Grupo × Tiempo0.71880.1929.753.78.0007[0.330, 1.107]

Tabla 3: Modelo lineal de efectos mixtos para la banda global del IELTS a partir de las puntuaciones de la Semana 1/8. Estimaciones de efectos fijos, errores estándar (SE), grados de libertad (df), valores t, valores p e intervalos de confianza (IC) del 95% para la interacción y términos del modelo Group × Time.

DimensiónWCF Δ (bandas)STEP-DWCF-R Δ (bandas)ΔΔ (IC 95%)ADJ-P
Respuesta a la Tarea (TR)0.250.950.70 (0.28, 1.12).006
Coherencia y Cohesión (CC)0.31.150.85 (0.44, 1.26).002
Recurso Léxico (LR)0.350.950.60 (0.18, 1.02).012
Rango Gramatical y Precisión (GRA)0.250.970.72 (0.31, 1.13).004

Tabla 4: Resultados a nivel dimensional (Tarea 2): cambios pre-post y diferencias entre grupos. Cambios pre-post (Δ) y diferencias en diferencias (ΔΔ) con intervalos de confianza (IC) del 95% y valores p ajustados por Holm para Respuesta a la Tarea (TR), Coherencia y Cohesión (CC), Recursos Léxicos (LR) y Rango y Precisión Gramatical (GRA).

UmbralWCF (%)STEP-DWCF-R (%)
En general ≥ 6,51381
Nota ≥ global 7,0025

Tabla 5: Obtención de la banda tras el examen (Semana 8). Proporción de alumnos en los grupos WCF y STEP-DWCF-R que alcanzan umbrales de puntuación global en IELTS de al menos 6,5 y al menos 7,0.

ResultadoICCIC 95%
En general0.91[0.86, 0.94]
Respuesta a la Tarea (TR)0.88[0.82, 0.92]
Coherencia y Cohesión (CC)0.9[0.85, 0.94]
Recurso Léxico (LR)0.89[0.83, 0.93]
Rango Gramatical y Precisión (GRA)0.87[0.80, 0.91]

Tabla 6: Fiabilidad entre evaluadores para los resultados del IELTS. Dos evaluadores a ciegas sobre N = 64 ensayos (Semana 1 y Semana 8 combinadas). El promedio mide los coeficientes de correlación intraclase (ICC[2,2]) con intervalos de confianza (IC) del 95% para las puntuaciones globales y dimensionales.

MedidaGrupo WCFGrupo STEP-DWCF-R
Rondas de repaso por tarea12.26
Tasa de captación por retroalimentación (adoptada o modificada, %)68.582.3
Tasa de error persistente tras la ronda final (%)67.445.6
Tiempo de moderación del profesor (mínimo por tarea)23.513.8
Tiempo de entrega del agente de IA (mínimo por tarea)3.9
Tiempo de revisión del alumno (mínimo por tarea)44.871.2
Tiempo total de feedback + revisión (min/tarea)68.388.9

Tabla 7: Medios a lo largo de 96 tareas (6 tareas × 16 alumnos). Las tasas de captación y errores persistentes se calcularon a nivel de punto de retroalimentación. Las medidas de tiempo se registraban a través de registros de profesores y marcas de tiempo del sistema. El tiempo de entrega de agentes de IA no es aplicable al grupo WCF.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio comparó STEP-DWCF-R, un marco dinámico de retroalimentación correctiva escrita multicomponente con un agente robótico de IA, con WCF de ronda única en un curso de redacción IELTS de ocho semanas. El paso DWCF-R produjo mayores ganancias antes del post en la banda total y en TR, CC, LR y GRA. Los estudiantes bajo STEP-DWCF-R también completaron más rondas de revisión y mostraron una reducción de errores más rápida, con modelos que estimaron una disminución de aproximadamente 4,1 errores por ronda. La mayor mejora fue en coherencia y cohesión (ΔΔ = 0,85), lo que indica que la retroalimentación estructurada vinculada a rúbricas fomenta una organización y precisión de mayor nivel. Estos hallazgos coinciden con investigaciones previas del DWCF que muestran que la retroalimentación iterativa y completa mejora la precisión de la escritura conel tiempo 14,15,16,17.

El flujo de trabajo STEP-DWCF-R implica tres pasos críticos. Primero, el sistema de IA genera retroalimentación detallada en cuatro categorías (Gramática, Vocabulario, Organización, Razonamiento) utilizando un esquema JSON restringido y una consigna de sistema estandarizado. En segundo lugar, el profesor modera la salida para eliminar falsos positivos, añadir cuestiones críticas pasadas por alto alineadas con la rúbrica del IELTS, asegurar una redacción accionable y alentadora, y mantener la coherencia con el esquema de cuatro categorías. Este paso de moderación sirve como principal mecanismo de solución de problemas, corrigiendo alucinaciones o sobrecalificaciones de IA que de otro modo podrían abrumar a los estudiantes. Cabe destacar que el tiempo de moderación del profesor por tarea fue menor en STEP-DWCF-R que en WCF (13,8 min frente a 23,5 min), porque la IA generó la retroalimentación estructurada inicial y el profesor solo la moderó. En tercer lugar, la respuesta moderada se entrega a través de la interfaz web de agentes robóticos de IA, que registra los acuses de recibo y las reenvíos de los alumnos a lo largo de varias rondas.

En comparación con los enfoques existentes, STEP-DWCF-R aborda limitaciones claras. La WCF convencional de una sola ronda sigue limitada por el tiempo del instructor y normalmente ofrece una oportunidad limitada para una revisión sostenida. Las herramientas automatizadas de evaluación de escritura ofrecen escalabilidad pero a menudo entregan comentarios estáticos y fragmentados que los alumnos tienen dificultades para traducir en revisionessignificativas 20, 21, 22. Los primeros estudios de DWCF demostraron la eficacia de los ciclos de retroalimentación de varias rondas, pero su dependencia de correcciones redactadas por el instructor planteó preocupaciones de viabilidad en las grandes clases14, 15, 16 y 17. Estudios recientes de retroalimentación generativa en IA reportan paridad con la retroalimentación de los profesores sobre los resultados de escritura, pero sin moderación estructurada ni entregaiterativa 18,19. STEP-DWCF-R combina la escalabilidad de la IA con la supervisión docente y la entrega iterativa de agentes robóticos de IA, logrando una menor carga de trabajo docente y aumentando la frecuencia de revisiones.

Reconocemos varias limitaciones. El tamaño relativamente pequeño de la muestra (N = 32) limita la generalizabilidad de nuestros hallazgos, y el estudio debe considerarse una investigación piloto. Las dos condiciones diferían en la dosis de retroalimentación: el grupo WCF solo recibió una ronda de retroalimentación por tarea, mientras que el grupo STEP-DWCF-R pasó por 2–3 rondas iterativas. Por lo tanto, el rendimiento superior del grupo STEP-DWCF-R refleja los efectos combinados de múltiples ciclos de revisión, la retroalimentación generada por IA y la moderación del profesor, en lugar del efecto aislado del agente robótico de IA o su modalidad de entrega. El agente robótico de IA es una interfaz web puramente virtual, por lo que sus efectos no pueden separarse de los de la propia estructura iterativa. La retroalimentación humana multimodal (por ejemplo, habla más gesto) no se incluyó como condición de control porque no es una práctica estándar en las aulas convencionales de escritura de inglés inglés y requeriría un paradigma experimental separado. Los estudios futuros deberían incluir grupos control con dosis igualadas (por ejemplo, retroalimentación de profesores en varias rondas) para desentrañar aún más estos componentes.

A pesar de estas limitaciones, el marco STEP-DWCF-R ofrece instrucciones prácticas para la enseñanza de la escritura asistida por IA. Su arquitectura modular permite la integración en sistemas de gestión del aprendizaje para cursos de inglés inglés a gran escala, y el esquema estructurado de cuatro categorías podría adaptarse para redacción académica o géneros específicos de cada disciplina. Las futuras iteraciones podrían explorar la entrega multimodal para aprovechar los beneficios teóricos de compromiso de los agentes incorporados, aunque el piloto actual establece la viabilidad de la colaboración iterativa basada en texto entre IA y profesores. No obstante, el patrón consistente entre las medidas de resultado, los indicadores de proceso y la fuerte fiabilidad entre evaluadores respaldan la viabilidad y la posible efectividad de este enfoque multicomponente en contextos similares de EFL.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue financiado por una subvención puente de la Universidad Sains de Malasia, Proyecto Nº: R501-LR-RND003-0000001342-0000.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersión 2.1; usado para la interfaz web del agente de IA robótica
API GPT-5OpenAIhttps://platform.openai.comModelo gpt-5, temperatura=0.7; para la generación de retroalimentación JSON estructurada
Jinja2Pallets Projectshttps://jinja.palletsprojects.comPlantillas renderizadas en el servidor para la interfaz web
PythonPython Software Foundationhttps://www.python.orgVersión 3.10; scripts de backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operativo para el sistema de retroalimentación de IA

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

Artículos relacionados