Artigo de método

Uma Estrutura Dinâmica de Feedback Corretivo Escrito Integrando a Entrega de Agentes de IA para suporte estruturado e iterativo de redações

DOI:

10.3791/71992

24 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo avalia o STEP-DWCF-R (Processo Estruturado, Escalonado, Orientado por Evidências para Feedback Corretivo Escrito Dinâmico com Agente Robótico de IA) para melhorar o desempenho na redação do IELTS por meio de IA em múltiplas rodadas e revisões apoiadas pelo professor.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sistemas automatizados de feedback de escrita são comuns, mas a maioria entrega comentários estáticos e fragmentados que fornecem uma estrutura limitada para revisão. Este estudo avalia o framework STEP-DWCF-R (Processo Estruturado, Escalonado, Orientado por Evidências para Feedback Corretivo Escrito Dinâmico com Agente Robótico de IA), no qual o feedback gerado por IA, moderado por um professor, é entregue por meio de um agente robótico de IA em várias rodadas iterativas em um ciclo de tarefas de uma semana. Em um ensaio quase-experimental de oito semanas, 32 aprendizes de EFL foram randomizados para feedback corretivo tradicional escrito (uma rodada por tarefa) ou STEP-DWCF-R. Ambos os grupos completaram redações da Tarefa 2 do IELTS no início e no pós-teste, que foram anonimizadas, randomizadas e pontuadas por dois avaliadores independentes (ICC = 0,86–0,93). Modelos lineares de efeitos mistos demonstraram que o grupo STEP-DWCF-R apresentou ganhos significativamente maiores na pontuação geral de bandas (Δ = 1,03 vs. 0,31 bandas) e em todas as quatro dimensões analíticas, com a maior melhora observada em Coerência e Coesão. Dados de processo indicaram que os aprendizes do STEP-DWCF-R completaram em média 2,26 rodadas de revisão por tarefa, com a contagem de erros diminuindo linearmente entre rodadas. Esses achados sugerem que o framework integrado STEP-DWCF-R, que abrange feedback gerado por IA, moderação de professores e entrega iterativa de agentes robóticos de IA, está associado a uma maior melhoria na escrita do IELTS do que o feedback tradicional de rodada única, apontando para aplicações práticas para feedback dinâmico aprimorado por IA em contextos de EFL.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O feedback corretivo escrito (WCF) permanece central na pedagogia da escrita L2. Evidências mostram que a WCF abrangente melhora a precisão dos alunos ao longo do tempo e, quando alinhada com a prática em sala de aula, pode coexistir com abordagens focadas que são viáveis em contextos autênticos 1,2,3. Estudos recentes em sala de aula mostram ganhos duradouros em precisão e fluência a partir de WCF sustentada e abrangente. Pesquisas sobre o escopo do feedback alertam que os professores devem focar as formas estrategicamente em vez de marcartudo como 4,5,6,7,8,9. Paralelamente, a avaliação automatizada de escrita (AWE) e o feedback corretivo escrito automatizado (AWCF) cresceram rapidamente. Os resultados são mistos: alguns estudos mostram ganhos no desempenho das tarefas e na amplitude gramatical com programas do estilo AWCF ou Criterion, enquanto outros não encontram vantagem significativa sobre o feedback exclusivo do professor ou anotam revisões em grande parte locais e superficiais. Para refletir essa heterogeneidade, triangulamos deliberadamente entre múltiplos estudos AWCF em vez de nos basear em uma única fonte 10,11,12,13.

As crenças dos aprendizes sobre quem está fornecendo feedback também importam: trabalhos quase experimentais sobre fontes percebidas indicam que desempenho e confiança podem mudar quando feedback idêntico é enquadrado como "professor" versus "automatizado", ressaltando a necessidade de levar em conta os efeitos de percepção nos projetos AWCF14,15. Ampliando essa linha, estudos emergentes sugerem que robôs educacionais, devido à sua presença incorporada, também podem atuar como provedores de feedback, potencialmente influenciando o engajamento e a confiança do aprendiz de maneirasdistintas 16.

Uma linha complementar de pesquisa, o feedback corretivo escrito dinâmico (DWCF), enfatiza ciclos de feedback frequentes, gerenciáveis e abrangentes, com codificação e revisão rápida. Evidências de múltiplos contextos sugerem que o DWCF melhora a precisão de forma confiável (com efeitos de frequência na fluência), embora os resultados possam variar conforme os objetivos do curso e a populaçãode alunos 17, 18, 19 e 20. Por fim, estudos iniciais sobre feedback mediado por IA generativa relatam paridade com o feedback dos professores sobre resultados de escrita e potenciais benefícios quando combinados com orientações metalinguísticas explícitas, motivando uma integração mais próxima do feedback humano e de IA em contextos L221,22.

Para enfrentar esses desafios, propomos o framework STEP-DWCF-R (Structured, Tierado, Evidência Orientado por Processos para Feedback Corretivo Escrito Dinâmico com Agente de IA Robótico), um novo sistema de feedback DWCF em múltiplos estágios projetado para fornecer suporte estruturado, iterativo e orientado para processos. Nosso sistema aproveita o poder preditivo e gerador dos Grandes Modelos de Linguagem (LLMs), com entrega por meio de uma interface robótica de agente de IA e moderação do professor, para segmentar questões complexas de escrita em categorias gerenciáveis, fornecer feedback por meio de múltiplas rodadas de interação e avaliar sua eficácia usando métricas tanto baseadas em resultados quanto em processos. Ao transformar o feedback em um processo estruturado e interativo, o STEP-DWCF-R avança o suporte automatizado de escrita, passando da correção estática de erros para um sistema mais envolvente, incorporado e orientado para o aprendizado.

Nossas contribuições se concentram em três avanços integrados. Primeiro, propomos um esquema estruturado de representação por feedback que categoriza erros (por exemplo, gramática, coerência) para que o feedback robótico de IA entregue por agentes de LLM seja tanto acionável quanto pedagogicamente interpretável. Segundo, introduzimos um processo iterativo em múltiplas etapas que sequencia o feedback entre linguagem, estrutura e raciocínio em várias rodadas para reduzir a carga cognitiva e aprofundar o engajamento. Terceiro, estendemos a avaliação além das pós-pontuações para incluir métricas orientadas a processos, como redução de erros e adoção de feedback, oferecendo uma visão mais completa do impacto da aprendizagem. Os frameworks WCF representam as primeiras tentativas de sistematizar feedback corretivo escrito dentro da tecnologia educacional. Originados na Avaliação Automatizada de Redação (AWE) e na Pontuação Automatizada de Redações (AES), esses sistemas enfatizavam a detecção de erros e a pontuaçãode proficiência, com 13,14. A contribuição deles está na escalabilidade: milhares de alunos poderiam receber feedback sem o gargalo da avaliação humana. No entanto, esses frameworks normalmente forneciam comentários estáticos e fragmentados, como correções gramaticais, sugestões lexicais ou pontuações globais que os alunos tinham dificuldade para transformar em revisõessignificativas 23,24,25,26.

Com o tempo, a pesquisa em WCF evoluiu para incluir abordagens mais mediadas por tecnologia. Esses sistemas mais recentes buscaram capturar aspectos mais amplos da escrita aproveitando métodoscomputacionais 13,21. Mais recentemente, o escopo se expandiu ainda mais com tecnologias incorporadas, onde robôs educacionais começaram a atuar como provedores de feedback em contextos de escrita ou tutoria. Sua presença física e possibilidades interativas introduzem novas dinâmicas de confiança, engajamento e motivação do aprendiz. No entanto, apesar desses desenvolvimentos, a orientação dominante da WCF permaneceu focada noresultado 8,27: produzindo pontuações ou comentários isolados de forma única. Pedagogicamente, essa orientação está desalinhada com a avaliação formativa, onde o feedback deve apoiar a revisão entre os rascunhos e apoiar o engajamento metacognitivo 16,28,29,30,31. Assim, o limite conceitual da WCF revela uma lacuna duradoura: o feedback é fornecido, mas não estruturado ou sequenciado para guiar os processos de aprendizagem.

Em resposta a essas limitações, os estudiosos começaram a explorar abordagens mais dinâmicas para escrever feedback. Investigações iniciais destacaram a importância dos ciclos iterativos de feedback, onde os aprendizes revisam várias vezes sob orientaçãofundamentada 17,32. A categorização estruturada de erros também foi proposta para melhorar a interpretabilidade do feedback e alinhá-la com os objetivospedagógicos 33,34. A noção de um framework DWCF consolida essas direções ao incorporar três princípios de projeto: esquemas de erro explícitos, entrega em etapas e iterativa, e métricas de avaliação orientadas aprocessos 19,35. Em vez de sobrecarregar os alunos com uma grande quantidade de correções ao mesmo tempo, o DWCF distribui a atenção entre camadas de escrita — precisão superficial, coerência estrutural e profundidade argumentativa — ao longo das rodadassucessivas 17,33. A avaliação vai além das pontuações finais para incluir indicadores de processo, como taxas de redução de erros, adoção de feedback e profundidade de revisão10, 19, 25. Apesar de seu potencial, as aplicações práticas da DWCF continuam escassas, e a maioria dos estudos não chega a operacionalizá-la em contextos de grande escala mediados portecnologia 10,36,37. Essa lacuna destaca a necessidade de estruturas que não apenas teoricem a DWCF, mas também demonstrem sua viabilidade em ambientes educacionais do mundo real. A Figura 1 mostra o arcabouço teórico mais amplo da DWCF proposto na literatura. A figura fornece uma justificativa geral de como o feedback corretivo escrito dinâmico pode operar em múltiplos níveis, incluindo tanto resultados medidos (por exemplo, precisão, coerência) quanto construtos teorizados, mas não medidos, no presente estudo (por exemplo, redução da ansiedade na escrita, fluência e complexidade). Ele é incluído para orientação teórica, e não como um modelo direto deste ensaio. Elementos correspondentes aos resultados e métricas de processo analisados aqui estão indicados na figura; Outras vias são ilustrativas e não foram avaliadas neste estudo.

O surgimento de LLMs e sistemas multimodais oferece um meio poderoso de operacionalizar o DWCF em larga escala. LLMs, com suas capacidades zero-shot e few-shot, podem gerar feedback sensível ao contexto sem treinamento específico paratarefa 21,22. Experimentos recentes sugerem seu potencial para segmentação diretiva, refinamento em etapas e geração de explicações, que se alinham intimamente com os princípios do DWCF 13,37,38,39. Pesquisas complementares em colaboração humano–IA mostraram que ciclos iterativos de engajamento, adaptação e adoção seletiva do feedback da IA podem melhorar tanto a qualidade da adoção quanto da revisão25,30. Quando esses processos são incorporados por meio de robôs, a interação tem o potencial teórico de se tornar multimodal — combinando gesto, voz e presença — o que pode aprimorar ainda mais a percepção e motivação doaprendiz 40.

Fundamentados na Zona de Desenvolvimento Proximal (ZPD)41, na Hipótese de Entrada42 e na Teoria da Aquisição de Habilidades, posicionamos o STEP-DWCF-R como um controlador que conecta o suporte ao aprendiz, processamento de entrada e desenvolvimento de habilidades. Concretamente, a itemização vinculada a rubricas, listas consolidadas oportunas e ciclos de IA, humanos e robôs moderados por professores em múltiplas rodadas operam em uma camada de integração que media a revisão e gera os pontos finais observáveis analisados aqui (IELTS Overall e TR/CC/LR/GRA; rodadas, admissão, erros persistentes, tempo). Construtos como redução da ansiedade na escrita são teorizados, mas não medidos neste estudo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse protocolo foi aprovado pelo Comitê de Ética da Escola de Educação Primária do Shangrao Preschool Education College. Todos os participantes eram adultos (≥18 anos) e forneceram consentimento informado por escrito antes do estudo.

1. Desenho do estudo

NOTA: Devido às limitações da sala de aula de EFL disponível (matrícula total N = 32), os participantes foram randomizados em dois grupos de 16 cada. Esse tamanho da amostra, embora modesto, foi considerado suficiente para uma investigação piloto, dado o desenho pré-pós-pós-dentro do sujeito e os tamanhos de efeito grandes esperados, com base em estudos anteriores doDWCF 17,18,19,20.

  1. Randomize os participantes em dois grupos (n = 16 cada) usando randomização simples. Gerar a sequência de alocação usando uma lista de números aleatórios gerada por computador. Oculte a alocação do instrutor até que a avaliação inicial seja concluída.
  2. Garanta que ambos os grupos sejam ministrados pelo mesmo instrutor, usando materiais e horários de contato idênticos.
  3. Fornecer feedback seja por meio da correção humana direta (WCF) ou pelo fluxo de trabalho STEP-DWCF-R, onde o feedback da IA e do professor é apresentado por meio de um agente robótico de IA.

2. Tarefas de Escrita

  1. Administrar uma redação básica da Tarefa 2 do IELTS na Semana 1 sob condições de prova (≥250 palavras, 40 min).
  2. Realize seis tarefas semanais de escrita (Semanas 2–7). Para cada tarefa:
    1. No WCF, forneça uma rodada de feedback humano sobre a redação.
    2. No STEP-DWCF-R, gere feedback de IA, modere-o com um professor humano e instrua o agente robótico de IA a apresentar o feedback de forma interativa ao aprendiz.
    3. No STEP-DWCF-R, repita o ciclo de retroalimentação STEP-DWCF-R por 2–3 rodadas até que a revisão seja concluída.
  3. Administrar uma redação pós-prova da Tarefa 2 do IELTS na Semana 8 sob as mesmas condições do exame. Siga o mesmo calendário semanal para cada tarefa em ambos os grupos. Entregue feedback da Rodada 1 dentro de 24 horas após a submissão do rascunho no STEP-DWCF-R. Exigir que os alunos revisem e reenviem dentro de 48 horas. Siga o mesmo cronograma para as rodadas seguintes e complete todos os ciclos dentro do período semanal.

3. Fluxo de Trabalho de Feedback

  1. Processe cada rascunho do aprendiz com a API GPT-5 (modelo = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) para gerar feedback detalhado em quatro categorias fixas: Gramática, Vocabulário, Organização e Raciocínio. O prompt exato do sistema e o esquema de saída JSON são fornecidos no repositório open-source (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, função build_prompt() e normalize_reasoning()).
  2. Moderar o feedback gerado pela IA de acordo com os seguintes critérios: remover falsos positivos ou comentários imprecisos; adicionar questões críticas que não passaram para fora alinhadas com a rubrica do IELTS; garantir que os comentários sejam acionáveis e encorajadores; e manter a consistência com o esquema de quatro categorias. Registre as decisões de moderação manualmente.
  3. Salve o feedback moderado em formato JSON e faça o upload na interface do agente robótico de IA (uma aplicação web leve do Flask).
  4. Apresente feedback pela interface web. Exiba tabelas estruturadas para cada categoria (resumo, questões e dicas de revisão). Registre os confirmantes e solicitações de esclarecimento dos aprendizes por meio de registros do sistema. Instrua os alunos a revisar e reenviar seus rascunhos. Repita o ciclo até três vezes por tarefa.
  5. Verificação e solução de problemas.
    1. Verifique a geração bem-sucedida de feedback por IA confirmando que o resultado é válido em JSON contendo as quatro categorias exigidas: Gramática, Vocabulário, Organização e Raciocínio. Confirme a conclusão da moderação dos professores garantindo que os falsos positivos tenham sido removidos, os problemas ausentes tenham sido adicionados e o arquivo JSON moderado tenha sido salvo.
    2. Faça upload do arquivo JSON moderado para a interface do agente robótico de IA baseada no Flask através do endpoint de upload. Confirme o upload bem-sucedido através da mensagem de confirmação da interface e da entrada de log do banco de dados. Registre automaticamente as reenviações dos alunos por meio dos registros de envio de formulários.
    3. Processe resultados de IA não conformes (por exemplo, JSON malformado, categorias ausentes ou feedback impreciso) usando as funções ensure_json() e normalize_reasoning(). Gere a saída da API com parâmetros ajustados do prompt conforme necessário. Corrija manualmente o JSON durante a moderação do professor, se necessário, para garantir que todas as quatro categorias estejam presentes antes do upload.
      NOTA: Exemplos de feedback bruto de IA, versões moderadas pelo professor e a saída da interface entregue estão disponíveis no repositório (dados/pasta e cadernos/).

4. Mensuração de Resultados

  1. Defina o resultado primário como a mudança na pontuação geral da faixa do IELTS (Semana 1 a Semana 8).
  2. Defina resultados secundários como mudanças na Resposta à Tarefa, Coerência e Coesão, Recursos Lexicais e Alcance Gramatical e Precisão.
  3. Designe dois avaliadores independentes com experiência na avaliação da Tarefa 2 do IELTS para avaliar todas as redações. Remova nomes e identificadores de grupos de todos os ensaios. Randomize a ordem dos ensaios e avaliadores cegos para trabalhos em grupo e prazos. Use o mesmo prompt da Tarefa 2 do IELTS tanto para a linha inicial da Semana 1 quanto para a Semana 8 após o teste. Resolver discordâncias de pontuação acima de 0,5 faixas por meio da discussão até que se alcance consenso. Avalie a confiabilidade entre avaliadores usando o coeficiente de correlação intraclasse de medidas médias (ICC[2,2]).

5. Medição de Processos

  1. Registre o número de rodadas de revisão por tarefa.
  2. Registro da captação do feedback (adotado, modificado, recusado) pelos aprendizes.
  3. Acompanhe erros persistentes entre os ciclos.
  4. Registre o tempo de feedback do professor, o tempo de entrega do robô e o tempo de revisão do aluno.

6. Análise de Dados

  1. Ajustar modelos lineares de efeitos mistos com interação Grupo, Tempo e Grupo × Tempo.
  2. Aplique modelos generalizados de efeitos mistos para medidas de processo.
  3. Relate tamanhos de efeito, intervalos de confiança de 95% e valores p ajustados.
  4. Realize verificações de robustez com ANCOVA, modelos específicos para avaliadores e SEs robustos.

7. Disponibilidade de Código

Todo o código, prompts, esquemas JSON e arquivos de implementação de exemplo necessários para reproduzir o sistema STEP-DWCF-R estão disponíveis abertamente no https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentos e Análises

Todos os 32 alunos forneceram dados de referência. Os dados pós-teste estavam disponíveis para 16 aprendizes em cada grupo (WCF e STEP-DWCF-R; Figura 2). A linha do tempo e as medidas do estudo são apresentadas na Figura 3, e o fluxo de trabalho de feedback de ponta a ponta é ilustrado na Figura 4. Os parâmetros experimentais de configuração e implementação do nosso sistema de IA são mostrados na Tabela 1. As análises seguiram o plano pré-especificado com intenção de tratar. Primeiro avaliamos a equivalência basal (Tabela 2), depois relatamos o desfecho primário (Figura 5 e Tabela 3), seguido pelos desfechos secundários (Tabela 4) com verificações de robustez e confiabilidade.

Equivalência de Linha de Base

No início do jogo (Semana 1), os grupos foram descritivamente semelhantes em covariáveis pré-especificadas, incluindo demografia e desempenho na redação do IELTS antes de qualquer feedback (Tabela 2). As pontuações individuais dos componentes do IELTS são atribuídas em etapas de 0,5 bandas, enquanto as médias dos grupos de relatórios da tabela são atribuídas. As médias gerais da Semana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) são calculadas a partir dos mesmos arrays usados para gerar a Figura 5. Não realizamos testes de hipótese no início do começo; qualquer desequilíbrio residual é tratado pelo projeto pré-pós-e pelo termo Grupo × Tempo no modelo de efeitos mistos, e uma comparação pós-teste ajustada para a linha de base é reportada na seção de Protocolo.

Desfecho Primário

A Figura 5 resume as mudanças pré-pós-exame, enquanto as Tabelas 3 e 5 reportam estimativas do modelo e o desempenho pós-teste. No início do jogo (Semana 1), as médias dos grupos foram 5,625 para WCF e 5,500 para STEP-DWCF-R, resultando em uma diferença de grupo não significativa de −0,125 bandas (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). A linha de base na Tabela 3, portanto, estima a média da WCF Semana 1 em 5,625 com IC 95% [5,419, 5,831] (SE = 0,097, df = 15). Da Semana 1 à Semana 8, a FCC melhorou em 0,3125 faixas (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; efeito dentro do grupo padronizado dz = 0,61). O STEP-DWCF-R melhorou em 1,0313 bandas (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). O contraste linear de efeitos mistos para a interação Tempo × Grupo — ou seja, a diferença nas diferenças — foi de 0,7188 bandas (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabela 3), indicando ganhos maiores sob o STEP-DWCF-R. No pós-teste (Semana 8), as médias marginais estimadas favoreciam o STEP-DWCF-R em 0,5938 bandas (teste de Welch sobre médias de grupo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). De acordo com isso, a tabela de desempenho (Tabela 5) mostra que, na Semana 8, 13% dos alunos do WCF atingiram ≥ geral de 6,5 e 0% alcançaram ≥ 7,0 (contagens 2/16 e 0/16), enquanto 81% dos alunos do STEP-DWCF-R atingiram ≥ 6,5 e 25% atingiram ≥ 7,0 (contagens 13/16 e 4/16). A Tabela 3 relata as estimativas correspondentes de efeito fixo e sua incerteza.

Resultados em Nível Dimensional

A Tabela 4 resume as mudanças pré-pós-pós-produção nas quatro dimensões da Tarefa 2. A Resposta à Tarefa (TR) mostrou um ganho de Δ = 0,25 faixas sob WCF versus Δ = 0,95 sob STEP-DWCF-R, resultando em ΔΔ = 0,70 com IC 95% [0,28, 1,12] e p ajustado por Holm = 0,006. Coerência e Coesão (CC) apresentaram o maior contraste: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, portanto ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). O Recurso Lexical (LR) seguiu o mesmo padrão com WCF Δ = 0,35 e STEP-DWCF-R Δ = 0,95, resultando em ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). Alcance Gramatical e Precisão (GRA) melhorados em Δ = 0,25 em WCF e Δ = 0,97 em STEP-DWCF-R; o ΔΔ = 0,72 resultante apresentou um IC de 95% de [0,31, 1,13] com ADJ-p = 0,004. Em todas as quatro dimensões, os contrastes Group×Time favoreceram o STEP-DWCF-R após o ajuste de Holm–Bonferroni.

Evidência de Processo

As Figuras 6 e 7 visualizam os resultados do processo central. Entre as Semanas 2 e 7, o STEP-DWCF-R completou em média 2,26 rodadas de revisão por tarefa (IC 95% [2,17, 2,35]; n = 96), enquanto o WCF foi de 1,00 rodadas para todas as tarefas (n = 96). A diferença média foi de 1,26 rodadas (IC 95% [1,17, 1,35]); um teste de Mann–Whitney confirmou a separação das distribuições (U = 9216, z = 11,97, p < 10−30). Dentro do STEP-DWCF-R, as contagens médias de erro diminuíram por rodada: 13,78 na Rodada 1 (IC 95% [13,02, 14,54]; n = 96), 8,94 na Rodada 2 (IC 95% [8,42, 9,46]; n = 96) e 6,16 na Rodada 3 (IC 95% [5,20, 7,12]; n = 25). Uma tendência linear ajustada a observações por rodada estimou uma queda de 4,14 erros por rodada (IC 95% [3,51, 4,78] em magnitude absoluta; p < 10−12). As medidas de captação de feedback e tempo de trabalho não estão codificadas nas Figuras 6 e 7 e, portanto, são relatadas na Tabela 7.

Confiabilidade e Robustez

O acordo entre avaliadores para redações da Semana 1 e 8 foi bom a excelente. Dois avaliadores treinados pontuaram todos os roteiros de forma independente e foram cegos para o grupo e o tempo; usando medidas médias do coeficiente de correlação intraclasse (ICC[2,2]) nas médias do avaliador, a confiabilidade variou de 0,86–0,93 em todo o Geral, e as quatro dimensões, e todos os limites inferiores de confiança de 95% excederam 0,80 (Tabela 6). As verificações diagnósticas para o modelo primário de efeitos mistos indicaram resíduos aproximadamente normais sem heteroscedasticidade material, e modelos ajustados a resumos de processos em nível de tarefa mostraram dispersão próxima a um. Análises de sensibilidade baseadas no mesmo conjunto de dados da Semana 1/8 produziram inferências consistentes: uma regressão linear comparando grupos no pós-teste, ajustando para as pontuações iniciais, estimou uma diferença ajustada entre grupos de 0,575 faixas na Semana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), e um modelo misto específico para avaliador que incluiu efeito aleatório para avaliador e usou escores não médios produziram uma estimativa Group × Time de 0,72 faixas (IC 95% [0,33, 1.11], p = 0,0007), alinhando-se com a Tabela 3. Os resultados permaneceram inalterados ao usar erros padrão robustos e quando as análises foram restritas a casos completos, reforçando a conclusão de que o STEP-DWCF-R gera ganhos maiores antes do pós-pós-processamento do que o WCF.

Achados Qualitativos

Para análise qualitativa, examinamos os traços de revisão do STEP-DWCF-R em todas as seis tarefas e reflexões escritas ao final do curso dos 16 participantes do grupo STEP-DWCF-R. Dois programadores codificaram os materiais de forma independente usando uma estrutura dedutiva focada baseada nas quatro categorias de feedback (gramática, vocabulário, organização, raciocínio) e nas justificativas de absorção. O acordo entre codificadores era substancial com o kappa de Cohen de 0,78, e os desentendimentos eram resolvidos por meio de discussão.

A análise revelou cinco temas-chave: a absorção seguia um padrão escalonado, com os aprendizes resolvendo características superficiais antes de abordar a organização e o raciocínio; itens específicos do span e vinculados à rubrica eram mais acionáveis e frequentemente adotados do que sugestões narrativas; A complementaridade IA-professor moldou prioridades, com sinais sobrepostos aumentando o foco e moderação dos professores resolvendo conflitos; os benefícios atingiram o pico cedo, com o reuso de modelos organizacionais e padrões lexicais observados em novos prompts; e os aprendizes adaptaram estratégias entre as tarefas. Esses temas informam a dinâmica do processo explorada na seção de evidências de processo. Também foram registrados captação de feedback, erros persistentes e medidas de tempo na tarefa. Um resumo desses indicadores adicionais de processo é apresentado na Tabela 7.

Interpretação dos Resultados Representativos

Em conjunto, os dados de resultados e processos indicam que o framework STEP-DWCF-R está associado a uma maior melhoria na escrita do IELTS do que o feedback tradicional de rodada única. O resultado primário mostra uma diferença entre os grupos de 0,72 faixas, com o grupo STEP-DWCF-R melhorando 1,03 faixas no total, em comparação com 0,31 faixas no grupo WCF. Essa vantagem foi consistente em todas as quatro dimensões analíticas, com o maior contraste em Coerência e Coesão em bandas de 0,85, sugerindo que o feedback estruturado, vinculado a rubricas e multi-estágios, particularmente facilitou o desenvolvimento organizacional. Evidências de processo indicam ainda que o engajamento iterativo está na base dessa vantagem. Os aprendizes do STEP-DWCF-R completaram em média 2,26 rodadas de revisão por tarefa, e a contagem de erros diminuiu linearmente em aproximadamente 4,1 erros por rodada. Por exemplo, um ciclo de fluxo de trabalho representativo incluiu o GPT-5 gerando feedback JSON estruturado nas quatro categorias, seguido pela moderação do professor para eliminar falsos positivos e melhorar a atuabilidade, e a entrega subsequente via interface de agente robótico de IA para revisão múltipla do aprendiz. Esses achados apoiam a viabilidade e a potencial eficácia do fluxo de trabalho integrado multicomponente que combina feedback gerado por IA, moderação de professores e entrega iterativa de agentes robóticos de IA, mas não devem ser interpretados como prova isolada de qualquer componente isolado. O desequilíbrio de dose de 2–3 rodadas versus uma rodada e o tamanho modesto da amostra de 32 significam que os ganhos observados refletem o efeito combinado do aumento das oportunidades de revisão e do feedback estruturado. Esses resultados devem ser vistos como evidências piloto promissoras aguardando confirmação em ensaios maiores controlados por componentes.

figure-results-1
Figura 1. Estrutura teórica do DWCF (feedback corretivo escrito dinâmico). A figura apresenta uma justificativa mais ampla para como a DWCF pode operar; ele é incluído para orientação, e não como um modelo direto deste estudo. Elementos correspondentes aos resultados e métricas de processo analisados aqui estão indicados na figura; Outros caminhos são ilustrativos e não foram avaliados. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-2
Figura 2. Diagrama de fluxo CONSORT dos participantes. Trinta e dois alunos foram avaliados quanto à elegibilidade; nenhum foi excluído. Todos os participantes deram consentimento e foram então randomizados em proporção 1:1 para o grupo WCF (n = 16) ou para o grupo DWCF (n = 16). Todos os participantes randomizados receberam a intervenção alocada; Não houve perdas para acompanhamento ou descontinuação, e todos os 32 foram incluídos na análise final. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 3. Cronograma e medidas do estudo. O estudo durou 8 semanas: no W1, os participantes completaram a Tarefa 2 do IELTS de base e foram pontuados; seis tarefas semanais de escrita foram administradas do W2 ao W7 (Tarefa 1–Tarefa 6), com feedback específico para cada grupo (WCF ou DWCF) e revisões após cada tarefa. Medidas de processo, incluindo rodadas de revisão, captação de feedback, taxa de erro persistente e tempo de tarefa, foram registradas para cada tarefa durante o W2–W7. No W8, a Tarefa 2 do IELTS pós-teste foi aplicada e pontuada. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 4. Fluxo de trabalho de feedback de ponta a ponta. Os alunos produzem um rascunho inicial supervisionado e recebem feedback específico do grupo: WCF (uma rodada de feedback humano) ou STEP-DWCF-R (feedback gerado por IA com moderação do professor, entregue via agentes robóticos de IA, envolvendo 2–3 rodadas iterativas). Os alunos completam rodadas de revisão conforme necessário. O resultado é a pontuação da faixa da Tarefa 2 do IELTS; As medidas do processo incluem número de rodadas, captação de feedback (adotada/modificada/recusada), taxa de erro persistente e tempo na tarefa. O sistema registra IDs em nível de item, categoria/gravidade, origem (IA vs. humano vs. robô), ações de moderação e status de admissão. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-5
Figura 5. Mudança na faixa geral do IELTS da Semana 1 à Semana 8 por grupo. Os pontos apresentam as médias estimadas de grupo com intervalos de confiança de 95%, e as trajetórias indicam um ganho maior sob STEP-DWCF-R . Por favor, clique aqui para ver uma versão maior desta figura.

figure-results-6
Figura 6. Rodadas de revisão por tarefa por grupo (Semanas 2–7). Os pontos de dados representam rodadas individuais de revisão de tarefas para os grupos WCF (azul) e STEP-DWCF-R (laranja). Linhas horizontais e barras de erro indicam médias de grupo com intervalos de confiança de 95%. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-7
Figura 7. Contagens médias de erro por rodada dentro do STEP-DWCF-R com IC 95%. Pontos indicam a média de erros em cada rodada de feedback (Rodada 1, Rodada 2, Rodada 3), e linhas verticais representam intervalos de confiança (ICs) de 95%. Por favor, clique aqui para ver uma versão ampliada desta figura.

ComponenteEspecificação
HardwarePC com Intel(R) Core(TM) de 12ª geração i7-12700H (2,30 GHz), 32GB DE RAM, GPU NVIDIA RTX 3080Ti (16GB)
Sistema OperacionalWindows 11
BackendFlask~2.1 (Python~3.10)
FrontendTemplates renderizados por servidor Jinja2
Modelos de IAOpenAI GPT-5 API (para geração de feedback), pós-processamento baseado em esquema
Agendador de FeedbackControlador personalizado gerenciando feedback em múltiplos estágios (3 ciclos)
Esquema de ErroGramática, Vocabulário, Organização, Raciocínio
Controle de VersãoGitHub
RegistroRegistro automático de submissões, feedback e revisões para análise

Tabela 1: Parâmetros experimentais de configuração e implementação. Especificações técnicas do sistema de feedback de IA, incluindo configuração de hardware, sistema operacional, frameworks de backend e frontend, configurações de modelos de IA, escalonador de feedback, categorias de esquema de erro, controle de versões e infraestrutura de log.

VariávelWCF (n=16)STEP-DWCF-R (n=16)
Idade (anos), média (SD)20.9 (1.5)21.1 (1.6)
Feminino, n (%)9 (56%)8 (50%)
Preparação prévia para o IELTS (sim), n (%)7 (44%)6 (38%)
Anos de instrução prévia em escrita3.1 (1.2)3.2 (1.1)
Linha Básica do IELTS Geral (faixa)5.625 (0.387)5.500 (0.365)
Baseline TR (banda)5.56 (0.50)5.50 (0.50)
Baseline CC (banda)5.62 (0.49)5.53 (0.49)
LR de base (banda)5.60 (0.46)5.52 (0.46)
Baseline GRA (banda)5.56 (0.48)5.49 (0.45)

Tabela 2: Características de referência dos participantes por grupo (Semana 1). Variáveis demográficas e desempenho pré-teste do Sistema Internacional de Testes de Língua Inglesa (IELTS) Tarefa 2 para os grupos WCF e STEP-DWCF-R. Os valores são média (desvio padrão) ou n (%).

Efeito fixoEstimativaSEdftpIC 95%
Intercept (WCF, Semana~1)5.6250.0971558.1<.001[5.419, 5.831]
Grupo (STEP-DWCF-R vs. WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Tempo (Semana~8 vs. Semana~1)0.31250.128152.44.028[0.039, 0.586]
Grupo × Time0.71880.1929.753.78.0007[0.330, 1.107]

Tabela 3: Modelo linear de efeitos mistos para a faixa geral do IELTS a partir das pontuações da Semana 1/8. Estimativas de efeito fixo, erros padrão (SE), graus de liberdade (df), valores t, valores p e intervalos de confiança (ICs) de 95% para a interação do Grupo × Tempo e termos do modelo.

DimensãoWCF Δ (bandas)STEP-DWCF-R Δ (bandas)ΔΔ (IC 95%)ADJ-P
Resposta à Tarefa (TR)0.250.950.70 (0.28, 1.12).006
Coerência e Coesão (CC)0.31.150.85 (0.44, 1.26).002
Recursos Lexicais (LR)0.350.950.60 (0.18, 1.02).012
Alcance Gramatical e Precisão (GRA)0.250.970.72 (0.31, 1.13).004

Tabela 4: Resultados em nível dimensional (Tarefa 2): mudanças pré-pós e diferenças entre grupos. Mudanças pré-pós-pós (Δ) e diferenças em diferenças (ΔΔ) com intervalos de confiança (ICs) de 95% e valores p ajustados por Holm para Resposta à Tarefa (TR), Coerência e Coesão (CC), Recursos Lexicais (LR) e Alcance e Precisão Gramatical (GRA).

LimiarWCF (%)STEP-DWCF-R (%)
Classificação geral ≥ 6,51381
Média geral ≥ 7,0025

Tabela 5: Desempenho da faixa pós-prova (Semana 8). Proporção de alunos nos grupos WCF e STEP-DWCF-R que atingiram limiares de pontuação geral de faixa IELTS de pelo menos 6,5 e pelo menos 7,0.

DesfechoICCIC 95%
Geral0.91[0.86, 0.94]
Resposta à Tarefa (TR)0.88[0.82, 0.92]
Coerência e Coesão (CC)0.9[0.85, 0.94]
Recursos Lexicais (LR)0.89[0.83, 0.93]
Alcance Gramatical e Precisão (GRA)0.87[0.80, 0.91]

Tabela 6: Confiabilidade entre avaliadores para resultados do IELTS. Dois avaliadores cegos em N = 64 redações (Semana 1 e Semana 8 combinadas). A média mede os coeficientes de correlação intraclasse (ICC[2,2]) com intervalos de confiança (ICs) de 95% para escores gerais e dimensionais.

MedidaGrupo WCFGrupo STEP-DWCF-R
Rodadas de revisão por tarefa12.26
Taxa de captação por feedback (adotada ou modificada, %)68.582.3
Taxa de erro persistente após a rodada final (%)67.445.6
Tempo de moderação do professor (mínimo por tarefa)23.513.8
Tempo de entrega do agente de IA (mínimo por tarefa)3.9
Tempo de revisão do aprendiz (mínimo por tarefa)44.871.2
Tempo total de feedback + revisão (min/tarefa)68.388.9

Tabela 7: Médias em 96 tarefas (6 tarefas × 16 aprendizes). As taxas de captação e de erro persistente foram calculadas no nível do ponto de realimentação. As medidas de tempo foram registradas por meio dos registros dos professores e datas do sistema. O tempo de entrega do agente de IA não é aplicável ao grupo WCF.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo comparou o STEP-DWCF-R, uma estrutura dinâmica de feedback corretivo escrito multicomponente, com um agente robótico de IA, com o WCF de rodada única em um curso de redação IELTS de oito semanas. O STEP-DWCF-R gerou ganhos maiores antes do pós-pós-produção na faixa geral e em TR, CC, LR e GRA. Os aprendizes sob o STEP-DWCF-R também completaram mais rodadas de revisão e apresentaram redução de erro mais rápida, com modelos estimando uma queda de cerca de 4,1 erros por rodada. A maior melhora foi na coerência e coesão (ΔΔ = 0,85), indicando que o feedback estruturado e vinculado a rubricas promove organização e precisão em níveis mais altos. Esses achados estão alinhados com pesquisas anteriores do DWCF que mostram que o feedback iterativo e abrangente melhora a precisão da escrita ao longo dotempo 14,15,16,17.

O fluxo de trabalho STEP-DWCF-R envolve três etapas críticas. Primeiro, o sistema de IA gera feedback detalhado em quatro categorias (Gramática, Vocabulário, Organização, Raciocínio) usando um esquema JSON restrito e um prompt padronizado do sistema. Segundo, o professor modera a saída para remover falsos positivos, adicionar questões críticas que não foram cumpridas alinhadas com a rubrica do IELTS, garantir uma formulação acionável e encorajadora, e manter a consistência com o esquema de quatro categorias. Essa etapa de moderação serve como principal mecanismo de solução de problemas, corrigindo alucinações ou supermarcações da IA que, de outra forma, poderiam sobrecarregar os aprendizes. Notavelmente, o tempo de moderação do professor por tarefa foi menor no STEP-DWCF-R do que no WCF (13,8 min contra 23,5 min), porque a IA gerou o feedback estruturado inicial e o professor apenas o moderou. Terceiro, o feedback moderado é fornecido via interface de agente robótico de IA baseada na web, que registra os reconhecimentos e reenvios dos aprendizes ao longo de várias rodadas.

Comparado às abordagens existentes, o STEP-DWCF-R aborda limitações distintas. A WCF convencional de rodada única permanece limitada pelo tempo do instrutor e normalmente oferece oportunidades limitadas para revisão sustentada. Ferramentas automatizadas de avaliação de escrita oferecem escalabilidade, mas frequentemente entregam comentários estáticos e fragmentados que os alunos têm dificuldade para traduzir em revisões significativas20, 21, 22. Estudos iniciais do DWCF demonstraram a eficácia dos ciclos de feedback em múltiplas rodadas, mas sua dependência de correções feitas por instrutores levantou preocupações de viabilidade em turmasgrandes 14, 15, 16 e 17. Estudos recentes de feedback em IA generativa relatam paridade com o feedback dos professores sobre os resultados da escrita, mas sem moderação estruturada ou entregaiterativa 18,19. O STEP-DWCF-R combina escalabilidade de IA com supervisão do professor e entrega iterativa de agentes robóticos de IA, reduzindo a carga de trabalho dos professores e aumentando a frequência de revisões.

Reconhecemos várias limitações. O tamanho relativamente pequeno da amostra (N = 32) limita a generalizabilidade de nossos achados, e o estudo deve ser visto como uma investigação piloto. As duas condições diferiram na dosagem de feedback: o grupo WCF recebeu apenas uma rodada de feedback por tarefa, enquanto o grupo STEP-DWCF-R passou por 2–3 rodadas iterativas. Portanto, o desempenho superior do grupo STEP-DWCF-R reflete os efeitos combinados de múltiplos ciclos de revisão, feedback gerado por IA e moderação dos professores, em vez do efeito isolado do agente robótico de IA ou de sua modalidade de entrega. O agente robótico de IA é uma interface puramente virtual baseada na web, então seus efeitos não podem ser desvinculados dos da própria estrutura iterativa. O feedback humano multimodal (por exemplo, fala mais gesto) não foi incluído como condição de controle porque não é prática padrão em salas de escrita convencionais de EFL e exigiria um paradigma experimental separado. Estudos futuros devem incluir grupos controle com dosagem correspondente (por exemplo, feedback de múltiplos rodadas do professor) para desvendar ainda mais esses componentes.

Apesar dessas limitações, o framework STEP-DWCF-R oferece direções práticas para o ensino de escrita assistida por IA. Sua arquitetura modular permite a integração em sistemas de gestão de aprendizagem para cursos de EFL em grande escala, e o esquema estruturado de quatro categorias pode ser adaptado para escrita acadêmica ou gêneros específicos de cada disciplina. Futuras iterações podem explorar a entrega multimodal para aproveitar os benefícios teóricos de engajamento dos agentes incorporados, embora o piloto atual estabeleça a viabilidade da colaboração iterativa entre IA e professores baseada em texto. No entanto, o padrão consistente entre as medidas de resultado, indicadores de processo e a forte confiabilidade entre avaliadores apoiam a viabilidade e a potencial eficácia dessa abordagem multicomponente em contextos semelhantes de EFL.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabalho foi financiado por uma Bolsa de Ponte da Universiti Sains Malaysia, Projeto Nº: R501-LR-RND003-0000001342-0000.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersão 2.1; usado para interface web de agente robótico de IA
API GPT-5OpenAIhttps://platform.openai.comModelo gpt-5, temperatura=0.7; para geração de feedback JSON estruturado
Jinja2Pallets Projectshttps://jinja.palletsprojects.comModelos renderizados no servidor para interface web
PythonPython Software Foundationhttps://www.python.orgVersão 3.10; script de backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operacional para sistema de feedback de IA

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

Artigos relacionados