$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Experimentos e Análises
Todos os 32 alunos forneceram dados de referência. Os dados pós-teste estavam disponíveis para 16 aprendizes em cada grupo (WCF e STEP-DWCF-R; Figura 2). A linha do tempo e as medidas do estudo são apresentadas na Figura 3, e o fluxo de trabalho de feedback de ponta a ponta é ilustrado na Figura 4. Os parâmetros experimentais de configuração e implementação do nosso sistema de IA são mostrados na Tabela 1. As análises seguiram o plano pré-especificado com intenção de tratar. Primeiro avaliamos a equivalência basal (Tabela 2), depois relatamos o desfecho primário (Figura 5 e Tabela 3), seguido pelos desfechos secundários (Tabela 4) com verificações de robustez e confiabilidade.
Equivalência de Linha de Base
No início do jogo (Semana 1), os grupos foram descritivamente semelhantes em covariáveis pré-especificadas, incluindo demografia e desempenho na redação do IELTS antes de qualquer feedback (Tabela 2). As pontuações individuais dos componentes do IELTS são atribuídas em etapas de 0,5 bandas, enquanto as médias dos grupos de relatórios da tabela são atribuídas. As médias gerais da Semana 1 (WCF = 5,625, STEP-DWCF-R = 5,500) são calculadas a partir dos mesmos arrays usados para gerar a Figura 5. Não realizamos testes de hipótese no início do começo; qualquer desequilíbrio residual é tratado pelo projeto pré-pós-e pelo termo Grupo × Tempo no modelo de efeitos mistos, e uma comparação pós-teste ajustada para a linha de base é reportada na seção de Protocolo.
Desfecho Primário
A Figura 5 resume as mudanças pré-pós-exame, enquanto as Tabelas 3 e 5 reportam estimativas do modelo e o desempenho pós-teste. No início do jogo (Semana 1), as médias dos grupos foram 5,625 para WCF e 5,500 para STEP-DWCF-R, resultando em uma diferença de grupo não significativa de −0,125 bandas (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, IC 95% [−0,397, 0,147]). A linha de base na Tabela 3, portanto, estima a média da WCF Semana 1 em 5,625 com IC 95% [5,419, 5,831] (SE = 0,097, df = 15). Da Semana 1 à Semana 8, a FCC melhorou em 0,3125 faixas (SE = 0,128, t = 2,44, df = 15, p = 0,028, IC 95% [0,039, 0,586]; efeito dentro do grupo padronizado dz = 0,61). O STEP-DWCF-R melhorou em 1,0313 bandas (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, IC 95% [0,732, 1,331]; dz = 1,84). O contraste linear de efeitos mistos para a interação Tempo × Grupo — ou seja, a diferença nas diferenças — foi de 0,7188 bandas (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, IC 95% [0,330, 1,107]; Tabela 3), indicando ganhos maiores sob o STEP-DWCF-R. No pós-teste (Semana 8), as médias marginais estimadas favoreciam o STEP-DWCF-R em 0,5938 bandas (teste de Welch sobre médias de grupo: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, IC 95% [0,359, 0,829]). De acordo com isso, a tabela de desempenho (Tabela 5) mostra que, na Semana 8, 13% dos alunos do WCF atingiram ≥ geral de 6,5 e 0% alcançaram ≥ 7,0 (contagens 2/16 e 0/16), enquanto 81% dos alunos do STEP-DWCF-R atingiram ≥ 6,5 e 25% atingiram ≥ 7,0 (contagens 13/16 e 4/16). A Tabela 3 relata as estimativas correspondentes de efeito fixo e sua incerteza.
Resultados em Nível Dimensional
A Tabela 4 resume as mudanças pré-pós-pós-produção nas quatro dimensões da Tarefa 2. A Resposta à Tarefa (TR) mostrou um ganho de Δ = 0,25 faixas sob WCF versus Δ = 0,95 sob STEP-DWCF-R, resultando em ΔΔ = 0,70 com IC 95% [0,28, 1,12] e p ajustado por Holm = 0,006. Coerência e Coesão (CC) apresentaram o maior contraste: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, portanto ΔΔ = 0,85 (IC 95% [0,44, 1,26], adj-p = 0,002). O Recurso Lexical (LR) seguiu o mesmo padrão com WCF Δ = 0,35 e STEP-DWCF-R Δ = 0,95, resultando em ΔΔ = 0,60 (IC 95% [0,18, 1,02], adj-p = 0,012). Alcance Gramatical e Precisão (GRA) melhorados em Δ = 0,25 em WCF e Δ = 0,97 em STEP-DWCF-R; o ΔΔ = 0,72 resultante apresentou um IC de 95% de [0,31, 1,13] com ADJ-p = 0,004. Em todas as quatro dimensões, os contrastes Group×Time favoreceram o STEP-DWCF-R após o ajuste de Holm–Bonferroni.
Evidência de Processo
As Figuras 6 e 7 visualizam os resultados do processo central. Entre as Semanas 2 e 7, o STEP-DWCF-R completou em média 2,26 rodadas de revisão por tarefa (IC 95% [2,17, 2,35]; n = 96), enquanto o WCF foi de 1,00 rodadas para todas as tarefas (n = 96). A diferença média foi de 1,26 rodadas (IC 95% [1,17, 1,35]); um teste de Mann–Whitney confirmou a separação das distribuições (U = 9216, z = 11,97, p < 10−30). Dentro do STEP-DWCF-R, as contagens médias de erro diminuíram por rodada: 13,78 na Rodada 1 (IC 95% [13,02, 14,54]; n = 96), 8,94 na Rodada 2 (IC 95% [8,42, 9,46]; n = 96) e 6,16 na Rodada 3 (IC 95% [5,20, 7,12]; n = 25). Uma tendência linear ajustada a observações por rodada estimou uma queda de 4,14 erros por rodada (IC 95% [3,51, 4,78] em magnitude absoluta; p < 10−12). As medidas de captação de feedback e tempo de trabalho não estão codificadas nas Figuras 6 e 7 e, portanto, são relatadas na Tabela 7.
Confiabilidade e Robustez
O acordo entre avaliadores para redações da Semana 1 e 8 foi bom a excelente. Dois avaliadores treinados pontuaram todos os roteiros de forma independente e foram cegos para o grupo e o tempo; usando medidas médias do coeficiente de correlação intraclasse (ICC[2,2]) nas médias do avaliador, a confiabilidade variou de 0,86–0,93 em todo o Geral, e as quatro dimensões, e todos os limites inferiores de confiança de 95% excederam 0,80 (Tabela 6). As verificações diagnósticas para o modelo primário de efeitos mistos indicaram resíduos aproximadamente normais sem heteroscedasticidade material, e modelos ajustados a resumos de processos em nível de tarefa mostraram dispersão próxima a um. Análises de sensibilidade baseadas no mesmo conjunto de dados da Semana 1/8 produziram inferências consistentes: uma regressão linear comparando grupos no pós-teste, ajustando para as pontuações iniciais, estimou uma diferença ajustada entre grupos de 0,575 faixas na Semana 8 (IC 95% [0,336, 0,814], p = 3,15 × 10−5), e um modelo misto específico para avaliador que incluiu efeito aleatório para avaliador e usou escores não médios produziram uma estimativa Group × Time de 0,72 faixas (IC 95% [0,33, 1.11], p = 0,0007), alinhando-se com a Tabela 3. Os resultados permaneceram inalterados ao usar erros padrão robustos e quando as análises foram restritas a casos completos, reforçando a conclusão de que o STEP-DWCF-R gera ganhos maiores antes do pós-pós-processamento do que o WCF.
Achados Qualitativos
Para análise qualitativa, examinamos os traços de revisão do STEP-DWCF-R em todas as seis tarefas e reflexões escritas ao final do curso dos 16 participantes do grupo STEP-DWCF-R. Dois programadores codificaram os materiais de forma independente usando uma estrutura dedutiva focada baseada nas quatro categorias de feedback (gramática, vocabulário, organização, raciocínio) e nas justificativas de absorção. O acordo entre codificadores era substancial com o kappa de Cohen de 0,78, e os desentendimentos eram resolvidos por meio de discussão.
A análise revelou cinco temas-chave: a absorção seguia um padrão escalonado, com os aprendizes resolvendo características superficiais antes de abordar a organização e o raciocínio; itens específicos do span e vinculados à rubrica eram mais acionáveis e frequentemente adotados do que sugestões narrativas; A complementaridade IA-professor moldou prioridades, com sinais sobrepostos aumentando o foco e moderação dos professores resolvendo conflitos; os benefícios atingiram o pico cedo, com o reuso de modelos organizacionais e padrões lexicais observados em novos prompts; e os aprendizes adaptaram estratégias entre as tarefas. Esses temas informam a dinâmica do processo explorada na seção de evidências de processo. Também foram registrados captação de feedback, erros persistentes e medidas de tempo na tarefa. Um resumo desses indicadores adicionais de processo é apresentado na Tabela 7.
Interpretação dos Resultados Representativos
Em conjunto, os dados de resultados e processos indicam que o framework STEP-DWCF-R está associado a uma maior melhoria na escrita do IELTS do que o feedback tradicional de rodada única. O resultado primário mostra uma diferença entre os grupos de 0,72 faixas, com o grupo STEP-DWCF-R melhorando 1,03 faixas no total, em comparação com 0,31 faixas no grupo WCF. Essa vantagem foi consistente em todas as quatro dimensões analíticas, com o maior contraste em Coerência e Coesão em bandas de 0,85, sugerindo que o feedback estruturado, vinculado a rubricas e multi-estágios, particularmente facilitou o desenvolvimento organizacional. Evidências de processo indicam ainda que o engajamento iterativo está na base dessa vantagem. Os aprendizes do STEP-DWCF-R completaram em média 2,26 rodadas de revisão por tarefa, e a contagem de erros diminuiu linearmente em aproximadamente 4,1 erros por rodada. Por exemplo, um ciclo de fluxo de trabalho representativo incluiu o GPT-5 gerando feedback JSON estruturado nas quatro categorias, seguido pela moderação do professor para eliminar falsos positivos e melhorar a atuabilidade, e a entrega subsequente via interface de agente robótico de IA para revisão múltipla do aprendiz. Esses achados apoiam a viabilidade e a potencial eficácia do fluxo de trabalho integrado multicomponente que combina feedback gerado por IA, moderação de professores e entrega iterativa de agentes robóticos de IA, mas não devem ser interpretados como prova isolada de qualquer componente isolado. O desequilíbrio de dose de 2–3 rodadas versus uma rodada e o tamanho modesto da amostra de 32 significam que os ganhos observados refletem o efeito combinado do aumento das oportunidades de revisão e do feedback estruturado. Esses resultados devem ser vistos como evidências piloto promissoras aguardando confirmação em ensaios maiores controlados por componentes.

Figura 1. Estrutura teórica do DWCF (feedback corretivo escrito dinâmico). A figura apresenta uma justificativa mais ampla para como a DWCF pode operar; ele é incluído para orientação, e não como um modelo direto deste estudo. Elementos correspondentes aos resultados e métricas de processo analisados aqui estão indicados na figura; Outros caminhos são ilustrativos e não foram avaliados. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 2. Diagrama de fluxo CONSORT dos participantes. Trinta e dois alunos foram avaliados quanto à elegibilidade; nenhum foi excluído. Todos os participantes deram consentimento e foram então randomizados em proporção 1:1 para o grupo WCF (n = 16) ou para o grupo DWCF (n = 16). Todos os participantes randomizados receberam a intervenção alocada; Não houve perdas para acompanhamento ou descontinuação, e todos os 32 foram incluídos na análise final. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 3. Cronograma e medidas do estudo. O estudo durou 8 semanas: no W1, os participantes completaram a Tarefa 2 do IELTS de base e foram pontuados; seis tarefas semanais de escrita foram administradas do W2 ao W7 (Tarefa 1–Tarefa 6), com feedback específico para cada grupo (WCF ou DWCF) e revisões após cada tarefa. Medidas de processo, incluindo rodadas de revisão, captação de feedback, taxa de erro persistente e tempo de tarefa, foram registradas para cada tarefa durante o W2–W7. No W8, a Tarefa 2 do IELTS pós-teste foi aplicada e pontuada. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 4. Fluxo de trabalho de feedback de ponta a ponta. Os alunos produzem um rascunho inicial supervisionado e recebem feedback específico do grupo: WCF (uma rodada de feedback humano) ou STEP-DWCF-R (feedback gerado por IA com moderação do professor, entregue via agentes robóticos de IA, envolvendo 2–3 rodadas iterativas). Os alunos completam rodadas de revisão conforme necessário. O resultado é a pontuação da faixa da Tarefa 2 do IELTS; As medidas do processo incluem número de rodadas, captação de feedback (adotada/modificada/recusada), taxa de erro persistente e tempo na tarefa. O sistema registra IDs em nível de item, categoria/gravidade, origem (IA vs. humano vs. robô), ações de moderação e status de admissão. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 5. Mudança na faixa geral do IELTS da Semana 1 à Semana 8 por grupo. Os pontos apresentam as médias estimadas de grupo com intervalos de confiança de 95%, e as trajetórias indicam um ganho maior sob STEP-DWCF-R . Por favor, clique aqui para ver uma versão maior desta figura.

Figura 6. Rodadas de revisão por tarefa por grupo (Semanas 2–7). Os pontos de dados representam rodadas individuais de revisão de tarefas para os grupos WCF (azul) e STEP-DWCF-R (laranja). Linhas horizontais e barras de erro indicam médias de grupo com intervalos de confiança de 95%. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 7. Contagens médias de erro por rodada dentro do STEP-DWCF-R com IC 95%. Pontos indicam a média de erros em cada rodada de feedback (Rodada 1, Rodada 2, Rodada 3), e linhas verticais representam intervalos de confiança (ICs) de 95%. Por favor, clique aqui para ver uma versão ampliada desta figura.
| Componente | Especificação |
| Hardware | PC com Intel(R) Core(TM) de 12ª geração i7-12700H (2,30 GHz), 32GB DE RAM, GPU NVIDIA RTX 3080Ti (16GB) |
| Sistema Operacional | Windows 11 |
| Backend | Flask~2.1 (Python~3.10) |
| Frontend | Templates renderizados por servidor Jinja2 |
| Modelos de IA | OpenAI GPT-5 API (para geração de feedback), pós-processamento baseado em esquema |
| Agendador de Feedback | Controlador personalizado gerenciando feedback em múltiplos estágios (3 ciclos) |
| Esquema de Erro | Gramática, Vocabulário, Organização, Raciocínio |
| Controle de Versão | GitHub |
| Registro | Registro automático de submissões, feedback e revisões para análise |
Tabela 1: Parâmetros experimentais de configuração e implementação. Especificações técnicas do sistema de feedback de IA, incluindo configuração de hardware, sistema operacional, frameworks de backend e frontend, configurações de modelos de IA, escalonador de feedback, categorias de esquema de erro, controle de versões e infraestrutura de log.
| Variável | WCF (n=16) | STEP-DWCF-R (n=16) |
| Idade (anos), média (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Feminino, n (%) | 9 (56%) | 8 (50%) |
| Preparação prévia para o IELTS (sim), n (%) | 7 (44%) | 6 (38%) |
| Anos de instrução prévia em escrita | 3.1 (1.2) | 3.2 (1.1) |
| Linha Básica do IELTS Geral (faixa) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (banda) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (banda) | 5.62 (0.49) | 5.53 (0.49) |
| LR de base (banda) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (banda) | 5.56 (0.48) | 5.49 (0.45) |
Tabela 2: Características de referência dos participantes por grupo (Semana 1). Variáveis demográficas e desempenho pré-teste do Sistema Internacional de Testes de Língua Inglesa (IELTS) Tarefa 2 para os grupos WCF e STEP-DWCF-R. Os valores são média (desvio padrão) ou n (%).
| Efeito fixo | Estimativa | SE | df | t | p | IC 95% |
| Intercept (WCF, Semana~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Grupo (STEP-DWCF-R vs. WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Tempo (Semana~8 vs. Semana~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Grupo × Time | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Tabela 3: Modelo linear de efeitos mistos para a faixa geral do IELTS a partir das pontuações da Semana 1/8. Estimativas de efeito fixo, erros padrão (SE), graus de liberdade (df), valores t, valores p e intervalos de confiança (ICs) de 95% para a interação do Grupo × Tempo e termos do modelo.
| Dimensão | WCF Δ (bandas) | STEP-DWCF-R Δ (bandas) | ΔΔ (IC 95%) | ADJ-P |
| Resposta à Tarefa (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Coerência e Coesão (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Recursos Lexicais (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Alcance Gramatical e Precisão (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Tabela 4: Resultados em nível dimensional (Tarefa 2): mudanças pré-pós e diferenças entre grupos. Mudanças pré-pós-pós (Δ) e diferenças em diferenças (ΔΔ) com intervalos de confiança (ICs) de 95% e valores p ajustados por Holm para Resposta à Tarefa (TR), Coerência e Coesão (CC), Recursos Lexicais (LR) e Alcance e Precisão Gramatical (GRA).
| Limiar | WCF (%) | STEP-DWCF-R (%) |
| Classificação geral ≥ 6,5 | 13 | 81 |
| Média geral ≥ 7,0 | 0 | 25 |
Tabela 5: Desempenho da faixa pós-prova (Semana 8). Proporção de alunos nos grupos WCF e STEP-DWCF-R que atingiram limiares de pontuação geral de faixa IELTS de pelo menos 6,5 e pelo menos 7,0.
| Desfecho | ICC | IC 95% |
| Geral | 0.91 | [0.86, 0.94] |
| Resposta à Tarefa (TR) | 0.88 | [0.82, 0.92] |
| Coerência e Coesão (CC) | 0.9 | [0.85, 0.94] |
| Recursos Lexicais (LR) | 0.89 | [0.83, 0.93] |
| Alcance Gramatical e Precisão (GRA) | 0.87 | [0.80, 0.91] |
Tabela 6: Confiabilidade entre avaliadores para resultados do IELTS. Dois avaliadores cegos em N = 64 redações (Semana 1 e Semana 8 combinadas). A média mede os coeficientes de correlação intraclasse (ICC[2,2]) com intervalos de confiança (ICs) de 95% para escores gerais e dimensionais.
| Medida | Grupo WCF | Grupo STEP-DWCF-R |
| Rodadas de revisão por tarefa | 1 | 2.26 |
| Taxa de captação por feedback (adotada ou modificada, %) | 68.5 | 82.3 |
| Taxa de erro persistente após a rodada final (%) | 67.4 | 45.6 |
| Tempo de moderação do professor (mínimo por tarefa) | 23.5 | 13.8 |
| Tempo de entrega do agente de IA (mínimo por tarefa) | — | 3.9 |
| Tempo de revisão do aprendiz (mínimo por tarefa) | 44.8 | 71.2 |
| Tempo total de feedback + revisão (min/tarefa) | 68.3 | 88.9 |
Tabela 7: Médias em 96 tarefas (6 tarefas × 16 aprendizes). As taxas de captação e de erro persistente foram calculadas no nível do ponto de realimentação. As medidas de tempo foram registradas por meio dos registros dos professores e datas do sistema. O tempo de entrega do agente de IA não é aplicável ao grupo WCF.