Ensino do planejamento de experimentos
Este estudo utilizou a versão básica de código aberto do DeepSeek, baseando-se na interface de API aberta da plataforma para chamadas de programa. O conjunto completo de cinco modelos de texto de prompt, quatro níveis de entradas de exemplo de tarefa, etiquetas de categoria de anotação de transferência e regras de mapeamento de correspondência de modelos de erros de escrita foram compilados no apêndice suplementar. O sistema possuía parâmetros de chamada fixos: um coeficiente de temperatura de 0,7, e o comprimento gerado era limitado dinamicamente com base no tipo de questão de escrita. Seguia rigorosamente uma sequência fixa de reconstrução semântica > ajuste estilístico > adaptação cultural, executando chamadas em cadeia aninhadas de prompts. A saída do modelo era selecionada manualmente pelo instrutor para textos eficazes no ensino em sala de aula.
Este estudo convidou três professores universitários de redação em inglês em regime integral, com mais de cinco anos de experiência, para participar da correção manual. Todos os corretores receberam treinamento padronizado antes da correção oficial, familiarizando-se com as dimensões de avaliação, o sistema de pontuação de 5 pontos, transferência cultural, sintaxe, discurso e outros detalhes da correção, além de concluírem uma calibração prévia. Todas as redações dos alunos foram corrigidas independentemente por dois professores em um modo de correção cega dupla. Caso a diferença entre as notas dos dois corretores excedesse 1 ponto (em uma escala de 5), um terceiro professor sênior atuaria como árbitro na correção, e a média das duas notas válidas seria considerada a pontuação final manual para aquela amostra. Duas equipes de avaliadores participaram da fase de avaliação com diferentes objetivos de pesquisa. Três professores universitários de redação em inglês em regime integral, com mais de cinco anos de experiência docente, realizaram a dupla correção cega de todas as amostras de redação dos alunos no experimento formal, e um terceiro professor sênior atuou como árbitro sempre que as discrepâncias nas notas excedessem 1 ponto na escala de 5 pontos. Em contraste, cinco avaliadores participaram do teste de confiabilidade interavaliadores utilizando o Coeficiente de Correlação Intraclasse (ICC), realizado separadamente para verificar a consistência dos critérios de avaliação entre os avaliadores. A diferença no número de avaliadores decorre de requisitos funcionais distintos: três professores principais garantiram a correção prática dos dados experimentais, enquanto o grupo ampliado de cinco avaliadores forneceu evidências mais robustas sobre a confiabilidade de todo o sistema de avaliação.
A complexidade sintática, a pontuação da estrutura textual pelo BERT e a similaridade semântica são todas pontuadas em uma escala de 0 a 5 pontos. Os pesos para cada dimensão foram definidos de acordo com padrões de ensino e pesquisa em escrita de línguas estrangeiras: sintaxe 0,35, estrutura textual 0,35 e lógica e cultura 0,3. Os valores dos pesos basearam-se em sistemas quantitativos maduros de avaliação de escrita na mesma área. O módulo de pontuação automática por IA foi calibrado utilizando limiares com base em 15 redações modelo previamente classificadas. A correção humana seguiu uma escala de classificação unificada de cinco pontos. A pontuação por máquina e a calibração humana foram combinadas para uma verificação pré-experimental antes da avaliação formal.
A tarefa de ensino foi realizada com base nos objetivos de transferência de três níveis: "sintaxe-estrutura-cultura", com três rodadas de treinamento, cada uma com duração de uma semana. A primeira rodada envolveu reescrita em nível de frase para melhorar a diversidade sintática e a precisão da expressão; a segunda rodada incluiu a reconstrução estrutural em nível de parágrafo para aprimorar a organização do parágrafo e a coerência lógica; a terceira rodada envolveu transferência em nível cultural para fortalecer a consciência pragmática intercultural e a adaptabilidade da expressão. Considerando as medidas repetidas coletadas dos mesmos participantes entre o pré-teste, as três rodadas sequenciais de treinamento e o pós-teste, adotou-se a análise de variância com medidas repetidas (RM-ANOVA) como abordagem estatística principal para examinar os efeitos principais do grupo (experimental versus controle), os efeitos principais do momento da avaliação, bem como o efeito da interação grupo × tempo, o qual indicou se as mudanças nas pontuações durante o treinamento diferiram entre os dois grupos. A suposição de esfericidade foi verificada por meio do teste de Mauchly; a correção de Greenhouse–Geisser foi aplicada caso a esfericidade fosse violada. Testes t para amostras independentes foram utilizados apenas para comparações post hoc entre grupos aos pontos individuais de tempo, enquanto a correlação de Pearson e o d de Cohen foram mantidos para quantificação da consistência das pontuações e do tamanho do efeito, respectivamente.
Todas as análises estatísticas foram especificadas previamente à coleta de dados. Testes t para amostras independentes foram utilizados para comparar os indicadores de escrita pré e pós-teste entre dois grupos, com a hipótese nula principal assumindo ausência de diferenças entre grupos no desempenho de transferência da escrita. A análise de correlação de Pearson foi empregada para quantificar a associação linear entre a pontuação automática por IA e as avaliações manuais dos professores, e o d de Cohen foi calculado como o tamanho do efeito padronizado para comparações entre grupos. O limiar de significância foi estabelecido em α = 0,05 para todos os testes de hipóteses, e intervalos de confiança de 95% foram calculados juntamente com todas as estatísticas de teste. O SPSS 26.0 foi utilizado para realizar todos os cálculos estatísticos. Não houve dados ausentes nos conjuntos de dados de provas dos alunos e questionários, já que todos os participantes concluíram o treinamento completo de três rodadas e as avaliações pertinentes; portanto, não foi necessária imputação ou exclusão de casos para valores ausentes.
Construção do sistema de índice de avaliação
Para avaliar de forma abrangente o desempenho dos alunos no treinamento de transferência de escrita em inglês, este estudo construiu um sistema de avaliação multidimensional que abrangeu os objetivos de transferência em três níveis: "sintaxe-estrutura-cultura", integrou a capacidade linguística, a resposta do modelo, o feedback docente e a autorreflexão, e estabeleceu seis indicadores principais. Primeiramente, o "índice de transferência na escrita" foi um indicador de avaliação abrangente que contemplou diversidade sintática, clareza estrutural e adaptabilidade cultural, combinando a pontuação automática do sistema e a correção manual do professor para análise quantitativa. A "pontuação de complexidade sintática" utilizou tecnologia de processamento de linguagem natural para extrair características como comprimento médio das frases, número de níveis de subordinação de orações e frequência de uso de locuções verbais, a fim de avaliar a riqueza e complexidade das frases dos alunos. A análise de "adequação ao estilo acadêmico" examinou a proporção de uso da voz passiva e a proporção de vocabulário formal, com base em um modelo de PLN (Processamento de Linguagem Natural), para determinar se o texto seguia as normas estilísticas da escrita acadêmica em inglês. Além disso, o estudo introduziu uma dimensão de avaliação subjetiva, coletando, por meio de questionários aplicados aos professores, feedback sobre a aceitação e a praticidade das sugestões geradas pelo modelo, a fim de avaliar o impacto real do ensino assistido por IA. As "mudanças nas notas de correção dos professores" refletiram o impacto do ensino assistido por IA na melhoria da qualidade da escrita, comparando-se as notas atribuídas pelos professores às redações dos alunos antes e após o experimento. Por fim, a "autoavaliação dos alunos quanto à capacidade de transferência" utilizou a tabela de cognição de transferência para orientar os alunos na autoravaliação de seu domínio em dimensões como estrutura, sintaxe e cultura, promovendo, assim, o aumento da consciência metacognitiva e das habilidades de reflexão. As descrições específicas e as fontes de dados para cada indicador estão apresentadas na Tabela 3.
Indicadores sintáticos e estilísticos foram calculados automaticamente por meio de análise de dependência e classificação baseada em BERT, com escores normalizados variando de 0 a 5; a avaliação manual utiliza uma escala de 5 pontos. As fórmulas de cálculo para complexidade sintática utilizaram o número total de palavras dividido pelo número de orações como denominador principal. Fonte dos dados brutos: composições escritas do pré-teste e pós-teste de todos os 60 estudantes inscritos.
Resultados experimentais e análise
Para apresentar intuitivamente as diferenças abrangentes no desempenho dos alunos nas três dimensões de transferência sintática, transferência estrutural e transferência cultural, Figura 3 comparou o índice médio de transferência escrita dos alunos do grupo experimental e do grupo de controle antes e após o experimento: Figura 3 mostrou a diferença nas pontuações médias entre o grupo experimental e o grupo de controle nas três dimensões de transferência sintática, transferência estrutural e transferência cultural. O grupo experimental apresentou uma melhoria significativa na capacidade de transferência em cada dimensão após o experimento, e o círculo externo do gráfico de radar é significativamente maior que o círculo interno, indicando que o método de otimização do ensino baseado no modelo DeepSeek tem um efeito positivo na promoção do desenvolvimento da capacidade de transferência escrita em inglês dos alunos. Em contraste, os diversos indicadores de capacidade de transferência do grupo de controle permaneceram relativamente inalterados antes e após o experimento. A melhoria geral foi limitada, indicando que métodos tradicionais de ensino ou ferramentas assistidas por IA que não otimizaram as instruções do sistema têm um papel limitado no treinamento de transferência. Foi difícil estimular efetivamente o potencial de aprendizagem dos alunos na transferência linguística multidimensional.
Os índices médios de transferência escrita do grupo experimental nas dimensões de transferência sintática, transferência estrutural e transferência cultural antes do experimento foram 3,0, 2,9 e 2,8, respectivamente, aumentando para 4,3, 4,1 e 4,5 após o experimento, com incrementos de 1,3, 1,2 e 1,7, respectivamente, indicando que o método de ensino teve um bom efeito de intervenção em diferentes níveis de transferência. As pontuações do grupo controle antes do experimento foram 3,0, 3,0 e 2,9. Após o experimento, os valores aumentaram para 3,4, 3,3 e 3,2, respectivamente, o que é significativamente menor do que os do grupo experimental. É particularmente notável que, na dimensão de transferência cultural, o grupo experimental apresentou a melhoria mais significativa, passando de 2,8 para 4,5, um aumento de 1,7 ponto, substancialmente superior ao aumento de 0,3 ponto do grupo controle. Esse resultado sugere que o método de ensino proposto desempenha um papel importante na ajuda aos alunos a identificar e adaptar-se às normas de expressão cultural em inglês. Isso refletiu-se não apenas nos ajustes na forma linguística, mas também no aprimoramento da consciência pragmática intercultural dos alunos e na profundidade de sua compreensão dos hábitos de expressão cultural da língua-alvo. A transferência linguística manifestou-se principalmente na complexidade sintática, adaptação de estilo linguístico e outros aspectos. O estudo utilizou tecnologia automatizada de PLN para realizar uma análise aprofundada dos textos escritos pelos alunos, extrair características linguísticas-chave e, combinando com as avaliações dos professores, avaliar sistematicamente as mudanças na capacidade de transferência linguística dos alunos ao longo de três rodadas de tarefas.
Complexidade sintática e estilo linguístico
Em termos de complexidade sintática, o estudo registrou o comprimento médio das frases e o número de níveis de aninhamento de orações no texto produzido pelos alunos após a conclusão da tarefa de escrita designada em cada rodada de atividades. Esses dois indicadores foram amplamente utilizados para medir a complexidade da expressão linguística. Eles refletiram efetivamente o nível de desenvolvimento dos alunos em diversidade de frases e capacidade de organização estrutural, conforme mostrado na Figura 4.
Na evolução longitudinal da complexidade sintática, o grupo experimental exibiu uma tendência clara de aumento nas três rodadas de tarefas, refletindo a promoção eficaz do treinamento de transferência na capacidade dos alunos de expressar sua estrutura linguística. Do ponto de vista do comprimento médio das frases, o grupo experimental aumentou de 12,5 palavras na Tarefa 1 para 16,1 palavras na Tarefa 3, representando um aumento de 3,6 palavras, significativamente maior do que o aumento de apenas 0,9 palavras observado no grupo controle no mesmo período (de 12,4 para 13,3). Da mesma forma, sob a perspectiva da dimensão de complexidade estrutural, medida pelo número de camadas de aninhamento de orações, o grupo experimental aumentou de 1,8 para 2,7 camadas, enquanto o grupo controle passou de 1,7 para 1,9 camadas, com um aumento relativamente lento. Para verificar mais aprofundadamente se a diferença na complexidade sintática entre os dois grupos de alunos é estatisticamente significativa, o estudo utilizou testes t para amostras independentes para analisar o comprimento médio das frases e o número de níveis de aninhamento de orações nas três fases da tarefa. Os resultados mostraram que há uma diferença significativa entre o grupo experimental e o grupo controle quanto ao comprimento médio das frases, t(58) = 4,23, p < 0,001, d de Cohen = 0,98; também houve uma diferença significativa no número de níveis de aninhamento de orações, t(58) = 3,15, p = 0,002, d de Cohen = 0,78. Essa comparação indicou que o treinamento sistemático de transferência não apenas melhorou a capacidade dos alunos de construir frases complexas, mas também fortaleceu seu domínio de estratégias de organização gramatical. Em particular, na terceira fase da tarefa, os alunos do grupo experimental demonstraram maior flexibilidade no uso de orações com múltiplas camadas e estruturas de frases complexas. Isso refletiu uma mudança notável em sua transferência linguística, de um nível “funcional” para um nível mais “estratégico”. O caminho de treinamento orientado à transferência aprimorou continuamente as habilidades de transferência sintática dos alunos, superando efetivamente as limitações da escrita de frases isoladas e dos padrões fixos de expressão frequentemente observados no ensino tradicional. Em termos de adaptação ao estilo linguístico, o estudo extraiu os textos escritos pelos alunos antes e depois do experimento. Utilizou-se um modelo de PLN para determinar a proporção de vocabulário formal e a frequência de uso da voz passiva como indicadores principais para avaliar a adequação ao estilo linguístico acadêmico. Esses indicadores refletiram se os alunos possuem a consciência linguística e a capacidade de expressão necessárias para adaptar-se ao estilo alvo na escrita em inglês. Os resultados relevantes estão apresentados na Figura 5.
Figura 5 mostra as alterações no ajuste ao estilo acadêmico do grupo experimental e do grupo de controle antes e após a tarefa, concentrando-se principalmente em dois indicadores centrais: a proporção de vocabulário formal e a frequência de uso da voz passiva. De modo geral, após a conclusão do treinamento de transferência baseado no modelo DeepSeek, a capacidade de adaptação ao estilo acadêmico do grupo experimental foi significativamente aprimorada, demonstrando a eficácia desse método de ensino no desenvolvimento da consciência dos alunos sobre as normas linguísticas e na sua habilidade de adaptação a estilos acadêmicos. Em relação à proporção de vocabulário formal, o grupo experimental aumentou de 0,42 antes da tarefa para 0,56 após a tarefa, um aumento relativamente significativo. Em contraste, o grupo de controle aumentou apenas ligeiramente, de 0,43 para 0,48, o que sugere uma melhoria limitada. Esse resultado indicou que, após receber orientação sistemática por meio de prompts e feedback do modelo, os alunos do grupo experimental tenderam mais a utilizar vocabulário formal compatível com os requisitos do estilo acadêmico durante o processo de escrita, e seu estilo linguístico aproximou-se progressivamente dos padrões da escrita acadêmica em inglês. Quanto à frequência de uso da voz passiva, o grupo experimental aumentou significativamente de 0,18 antes da tarefa para 0,27 após a tarefa, representando um aumento de 0,09; em contrapartida, o grupo de controle aumentou apenas 0,02.
Para verificar mais a fundo se as alterações acima são estatisticamente significativas, o estudo realizou um teste t para amostras independentes nos dados antes e depois da tarefa. Os resultados mostraram que o grupo experimental apresentou uma melhoria significativa na proporção de vocabulário formal, t(58) = 3,89, p < 0,001, d de Cohen = 0,92; o aumento na frequência de uso da voz passiva também foi significativo, t(58) = 4,56, p < 0,001, d de Cohen = 1,05. Isso indicou que os alunos do grupo experimental haviam progredido substancialmente na adaptação do estilo linguístico, e esse progresso não foi casual, mas sim resultado do efeito combinado da orientação sistemática por meio de instruções e do feedback do modelo.
Verificação estatística
Além disso, para verificar ainda mais a confiabilidade do conteúdo gerado por IA na prática de ensino, o estudo também comparou as pontuações médias do conteúdo gerado por IA e do conteúdo gerado por professores sob diferentes tipos de instruções. A consistência entre os dois foi avaliada mediante o cálculo do coeficiente de correlação de Pearson. Os resultados comparativos relevantes são apresentados na Tabela 4. A Tabela 4 mostra a consistência entre o conteúdo gerado por IA e as pontuações dos professores em cinco tipos de instruções orientadas à transferência. Do ponto de vista da pontuação média, a pontuação da IA foi ligeiramente inferior à dos professores no geral. Contudo, a diferença estava dentro de uma faixa razoável na maioria dos tipos de tarefas, indicando que o modelo DeepSeek possui alta estabilidade e valor de referência na avaliação de tarefas de transferência escrita. Na instrução de transferência sintática, a pontuação média dos professores foi 4,1 e a da IA foi 4,0, com uma diferença de apenas 0,1 entre ambas. Nas instruções de transferência estrutural e lógica, a pontuação da IA foi apenas 0,1 ponto inferior à dos professores, indicando que o modelo consegue simular melhor os critérios de avaliação docente nessas tarefas, que envolvem alto grau de estrutura linguística e regras claras. Em contraste, os desvios nas pontuações nas instruções de transferência cultural e de transferência de registro são relativamente evidentes, com pontuações da IA de 3,6 e 3,7, respectivamente, 0,2 pontos abaixo das pontuações dos professores, refletindo que a IA ainda apresenta certas limitações ao lidar com tarefas de alto grau de subjetividade, como implicações semânticas e pragmática cultural. A confiabilidade interavaliadores foi avaliada por meio do ICC (n = 5 avaliadores). O ICC geral para a correção manual foi de 0,86, e os ICCs para cada dimensão variaram de 0,82 a 0,89, indicando concordância interavaliadores satisfatória.
A análise adicional do coeficiente de correlação de Pearson revelou que a consistência das pontuações sob diferentes estímulos estava em um nível elevado, indicando que a pontuação da IA não era apenas próxima ao julgamento do professor em termos de valor, mas também exibia uma boa relação linear em sua tendência de pontuação. Dentre eles, o coeficiente de consistência do estímulo de transferência sintática foi o mais alto, com 0,87, e os estímulos de transferência estrutural e transferência lógica foram também de 0,83 e 0,85, respectivamente, indicando que os resultados de avaliação da IA em termos de complexidade sintática, organização de parágrafos e coerência lógica são altamente consistentes com o julgamento do professor. Isso pode ocorrer porque essas tarefas possuem objetivos claros e características linguísticas quantificáveis, o que facilitou o reconhecimento pelo modelo e um julgamento estável. O coeficiente de correlação do estímulo de transferência de domínio é de 0,81. Embora tenha diminuído ligeiramente, ainda demonstra uma forte capacidade de avaliação, indicando que a IA possui certo grau de julgamento no nível de adaptação de estilo. No entanto, o coeficiente de consistência do estímulo de transferência cultural foi de apenas 0,79, o que é inferior aos demais tipos, mas ainda dentro de uma faixa aceitável.
Para examinar a aplicabilidade de diferentes tipos de estímulos na prática de ensino e o grau de aceitação pelos professores, foi elaborado um questionário de satisfação com as respostas aos estímulos. Cinco professores de inglês (numerados de T1 a T5) foram convidados a avaliar as sugestões geradas por cinco tipos de estímulos utilizando uma escala de cinco níveis (muito insatisfeito a muito satisfeito), conforme mostrado na Figura 6: as pontuações dos cinco professores para os cinco tipos de estímulos variam um pouco, mas o reconhecimento geral foi alto. Dentre eles, os estímulos de "transferência sintática" e "transferência cultural" obtiveram as pontuações mais altas, com média de 4,0, refletindo alta praticidade e adaptabilidade no ensino. Em contraste, o estímulo de "transferência de registro" obteve pontuações relativamente baixas, com média de apenas 2,4, e alguns professores, como T4 e T5, atribuíram as notas mais baixas, indicando que sua orientação e adaptabilidade nas aplicações didáticas ainda precisam ser aprimoradas.
Em nível individual, havia diferenças evidentes nas tendências de pontuação dos professores. A pontuação geral de T1 foi positiva, indicando um alto grau de aceitação da escrita assistida por IA, enquanto as pontuações de T5 foram baixas em múltiplas dimensões do Prompt, especialmente em "transferência de registro" e "transferência lógica". Essa diferença pode estar relacionada à experiência docente, preferência linguística ou familiaridade dos professores com ferramentas de IA, sugerindo que o design futuro do Prompt precisa considerar mecanismos de adaptação personalizados para aumentar a aceitação por diferentes grupos de professores. Para verificar mais a fundo o efeito real do ensino assistido por IA na melhoria da qualidade da escrita dos alunos, o estudo comparou as alterações nas pontuações gerais do grupo experimental e do grupo controle, conforme avaliado pelos professores, antes e após o experimento. Os resultados da comparação são apresentados na Figura 7.
Conforme mostrado na Figura 7, as pontuações gerais do grupo experimental e do grupo controle, avaliadas por professores antes e depois do experimento, apresentaram diferenças significativas. De modo geral, após a intervenção pedagógica com otimização do ensino baseada no modelo DeepSeek, a pontuação geral do grupo experimental mostrou uma tendência claramente ascendente. Em contraste, a alteração na pontuação do grupo controle foi relativamente suave. A pontuação média atribuída pelos professores ao grupo experimental antes do experimento foi de 59,1 pontos, e a pontuação média após o experimento aumentou significativamente para 74,4 pontos, representando um aumento de 15,3 pontos. Isso indicou que o ensino assistido por IA teve um impacto positivo na qualidade da escrita dos alunos. A partir do gráfico de caixas, observou-se que a amplitude da distribuição das pontuações do grupo experimental também se ampliou. Em particular, a caixa de pontuações após o experimento está significativamente mais alta do que antes, e os valores máximo superior e mínimo inferior aumentaram, indicando que o nível geral dos alunos melhorou significativamente. Em contraste, as alterações nas pontuações do grupo controle foram relativamente limitadas. Antes do experimento, a pontuação média do grupo controle foi de 60,1 pontos, e após o experimento, foi de 64,9 pontos, representando um aumento de 4,8 pontos. Esse aumento foi muito menor do que o do grupo experimental, e a caixa de pontuações do grupo controle não mudou muito antes e depois do experimento, indicando que métodos de ensino tradicionais ou ferramentas assistidas por IA não otimizadas têm um efeito limitado na melhoria da qualidade da escrita.
Além disso, este estudo utilizou a tabela de cognição transferível para orientar os alunos em três rodadas de autoavaliação sobre o desenvolvimento de suas habilidades em ajuste estrutural, transformação de frases e expressão cultural, entre outras áreas, com o objetivo de refletir a tendência de mudança da consciência metacognitiva dos alunos e do domínio das estratégias de transferência. Os resultados são apresentados em Figura 8. De acordo com os dados do gráfico de radar da autoavaliação dos alunos sobre a capacidade de transferência mostrados em Figura 8, a autoavaliação dos estudantes nas cinco dimensões de transferência estrutural, transferência sintática, transferência cultural, transferência de registro e transferência lógica nas três rodadas de tarefas mostrou uma tendência crescente contínua, indicando que, sob a intervenção pedagógica de otimização instrucional baseada no modelo DeepSeek, a capacidade dos estudantes de utilizar estratégias de transferência foi significativamente aprimorada. Na primeira rodada de tarefas, as pontuações de autoavaliação dos estudantes foram geralmente baixas. Dentre as cinco dimensões, a "transferência estrutural" e a "transferência lógica" obtiveram pontuações de 3,2 e 3,0, respectivamente, enquanto a "transferência cultural" e a "transferência de registro" obtiveram 2,5 e 2,7, indicando que os estudantes ainda estavam pouco desenvolvidos na identificação e no uso de estratégias de transferência. Na segunda rodada de tarefas, as pontuações de cada item melhoraram, com a "transferência estrutural" subindo para 3,8, a "transferência sintática" para 3,5 e a "transferência lógica" para 3,7. Isso demonstrou que, com a orientação dos professores e o suporte do feedback do modelo, os estudantes foram gradativamente dominando os pontos-chave das operações básicas de transferência e começaram a aplicá-los à escrita prática. Na terceira rodada de tarefas, as pontuações de autoavaliação dos estudantes aumentaram significativamente, com a "transferência estrutural" e a "transferência lógica" atingindo 4,5 e 4,3, respectivamente, e as demais dimensões também se estabilizando acima de 4,0 pontos, evidenciando o efeito sustentado de múltiplas rodadas de treinamento em transferência no aprimoramento do controle das formas linguísticas e da capacidade de construção textual dos estudantes. Nesta fase, os estudantes já haviam formado um ciclo cognitivo básico fechado entre compreensão, execução e reflexão das estratégias de transferência. Além do feedback dos professores, o estudo também distribuiu um questionário de satisfação sobre a função de escrita assistida por IA a todos os estudantes do grupo experimental, coletando-se um total de 30 questionários válidos. O questionário avaliou o desempenho da IA em três módulos funcionais: sugestões de reescrita, otimização estrutural e estímulos culturais, exigindo que os estudantes selecionassem opções de acordo com cinco níveis de critérios. Os resultados são apresentados em Tabela 5.
De acordo com os resultados da pesquisa de satisfação dos alunos sobre as funções de escrita assistida por IA apresentados na Tabela 5, os alunos do grupo experimental deram, em geral, comentários positivos sobre o desempenho da IA nos três módulos funcionais de sugestões de reescrita, otimização estrutural e estímulos culturais, demonstrando as boas perspectivas de aplicação dos sistemas de escrita assistida por IA na melhoria da eficiência do treinamento de escrita e da qualidade do suporte ao ensino. No geral, mais de 90% dos alunos se declararam "muito satisfeitos" ou "satisfeitos" nos dois itens funcionais de "sugestões de reescrita" e "otimização estrutural", sendo que o item "sugestões de reescrita" obteve a maior taxa de satisfação, atingindo 91%, o que indica um alto grau de reconhecimento da capacidade da IA na reconstrução sintática e no aprimoramento linguístico. Em comparação, a satisfação com a função de "estímulos culturais" foi relativamente menor, ainda assim alcançando 83%, o que indica que, embora a IA enfrente certa complexidade e subjetividade ao orientar expressões interculturais, seu papel no auxílio aos alunos na identificação e ajuste de interferências culturais da língua materna ainda foi reconhecido pela maioria dos estudantes. Em termos de insatisfação, a porcentagem de alunos que escolheram "insatisfeito" ou "muito insatisfeito" nas três funções foi inferior a 5%, indicando que as funções assistidas por IA apresentaram boa usabilidade e aceitação na maioria dos cenários de aplicação. Vale destacar que a proporção de alunos que avaliaram como "regular" no item "estímulos culturais" foi relativamente alta, sugerindo que a IA atual pode não estar plenamente atendendo às expectativas dos alunos ao lidar com questões de adaptação cultural, havendo ainda espaço para aprimoramento. Uma análise abrangente revela que o método de otimização de instruções baseado no DeepSeek tem sido amplamente reconhecido pelos alunos, especialmente pelo seu suporte à forma linguística.
ANOVA de medidas repetidas
Uma análise de variância de medidas repetidas de dois fatores (RM-ANOVA) foi realizada para examinar os efeitos do grupo (fator entre sujeitos: grupo experimental versus grupo controle) e do tempo (fator intra-sujeitos: pré-teste, Tarefa 1, Tarefa 2, Tarefa 3, pós-teste), bem como a interação entre eles no desempenho de transferência da escrita em inglês dos alunos. O teste de Mauchly indicou uma violação da suposição de esfericidade (p < 0,05), portanto, a correção de Greenhouse–Geisser foi aplicada para ajustar os graus de liberdade dos efeitos intra-sujeitos. Todas as análises foram baseadas em n = 30 participantes por grupo. Os resultados são apresentados na Tabela 6:
Os resultados da ANOVA de medidas repetidas com correção de Greenhouse–Geisser indicaram efeitos principais significativos de Grupo, Tempo e interação Grupo × Tempo em todas as dimensões medidas (p < 0,001). Para o Índice Geral de Transferência, observou-se um efeito significativo de Grupo (F(1,58) = 76,32), juntamente com um efeito significativo de Tempo (F(2,14,124,12) = 92,75) e uma interação significativa Grupo × Tempo (F(2,14,124,12) = 68,49), sugerindo que as mudanças no desempenho geral de transferência ao longo do tempo diferiram significativamente entre os grupos.
Da mesma forma, a transferência sintática mostrou efeitos significativos de Grupo (F(1,58) = 52,18), Tempo (F(2,11,122,38) = 71,26) e interação Grupo × Tempo (F(2,11,122,38) = 45,73), indicando padrões de desenvolvimento diferenciados na habilidade de transferência sintática entre os grupos e pontos de medição. Para a Transferência Estrutural, efeitos significativos de Grupo (F(1,58)=48,65), Tempo (F(2,09,121,22) = 67,81) e interação (F(2,09,121,22) = 41,36) também foram identificados, refletindo melhorias consistentes com trajetórias dependentes do grupo. Notavelmente, a Transferência Cultural exibiu os efeitos mais fortes, com um efeito significativo de Grupo (F(1,58) = 81,44), um efeito acentuado de Tempo (F(2,07,119,96) = 98,52) e uma interação robusta Grupo × Tempo (F(2,07,119,96) = 79,27), sugerindo o padrão de crescimento mais acentuado e diferenciado nesta dimensão. De modo geral, todos os índices demonstram efeitos estatisticamente significativos, confirmando que a intervenção exerceu um impacto estável e diferenciado no desenvolvimento da transferência ao longo do tempo.
DISPONIBILIDADE DE DADOS:
Todos os dados gerados ou analisados durante este estudo estão incluídos neste artigo. Os dados brutos de avaliação estão fornecidos na Tabela Suplementar 1.

Figura 1: Etapas para a transformação da estrutura da frase. (A) Estratégias para combinar e fortalecer verbos a fim de melhorar a estrutura da frase. (B) Transformações alternativas de sujeito, incluindo sujeitos gerúndio, infinitivo e nominalizados. (C) Uso de frases não finitas para aumentar a variedade e a concisão da frase. (D) Exemplos de versões finais aprimoradas que demonstram estilo acadêmico aprimorado e expressão em inglês intercultural. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Diagrama da árvore evolutiva da tarefa. Apresenta a estrutura progressiva de tarefas de transferência em quatro níveis, que variam da frase, parágrafo, discurso até o nível cultural. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Comparação da capacidade de transferência escrita antes e após o experimento. O gráfico de radar mostra as pontuações do pré-teste e pós-teste dos grupos experimental e controle nas dimensões de transferência sintática, estrutural e cultural. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Gráfico de linha de tendência da complexidade sintática. São exibidas as alterações no comprimento médio das frases e nas camadas de aninhamento de orações ao longo de três tarefas de treinamento. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Correspondência de terminologia acadêmica. Esta figura mostra as variações na proporção de vocabulário formal e na frequência de voz passiva antes e depois da intervenção. Clique aqui para visualizar uma versão maior desta figura.

Figura 6: Mapa de calor da satisfação com as respostas aos estímulos. Aqui são resumidas as classificações de cinco tipos de modelos de estímulos fornecidas pelos professores participantes. Clique aqui para visualizar uma versão maior desta figura.

Figura 7: Gráfico de caixa das alterações nas avaliações dos professores. O gráfico de caixa demonstra a distribuição e as alterações gerais dos escores de escrita avaliados pelos professores para dois grupos antes e após o experimento. Clique aqui para visualizar uma versão maior desta figura.

Figura 8: Gráfico de radar da capacidade de transferência autoavaliada pelos estudantes. Mostra as pontuações de autoavaliação dos estudantes em cinco dimensões de transferência ao longo de três rodadas de treinamento. Clique aqui para visualizar uma versão maior desta figura.
| Entrada | Atuação do professor | Tipo de estímulo | Atuação do aluno | Saída | Critérios de avaliação |
| Rascunhos originais dos alunos (frases/parágrafos/redações) | 1. Identificar os tipos de transferência e níveis da tarefa 2. Ajustar os parâmetros do estímulo, se necessário | Estímulo único de transferência / Cadeia de estímulos aninhados em três etapas | 1. Aprender estratégias de transferência 2. Revisar rascunhos com base no feedback da IA 3. Realizar autoavaliação | Texto revisado pela IA + Rascunho final revisado pelo aluno | Complexidade sintática, racionalidade estrutural, adequação cultural, coerência lógica, padronização de registro (escala de 0 a 5) |
Tabela 1: Tabela Resumo do Fluxo de Trabalho. Esta tabela resume todo o fluxo de trabalho operacional do treinamento de transferência de escrita em inglês assistido por IA, abrangendo materiais de entrada, operações do professor e do aluno, tipos de instruções, resultados finais e critérios de avaliação correspondentes.
| Categoria do Projeto | Conteúdo |
| Compreensão dos objetivos da missão | Descreva brevemente as metas de migração desta rodada de tarefas de escrita, como ajuste estrutural, adaptação cultural e conversão linguística. |
| Estratégia de migração utilizada | Liste as estratégias de migração que adotou (múltiplas seleções permitidas): |
| Ajuste Estrutural |
| Transformação de Frase |
| Alternância de Língua |
| Manifestação Cultural |
| Fortalecimento da Conexão Lógica |
| Outro: _______ |
| Exemplos e instruções reescritos | Selecione 1–2 frases reescritas, apresente as versões antes e depois da reescrita e explique os motivos das alterações e as metas desejadas de transferência. |
| Dificuldades e dúvidas encontradas | Descreva quaisquer desafios enfrentados durante a migração ou dúvidas que teve sobre uma expressão específica. |
Pontuação de autoavaliação
(de um total de 5 pontos) | Avalie sua reescrita textual com base nos seguintes três aspectos: |
| • Precisão na aplicação da estratégia (/5) |
| • Fluência natural da expressão (/5) |
| • Adequação cultural (/5) |
| Metas futuras de aprimoramento na escrita | Descreva brevemente a transferibilidade que gostaria de fortalecer ou otimizar na próxima rodada de treinamento |
Tabela 2: Tabela de cognição da transferência. Uma escala de classificação de 1 a 5 (1 = nenhuma proficiência, 5 = proficiência total) é adotada para a autoavaliação dos alunos sobre estratégias de transferência na escrita.
| Nome do indicador | Descrição | Fonte de dados |
| Índice de transferência de escrita (0–5) | Um indicador quantitativo que mede de forma abrangente a capacidade de transferência linguística, abrangendo três níveis: sintaxe, estrutura e cultura. | Correção automática pelo sistema + correção manual pelos professores |
| Pontuação de complexidade sintática | Inclui comprimento médio das frases, número de inserções de orações, riqueza da locução verbal, etc. | Análise automática de PLN |
| Conformidade com estilo acadêmico | Está de acordo com os padrões de escrita acadêmica em inglês? | Avaliação por modelo de processamento de linguagem natural |
| Satisfação com a resposta ao estímulo | Aceitação e avaliação prática pelos professores das sugestões geradas pelo modelo | Questionário aplicado aos professores |
| Mudanças nas notas atribuídas pelos professores | Comparação das notas dadas pelos professores antes e depois do experimento, refletindo a melhoria na qualidade da escrita | Registros de avaliação pelos professores |
| Capacidade de transferência autoavaliada pelos alunos | Os alunos autoavaliam seu domínio em diferentes dimensões de transferência | Preenchimento do formulário de conscientização sobre migração |
Tabela 3: Resumo dos indicadores de avaliação, descrições e fontes de dados. Esta tabela esclarece as definições, métodos de mensuração e fontes originais dos dados para cada indicador central de avaliação neste estudo.
| Tipo de prompt | Média da avaliação dos professores | Média da pontuação da IA | Coeficiente de correlação de Pearson |
| Transferência estrutural | 4 | 3,9 | 0,83 |
| Transferência sintática | 4,1 | 4 | 0,87 |
| Transferência cultural | 3,8 | 3,6 | 0,79 |
| Transferência de registro | 3,9 | 3,7 | 0,81 |
| Transferência lógica | 4,2 | 4,1 | 0,85 |
Tabela 4: Comparação da consistência entre o conteúdo gerado por IA e as avaliações dos professores. Os resultados demonstram a consistência entre o conteúdo gerado por IA e as avaliações dos professores em diferentes tipos de instruções.
| Itens de função | Muito satisfeito | Satisfeito | Regularmente | Insatisfeito | Muito insatisfeito |
| Sugestão de reescrita | 66% | 25% | 7% | 1.50% | 0.50% |
| Otimização estrutural | 60% | 30% | 7% | 2% | 1% |
| Dicas culturais | 55% | 28% | 12% | 3.50% | 1.50% |
Tabela 5: Estatísticas da pesquisa sobre a satisfação dos alunos com funções assistidas por IA. As estatísticas mostram a distribuição da satisfação dos alunos em relação às funções de reescrita por IA, otimização estrutural e prompts culturais.
| Medida | Grupo F(gl) | Tempo F(gl)GG | Grupo × Tempo F(gl)GG | p |
| Índice Geral de Transferência | 76,32 (1, 58) | 92,75 (2,14, 124,12) | 68,49 (2,14, 124,12) | <0,001 |
| Transferência Sintática | 52,18 (1, 58) | 71,26 (2,11, 122,38) | 45,73 (2,11, 122,38) | <0,001 |
| Transferência Estrutural | 48,65 (1, 58) | 67,81 (2,09, 121,22) | 41,36 (2,09, 121,22) | <0,001 |
| Transferência Cultural | 81,44 (1, 58) | 98,52 (2,07, 119,96) | 79,27 (2,07, 119,96) | <0,001 |
Tabela 6: Resumo dos resultados da ANOVA de medidas repetidas. Apresenta os resultados da ANOVA de medidas repetidas com dois fatores para o desempenho geral na transferência de escrita e suas três subdimensões, incluindo os efeitos principais de grupo, tempo e a interação grupo por tempo. Abreviações: GG = correção de Greenhouse–Geisser.
Tabela Suplementar 1: Avaliação dos dados brutos. Inclui os dados brutos utilizados em todas as análises deste estudo.Clique aqui para baixar este arquivo.