$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo foi realizado na Escola de Humanidades e Artes da Civil Aviation Flight University of China, utilizando dados educacionais desidentificados coletados no ambiente do curso. Nenhuma informação pessoal diretamente identificável foi incluída no conjunto de dados analítico. Todos os participantes foram informados sobre o propósito e os procedimentos do estudo, e o consentimento informado por escrito foi obtido antes da participação. A participação era voluntária, e a não participação ou a retirada do componente de pesquisa não afetavam a frequência dos cursos, as notas ou o acesso à instrução regular. Sob o quadro aplicável de práticas de pesquisa da Civil Aviation Flight University of China, estudos baseados em dados educacionais de risco mínimo desidentificados podem não exigir revisão ética formal. Todos os materiais desidentificados foram armazenados em arquivos protegidos por senha, acessíveis apenas à equipe de pesquisa. A ética e o fluxo de participantes são mostrados na Figura 1.
1. Recrutamento de participantes e perfil de linha base
Um total de 525 estudantes foram recrutados em cursos universitários relacionados ao inglês ou à tradução. Estudantes de graduação e pós-graduação de disciplinas como linguística, literatura e estudos internacionais foram incluídos. Todos os voluntários foram avaliados antes da matrícula. Apenas estudantes que estavam cursando um curso de inglês ou tradução e tinham pelo menos proficiência intermediária em inglês com base em registros institucionais de colocação, cursos anteriores ou evidências acadêmicas equivalentes foram incluídos. Estudantes com experiência profissional substancial em tradução foram excluídos. Idade, gênero, nível acadêmico, área de estudo, experiência prévia com suporte de tradução assistida por IA e frequência inicial de uso da ferramenta foram registrados. As características dos participantes foram apresentadas na Tabela 1.
2. Design instrucional e fluxo de trabalho de intervenção
Foi implementada uma intervenção em sala de aula de oito semanas, na qual a instrução convencional de tradução permaneceu como principal modo de ensino e o suporte de tradução assistida por IA foi usado como um andaime suplementarestruturado 11. Na Semana 0, a avaliação inicial foi concluída. Da Semana 1 à Semana 8, uma tarefa de tradução era atribuída a cada semana, e todos os participantes deveriam seguir a mesma sequência instrucional. Ao final da Semana 8, a bateria de avaliação usada no início do jogo foi repetida. Após a fase quantitativa, entrevistas semiestruturadas foram conduzidas com um subgrupo selecionado de forma intencional. O fluxo de trabalho geral é mostrado na Figura 2.
3. Avaliação de base
Todas as medidas de base foram aplicadas em sala de aula supervisionada sob instruções e condições de tempo idênticas. Uma tarefa de tradução baseada em um texto fonte de cerca de 300 palavras foi utilizada. Um trecho contendo segmentos literais e culturalmente nuançados foi selecionado para que os alunos precisassem demonstrar precisão lexical, controle sintático, fidelidade semântica e compreensão contextual12. O uso de ferramentas externas foi proibido durante os testes de base. Todos os roteiros completos eram anonimizados antes da pontuação. Cada roteiro foi pontuado independentemente por dois avaliadores treinados, usando uma rubrica que cobre precisão lexical, adequação gramatical e sintática, completude semântica e contextualização cultural. Se a discrepância de pontuação ultrapassasse a faixa de tolerância pré-definida, era necessária discussão até que uma pontuação consensual fosse alcançada.
Após a tarefa de tradução, a Escala de Estresse Percebido, composta por 10 itens, foi aplicada e pontuada de acordo com o procedimento padrão, com escores mais altos indicando maior estressepercebido 13. A escala de Transtorno de Ansiedade Generalizada, composta por 7 itens, foi então aplicada e avaliada pelo método publicado, com escores mais altos indicando maior gravidade daansiedade 14. Por fim, uma breve medida de confiança na tradução foi administrada usando um formato Likert de cinco pontos. Itens representativos, intervalos de pontuação e definições de variáveis foram fornecidos na Tabela 2.
4. Integração semanal padronizada do suporte de tradução assistida por IA
Durante cada semana de intervenção, uma tarefa de tradução era atribuída, que era o mais próxima possível em gênero e dificuldade às outras tarefas semanais. Os alunos eram obrigados a completar a tarefa na mesma ordem a cada semana. Primeiro, o texto fonte era lido de forma independente, e itens lexicais difíceis, estruturas sintáticas ou expressões culturalmente carregadas eram marcados. Segundo, foi preparado um rascunho inicial ou uma breve nota descrevendo os problemas de tradução previstos. Terceiro, a consulta de sistemas de tradução aprovados assistida por IA só era permitida durante a elaboração e revisão. A submissão direta de saídas geradas por máquina não editadas não era permitida.
Os alunos eram obrigados a avaliar todas as sugestões de máquinas retidas ou rejeitadas usando os mesmos quatro critérios a cada semana: ajuste lexical, naturalidade sintática, coerência do discurso e adequação cultural. A submissão do texto fonte marcado, do rascunho assistido por máquina e da tradução revisada final eram exigidos para cada tarefa semanal. Após a submissão, uma discussão estruturada entre pares foi organizada usando os mesmos prompts a cada semana, para que os alunos explicassem onde a produção automatizada era útil, enganosa, excessivamente literal ou contextualmente inadequada. Esse desenho seguiu evidências atuais mostrando que a tradução automática é mais útil educacionalmente quando incorporada em comparação e revisão guiada, em vez de ser usada como substituta do julgamento humano15.
5. Monitoramento e uso de ferramentas de categorização
O uso de ferramentas assistidas por IA foi acompanhado ao longo da intervenção de oito semanas. Após cada tarefa semanal, os participantes precisavam preencher um breve registro de uso online informando se o suporte automatizado foi utilizado, qual função ele desempenhava, com que frequência foi consultado e em que estágio entrou no processo de tradução. Categorias padronizadas de resposta foram fornecidas na Semana 1 para que os participantes usassem os mesmos critérios de relato durante todo o estudo. Ao final da Semana 8, os registros semanais foram agregados, e a frequência geral de uso foi classificada como diária, semanal ou ocasional. As definições operacionais dessas categorias são apresentadas na Figura 3.
6. Avaliação pós-intervenção
Ao final da Semana 8, a mesma bateria de avaliação usada no início do jogo foi repetida. Foi usado um texto de tradução pós-intervenção que foi o mais próximo possível do texto base em comprimento, gênero e dificuldade. Condições administrativas, tempo, rubrica de avaliação e fluxo de trabalho do avaliador foram mantidos consistentes com os procedimentos de base. A mesma Escala de Estresse Percebido, a mesma escala de Transtorno de Ansiedade Generalizada e a mesma medida de confiança na tradução foram aplicadas na mesma ordem usada no comece inicial.
7. Procedimentos qualitativos de entrevista e análise temática
Após a avaliação pós-intervenção, 40 estudantes foram selecionados propositalmente para entrevistas semiestruturadas, garantindo variação de gênero, nível acadêmico e experiência prévia com suporte de tradução assistida por IA. As entrevistas foram realizadas presencialmente ou por meio de um formato de reunião online aprovado, utilizando o mesmo guia de entrevistas para todos os participantes. Foram feitas perguntas sobre estratégias de uso de ferramentas, carga cognitiva percebida, mudanças de confiança, avaliação da produção da máquina e preocupações com dependência excessiva. Todas as entrevistas foram gravadas em áudio com consentimento dos participantes e transcritas literalmente.
As transcrições foram analisadas por meio de análise temática. Dois pesquisadores foram solicitados a ler todas as transcrições de forma independente, gerar códigos iniciais, comparar resultados de codificação, mesclar códigos sobrepostos e refinar temas candidatos por meio de repetidas revisões das transcrições. Após a fase inicial de codificação, foi calculado o acordo entre avaliadores e o kappa de Cohen foi reportado. A lógica analítica seguiu procedimentos estabelecidos para análise temática em pesquisaqualitativa 16.
8. Análise quantitativa e de métodos mistos
Estatísticas descritivas foram usadas para resumir as características dos participantes e os escores iniciais. Comparações com amostras pareadas foram usadas para testar diferenças pré-pós-produção na precisão da tradução, estresse percebido, ansiedade e confiança. Múltiplos modelos de regressão foram usados para identificar preditores da precisão da tradução pós-intervenção, com desempenho inicial, frequência de uso de ferramentas assistidas por IA e variáveis psicológicas inseridas como variáveis independentes. Testes de qui-quadrado foram usados para examinar associações entre categorias de uso e resultados categóricos, e coeficientes de correlação de Pearson foram usados para avaliar a direção e a força das associações entre precisão de tradução, frequência de uso, estresse percebido, ansiedade e confiança. A significância estatística foi definida em alfa = 0,05 usando testes bilaterais. Os achados quantitativos e qualitativos foram integrados na etapa de interpretação, de acordo com procedimentos padrão de métodosmistos 17.