Declaração de ética
Este estudo foi conduzido de acordo com os padrões éticos do Conselho de Revisão Institucional (IRB) da Universidade de Chengdu, China (Aprovação nº: 202509). Todos os participantes forneceram consentimento informado por escrito antes da participação. O estudo seguiu as diretrizes institucionais para pesquisas envolvendo sujeitos humanos, garantindo participação voluntária, confidencialidade e o direito de se retirar a qualquer momento sem penalidade.
Para manter a confidencialidade, todos os dados coletados foram anonimizados usando identificadores codificados, e as informações pessoais foram armazenadas separadamente dos dados de pesquisa em arquivos protegidos por senha, acessíveis apenas aos pesquisadores principais. O desenho do questionário incorporou medidas para minimizar o desconforto psicológico, especialmente para perguntas sobre ansiedade, e os participantes receberam informações de contato dos serviços de aconselhamento universitário caso surgisse algum sofrimento devido à participação na pesquisa. Para abordar possíveis desequilíbrios de poder na relação professor-aluno, o recrutamento e a coleta de dados foram realizados por assistentes de pesquisa treinados, em vez de instrutores do curso, e os participantes foram assegurados de que suas respostas não afetariam seu desempenho acadêmico ou o relacionamento com o corpo docente.
Este estudo utilizou um desenho quantitativo e transversal envolvendo 290 estudantes chineses de graduação em EFL de uma universidade pública. Participantes de diversos anos acadêmicos e disciplinas foram recrutados por meio de amostragem por conveniência com representação proporcional e preenchidos questionários em papel em ambientes de sala de aula controlados durante sessões regulares, exigindo aproximadamente 25 minutos. A bateria do questionário incluiu escalas validadas que mediam estilo de ensino, alfabetização digital, uso do ChatGPT, motivação, ansiedade e criatividade. Para minimizar o viés, assistentes de pesquisa treinados administraram os questionários usando contramedidas procedimentais, como a separação psicológica dos itens. Após a coleta de dados, as respostas foram analisadas usando software estatístico e software de Modelagem de Equações Estruturais de Mínimos Quadrados Parciais (PLS-SEM), incluindo triagem de dados, avaliação de modelos de medição, testes de modelos estruturais e análise de mediação usando um procedimento bootstrapping com 5.000 reamostras.
Design de Pesquisa
Este estudo utilizou um desenho quantitativo e transversal para examinar as relações entre o estilo de ensino, o uso do ChatGPT, a alfabetização digital, a motivação, a ansiedade e a criatividade entre os aprendizes de EFL. Uma abordagem transversal foi considerada adequada para capturar um instantâneo dessas variáveis em um momento específico, permitindo a análise de suas inter-relações sem as demandas temporais da pesquisa longitudinal. O projeto facilitou o teste de um modelo de mediação hipotetizado no qual a motivação serve como mecanismo que liga o estilo de ensino, o uso do ChatGPT e a alfabetização digital à redução da ansiedade e ao aumento da criatividade.
Dados e Amostra
O quadro de amostragem consistiu em todos os estudantes de graduação matriculados em cursos de Inglês como Língua Estrangeira (EFL) em uma universidade pública na China durante o ano letivo de 2024–2025. Os critérios de elegibilidade exigiam que os participantes fossem (a) falantes nativos de chinês, (b) estivessem matriculados em pelo menos um curso obrigatório de EFL, e (c) não tivessem treinamento formal prévio em ferramentas de aprendizado de idiomas baseadas em IA além do curso geral. Foi utilizada uma abordagem estratificada de amostragem por conveniência, com alocação proporcional entre os anos acadêmicos (calouro, segundo ano, terceiro e médio) e áreas disciplinares (humanidades, ciências sociais, ciências naturais, engenharia). Os tamanhos-alvo dos condomínios foram definidos em 25% por ano acadêmico e 25% por área disciplinar, com base na distribuição geral de estudantes da universidade. A amostra final foi composta por 290 estudantes de graduação em EFL. Dos 328 alunos abordados durante as sessões regulares de aula, 11 recusaram-se a participar (taxa de não participação = 3,4%) e 27 forneceram questionários incompletos (taxa de resposta incompleta = 8,2%), resultando em uma taxa final utilizável de resposta de 88,4% (290/328). O cálculo a priori do tamanho da amostra foi realizado usando G*Power 3.1 com a família de testes F, regressão múltipla linear: modelo fixo, desvio R2 a partir de zero como teste. Os parâmetros de entrada foram: tamanho do efeito f2 = 0,15 (tamanho médio convencional para pesquisa comportamental), α err probabilidade = 0,05, potência (1-β err probabilidade) = 0,95, e número de preditores = 3 (estilo de ensino, uso do ChatGPT, alfabetização digital) para o resultado motivacional. O cálculo resultou em um tamanho mínimo de amostra exigido de 119 para detectar um R2 significativo. Para considerar ainda mais o modelo completo de MEB (incluindo caminhos indiretos e variáveis endógenas adicionais), aplicamos a regra mais conservadora de 10 casos por parâmetro estimado. Com 29 parâmetros estimados em nosso modelo, o tamanho da amostra exigido era 290, que corresponde exatamente à amostra final. Assim, a amostra obtida é totalmente alimentada tanto para análises baseadas em regressão quanto em SEM.
Participantes e Procedimento
Os participantes foram recrutados por meio de amostragem estratificada por conveniência para garantir proporcionalidade entre anos acadêmicos (calouro a último ano) e formações disciplinares (humanidades, ciências e engenharia). Os tamanhos dos condomínios na amostra final foram: calouros (n = 72, 24,8%), calouros (n = 74, 25,5%), juniores (n = 71, 24,5%), veteranos (n = 73, 25,2%); e humanidades (n = 76, 26,2%), ciências sociais (n = 68, 23,4%), ciências naturais (n = 72, 24,8%), engenharia (n = 74, 25,5%). A amostra era composta por 62% de estudantes do sexo feminino e 38% do sexo masculino, com uma idade média de 20,3 anos (DE = 1,7). A coleta de dados ocorria durante as aulas regulares de EFL. Assistentes de pesquisa treinados aplicavam questionários em papel em ambientes de sala de aula controlados para garantir a padronização. Antes da administração da pesquisa, todos os estudantes elegíveis presentes em sala de aula foram informados sobre o propósito do estudo, a natureza voluntária e as medidas de confidencialidade (respostas anônimas, armazenamento seguro de dados). Estudantes que não atenderam aos critérios de elegibilidade (n = 6, sem matrícula em EFL) ou recusaram participação (n = 11) foram excluídos; As razões para a recusa incluíam restrições de tempo (n = 7) e desconforto com o uso auto-relatado de tecnologia (n = 4). A bateria do questionário levou aproximadamente 25 minutos para ser concluída e incluiu escalas validadas para todos os construtos. Para mitigar o viés comum do método, foram aplicadas contramedidas processuais (por exemplo, separação psicológica dos itens da escala, anonimato das respostas). Além disso, o viés comum do método foi avaliado usando o teste de fator único de Harman, e o primeiro fator representou menos de 50% da variância total, indicando que o viés comum do método não foi uma preocupação principal neste estudo.
Medidas de Estudo
Todas as escalas foram adaptadas ao contexto do EFL chinês por meio de um rigoroso procedimento de tradução e adaptação. Dois pesquisadores bilíngues traduziram independentemente os itens originais em inglês para o chinês, e um terceiro pesquisador conciliou discrepâncias para produzir uma versão preliminar. Essa versão foi retrotraduzida para o inglês por dois tradutores diferentes, e quaisquer inconsistências foram resolvidas por meio de discussões com a equipe de pesquisa. As versões chinesas foram então testadas em piloto com 30 estudantes de graduação em EFL (que não fazem parte da amostra principal) para verificar clareza e compreensão, resultando em pequenos ajustes na redação. Para cada escala, as respostas foram coletadas em uma escala de Likert de 5 pontos, variando de 1 (fortemente discordante) a 5 (fortemente concordo). Foram usados pontuações somadas ou médias para cada construto, com pontuações mais altas indicando níveis mais altos da respectiva variável. Todas as escalas adaptadas foram usadas com permissão dos autores originais ou sob termos de licença aberta, quando aplicável. Nenhum item foi removido das escalas originais, exceto onde indicado abaixo; A retenção de itens baseava-se em cargas fatorizadas > 0,40 e relevância teórica. Sobre o uso do ChatGPT, o estudo avaliou a interação autorrelatada dos alunos com a versão gratuita do ChatGPT (GPT-3.5/4 disponível via web ou aplicativo móvel durante o ano letivo de 2024–2025). Todos os participantes tiveram acesso igual à ferramenta, já que a universidade não restringia o ChatGPT; no entanto, o uso real variava de pessoa para pessoa. A escala mediu a frequência do uso do ChatGPT (variando de "nunca" a "diária"), os tipos de tarefas de aprendizado de idiomas para as quais ele foi empregado (por exemplo, construção de vocabulário, correção gramatical, redação de redações, prática de conversação e correção de erros) e a qualidade percebida da interação (por exemplo, utilidade, clareza do feedback). A escala não distinguia entre versões específicas do ChatGPT, pois as atualizações ocorriam durante o período de coleta de dados; em vez disso, os participantes relataram a versão que usaram principalmente, com mais de 90% relatando GPT-3,5 ou GPT-4. Exemplos detalhados de itens e notas de adaptação para cada construto são fornecidos abaixo.
Este estudo utilizou escalas rigorosamente validadas, cuidadosamente adaptadas ao contexto da educação EFL, para avaliar as variáveis-chave: abordagens de ensino, competência digital, integração com o ChatGPT, ansiedade na aprendizagem de idiomas, motivação do aprendiz e pensamento criativo. As ferramentas de medição foram escolhidas por sua confiabilidade demonstrada e capacidade de avaliar abrangente cada construção. Para examinar métodos instrucionais, a pesquisa utilizou uma versão modificada do Inventário34 de Estilo de Ensino de Grasha, que avalia cinco abordagens pedagógicas distintas: autoritativa, especializada, Modelo Pessoal de Professor, facilitadora e delegativa. Para avaliar a Alfabetização Digital, o estudo incorporou uma versão modificada da escala desenvolvida por Rodríguez-de-Dueños et al.35, composta por 29 itens em seis domínios-chave: (1) alfabetização técnica, (2) alfabetização em proteção de dados pessoais, (3) alfabetização em avaliação crítica, (4) alfabetização em segurança de dispositivos, (5) alfabetização em processamento de informação e (6) alfabetização em comunicação digital. Essa estrutura multidimensional forneceu uma avaliação minuciosa das capacidades digitais dos alunos necessárias para a educação contemporânea. O uso do ChatGPT foi avaliado usando uma escala de 8 itens adaptada de Abbas et al.36, focando na interação dos alunos com a ferramenta de IA para tarefas de aprendizado de idiomas. Essa escala captura o uso percebido e auto-relatado do ChatGPT pelos alunos em tarefas de aprendizado de idiomas, em vez da frequência objetiva de uso. A ansiedade em sala de aula em línguas estrangeiras (FLCA) foi medida usando uma escala adaptada baseada em Briesmaster eBriesmaster 37. Este instrumento examinou a ansiedade em três dimensões críticas: Apreensão na Comunicação, Ansiedade em Teste e Medo de Avaliação Negativa, com 10, 10 e 7 itens, respectivamente. A motivação dos alunos foi avaliada usando uma escala adaptada de Kanoksilapatham et al.38, medindo três dimensões-chave: Promoção e Prevenção da Instrumentalidade, Etnocentrismo e Integração, e Atitude em relação ao Aprendizado do Inglês. A escala incluía um total de 20 itens. A criatividade dos alunos de EFL foi medida usando uma escala adaptada de Govindasamy et al.39, que avaliou quatro dimensões: Originalidade, Flexibilidade, Fluência e Elaboração. Cada dimensão foi medida usando três itens.
Métodos de Análise de Dados
Os dados coletados foram analisados usando uma abordagem analítica em dois estágios que combina SPSS (Versão 27) e Modelagem de Equações Estruturais de Mínimos Quadrados Parciais (PLS-SEM) por meio de software SmartPL. A triagem inicial dos dados e as análises preliminares foram realizadas usando SPSS para examinar a qualidade dos dados, incluindo verificações de valores ausentes, valores fora do comum e suposições de normalidade. Menos de 2% dos pontos de dados estavam completamente ausentes de forma aleatória (MCAR), conforme confirmado pelo teste MCAR de Little (χ2 = 18,24, p = 0,212), e foram tratados usando o algoritmo de expectativa-maximização para preservar o poder estatístico. O conjunto de dados demonstrou normalidade univariada aceitável (assimetria < |2|, curtose < |7|) e normalidade multivariada (coeficiente de Mardia = 18,37, p < 0,001), justificando o uso tanto de testes paramétricos quanto do PLS-SEM, que é robusto à não normalidade. Embora a normalidade univariada fosse aceitável, o coeficiente de Mardia indicou uma violação da normalidade multivariada (p < 0,001). No entanto, isso não representa preocupação, pois o PLS-SEM é robusto a distribuições de dados não normais.
A análise de confiabilidade revelou forte consistência interna para todas as escalas (α > de Cronbach 0,82, confiabilidade composta > 0,85), enquanto a análise fatorial exploratória confirmou as estruturas fatoriais esperadas com todos os itens carregando limpamente em suas respectivas construções (cargas > 0,65, cargas cruzadas < 0,40).
Para testes de hipóteses, o PLS-SEM foi escolhido em vez do SEM baseado em covariância devido ao seu manejo superior de modelos complexos com tamanhos de amostra pequenos a médios e à sua capacidade de maximizar a variância explicada em construtos endógenos. A análise seguiu o procedimento de duas etapas, primeiro avaliando o modelo de medição e depois avaliando o modelo estrutural. O modelo de medição reflexiva demonstrou validade convergente adequada (variância média extraída > 0,50 para todos os construtos) e validade discriminante, conforme confirmado tanto pelo critério de Fornell-Larcker quanto pela razão heterotraço-monotraço (HTMT < 0,85). No modelo estrutural, os coeficientes de caminho foram estimados usando um procedimento bootstrapping com 5.000 reamostras para gerar estimativas estáveis e intervalos de confiança. O poder preditivo do modelo foi avaliado por meio de valores R2 para variáveis endógenas (motivação = 0,53, ansiedade = 0,41, criatividade = 0,38) e relevância preditiva (Q2 > 0), com tamanhos de efeito (f2) calculados para determinar o impacto substantivo. Análises de mediação utilizaram o método bootstrap corrigido por viés para testar efeitos indiretos, com mediação significativa estabelecida quando intervalos de confiança de 95% excluíam zero.
Todos os construtos foram modelados como reflexivos (modo A) com base em considerações teóricas, já que cada variável latente era assumida como responsável pelos indicadores observados. Nenhum item foi retirado de qualquer escala, pois todos os itens demonstraram cargas externas acima do limite de 0,50 (variando de 0,62 a 0,89) e todos os valores médios de variância extraída (AVE) excederam 0,50, confirmando a validade convergente. Para testes de mediação, o modelo estrutural incluiu caminhos diretos dos três antecedentes (estilo de ensino, uso do ChatGPT, alfabetização digital) até a motivação, da motivação para a ansiedade e da ansiedade para a criatividade. Caminhos diretos dos antecedentes para a ansiedade e dos antecedentes para a criatividade também foram estimados para testar a mediação parcial versus total. A mediação completa foi determinada com base nos critérios de que (a) os efeitos indiretos (antecedentes → motivação → ansiedade) eram significativos (intervalo de confiança bootstrap corrigido por viés de 95%, excluindo zero), e (b) os efeitos diretos dos antecedentes da ansiedade tornaram-se não significativos após incluir o mediador, enquanto os efeitos diretos dos antecedentes à criatividade nunca foram significativos. Todas as análises usaram o algoritmo PLS-SEM no SmartPLS 4 com esquema de ponderação de caminhos, iterações máximas definidas em 300 e critério de parada de 1,0e-7. O bootstrapping foi realizado com 5.000 subamostras, intervalos de confiança corrigidos por viés e acelerados (BCa) a 95%, e sem opção de mudança de sinal. O ajuste ao modelo foi avaliado usando o padrão padrão de residência quadrática média da raiz (SRMR = 0,061), que fica abaixo do limiar recomendado de 0,08.