$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A globalização intensiva da educação e das tecnologias digitais aumentou a necessidade de avaliar cientificamente e de forma credível o nível de escrita em inglês para o ensino de línguas, desenvolvimento acadêmico e avanço nacarreira 1. Avaliações convencionais de escrita, como praticadas pela avaliação humana, podem medir aspectos subjetivos da escrita, como a minuciosidade da argumentação e a adequaçãocultural 2, mas são suscetíveis a longos prazos de resposta, altos custos de mão de obra e viés devido à experiência e inclinações dosavaliadores 3,4. Essas limitações são especialmente agudas em práticas em larga escala, como testes de língua internacional (IELTS, TOEFL) ou outros cursos de inglês ministrados em universidades onde a pontuação manual não pode ser tudo o que é necessário em termos de feedback instantâneo e cobertura5.
Sistemas AWE tornaram-se amplamente utilizados nesse contexto devido ao seu processamento em tempo real, padronização e escalabilidade6. Ferramentas populares como Grammarly (que foca em erros gramaticais e refinamento de estilo) e ETS Criterion (que segue normas formais de escrita) são atualmente usadas por milhões de estudantes na educação K-12, escolas de idiomas, ensino superior e treinamentoindividual 7. Embora esses sejam os benefícios, a eficiência tecnológica e a aplicabilidade educacional dos sistemas AWE ainda sãocontestadas. Tecnicamente falando, os sistemas existentes são altamente precisos em dimensões objetivas, incluindo detecção de erros e diversidade lexical, onde a correlação com a pontuação humana pode ser superior a 0,859. No entanto, em áreas mais subjetivas, como relevância de conteúdo, argumentação lógica e organização de um texto, as correlações frequentemente ficam menores que 0,7010. Tal desproporção tem o risco de promover uma precisão superficial entre os aprendizes, ao custo da competência geral naescrita 11.
A questão da equidade também limita a utilidade educacional da AWE. Os estudos atuais também tendem a focar nos indicadores agregados de precisão, negligenciando a possibilidade de desvios que prejudiquem sistematicamente alguns grupos12. Indicativamente, características do interidioma compartilhadas por aprendizes de chinês ou espanhol seriam confundidas com erros, o que resultaria em subestimaçãosistemática 13,14. Além disso, a aceitação subjetiva do feedback de IA pelos aprendizes é geralmente pouco conhecida15. Pesquisas indicam que quase um terço dos aprendizes não nativos relata uma inadequação entre as pontuações de IA e o desempenho real, com os processos de precisão técnica, equidade em grupo e satisfação do aprendiz ainda sendo poucocompreendidos 16.
Essas fraquezas refletem as deficiências do paradigma clássico de precisão17. Uma estrutura que considera apenas o alinhamento entre IA e pontuação humana não pode capturar questões de equidade ou a confiança do aprendiz no sistema. Na prática, o valor educacional da AWE deve satisfazer três condições simultaneamente: precisão técnica, justiça entre grupos e aceitação peloaprendiz 18. A ausência de uma abordagem de validação tão abrangente ajuda a explicar por que os sistemas AWE gozam de ampla adoção, porém de confiança limitada na prática educacional19,20.
Para enfrentar esse desafio, o presente estudo introduz uma estrutura de validação multinível que integra precisão técnica, justiça em grupo e individual, e percepção do aprendiz em uma estrutura coerente. O framework XAI proposto foi projetado para ser implementado de forma prática nas plataformas AWE existentes, fornecendo a professores e alunos diagnósticos de imparcialidade e explicações transparentes de pontuação, podendo ser aplicado em cursos de redação ou aulas de preparação para provas para avaliar sua capacidade de aumentar a justiça, a interpretabilidade e a utilidade instrucional em ambientes reais de avaliação.
Nesse contexto, a hipótese é uma AFMM para investigar o papel mediador da justiça percebida na determinação da relação entre precisão e satisfação, bem como o papel moderador da proficiência linguística na sensibilidade à justiça. Portanto, contribui de duas formas, tanto teoricamente ao enriquecer os modelos de avaliação da AWE ao descrever a justiça como uma das principais dimensões de validação junto com a precisão e a percepção, quanto na prática, ao fornecer aos desenvolvedores estratégias para maximizar a justiça, educadores com critérios de seleção de sistemas sensíveis ao grupo, e o valor educacional da AWE, explicando a forma como as percepções dos aprendizes são formadas. Além da educação, o arcabouço também está alinhado com o conceito mais amplo de XAI, demonstrando como justiça e percepção do usuário podem aumentar a transparência, a confiança e a aceitação em outras áreas, como saúde, sistemas autônomos e cibersegurança.
Perguntas de Pesquisa:
1.To que ponto o sistema AWE demonstra precisão técnica e justiça entre diferentes grupos de língua nativa e proficiência?
2. Como uma estrutura de avaliação multinível baseada em XAI pode melhorar a transparência e a equidade na avaliação automatizada de redação em inglês?
REVISÃO DA LITERATURA:
Os fatores que afetam a aceitação do feedback do AWE pelos estudantes universitários foram examinados usando um Modelo de Aceitação de Tecnologia (TAM)21 estendido. Com base em dados de pesquisas de 448 estudantes chineses que usaram MEV, foi determinado que utilidade, facilidade de uso e intenção tiveram influência significativa na norma subjetiva, confiança, autoeficácia, feedback cognitivo e características do sistema. No entanto, o estudo foi limitado a uma única nação e a um único grupo de estudantes, o que limita a aplicabilidade da generalização. Para explorar como os estudantes chineses de EFL respondem ao feedback do PigaiAWE 22, um estudo analisou submissões repetidas (n = 5) de estudantes universitários. Observou uma ênfase inicial na correção de erros, baixa captação de feedback linguístico e aprofundamento gradual da resposta. No entanto, o tamanho da amostra era muito limitado, assim como o sistema AWE, que restringe a aplicabilidade e a generalizabilidade. As crenças dos professores de EFL sobre a aplicação da ferramenta de avaliação de IA (CoGrader) foram examinadas para identificar os fatores que influenciam suasopiniões 23. Por meio de um estudo de métodos mistos com 10 professores universitários sauditas, uma pesquisa e uma entrevista revelaram que havia uma opinião positiva mista, mas relutância em ter total certeza da confiabilidade e da substituição completa dos professores. Isso dificulta a generalização devido à amostra limitada e ao cenário de um país.
Considerando os avanços em linguística de corpus e tecnologia de IA, um estudo investigou os frameworksAES 24. Utilizou PCA para melhorar indicadores linguísticos de avaliação da qualidade da escrita e descobriu que combinar microcaracterísticas com características agregadas definia a qualidade da escrita de forma mais eficaz do que as características agregadas isoladamente. A abordagem não linear AES baseada na Regressão em Floresta Aleatória superou as outras abordagens. Além disso, o SHAP identificou elementos essenciais da linguagem para cada atributo avaliado, aumentando a transparência do sistema por meio de IA explicável. Os resultados podem ajudar a aprimorar métodos multidimensionais na redação, avaliação e educação. O sistema de colaboração homem-máquina foi introduzido para enfrentar os desafios de anotar escritos árabes, que frequentemente são caros e demorados. O método considera ensaios baseados em sete características da literatura com a ajuda do LLM. Os processos de validação e as táticas de prompting foram personalizados para garantir consistência e precisão. A cooperação resulta em um maior fornecimento de recursos rotulados e não afeta a qualidade da avaliação, demonstrando que é um método escalável de anotação de dados adequado para linguagens de menor recurso.
O uso da IA na área educacional oferece uma oportunidade de reduzir significativamente as exigências de avaliação e aprimorar a educação emescrita 25,26. Ao mesmo tempo, pesquisadores enfatizaram que a precisão da IA não é o único aspecto relevante para seu uso responsável. Existem princípios de justiça e redução de preconceitos, segurança e privacidade, responsabilidade, explicabilidade, transparência, efeito educacional, integridade e desenvolvimento contínuo. Pesquisas recentes avaliaram empiricamente a pontuação zero-shot baseada no GPT-4o, com foco nesses requisitos. A pesquisa focou nas percepções que os educadores tinham em relação aos ADWTs em relação ao aspecto da integridade educacional27. O estudo transversal envolvendo 100 estudantes de pós-graduação e professores de 10 disciplinas sugere que, apesar dos professores atribuírem os benefícios dos ADWTs ao alcançar o objetivo educacional, eles apresentam algumas limitações, como acessibilidade limitada, falta de conhecimento e preocupação com seu impacto na integridade e criatividade. A pesquisa sugeriu que, à medida que as tecnologias de IA se integram mais à educação, preocupações éticas e a participação das partes interessadas são necessárias para seu uso bem-sucedido e responsável. Pesquisas investigaram a eficácia das tecnologias de IA em comparação com avaliadores humanos na avaliação de ensaios submetidos por alunos deEFL (28 anos). A avaliação de 30 ensaios revelou que, embora a IA oferecesse comentários de alta qualidade em termos de conteúdo, linguagem, organização e correção, ela constantemente apresentava avaliações mais baixas do que avaliadores humanos. Além disso, a IA forneceu um feedback mais completo, mas as pontuações das várias ferramentas de IA não foram substancialmente diferentes.
Lacuna na Pesquisa:
Atualmente, a maioria das pesquisas sobre estudos AWE examina a precisão ou a aceitação dos usuários. Pouquíssimos analisam se as diferenças de pontuação prejudicam sistematicamente grupos de língua nativa ou proficiência. Embora estudos anteriores tenham examinado a aceitação por usuários ou sejam limitados a um sistema AWE específico de um país e tamanho de amostra específicos, surgem questões sobre generalizabilidade. Embora tanto o SHAP quanto o PCA sejam estratégias XAI e tenham sido desenvolvidos para aumentar a transparência, nenhum estudo examinou mecanismos de justiça ou como os aprendizes utilizam o feedback da IA do AWE. Não existem estruturas extensas na literatura que contemplem dimensões definidas de precisão, análise de justiça e percepções do aprendiz. Não há exemplo de modelo explicável de avaliação que considere a precisão intra e interavaliadora, a justiça e as percepções do aprendiz. Uma estrutura explicável, TLEF, e um modelo combinado, AFMM, são propostos e validados nesta pesquisa para avaliar a precisão, justiça e percepções do aprendiz ao mesmo tempo entre aprendizes multilíngues e com diversos níveis de proficiência.