Artigo de investigação

Investigando o Efeito da Avaliação Automatizada de Escrita por Meio de Rede Neural Profunda e Avaliação Escrita de Professores no Desempenho da Redação em Inglês

DOI:

10.3791/69995

8 de maio de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A oferta de feedback na forma de dois recursos semânticos de PLN por meio do sistema computacional e do feedback escrito do professor foi empregada para melhorar a fluência e a correção da escrita em inglês dos alunos. Os resultados mostraram resultados positivos em relação ao primeiro.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

As tecnologias de aprendizado de idiomas assistidas por computador foram as que mais avançaram na aprendizagem de idiomas, especialmente no contexto da inteligência artificial (IA), nos últimos anos. Existem várias tecnologias, como a avaliação automatizada de redação (AWE daqui em diante) e a pontuação automática de redações (AES), que são consideradas pilares do aprendizado de idiomas, não apenas nas disciplinas de computação, mas também na educação. A avaliação só pode ser feita na forma de pontuações holísticas usando a tecnologia AWE, que tem sido bastante eficaz no aprimoramento do aprendizado de idiomas e, portanto, não pode fornecer feedback detalhado ou aprofundado. Para fornecer feedback detalhado de escrita sobre dois elementos principais de uma linguagem (ou seja, Gramática e Fluência), foram considerados um sistema de implementação assistido por computador que envolve modelos de redes neurais, e dois métodos de processamento de linguagem natural baseada em semântica (NLP daqui para frente). Para isso, 90 estudantes universitários paquistaneses que aprendiam inglês segunda língua (ESL) foram aleatoriamente designados para os grupos de controle, feedback do instrutor e experimentais. A avaliação assistida por computador abrangeu uma rede neural. Os resultados do teste de comparação entre o modelo de linha inicial do AWE e os instrutores que avaliaram mostraram uma correlação entre o feedback assistido por computador que utilizava essas redes neurais. As implicações desses resultados estão na pedagogia da escrita em ESL, especialmente em situações onde a precisão linguística e a fluência representam um desafio.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O feedback na escrita aborda vários atributos da linguagem, como organização, gramática, fluência, conteúdo e mecânica, permitindo que os aprendizes reescrevam ou criem um novo textoescrito 1,2,3. Atualmente, os professores de escrita em inglês têm sido grandes beneficiários devido às rápidas mudanças e avanços do aprendizado de idiomas assistido por computador (CALL daqui para frente) e da avaliação assistida por computador na forma AWE ou AES, além da correção de redaçõesescritas 4. Além disso, a avaliação assistida por computador da escrita em inglês fornece feedback diagnóstico sobre elementos linguísticos como conteúdo, gramática, vocabulário, etc., fornecendo respostas oportunas, individuais e objetivas ao texto escrito dos alunos. O sistema AWE também está em posição de fornecer respostas claras por escrito aos alunos, para que eles internalizem o conhecimento adquirido por meio dessas respostas escritas e aumentem a capacidadecognitiva 6dos alunos.

O presente estudo baseou-se em uma pesquisa4, que apresentou o conceito de um aprendizado de escrita em inglês baseado em múltiplas estratégias, baseado em computador, com a teoria do feedback da escrita em inglês em perspectiva e o processo de pontuação analítica em mente. Isso incluiu outros modelos baseados em semântica de PLN que incorporavam deep learning ao feedback escrito para oferecer uma pontuação elaborada de feedback escrito. Ela aborda as limitações da tecnologia AWE anterior, que enfatiza apenas o holístico, mas não a pontuação analítica e específica. Consequentemente, isso tem mais a ver com avaliação precisa e imediata com notas sub-total e sub-total em uma série de elementos de indicadores linguísticos para melhorar a aprendizagem da escrita em inglês entre os alunos. Entre as várias características da linguística (ou seja, conteúdo, complexidades, correção, fluências), o presente estudo examinará apenas a fluência e o aspecto gramatical dos aprendizes de ESL no Paquistão. Para isso, o estudo atual sugere uma estratégia de tecnologia de PLN que envolve o uso de redes neurais acompanhadas de avaliação dos professores.

No contexto de aprendizagem da língua paquistanesa, os alunos paquistaneses enfrentam dificuldades para aprender a escrita em inglês, mesmo que considerem estudar inglês como uma disciplina obrigatória a partir do 1º ano e continuando até o 14º ano. É aí que inúmeros fatores, como cursos errados e o uso dos métodos antigos para explicar a gramática, entram em cena7. No nível universitário, o número de alunos que os professores são obrigados a ensinar é considerável, pois os alunos têm uma variedade de origens que abrange diferentes faculdades e escolas. Isso obriga os professores a passarem grande parte do tempo corrigindo erros de escrita dos alunos, e isso torna a carga de trabalho muito alta. Por outro lado, os alunos tomavam o feedback escrito dos professores como garantido e não faziam esforço para reconhecer os erros ecorrigi-los 8.

Um estudo afirmou que a fluência é principalmente influenciada pelo fato de que, como os alunos têm medo de cometer erros, ela se torna uma barreira para escrever fluentemente e, portanto, preferem evitar errar com mais frequência do que se envolver com pensamentos. Há interferência ocasional da língua urdu com a escrita em inglês, além de outros fatores contextuais. Além disso, o urdu é a língua nacional. Como resultado desses fatores contextuais, os professores têm dificuldade em fornecer um feedback preciso, oportuno e consistente a cada aluno sempre que eles geram resultados escritos ou editam os manuscritos. Considerando a teoria da avaliação da escrita, este estudo poderá acompanhar o estudo que emprega uma estratégia automática de feedback de escrita automática durante a comparação com a avaliação tradicional do professor, adotando a pontuação analítica em vez da holística para garantir que os alunos recebam feedback instantâneo sobre as duas dimensões linguísticas significativas (ou seja, Gramática e Fluência)4.

Diferentes produtos industriais AWE e AES surgiram, incluindo Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion, etc. O AES/AWE, em seu estágio inicial de desenvolvimento, é caracterizado principalmente pelo sistema tradicional de aprendizado de máquina baseado no teoremade Bayes 10, regressãolinear 11 , etc. Atualmente, o desenvolvimento prolongado do aprendizado profundo, especialmente a tecnologia de redes neurais, também beneficiou notavelmente o campo do feedback de escrita, como redes neurais recorrentes ouRNN 12, memória de curto prazolongo 13, Redes Neurais Convolucionais (CNN)14, abordagemBERT 15. A AWE também recebeu benefícios das estratégias de pré-treinamento empregadas no início daNLP 16. Muitos estudos consideraram várias soluções focadas em redes neurais, como geração de amostras adversariais para fins de aprendizagem, aprendizagem por meio deMultitarefa 17, aprendizagem por Auto-Supervisão18 e Algoritmos deGrafos 19. Alguns sugeriram técnicas diferentes para resolver o problema da falta de dados de treinamento para escrever feedback20. Também existem modelos de pontuação que contribuem para muitos modelos de redesneurais 21.

A correção de erros gramaticais (GEC daqui para frente) é uma forma independente de missões de PLN, que tem a capacidade de detectar e corrigir automaticamente os erros de composição. O conteúdo da TAC está inter-relacionado com os aspectos do AWE. As tarefas AWE são consideradas para levar em conta o diagnóstico de erros gramaticais, a maioria dos quais precisa ser destacada na forma correta. No entanto, os estudos do AWE deram menos atenção ao GEC, e apenas algumas pesquisas integraram o modelo inicial do GEC à tecnologia AWE. Inicialmente, a pesquisa sobre GEC escolhe geralmente N-grama22, e modelo de linguagem23 , incluindoBERT 24 , para identificar e corrigir erros gramaticais. No entanto, as soluções acima não conseguiram resolver completamente problemas como desordem e omissão de componentes. A arquitetura docodificador-decodificador 25 alcançou o mesmo sucesso no GEC ao abordar problemas que outros modelos não conseguiam resolver anteriormente. É importante notar que arquiteturas GEC avançadas utilizavam múltiplos modelos para resolver problemas, incluindo as abordagens baseadas emTransformers 26.

Diferentes estudos confirmaram a eficiência do AES em comparação com as avaliações humanas na avaliação de redações27,28. Um estudo29 demonstrou o efeito da avaliação automatizada na fluência em inglês dos aprendizes. Os resultados indicaram que a avaliação automática teve um efeito positivo na fluência na escrita em inglês. Em contraste, alguns outros estudosdesconsiderama alta taxa de detecção de erros pelo AES em comparação com as avaliações humanas. Estudos recentes destacam a crescente eficácia das ferramentas assistidas por IA para avaliação de escrita na educação linguística. Um dessesestudos, o 31, fez uma comparação entre a correção automatizada e o feedback do instrutor no contexto de aprendizagem dos estudantes universitários chineses.

O papel revolucionário das ferramentas baseadas em IA na escrita acadêmica tem sido ativamente relatado na literatura recente. Pesquisas sobre a aplicação de ferramentas de escrita baseadas em IA como complementos à educação tradicional em inglês inglês destacam a importância fundamental da igualdade de oportunidades e do apoio proativo dos professores na implementação bem-sucedida datecnologia 32. Os estudos que investigaram a AWE, como o Pigai, indicaram a forte correlação entre o feedback com o suporte de computadores e o aprimoramento da escrita, revisão e novas peças deESL 33. Outro estudo destacou os benefícios dos autoencoders variacionais (VAEs) que influenciam positivamente o aspecto do treinamento da escrita em inglês nos aprendizes e obtêm feedback sobre níveis mais altos de deep learning, especializando-se nas diversas característicaslinguísticas 34. Outra pesquisa sugeriu que sistemas neurais AWE seriam eficazes para uso com GEC baseados em PLN, que utiliza aprendizado profundo para oferecer uma avaliaçãoimediata 35.

A melhoria dos sistemas multiagente é um passo importante no desenvolvimento de tecnologias que auxiliam na escrita. Um exemplo de ser um multiagente, assistente de refinamento acadêmico da escrita, o AcademyCraft, baseado em deep learning, demonstrou habilidades para escrever e fornecer feedback detalhado, facilitando assim o suporte de escrita EFL/ESL baseado em IA, com base em esquemas analíticoscomplexos 36. De fato, estudos de aprendizagem de idiomas baseados em tecnologia também identificaram padrões emergentes diversos como deep learning, avaliação automática e feedback semântico, com análise de desempenho que mostrou um aumento gradual e consistente na precisão da escrita, bem como no engajamento doaprendiz 37.

Modelos Transformer-LSTM demonstraram certa propensão para avaliação automática e feedback feito na escrita em inglês. Tais arquiteturas híbridas tomaram mutuamente o entendimento contextual dos transformers junto com o processamento sequencial dos sistemas LSTM, concluindo mostrar uma maior precisão em gramatical e graduação de coerência e fornecer uma geração de feedback mais sutil38. A percepção dos professores de EFL sobre ferramentas de escrita com IA relata consistentemente melhorias mensuráveis na organização do conteúdo e na qualidade da escrita, focando no papel crucial da ajuda pedagógica em estimular a utilidade da integração tecnológica39. Há menos estudos que comparam o feedback dos instrutores e o feedback assistido por computador, sugerindo modelos de aprendizado profundo para explorar o efeito na escrita em inglês dos alunos de ESL em termos de fluência e gramática.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os softwares e ferramentas usados no estudo estão listados na Tabela de Materiais.

Critérios de avaliação

A classificação de avaliação adotada no presente estudo abrange dois domínios principais, a saber, fluência e correção, que incorporam todos os requisitos para uma avaliação abrangente da escrita em inglês como língua estrangeira (EFL). Essas dimensões têm como objetivo medir os pontos-chave da qualidade da escrita que auxiliam na comunicação eficaz e na demonstração de habilidades em proficiência linguística. O módulo de fluência mede naturalidade, expressividade e coerência na escrita, medindo a suavidade das ideias, bem como o quão bem as palavras e a estrutura das frases são usadas. O módulo de Correção tem como alvo precisão gramatical precisa, perfeição mecânica e conformidade com as convenções do inglês padrão e, hipoteticamente, mede e conta a equivocridade da língua em vários níveis. ( veja a Tabela 1)

Definição da tarefa

Seguindo as condições da avaliação automatizada da escrita dos alunos que aprendem a língua inglesa, o presente estudo sugere um novo modelo de sistema de avaliação de escrita em inglês assistido por computador EG. Comparado aos estudos anteriores, que foram limitados pelo escopo dos sistemas automatizados de avaliação de escrita, o sistema proposto ajudará a resolver essas limitações por meio da introdução de técnicas inovadoras de aprendizado profundo para permitir aos usuários um nível de análise linguística, escopo de modificação e análise de feedback em todo o sistema baseado no extenso processamento de dados. Operando com dois dos indicadores mais significativos de uma composição, a saber, fluência (quão natural, coerente e expressiva é a peça), ou correção (quão corretamente escrito o texto, repleto de erros gramaticais, mecânicos e linguísticos), com os componentes separados das redes neurais, o sistema de modelos duplos precisa realizar uma série de avaliações. Além disso, identifica erros em vários níveis linguísticos, recomenda medidas corretivas e fornece feedback em forma de lista para permitir que os usuários melhorem o aprendizado de idiomas dos alunos de forma metódica. Para descrever o processo de cálculo do sistema automático de avaliação assistida por computador, sugerimos o seguinte modelo matemático nas fórmulas (1)–(4) (ver Tabela 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

onde: Nota Final = a nota composta da avaliação de escrita; w1 = peso atribuído à pontuação de fluência; w2 = peso atribuído à pontuação de correção; Sf = pontuação de fluência baseada em BERT (normalizada para [0, 1]); Sc = pontuação de correção exponencial de decaindo; λ = constante de decaimento que controla a penalidade de erro; σ(x) = função logística de ativação sigmoide; ErroRazão = razão de erros para o total de tokens no texto. As pontuações de fluência são normalizadas para [0, 1] pela função sigmoide logística σ(x), enquanto a função de decaimento exponencial é usada para pontuar a correção e impor uma penalidade apropriada na frequência de erro.

Arquitetura e design do sistema

Sua arquitetura de sistema utiliza um sistema de dois modelos com uma arquitetura de processamento paralelo, no qual a análise dos ensaios de entrada é realizada em paralelo por meio de caminhos de avaliação paralelos. Os módulos de Fluência e Correção, por sua vez, fornecem as respectivas pontuações, e a pontuação composta final é a média ponderada das duas subpontuações. O módulo de correção também oferece uma sugestão sobre detecção e correção de erros, além da pontuação (veja a Figura 1).

O módulo de fluência

Fluência na escrita pode ser definida como a natureza ou o padrão de uso de uma língua no que diz respeito à escolha correta do vocabulário, variedade de estrutura da frase, complexidade sintática, coerência, etc.4. Modelos de avaliação de fluência capturam ideias transmitidas sem hesitar ou serem desajeitados, soando aproximados do tipo nativista de tendências de comunicação. A medição tradicional de fluência é baseada em escalas, destacando preocupações de confiabilidade entre avaliadores. O sistema proposto supera essa desvantagem ao incluir uma rede neural baseada em BERT para induzir coerência semântica e naturalidade linguística automaticamente por meio de compreensão situacional profunda. Essa decisão arquitetônica foi tomada considerando as forças do BERT, que se mostrou eficaz na identificação de relações contextuais e padrões semânticos necessários na medição de fluência. As sequências de entrada são alimentadas no sistema e passadas por 12 camadas de transformadores com autoatenção multi-cabeça para identificar dependências de longo alcance e relações contextuais (ver Figura 2).

O mecanismo de atenção seria o seguinte:

figure-protocol-5(5)

Sejam Q, K e V as matrizes que representam consulta, chave e valor, respectivamente, e d e k as dimensões dos vetores chave. A incorporação de token CLS é a de resumo, que registra a coerência semântica geral de toda a sequência de entrada.

O cálculo da pontuação de fluência é o seguinte:

figure-protocol-6(6)

Em que h, CLS é a embeção do token BERT [CLS], e Wreg, são breg os parâmetros da cabeça de regressão, e σ é a função de ativação sigmoide que normaliza a saída para [0, 1].

O módulo de correção

A avaliação de correção foca na precisão gramatical, exatidão mecânica e adesão às convenções padrão do inglês. Essa dimensão aborda os aspectos técnicos da escrita, incluindo sintaxe, morfologia, pontuação e precisão ortográfica. O componente de correção não apenas avalia o número de erros linguísticos, mas também examina o impacto na qualidade geral do texto. Ao contrário da avaliação de fluência, que enfatiza a coerência semântica e o fluxo natural, o módulo de avaliação de correção exige identificação precisa de erros e correção sistemática. O módulo distingue entre diferentes tipos de erro, avalia a gravidade e fornece correções direcionadas para apoiar a melhoria do aprendizado. A perda de correção utiliza o modelo FLAN-T5, que foi ajustado para detectar e corrigir erros gramaticais. Essa escolha é informada pela transformabilidade texto para texto do T5, que permite ao sistema não apenas encontrar falhas, mas também executar correções relevantes dentro de um único sistema. O sistema é uma forma codificador-decodificador, e o texto é alimentado na forma dessa transformação: (veja a Figura 3)

figure-protocol-7(7)

O elemento codificador gera representações sensíveis ao contexto que não apenas capturam as tendências gramaticais, mas também possíveis áreas de falha:

figure-protocol-8(8)

Com a ajuda de gerar variações gramaticais apropriadas para erros falsamente identificados, o decodificador gera sequências corrigidas:

figure-protocol-9(9)

Esse tipo de processamento bidirecional permite que o sistema tenha consciência dos contextos dos erros e de como esses contextos devem ser corrigidos, de modo que as dicas sejam semanticamente coerentes, mas que focem em qualquer correção gramatical.

Quantificação do erro e algoritmo de pontuação

A pontuação de precisão comparou a escrita original com a versão correta da escrita, considerando os erros linguísticos e a gravidade com base na posição dentro do texto e na interferência com o significado. Este método captura a distinção entre tipos de erros em comparação com o impacto na compreensão textual do texto. A relação entre frequência de erros e má qualidade do texto foi enfatizada de forma logarítmica no sistema de avaliação. Um passo fundamental na comparação token do texto original com o texto corrigido são dois graus de comparação baseados na técnica bit a bit do alinhamento de strings. A segunda etapa envolve a identificação e classificação de tipos de erros com base em algumas taxonomias linguísticas conhecidas que diferenciam erros gramaticais (concordância sujeito-verbo, consistência de tempo e confiabilidade da estrutura sintática), erros mecânicos (capitalização, pontuação e ortografia) e erros de uso (escolha de palavras, expressão idiomática e adequação de registro). A terceira etapa é o cálculo da razão de erro com base no comprimento total do texto. A quarta etapa explora o algoritmo de pontuação exponencial de decay, que transforma as razões de erros em pontuações de correção diretamente interpretáveis para aproximar a dependência não aditiva e não linear entre a frequência dos erros e a qualidade do texto.

O tratamento matemático do processo de quantificação de erros começa com o cálculo da razão de erros instalados, que fornece uma taxa normalizada de instalação de erros, o que permite fazer uma comparação justa de textos de diferentes comprimentos:

figure-protocol-10(10)

figure-protocol-11(11)

Foi estabelecido um parâmetro de calibração de 2,5 com base empírica, validando totalmente isso com julgamentos de especialistas humanos, para que a função de pontuação possa oferecer resultados alinhados à compreensão humana em relação à diminuição da qualidade do texto à medida que a frequência de erros aumenta. Definir esse valor do parâmetro dessa forma garante que qualquer texto com baixa taxa de erro (Error_Ratio < 0,1) tenha uma pontuação alta de correção, pois segue de perto as regras do inglês padrão; qualquer texto com taxa de erro moderada (0,1 < Error_Ratio ≤ 0,3) tem uma pontuação intermediária de correção, indicando que existem algumas preocupações linguísticas que, no entanto, não são totalmente desastrosas, e qualquer texto com alta taxa de erro (Error_Ratio > 0,3) obteve uma pontuação baixa de correção porque há preocupações linguísticas críticas que afetam significativamente a possibilidade de compreensão.

O algoritmo de pontuação de correção para a avaliação de correção leva em conta sistematicamente todos os erros localizados e corrigidos pelo sistema baseado em T5 como itens de penalidade no cálculo da razão final de erro. O mecanismo de crédito de penalidade usado para erros gramaticais é representado pela diminuição exponencial do crescimento da proporção de erro em relação a valores altos, o que significa que a qualidade do texto é muito ruim, e se torna 100 quando a razão de erro é igual a 0, o que significa que absolutamente nenhum erro é detectado. É um uso perfeito das convenções padrão do inglês. Tal relação matemática garante que o código de correção ofereça distinção significativa dentro de todo o espectro de níveis de proficiência linguística e seja responsivo a pequenos avanços sucessivos, que indicam aquisições reais.

Conjuntos de dados: corpus de treinamento e avaliação

Dados de treinamento de qualidade e escopo suficientes são fundamentais para o desempenho do sistema de modelo duplo. O estudo atual utilizou um conjunto de dados bem elaborado de textos escritos pelos alunos para desenvolver e avaliar o modelo, que foi produzido por meio do emprego de diferentes tarefas de escrita. A amostra era composta por 45 estudantes universitários paquistaneses do sexo masculino e 45 mulheres, com idade média de 19 anos, estudando 'Inglês Funcional' como disciplina obrigatória. Cada aluno escreveu oito redações durante oito semanas, incluindo pré-teste, redações de intervenção e ocasiões pós-prova. Os alunos podiam produzir de 400 a 450 palavras para cada tarefa de escrita. As estatísticas dos conjuntos de dados fornecem as seguintes características:

70.500 palavras

Comprimento médio da frase: 15,7 palavras (DS = 3,2)

O intervalo de vocabulário (Razão Tipo-Token): 0,64 (SD 0,08) Densidade de erro gramatical: 2,3 em 100 palavras (SD = 1,1)

A justificativa e garantia de qualidade dos dados selecionados

O conjunto de dados escolhido foi motivado por algumas considerações importantes que permitiram a riqueza e relevância para o trabalho de pesquisa sobre avaliação automatizada de escrita. Para começar, a população estudantil de Economia foi selecionada devido à sua natureza, semelhante à dos alunos de EFL no ensino superior paquistanês, permitindo assim a apresentação de amostras de escrita mais autênticas que refletem situações do mundo real. Segundo, o estabelecimento do intervalo máximo e mínimo potencial de palavras, 400–450 palavras, foi informado por dados de estudos piloto de que esse intervalo é linguisticamente complexo o suficiente para ser analisado de forma confiável por uma máquina, e permaneceu ao mesmo tempo de tamanho gerenciável em termos de avaliações humanas consistentes. Cada uma das composições foi avaliada por três professores de inglês treinados (confiabilidade interavaliadora κ = 0,847, dimensão de fluência e 0,823, dimensão de correção) em escalas padronizadas de 10 pontos de fluência e correção. O treinamento dos avaliadores humanos foi rigoroso e dependeu de rubricas de avaliação desenvolvidas em relação às avaliações de redação do IELTS e do TOEFL. Os dados consistem em um conjunto de dados anotado por humanos, que pode ser usado no treinamento e validação de modelos para serem treinados com dados anotados por humanos.

Procedimentos de pré-processamento e validação de dados

O conjunto de dados era pré-processado sistematicamente e envolvia normalização de texto, tokenização do texto com o tokenizador BERT WordPiece e realização de verificações de validação de qualidade. Aqueles que enviaram trabalhos incompletos e produziram texto plágio não foram incluídos para determinar a integridade dos dados. Os últimos dados foram divididos aleatoriamente em treinamento (70%, n = 189), validação (15%, n = 41) e conjuntos de teste (15%, n = 40) por amostragem estratificada para equilibrar entre níveis de proficiência e tipos de tarefas. Análise linguística de um grande corpus de referência contendo textos acadêmicos profissionalmente editados, artigos de jornais e ensaios publicados, totalizando aproximadamente 50 milhões de palavras. Este corpus fornece os padrões de linguagem necessários para realizar os testes de fluência e auxilia nos procedimentos de detecção de erros, comparando-os com o uso padrão. No corpus de referência, os passos antes do pré-processamento e indexação são tokenização, marcação de partes gramaticais, análise sintática e rotulagem semântica para facilitar o acesso eficiente durante a avaliação em tempo real.

Estratégia de treinamento do modelo de fluência

Um sistema de otimização sequencial é proposto para treinar os dados e alcançar fluência. O treinamento utilizou recursos de última geração, incluindo escalonamento adaptativo da taxa de aprendizagem, tamanho progressivo do lote e métodos avançados de regularização que evitam o sobreajuste conforme o treinamento avança, mantendo assim a eficácia do modelo na identificação de padrões linguísticos indicativos de fluência linguística. A taxa de aprendizado é 5 × 10-4 com um cronograma linear de decaimento, configurado para garantir que a convergência permaneça estável e não oscile em torno dos valores ótimos dos parâmetros. Essa taxa de aprendizado é escolhida por meio de busca em grade em [1 x 10-6, 1 x 10-4], sendo 5 x 10-5 o equilíbrio mais apropriado entre a velocidade de convergência e a estabilidade. O treinamento real será restrito a apenas 3 épocas, uma configuração otimizada com base nos benefícios empíricos pelo rastreamento de perdas de validação para evitar o superajuste sem impedir atualizações suficientes de parâmetros para tornar o aprendizado eficaz. A parada precoce dos mecanismos com paciência de 2 épocas e um delta mínimo de 0,001 foi feita para evitar a degradação.

A otimização é realizada pelo otimizador AdamW, com escolhas simplificadas como β₁ = 0,9 (momento, que controla exponencialmente o decaimento das estimativas do primeiro momento), β₂ = 0,999 (estimativa do segundo momento, que controla exponencialmente o decaimento das estimativas do segundo momento) e ε = 1 × 10⁻8 (termo numérico de estabilidade). A regularização por decaimento de peso (λ = 0,01) impede que magnitudes de parâmetros cresçam excessivamente grandes, com esse valor selecionado por meio de análise de desempenho de validação em toda a faixa [0,001, 0,1]. O monitoramento complexo é capaz de monitorar várias métricas durante o treinamento para garantir o melhor desempenho de um modelo e evitar o superajuste. Incluídos no framework de monitoramento estão:

Rastreamento de perdas: A perda de treinamento e validação é registrada em todas as épocas, e a parada antecipada ocorre automaticamente quando a perda de validação não melhora mais durante 2 épocas consecutivas.

Métricas de desempenho: Os dados de validação são usados no cálculo dos coeficientes de correlação de Pearson entre as pontuações previstas e reais a cada 100 passos de treinamento.

Sensoria de gradiente: Normas de gradiente são monitoradas para detectar gradientes nulos e explosivos, e em uma norma de gradiente de 1,0, aplica-se clipping de gradiente.

Escalonamento da taxa de aprendizagem: A diminuição da taxa de aprendizagem baseada em validação (fator = 0,5) no caso de um platô de mais de uma época seja detectada.

Relacionado à regularização: Taxas de evasão (0,1 para BERT, 0,3 para cabeça de regressão) foram encontradas por ablação sistemática. Vários métodos de regularização baseados na prevenção do sobreajuste são usados durante o processo de treinamento: (1) regularização de abandono usando taxas otimizadas de desistência por tipo de camada na rede, (2) decaimento de peso conforme explicado acima, (3) parada precoce, determinada pelo desempenho de validação, e (4) aumento de dados baseado na parafraseação de 15% dos exemplos de treinamento usando métodos de retrotradução. Os checkpoints do modelo de melhor desempenho foram salvos após cada época, e os modelos de maior pontuação foram selecionados com base nas pontuações de correlação de validação. A função de perda usada na parte de avaliação da fluência é o Erro Quadrático Médio (MSE), que é a principal função objetivo da tarefa de regressão de prever as pontuações contínuas de fluência. A formulação da perda matematicamente é dada como:

figure-protocol-12(12)

N é o tamanho total da amostra de treinamento, y_pred, i sendo a pontuação de fluência prevista da i-ésima amostra, e y_true, i sendo a pontuação de verdade de fundamento correspondente, conforme dada por avaliadores especialistas humanos. Essa perda é muito útil para desencorajar o erro real de previsão quadráticamente, de modo que erros maiores atraiam uma penalidade maior, e também é diferenciável. O mecanismo de escalonamento da taxa de aprendizado é altamente avançado, com um processo em duas fases, e começa com uma etapa linear de aquecimento, seguida por um processo sistemático de decaimento para criar características de convergência ótimas. Isso é feito na etapa de aquecimento, na qual a taxa de aprendizado começa em zero e gradualmente muda até a taxa máxima, após a qual os parâmetros do modelo são otimizados em relação ao conjunto de dados de treinamento. A expressão matemática da fase de aquecimento é:

figure-protocol-13(13)

Após a fase de aquecimento, a taxa de aprendizado decai de forma linear sistemática para evitar ultrapassar os valores ótimos dos parâmetros e resulta em convergência constante. Matematicamente, a fase de decaimento é a seguinte:

figure-protocol-14(14)

Em que t é a etapa atual de treinamento, lr max é a taxa máxima de aprendizado alcançada durante o aquecimento, o aquecimento é o número de passos atribuídos à fase de aquecimento, e o total é o número total de passos de treinamento em todas as épocas. O procedimento de escalonamento mencionado garante um aprendizado agressivo do modelo nos níveis inferiores e estabilidade nos níveis de convergência.

Estratégia de treinamento do modelo de correção

O modelo de correção foi baseado na estratégia de aprendizado por transferência usando o modelo FLAN-T5 pré-treinado para aproveitar todo o conhecimento gramatical disponível conforme necessário. O objetivo era analisar o entendimento geral da língua, bem como as informações específicas sobre os erros cometidos pelos alunos de ESL. O método de aprendizado por transferência utilizava o checkpoint pszemraj/flan-t5-gramática-grande-síntese como modelo base, com várias vantagens notáveis em termos de correção. Como o modelo já é treinado e possui alta capacidade de compreensão de idiomas, treinada em várias áreas do texto, ele se adaptará a muitos estilos e tópicos de escrita. Particularmente, ajustes finos específicos para gramática foram realizados em grandes conjuntos de dados de correção abrangendo múltiplos tipos de erros gramaticais, como os encontrados na escrita em segunda língua. Além disso, o checkpoint compreende sistemas poderosos de detecção de erros que são testados contra diferentes tipos de erros (ou seja, erros morfológicos, sintáticos e semânticos), criando um padrão perfeito de comparação com os parâmetros inatos de teste de correção do estudo.

O processo de adaptação de domínio reflete as modificações sistemáticas dos parâmetros que não alteram as capacidades gerais de compreensão da linguagem do modelo pré-treinado, mas introduzem as características específicas da solução de tarefa de avaliação de escrita. Esse processo de adaptação tem a derivação matemática como:

figure-protocol-15(15)

Aqui, θpré-treinado representa os parâmetros do modelo pré-treinado que codifica o entendimento geral da linguagem e o conhecimento gramatical, eo domínio Δθ representa as atualizações específicas de parâmetros aprendidas na tarefa de avaliação de escrita alvo. As atualizações específicas de domínio são calculadas por otimização baseada em gradiente no conjunto de dados alvo, garantindo que o modelo desenvolva sensibilidade específica da tarefa aos tipos de erro comuns na escrita EFL, sem prejudicar suas capacidades linguísticas mais amplas.

Experimentos com comparações

Para provar a funcionalidade do EG, o coeficiente de correlação de Pearson é proposto como o valor-chave da medição, que determina a conexão linear entre escores automatizados e a expertise humana. O coeficiente de correlação é encontrado pela fórmula:

figure-protocol-16(16)

Onde xi representa as pontuações automáticas, representa as avaliações humanas, e figure-protocol-17 e figure-protocol-18 são as respectivas médias. O coeficiente de correlação varia de −1 a 1, com valores próximos de 1 indicando uma forte relação positiva entre avaliação automatizada e humana.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Comparações de modelos de referência

Para avaliar o desempenho do EG e demonstrar sua superioridade em relação aos métodos existentes, são feitas comparações aprofundadas com as abordagens estabelecidas do AWE e das tradicionais métricas únicas. Essas comparações de referência são essenciais para validar o valor agregado da arquitetura EG e demonstrar que a integração da avaliação de fluência e correção proporciona melhorias mensuráveis em relação a abordagens que focam isoladamente em dimensões individuais. A seleção dos modelos de referência abrange quatro categorias de AWE, cada uma refletindo uma orientação distinta sobre como a escrita deve ser avaliada. O primeiro possui um único modelo baseado em BERT para avaliar a fluência. Esses modelos utilizam arquiteturas de transformadores para avaliar os padrões textuais de suavidade e coerência. A segunda categoria, incorporada em metodologias linguísticas tradicionais, foca em sistemas baseados em regras para detecção de erros gramaticais. Assim, o foco permaneceu na correção, negligenciando outros aspectos relacionados à qualidade da escrita, como coesão e conteúdo. A terceira categoria são os sistemas AWE baseados em características, que incluem indicadores de complexidade linguística — como comprimento variacional das frases, diversificação do léxico e complexidade sintática para gerar pontuações gerais de qualidade. O quarto leva em conta sistemas híbridos combinando várias características linguísticas de nível superficial, frequentemente usando métodos de conjunto ou médias ponderadas. Esses modelos não atingem o nível de sofisticação integrada alcançado pelas arquiteturas neurais EG. O desempenho básico do modelo é avaliado com três dimensões principais. A primeira mede o alinhamento das notas geradas pelo sistema com as avaliações de especialistas humanos treinados (instrutores de inglês) usando rubricas padronizadas. A segunda determina a generalizabilidade, identificando se o desempenho permanece consistente em três ensaios com temas variados e complexidade. A terceira dimensão depende da confiabilidade preditiva, avaliando a precisão e estabilidade da pontuação por meio de ferramentas estatísticas como erro absoluto médio, erro quadrático médio e análise de intervalos de confiança. Coletivamente, essas dimensões estabelecem uma estrutura robusta para comparação e destacam a superioridade dos sistemas EG, especialmente na obtenção de maior precisão e estabilidade do que as abordagens tradicionais.

Grupos experimentais e controle

Este estudo contou com 90 estudantes de graduação em Economia que estavam cursando um curso funcional de inglês em duas turmas intactas. Os dados foram coletados em três ocasiões: pré-teste, intervenção e pós-teste para acompanhar o progresso na precisão e fluência da escrita ao longo do tempo. Este estudo com sujeito humano foi aprovado pelo Conselho Consultivo Departamental da COMSATS University Islamabad, Campus de Lahore, Paquistão. Os participantes foram expostos a duas condições: feedback humano tradicional e feedback assistido por computador. O grupo controle era composto por 45 alunos, que receberam o tradicional feedback escrito de um instrutor de inglês treinado. Os participantes receberam feedback escrito sobre as redações dos alunos na forma de notas holísticas, identificação de erros e recomendações na forma de comentários de um instrutor sobre como melhorar o trabalho. O grupo experimental, por sua vez, incluiu 45 alunos que receberam instrução da mesma forma em sala de aula, mas a escrita dos alunos foi complementada com a ajuda de feedback rápido e automatizado fornecido pelo EG, que forneceu informações diagnósticas, tanto em termos de fluência quanto de correção, em cerca de 30 segundos após a submissão.

Este estudo foi realizado ao longo de 8 semanas, nas quais foi realizado um pré-teste (Semana 1) para determinar o desempenho inicial na escrita dos sujeitos antes que os alunos recebessem uma intervenção. Feedback baseado em computador com marcadores semânticos de PNL no grupo experimental e avaliação dos professores no grupo controle foi dado aos participantes durante seis semanas. Por fim, o pós-teste (na Semana 8) foi realizado para entender a diferença entre as medidas pré e pós-teste de precisão e escores de fluência. Para obter resultados semelhantes em comparabilidade, os respondentes foram solicitados a realizar tarefas semelhantes por escrito em cada período de avaliação, minimizando assim as possíveis variáveis de confusão da dificuldade da tarefa e da familiaridade do conteúdo na escrita. Para garantir que os prompts de escrita sejam consistentes com o nível de dificuldade, além de estabelecer a validade do conteúdo, os prompts foram escolhidos de forma congruente. Os temas dos ensaios foram escolhidos com base no fato de que os alunos cobrem várias áreas de conteúdo para evitar o efeito prático e o tédio dos participantes, que precisam realizar tarefas semelhantes por um longo período.

Durante a fase pré-prova, os participantes foram solicitados a compor um ensaio de 400 a 450 palavras e escrever sobre os objetivos acadêmicos e profissionais. Esta tarefa descritiva foi baseada em experiências pessoais e projeções futuras, o que implica a necessidade de organizar a escrita, fornecer exemplos claros e fazer uma declaração lógica de objetivos pessoais e motivação. A tarefa de escrita de intervenção foi baseada em diferentes temas, como escrever sobre a rotina diária da vida, hobbies, viagens, o primeiro dia na universidade, dias memoráveis da vida e momentos de melhores amigos. O tema pós-teste estava relacionado ao tema 'Efeito da tecnologia na comunicação', e o tamanho exigido para o ensaio era de 400 a 450 palavras.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Validade e confiabilidade da abordagem estatística

O sistema foi testado em vários métodos estatísticos complementares que fornecem evidências abrangentes dos efeitos do EG no desenvolvimento da escrita. Este é um método analítico multifacetado que reconhece que intervenções educacionais estão sujeitas a análises estatísticas complexas que não podem ser reduzidas a meras comparações de grupos, mas sim à análise dos padrões de mudança, da magni...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os resultados experimentais demonstram várias conquistas significativas. Primeiro, o sistema de modelo duplo alcançou uma forte correlação com os julgamentos de especialistas humanos (r = 0,923), superando substancialmente as abordagens de modelo único e os sistemas contemporâneos de AWE. Segundo, o estudo de intervenção controlada revelou melhorias significativas no desempenho de escrita dos alunos de ESL, com grandes tamanhos de efeito (d = 1,28) superando os relatados na literatura re...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Não há conflitos de interesse entre todos os autores.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Reconhecemos o apoio da COMSATS University Islamabad, campus de Lahore, e da faculdade de inglês, na ajuda na coleta de dados dos estudantes.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
SOFTWARE/BIBLIOTECAS USADOS NO ESTUDO
Estrutura de Aprendizado ProfundoPyTorch1.13.1Framework de aprendizado profundo para implementação de redes neurais
Modelos pré-treinadosTransformers (Abraçando o Rosto)4.21.3Carregamento de modelos pré-treinados, implementações de modelos BERT e T5
Modelo de LinguagemBERT (Representações Bidirecionais de Codificadores de Transformadores)Base-Bert-sem CaixaAvaliação de fluência, avaliação de coerência semântica, compreensão contextual
Modelo de LinguagemFLAN-T5 (Rede de Linguagem Finamente Ajustada T5)pszemraj/flan-t5-gramática-sínteseCorreção de erros gramaticais, transformação de texto para texto, detecção de erros
Computação NuméricaNumPy1.23.5Cálculos numéricos, operações de matriz para funções matemáticas
Análise de DadosPandas1.5.2Manipulação de dados, análise estatística e pré-processamento
Aprendizado de MáquinaScikit-learn1.1.3Cálculo de métricas estatísticas, análise de correlação, métricas de avaliação
VisualizaçãoMatplotlib3.6.2Visualização de dados, gráficos de progresso do treinamento, gráficos de desempenho
VisualizaçãoSeaborn0.12.1Visualização estatística de dados, mapas de calor de correlação
Kit de Ferramentas de PLNNLTK (Kit de Ferramentas de Linguagem Natural)3.7Pré-processamento de texto, tokenização, análise linguística
Processamento de PLNSpaCy3.4.4Pré-processamento avançado de NLP, marcação de POS, análise sintática
TokenizaçãoTokenizadores0.13.2Tokenização rápida para tokenização BERT WordPiece e T5
SOFTWARE ESTATÍSTICO E DE ANÁLISE
Software EstatísticoSoftware Estatístico SPSSVersão 26.0Análise estatística, testes t por amostras independentes, ANOVA, análise de correlação
Conjunto de Dados de TreinamentoConjunto de Dados Kaggle ASAPVersão de 2012Referência de corpus de treinamento (90% dos modelos AWE utilizam esse conjunto de dados)
BIBLIOTECAS DE OTIMIZAÇÃO E TREINAMENTO EM PYTHON
Otimizadortorch.optim.AdamWPyTorch 1.13.1Otimização de modelos com regularização de decaimento de peso (λ=0,01), β 1=0,9, β 2=0,999, ε=1× 10-8
Perda / Ativaçãotorch.nn.functionalPyTorch 1.13.1Ativação sigmoide, funções de perda, regularização de dropout
Carregamento de Dadostorch.utils.data.DataLoaderPyTorch 1.13.1Dimensionamento progressivo em lote (4→ 16), carregamento e agrupamento de dados
Tokenizaçãotransformadores. AutoTokenizerTransformers 4.21.3Tokenização BERT WordPiece, pré-processamento de texto
Carregamento de Modelostransformadores. AutomodeloTransformers 4.21.3Carregamento pré-treinado de modelos para arquiteturas BERT e T5
Controle de Gradientetorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Clipping de gradiente (limiar: 1,0) para estabilidade no treinamento
Escalonamento LRtorch.optim.lr_schedulerPyTorch 1.13.1Escalonamento da taxa de aprendizagem com decaimento linear e aquecimento
Métricassklearn.metricsScikit-learn 1.1.3Correlação Pearson, MAE, cálculo RMSE para avaliação
IMPLEMENTAÇÃO DE REDE NEURAL PYTHON
Classe Basetorch.nn.MóduloPyTorch 1.13.1Classe base para arquiteturas personalizadas de redes neurais (Fluência & Fluência Módulos de correção)
Camadas linearesTorch.nn.LinearPyTorch 1.13.1Implementação da cabeça de regressão linear (768→ 512→ 256→ 128→ 1 neurônios)
RegularizaçãoTocha.nn.DesistênciaPyTorch 1.13.1Regularização do dropout (0,1 para BERT, 0,3 para cabeça de regressão)
Ativaçãotorch.nn.functional.sigmoidPyTorch 1.13.1Ativação sigmoide para normalização da pontuação de fluência [0,1]
Ativaçãotorch.nn.functional.reluPyTorch 1.13.1Ativação do ReLU em camadas de regressão para transformações não lineares
Transformadortransformadores. BertModelTransformers 4.21.312 camadas transformadoras com autoatenção multi-cabeça para avaliação de fluência
Seq2Seqtransformadores. T5Para
Geração Condicional
Transformers 4.21.3Arquitetura codificador-decodificador para correção de erros gramaticais
Função de Perdatorch.nn.MSELossPyTorch 1.13.1Função de perda do Erro Quadrático Médio para treinamento de regressão de fluência
BIBLIOTECAS DE AVALIAÇÃO E MÉTRICAS EM PYTHON
Correlaçãoscipy.stats.pearsonrSciPy 1.9.3Coeficiente de correlação de Pearson para concordância modelo-humano
Métrica de Errosklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Cálculo do Erro Absoluto Médio (MAE) para precisão da previsão
Métrica de Errosklearn.metrics.mean_squared_errorScikit-learn 1.1.3Erro Quadrático Médio Raiz (RMSE) para avaliação de magnitude de erro
Teste Estatísticoscipy.stats.ttest_indSciPy 1.9.3Teste t de amostras independentes para teste de significância estatística
Matriz de Correlaçãonumpy.corrcoefNumPy 1.23.5Cálculo de matriz de correlação para confiabilidade entre avaliadores
Correlação de DadosPandas. DataFrame.corrPandas 1.5.2Análise de correlação de dados e relatórios estatísticos
Visualizaçãomatplotlib.pyplotMatplotlib 3.6.2Visualização de desempenho, gráficos de correlação, gráficos de progresso de treinamento
Mapa de calorseaborn.heatmapSeaborn 0.12.1Visualização de matrizes de correlação e apresentação estatística dos dados
PYTHON PROCESSAMENTO DE TEXTO E BIBLIOTECAS NLP
Processamento de Textore (Expressões Regulares)Python 3.9+ embutidoCorrespondência de padrões de texto, limpeza de dados e pré-processamento
Tratamento de ConfiguraçãoJSONPython 3.9+ embutidoGerenciamento de arquivos de configuração, armazenamento de parâmetros de modelo
SerializaçãopiclesPython 3.9+ embutidoSerialização de modelos e salvamento/carregamento de checkpoints
Acompanhamento do ProgressoQDM4.64.1Barras de progresso para loops de treinamento e processamento de dados
RegistroRegistroPython 3.9+ embutidoRegistro de progresso do treinamento, rastreamento de erros e depuração
ReprodutibilidadealeatórioPython 3.9+ embutidoConfiguração aleatória de sementes para experimentos reprodutíveis
Sistema de ArquivosOSPython 3.9+ embutidoOperações do sistema de arquivos, gerenciamento de caminhos de modelos
Análise Sintáctica CLIargparsePython 3.9+ embutidoAnálise sintática de argumentos na linha de comando para configurações de treinamento
PLATAFORMAS COMERCIAIS AWE / AES (Referenciado)
Plataforma ComercialPigai.orgPlataforma comercial AWEAvaliação de redação de EFL em chinês, sistemas automatizados de feedback
Plataforma ComercialBingo InglêsSistema AWE comercialApoio ao aprendizado da língua inglesa, desenvolvimento de habilidades de escrita
Plataforma EducacionalMeu AcessoPlataforma de escrita educacionalAvaliação de escrita e entrega de feedback por parte dos alunos
Máquina de PontuaçãoE-raterMotor automatizado de pontuação ETSAvaliação de redação de teste padronizado, avaliação holística
Ferramenta de AvaliaçãoI-escrevoFerramenta de avaliação de escritaAvaliação de escrita acadêmica e feedback diagnóstico
Serviço de PráticaCriterionServiço de prática de escrita ETSDesenvolvimento de habilidades de escrita e feedback automatizado
Modelo de Linguagem de IAChatGPTModelo de linguagem OpenAIFeedback e avaliação de escrita assistida por IA (referenciado na literatura)
ARQUITETURAS DE APRENDIZADO PROFUNDO (referenciado na literatura)
ArquiteturaRedes Neurais Recorrentes (RNN)Cai, 2019Processamento sequencial de texto — Sistemas de feedback de escrita e avaliação automatizada
ArquiteturaMemória de Curto Prazo Longo (LSTM)Jin et al., 2018Modelagem de dependência de longo alcance — Pontuação automatizada de redações e análise de sequências
ArquiteturaRedes Neurais Convolucionais (CNN)Dong et al., 2017Reconhecimento local de padrões — Classificação de texto e extração de características para pontuação
ArquiteturaHíbrido Transformador-LSTMXuan, 2025Processamento contextual e sequencial combinado — Geração automática de pontuação e feedback
ArquiteturaAutocodificadores variacionais (VAEs)Kumar et al., 2024Modelagem generativa & mdash; Desenvolvimento aprimorado de habilidades de escrita e feedback personalizado
ArquiteturaSistemas MultiagenteThompson et al., 2024Processamento colaborativo de IA & mdash; assistência avançada de escrita (plataforma AcademiCraft)
MecanismoMecanismos de AtençãoDong et al., 2017Autoatenção e atenção multi-cabeça — melhoria do desempenho do AES e compreensão contextual
TÉCNICAS TRADICIONAIS DE APRENDIZADO DE MÁQUINA (Referenciado)
Método EstatísticoTeorema de BayesRudner & Liang, 2002Abordagem tradicional de ML & mdash; Desenvolvimento inicial de AES/AWE e pontuação probabilística
Método EstatísticoRegressão linearPhandi et al., 2015Modelagem estatística & mdash; Avaliação de redação baseada em recursos e previsão de pontuação
Método de AprendizagemAprendizado por Preferência de PatenteChen & Ele, 2013Metodologia baseada em rankings & mdash; Pontuação comparativa de redações e modelagem de preferências
Modelo de LinguagemModelos N-gramXie et al., 2015Modelagem estatística de linguagem & mdash; Correção de erros gramaticais e reconhecimento de padrões
ArquiteturaArquitetura codificador-decodificadorGe et al., 2018Modelagem sequência a sequência — correção de erros gramaticais e transformação de texto
NORMAS E ESTRUTURAS DE AVALIAÇÃO
Padrão de AvaliaçãoAvaliação de Redação IELTSAdaptação da rubrica de avaliaçãoCritérios padronizados de avaliação para fluência e correção
Padrão de AvaliaçãoAvaliação de Redação do TOEFLPadrões de escrita acadêmicaAvaliação de proficiência e pontuação padronizada
Medida estatísticaTamanho do Efeito D de Cohen0,2=pequeno, 0,5=médio, 0,8=grandeAvaliação prática de significância para a eficácia da intervenção
Medida de ConfiabilidadeConfiabilidade entre avaliadores (κ)Fluência: 0,847 / Correção: 0,823Coeficiente Kappa & mdash; Validação de consistência e concordância do avaliador humano

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Aprendizagem de L nguas Assistida por ComputadorModelos de Redes NeuraisProcessamento de Linguagem NaturalPontua o Automatizada de Reda esPedagogia da Escrita para ESLFeedback GramaticalFlu ncia na Escrita

Artigos relacionados