$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Todos os softwares e ferramentas usados no estudo estão listados na Tabela de Materiais.
Critérios de avaliação
A classificação de avaliação adotada no presente estudo abrange dois domínios principais, a saber, fluência e correção, que incorporam todos os requisitos para uma avaliação abrangente da escrita em inglês como língua estrangeira (EFL). Essas dimensões têm como objetivo medir os pontos-chave da qualidade da escrita que auxiliam na comunicação eficaz e na demonstração de habilidades em proficiência linguística. O módulo de fluência mede naturalidade, expressividade e coerência na escrita, medindo a suavidade das ideias, bem como o quão bem as palavras e a estrutura das frases são usadas. O módulo de Correção tem como alvo precisão gramatical precisa, perfeição mecânica e conformidade com as convenções do inglês padrão e, hipoteticamente, mede e conta a equivocridade da língua em vários níveis. ( veja a Tabela 1)
Definição da tarefa
Seguindo as condições da avaliação automatizada da escrita dos alunos que aprendem a língua inglesa, o presente estudo sugere um novo modelo de sistema de avaliação de escrita em inglês assistido por computador EG. Comparado aos estudos anteriores, que foram limitados pelo escopo dos sistemas automatizados de avaliação de escrita, o sistema proposto ajudará a resolver essas limitações por meio da introdução de técnicas inovadoras de aprendizado profundo para permitir aos usuários um nível de análise linguística, escopo de modificação e análise de feedback em todo o sistema baseado no extenso processamento de dados. Operando com dois dos indicadores mais significativos de uma composição, a saber, fluência (quão natural, coerente e expressiva é a peça), ou correção (quão corretamente escrito o texto, repleto de erros gramaticais, mecânicos e linguísticos), com os componentes separados das redes neurais, o sistema de modelos duplos precisa realizar uma série de avaliações. Além disso, identifica erros em vários níveis linguísticos, recomenda medidas corretivas e fornece feedback em forma de lista para permitir que os usuários melhorem o aprendizado de idiomas dos alunos de forma metódica. Para descrever o processo de cálculo do sistema automático de avaliação assistida por computador, sugerimos o seguinte modelo matemático nas fórmulas (1)–(4) (ver Tabela 2).
(1)
(2)
(3)
(4)
onde: Nota Final = a nota composta da avaliação de escrita; w1 = peso atribuído à pontuação de fluência; w2 = peso atribuído à pontuação de correção; Sf = pontuação de fluência baseada em BERT (normalizada para [0, 1]); Sc = pontuação de correção exponencial de decaindo; λ = constante de decaimento que controla a penalidade de erro; σ(x) = função logística de ativação sigmoide; ErroRazão = razão de erros para o total de tokens no texto. As pontuações de fluência são normalizadas para [0, 1] pela função sigmoide logística σ(x), enquanto a função de decaimento exponencial é usada para pontuar a correção e impor uma penalidade apropriada na frequência de erro.
Arquitetura e design do sistema
Sua arquitetura de sistema utiliza um sistema de dois modelos com uma arquitetura de processamento paralelo, no qual a análise dos ensaios de entrada é realizada em paralelo por meio de caminhos de avaliação paralelos. Os módulos de Fluência e Correção, por sua vez, fornecem as respectivas pontuações, e a pontuação composta final é a média ponderada das duas subpontuações. O módulo de correção também oferece uma sugestão sobre detecção e correção de erros, além da pontuação (veja a Figura 1).
O módulo de fluência
Fluência na escrita pode ser definida como a natureza ou o padrão de uso de uma língua no que diz respeito à escolha correta do vocabulário, variedade de estrutura da frase, complexidade sintática, coerência, etc.4. Modelos de avaliação de fluência capturam ideias transmitidas sem hesitar ou serem desajeitados, soando aproximados do tipo nativista de tendências de comunicação. A medição tradicional de fluência é baseada em escalas, destacando preocupações de confiabilidade entre avaliadores. O sistema proposto supera essa desvantagem ao incluir uma rede neural baseada em BERT para induzir coerência semântica e naturalidade linguística automaticamente por meio de compreensão situacional profunda. Essa decisão arquitetônica foi tomada considerando as forças do BERT, que se mostrou eficaz na identificação de relações contextuais e padrões semânticos necessários na medição de fluência. As sequências de entrada são alimentadas no sistema e passadas por 12 camadas de transformadores com autoatenção multi-cabeça para identificar dependências de longo alcance e relações contextuais (ver Figura 2).
O mecanismo de atenção seria o seguinte:
(5)
Sejam Q, K e V as matrizes que representam consulta, chave e valor, respectivamente, e d e k as dimensões dos vetores chave. A incorporação de token CLS é a de resumo, que registra a coerência semântica geral de toda a sequência de entrada.
O cálculo da pontuação de fluência é o seguinte:
(6)
Em que h, CLS é a embeção do token BERT [CLS], e Wreg, são breg os parâmetros da cabeça de regressão, e σ é a função de ativação sigmoide que normaliza a saída para [0, 1].
O módulo de correção
A avaliação de correção foca na precisão gramatical, exatidão mecânica e adesão às convenções padrão do inglês. Essa dimensão aborda os aspectos técnicos da escrita, incluindo sintaxe, morfologia, pontuação e precisão ortográfica. O componente de correção não apenas avalia o número de erros linguísticos, mas também examina o impacto na qualidade geral do texto. Ao contrário da avaliação de fluência, que enfatiza a coerência semântica e o fluxo natural, o módulo de avaliação de correção exige identificação precisa de erros e correção sistemática. O módulo distingue entre diferentes tipos de erro, avalia a gravidade e fornece correções direcionadas para apoiar a melhoria do aprendizado. A perda de correção utiliza o modelo FLAN-T5, que foi ajustado para detectar e corrigir erros gramaticais. Essa escolha é informada pela transformabilidade texto para texto do T5, que permite ao sistema não apenas encontrar falhas, mas também executar correções relevantes dentro de um único sistema. O sistema é uma forma codificador-decodificador, e o texto é alimentado na forma dessa transformação: (veja a Figura 3)
(7)
O elemento codificador gera representações sensíveis ao contexto que não apenas capturam as tendências gramaticais, mas também possíveis áreas de falha:
(8)
Com a ajuda de gerar variações gramaticais apropriadas para erros falsamente identificados, o decodificador gera sequências corrigidas:
(9)
Esse tipo de processamento bidirecional permite que o sistema tenha consciência dos contextos dos erros e de como esses contextos devem ser corrigidos, de modo que as dicas sejam semanticamente coerentes, mas que focem em qualquer correção gramatical.
Quantificação do erro e algoritmo de pontuação
A pontuação de precisão comparou a escrita original com a versão correta da escrita, considerando os erros linguísticos e a gravidade com base na posição dentro do texto e na interferência com o significado. Este método captura a distinção entre tipos de erros em comparação com o impacto na compreensão textual do texto. A relação entre frequência de erros e má qualidade do texto foi enfatizada de forma logarítmica no sistema de avaliação. Um passo fundamental na comparação token do texto original com o texto corrigido são dois graus de comparação baseados na técnica bit a bit do alinhamento de strings. A segunda etapa envolve a identificação e classificação de tipos de erros com base em algumas taxonomias linguísticas conhecidas que diferenciam erros gramaticais (concordância sujeito-verbo, consistência de tempo e confiabilidade da estrutura sintática), erros mecânicos (capitalização, pontuação e ortografia) e erros de uso (escolha de palavras, expressão idiomática e adequação de registro). A terceira etapa é o cálculo da razão de erro com base no comprimento total do texto. A quarta etapa explora o algoritmo de pontuação exponencial de decay, que transforma as razões de erros em pontuações de correção diretamente interpretáveis para aproximar a dependência não aditiva e não linear entre a frequência dos erros e a qualidade do texto.
O tratamento matemático do processo de quantificação de erros começa com o cálculo da razão de erros instalados, que fornece uma taxa normalizada de instalação de erros, o que permite fazer uma comparação justa de textos de diferentes comprimentos:
(10)
(11)
Foi estabelecido um parâmetro de calibração de 2,5 com base empírica, validando totalmente isso com julgamentos de especialistas humanos, para que a função de pontuação possa oferecer resultados alinhados à compreensão humana em relação à diminuição da qualidade do texto à medida que a frequência de erros aumenta. Definir esse valor do parâmetro dessa forma garante que qualquer texto com baixa taxa de erro (Error_Ratio < 0,1) tenha uma pontuação alta de correção, pois segue de perto as regras do inglês padrão; qualquer texto com taxa de erro moderada (0,1 < Error_Ratio ≤ 0,3) tem uma pontuação intermediária de correção, indicando que existem algumas preocupações linguísticas que, no entanto, não são totalmente desastrosas, e qualquer texto com alta taxa de erro (Error_Ratio > 0,3) obteve uma pontuação baixa de correção porque há preocupações linguísticas críticas que afetam significativamente a possibilidade de compreensão.
O algoritmo de pontuação de correção para a avaliação de correção leva em conta sistematicamente todos os erros localizados e corrigidos pelo sistema baseado em T5 como itens de penalidade no cálculo da razão final de erro. O mecanismo de crédito de penalidade usado para erros gramaticais é representado pela diminuição exponencial do crescimento da proporção de erro em relação a valores altos, o que significa que a qualidade do texto é muito ruim, e se torna 100 quando a razão de erro é igual a 0, o que significa que absolutamente nenhum erro é detectado. É um uso perfeito das convenções padrão do inglês. Tal relação matemática garante que o código de correção ofereça distinção significativa dentro de todo o espectro de níveis de proficiência linguística e seja responsivo a pequenos avanços sucessivos, que indicam aquisições reais.
Conjuntos de dados: corpus de treinamento e avaliação
Dados de treinamento de qualidade e escopo suficientes são fundamentais para o desempenho do sistema de modelo duplo. O estudo atual utilizou um conjunto de dados bem elaborado de textos escritos pelos alunos para desenvolver e avaliar o modelo, que foi produzido por meio do emprego de diferentes tarefas de escrita. A amostra era composta por 45 estudantes universitários paquistaneses do sexo masculino e 45 mulheres, com idade média de 19 anos, estudando 'Inglês Funcional' como disciplina obrigatória. Cada aluno escreveu oito redações durante oito semanas, incluindo pré-teste, redações de intervenção e ocasiões pós-prova. Os alunos podiam produzir de 400 a 450 palavras para cada tarefa de escrita. As estatísticas dos conjuntos de dados fornecem as seguintes características:
70.500 palavras
Comprimento médio da frase: 15,7 palavras (DS = 3,2)
O intervalo de vocabulário (Razão Tipo-Token): 0,64 (SD 0,08) Densidade de erro gramatical: 2,3 em 100 palavras (SD = 1,1)
A justificativa e garantia de qualidade dos dados selecionados
O conjunto de dados escolhido foi motivado por algumas considerações importantes que permitiram a riqueza e relevância para o trabalho de pesquisa sobre avaliação automatizada de escrita. Para começar, a população estudantil de Economia foi selecionada devido à sua natureza, semelhante à dos alunos de EFL no ensino superior paquistanês, permitindo assim a apresentação de amostras de escrita mais autênticas que refletem situações do mundo real. Segundo, o estabelecimento do intervalo máximo e mínimo potencial de palavras, 400–450 palavras, foi informado por dados de estudos piloto de que esse intervalo é linguisticamente complexo o suficiente para ser analisado de forma confiável por uma máquina, e permaneceu ao mesmo tempo de tamanho gerenciável em termos de avaliações humanas consistentes. Cada uma das composições foi avaliada por três professores de inglês treinados (confiabilidade interavaliadora κ = 0,847, dimensão de fluência e 0,823, dimensão de correção) em escalas padronizadas de 10 pontos de fluência e correção. O treinamento dos avaliadores humanos foi rigoroso e dependeu de rubricas de avaliação desenvolvidas em relação às avaliações de redação do IELTS e do TOEFL. Os dados consistem em um conjunto de dados anotado por humanos, que pode ser usado no treinamento e validação de modelos para serem treinados com dados anotados por humanos.
Procedimentos de pré-processamento e validação de dados
O conjunto de dados era pré-processado sistematicamente e envolvia normalização de texto, tokenização do texto com o tokenizador BERT WordPiece e realização de verificações de validação de qualidade. Aqueles que enviaram trabalhos incompletos e produziram texto plágio não foram incluídos para determinar a integridade dos dados. Os últimos dados foram divididos aleatoriamente em treinamento (70%, n = 189), validação (15%, n = 41) e conjuntos de teste (15%, n = 40) por amostragem estratificada para equilibrar entre níveis de proficiência e tipos de tarefas. Análise linguística de um grande corpus de referência contendo textos acadêmicos profissionalmente editados, artigos de jornais e ensaios publicados, totalizando aproximadamente 50 milhões de palavras. Este corpus fornece os padrões de linguagem necessários para realizar os testes de fluência e auxilia nos procedimentos de detecção de erros, comparando-os com o uso padrão. No corpus de referência, os passos antes do pré-processamento e indexação são tokenização, marcação de partes gramaticais, análise sintática e rotulagem semântica para facilitar o acesso eficiente durante a avaliação em tempo real.
Estratégia de treinamento do modelo de fluência
Um sistema de otimização sequencial é proposto para treinar os dados e alcançar fluência. O treinamento utilizou recursos de última geração, incluindo escalonamento adaptativo da taxa de aprendizagem, tamanho progressivo do lote e métodos avançados de regularização que evitam o sobreajuste conforme o treinamento avança, mantendo assim a eficácia do modelo na identificação de padrões linguísticos indicativos de fluência linguística. A taxa de aprendizado é 5 × 10-4 com um cronograma linear de decaimento, configurado para garantir que a convergência permaneça estável e não oscile em torno dos valores ótimos dos parâmetros. Essa taxa de aprendizado é escolhida por meio de busca em grade em [1 x 10-6, 1 x 10-4], sendo 5 x 10-5 o equilíbrio mais apropriado entre a velocidade de convergência e a estabilidade. O treinamento real será restrito a apenas 3 épocas, uma configuração otimizada com base nos benefícios empíricos pelo rastreamento de perdas de validação para evitar o superajuste sem impedir atualizações suficientes de parâmetros para tornar o aprendizado eficaz. A parada precoce dos mecanismos com paciência de 2 épocas e um delta mínimo de 0,001 foi feita para evitar a degradação.
A otimização é realizada pelo otimizador AdamW, com escolhas simplificadas como β₁ = 0,9 (momento, que controla exponencialmente o decaimento das estimativas do primeiro momento), β₂ = 0,999 (estimativa do segundo momento, que controla exponencialmente o decaimento das estimativas do segundo momento) e ε = 1 × 10⁻8 (termo numérico de estabilidade). A regularização por decaimento de peso (λ = 0,01) impede que magnitudes de parâmetros cresçam excessivamente grandes, com esse valor selecionado por meio de análise de desempenho de validação em toda a faixa [0,001, 0,1]. O monitoramento complexo é capaz de monitorar várias métricas durante o treinamento para garantir o melhor desempenho de um modelo e evitar o superajuste. Incluídos no framework de monitoramento estão:
Rastreamento de perdas: A perda de treinamento e validação é registrada em todas as épocas, e a parada antecipada ocorre automaticamente quando a perda de validação não melhora mais durante 2 épocas consecutivas.
Métricas de desempenho: Os dados de validação são usados no cálculo dos coeficientes de correlação de Pearson entre as pontuações previstas e reais a cada 100 passos de treinamento.
Sensoria de gradiente: Normas de gradiente são monitoradas para detectar gradientes nulos e explosivos, e em uma norma de gradiente de 1,0, aplica-se clipping de gradiente.
Escalonamento da taxa de aprendizagem: A diminuição da taxa de aprendizagem baseada em validação (fator = 0,5) no caso de um platô de mais de uma época seja detectada.
Relacionado à regularização: Taxas de evasão (0,1 para BERT, 0,3 para cabeça de regressão) foram encontradas por ablação sistemática. Vários métodos de regularização baseados na prevenção do sobreajuste são usados durante o processo de treinamento: (1) regularização de abandono usando taxas otimizadas de desistência por tipo de camada na rede, (2) decaimento de peso conforme explicado acima, (3) parada precoce, determinada pelo desempenho de validação, e (4) aumento de dados baseado na parafraseação de 15% dos exemplos de treinamento usando métodos de retrotradução. Os checkpoints do modelo de melhor desempenho foram salvos após cada época, e os modelos de maior pontuação foram selecionados com base nas pontuações de correlação de validação. A função de perda usada na parte de avaliação da fluência é o Erro Quadrático Médio (MSE), que é a principal função objetivo da tarefa de regressão de prever as pontuações contínuas de fluência. A formulação da perda matematicamente é dada como:
(12)
N é o tamanho total da amostra de treinamento, y_pred, i sendo a pontuação de fluência prevista da i-ésima amostra, e y_true, i sendo a pontuação de verdade de fundamento correspondente, conforme dada por avaliadores especialistas humanos. Essa perda é muito útil para desencorajar o erro real de previsão quadráticamente, de modo que erros maiores atraiam uma penalidade maior, e também é diferenciável. O mecanismo de escalonamento da taxa de aprendizado é altamente avançado, com um processo em duas fases, e começa com uma etapa linear de aquecimento, seguida por um processo sistemático de decaimento para criar características de convergência ótimas. Isso é feito na etapa de aquecimento, na qual a taxa de aprendizado começa em zero e gradualmente muda até a taxa máxima, após a qual os parâmetros do modelo são otimizados em relação ao conjunto de dados de treinamento. A expressão matemática da fase de aquecimento é:
(13)
Após a fase de aquecimento, a taxa de aprendizado decai de forma linear sistemática para evitar ultrapassar os valores ótimos dos parâmetros e resulta em convergência constante. Matematicamente, a fase de decaimento é a seguinte:
(14)
Em que t é a etapa atual de treinamento, lr max é a taxa máxima de aprendizado alcançada durante o aquecimento, o aquecimento é o número de passos atribuídos à fase de aquecimento, e o total é o número total de passos de treinamento em todas as épocas. O procedimento de escalonamento mencionado garante um aprendizado agressivo do modelo nos níveis inferiores e estabilidade nos níveis de convergência.
Estratégia de treinamento do modelo de correção
O modelo de correção foi baseado na estratégia de aprendizado por transferência usando o modelo FLAN-T5 pré-treinado para aproveitar todo o conhecimento gramatical disponível conforme necessário. O objetivo era analisar o entendimento geral da língua, bem como as informações específicas sobre os erros cometidos pelos alunos de ESL. O método de aprendizado por transferência utilizava o checkpoint pszemraj/flan-t5-gramática-grande-síntese como modelo base, com várias vantagens notáveis em termos de correção. Como o modelo já é treinado e possui alta capacidade de compreensão de idiomas, treinada em várias áreas do texto, ele se adaptará a muitos estilos e tópicos de escrita. Particularmente, ajustes finos específicos para gramática foram realizados em grandes conjuntos de dados de correção abrangendo múltiplos tipos de erros gramaticais, como os encontrados na escrita em segunda língua. Além disso, o checkpoint compreende sistemas poderosos de detecção de erros que são testados contra diferentes tipos de erros (ou seja, erros morfológicos, sintáticos e semânticos), criando um padrão perfeito de comparação com os parâmetros inatos de teste de correção do estudo.
O processo de adaptação de domínio reflete as modificações sistemáticas dos parâmetros que não alteram as capacidades gerais de compreensão da linguagem do modelo pré-treinado, mas introduzem as características específicas da solução de tarefa de avaliação de escrita. Esse processo de adaptação tem a derivação matemática como:
(15)
Aqui, θpré-treinado representa os parâmetros do modelo pré-treinado que codifica o entendimento geral da linguagem e o conhecimento gramatical, eo domínio Δθ representa as atualizações específicas de parâmetros aprendidas na tarefa de avaliação de escrita alvo. As atualizações específicas de domínio são calculadas por otimização baseada em gradiente no conjunto de dados alvo, garantindo que o modelo desenvolva sensibilidade específica da tarefa aos tipos de erro comuns na escrita EFL, sem prejudicar suas capacidades linguísticas mais amplas.
Experimentos com comparações
Para provar a funcionalidade do EG, o coeficiente de correlação de Pearson é proposto como o valor-chave da medição, que determina a conexão linear entre escores automatizados e a expertise humana. O coeficiente de correlação é encontrado pela fórmula:
(16)
Onde xi representa as pontuações automáticas, representa as avaliações humanas, e
e
são as respectivas médias. O coeficiente de correlação varia de −1 a 1, com valores próximos de 1 indicando uma forte relação positiva entre avaliação automatizada e humana.
(17)
(18)
(19)
Comparações de modelos de referência
Para avaliar o desempenho do EG e demonstrar sua superioridade em relação aos métodos existentes, são feitas comparações aprofundadas com as abordagens estabelecidas do AWE e das tradicionais métricas únicas. Essas comparações de referência são essenciais para validar o valor agregado da arquitetura EG e demonstrar que a integração da avaliação de fluência e correção proporciona melhorias mensuráveis em relação a abordagens que focam isoladamente em dimensões individuais. A seleção dos modelos de referência abrange quatro categorias de AWE, cada uma refletindo uma orientação distinta sobre como a escrita deve ser avaliada. O primeiro possui um único modelo baseado em BERT para avaliar a fluência. Esses modelos utilizam arquiteturas de transformadores para avaliar os padrões textuais de suavidade e coerência. A segunda categoria, incorporada em metodologias linguísticas tradicionais, foca em sistemas baseados em regras para detecção de erros gramaticais. Assim, o foco permaneceu na correção, negligenciando outros aspectos relacionados à qualidade da escrita, como coesão e conteúdo. A terceira categoria são os sistemas AWE baseados em características, que incluem indicadores de complexidade linguística — como comprimento variacional das frases, diversificação do léxico e complexidade sintática para gerar pontuações gerais de qualidade. O quarto leva em conta sistemas híbridos combinando várias características linguísticas de nível superficial, frequentemente usando métodos de conjunto ou médias ponderadas. Esses modelos não atingem o nível de sofisticação integrada alcançado pelas arquiteturas neurais EG. O desempenho básico do modelo é avaliado com três dimensões principais. A primeira mede o alinhamento das notas geradas pelo sistema com as avaliações de especialistas humanos treinados (instrutores de inglês) usando rubricas padronizadas. A segunda determina a generalizabilidade, identificando se o desempenho permanece consistente em três ensaios com temas variados e complexidade. A terceira dimensão depende da confiabilidade preditiva, avaliando a precisão e estabilidade da pontuação por meio de ferramentas estatísticas como erro absoluto médio, erro quadrático médio e análise de intervalos de confiança. Coletivamente, essas dimensões estabelecem uma estrutura robusta para comparação e destacam a superioridade dos sistemas EG, especialmente na obtenção de maior precisão e estabilidade do que as abordagens tradicionais.
Grupos experimentais e controle
Este estudo contou com 90 estudantes de graduação em Economia que estavam cursando um curso funcional de inglês em duas turmas intactas. Os dados foram coletados em três ocasiões: pré-teste, intervenção e pós-teste para acompanhar o progresso na precisão e fluência da escrita ao longo do tempo. Este estudo com sujeito humano foi aprovado pelo Conselho Consultivo Departamental da COMSATS University Islamabad, Campus de Lahore, Paquistão. Os participantes foram expostos a duas condições: feedback humano tradicional e feedback assistido por computador. O grupo controle era composto por 45 alunos, que receberam o tradicional feedback escrito de um instrutor de inglês treinado. Os participantes receberam feedback escrito sobre as redações dos alunos na forma de notas holísticas, identificação de erros e recomendações na forma de comentários de um instrutor sobre como melhorar o trabalho. O grupo experimental, por sua vez, incluiu 45 alunos que receberam instrução da mesma forma em sala de aula, mas a escrita dos alunos foi complementada com a ajuda de feedback rápido e automatizado fornecido pelo EG, que forneceu informações diagnósticas, tanto em termos de fluência quanto de correção, em cerca de 30 segundos após a submissão.
Este estudo foi realizado ao longo de 8 semanas, nas quais foi realizado um pré-teste (Semana 1) para determinar o desempenho inicial na escrita dos sujeitos antes que os alunos recebessem uma intervenção. Feedback baseado em computador com marcadores semânticos de PNL no grupo experimental e avaliação dos professores no grupo controle foi dado aos participantes durante seis semanas. Por fim, o pós-teste (na Semana 8) foi realizado para entender a diferença entre as medidas pré e pós-teste de precisão e escores de fluência. Para obter resultados semelhantes em comparabilidade, os respondentes foram solicitados a realizar tarefas semelhantes por escrito em cada período de avaliação, minimizando assim as possíveis variáveis de confusão da dificuldade da tarefa e da familiaridade do conteúdo na escrita. Para garantir que os prompts de escrita sejam consistentes com o nível de dificuldade, além de estabelecer a validade do conteúdo, os prompts foram escolhidos de forma congruente. Os temas dos ensaios foram escolhidos com base no fato de que os alunos cobrem várias áreas de conteúdo para evitar o efeito prático e o tédio dos participantes, que precisam realizar tarefas semelhantes por um longo período.
Durante a fase pré-prova, os participantes foram solicitados a compor um ensaio de 400 a 450 palavras e escrever sobre os objetivos acadêmicos e profissionais. Esta tarefa descritiva foi baseada em experiências pessoais e projeções futuras, o que implica a necessidade de organizar a escrita, fornecer exemplos claros e fazer uma declaração lógica de objetivos pessoais e motivação. A tarefa de escrita de intervenção foi baseada em diferentes temas, como escrever sobre a rotina diária da vida, hobbies, viagens, o primeiro dia na universidade, dias memoráveis da vida e momentos de melhores amigos. O tema pós-teste estava relacionado ao tema 'Efeito da tecnologia na comunicação', e o tamanho exigido para o ensaio era de 400 a 450 palavras.