$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Todo el software y herramientas utilizados en el estudio están listados en la Tabla de Materiales.
Criterios de calificación
La clasificación de evaluación adoptada en el presente estudio aborda dos dominios principales, a saber, fluidez y corrección, que incorporan todos los requisitos para una evaluación integral de la escritura en inglés como lengua extranjera (EFL). Estas dimensiones están destinadas a medir los puntos clave de la calidad de la escritura que ayudan a una comunicación efectiva y a la demostración de habilidades en la competencia lingüística. El módulo de Fluidez mide la naturalidad, la expresividad y la coherencia en la escritura midiendo la suavidad de las ideas, así como la calidad del uso de las palabras y la estructura de las oraciones. El módulo de Corrección se centra en la precisión gramatical precisa, la impecable mecánica y el cumplimiento de las convenciones estándar del inglés y, hipotéticamente, mide y cuenta la erroquia del idioma en varios niveles. (véase la Tabla 1)
Definición de tarea
Siguiendo las condiciones de evaluación automática de la escritura de estudiantes que aprenden inglés, el presente estudio sugiere un nuevo modelo de sistema de evaluación asistida por ordenador de la escritura en inglés. En comparación con estudios anteriores, que han estado limitados por el alcance de los sistemas automatizados de evaluación de escritura, el sistema propuesto ayudará a resolver esas limitaciones mediante la introducción de técnicas innovadoras de aprendizaje profundo que permitan a los usuarios un nivel de análisis lingüístico, alcance de modificación y análisis de retroalimentación a nivel de sistema basado en el extenso procesamiento de datos. Operando sobre dos de los indicadores más significativos de una composición, a saber, la fluidez (cuán natural, coherente y expresiva es la pieza), o la corrección (cuán correctamente escrito está el texto, plagado de errores gramaticales, mecánicos y lingüísticos), con los componentes separados de las redes neuronales, el sistema de doble modelo debe realizar varias evaluaciones. Además, identifica errores en varios niveles lingüísticos, recomienda medidas correctivas y ofrece retroalimentación en forma de lista para permitir a los usuarios mejorar el aprendizaje de idiomas de los estudiantes de forma metódica. Para describir el proceso de cálculo del sistema de evaluación automática asistida por ordenador, sugerimos el siguiente modelo matemático en las fórmulas (1)–(4) (véase la Tabla 2).
(1)
(2)
(3)
(4)
donde: Puntuación final = la puntuación compuesta de la evaluación de escritura; w1 = peso asignado a la puntuación de fluidez; w2 = peso asignado a la puntuación de corrección; Sf = puntuación de fluidez basada en BERT (normalizada a [0, 1]); Sc = puntuación de corrección por decaimiento exponencial; λ = constante de decaimiento que controla la penalización de error; σ(x) = función de activación sigmoide logística; ErrorRatio = relación de errores respecto al total de tokens en el texto. Las puntuaciones de fluidez se normalizan a [0, 1] mediante la función sigmoide logística σ(x), mientras que la función de decaimiento exponencial se utiliza para puntuar la corrección e imponer una penalización adecuada a la frecuencia de error.
Arquitectura y diseño del sistema
Su arquitectura de sistema utiliza un sistema de dos modelos con una arquitectura de procesamiento paralelo, en la que el análisis de los ensayos de entrada se realiza en paralelo mediante vías de evaluación paralelas. Los módulos de Fluidez y Corrección, a su vez, otorgan las puntuaciones respectivas, y la puntuación compuesta final es la media ponderada de las dos subpuntuaciones. El módulo de corrección también ofrece una sugerencia sobre detección y corrección de errores, además de la puntuación (véase la Figura 1).
El módulo de fluidez
La fluidez en la escritura puede definirse como la naturaleza o el patrón de uso de un idioma en cuanto a la correcta elección del vocabulario, la variedad de la estructura de la oración, la complejidad sintáctica, la coherencia, etc.4. Los modelos de evaluación de fluidez capturan las ideas que se transmiten sin tartamudeos ni resultar torpes, sonando aproximados a las tendencias nativistas de comunicación. La medición tradicional de fluidez se basa en escalas, lo que pone de manifiesto las preocupaciones sobre la fiabilidad entre evaluadores. El sistema propuesto supera esta desventaja al incluir redes neuronales basadas en BERT para inducir automáticamente coherencia semántica y naturalidad lingüística mediante una comprensión situacional profunda. Esta decisión arquitectónica se tomó teniendo en cuenta las fortalezas de BERT, que se ha demostrado eficaz en la identificación de relaciones contextuales y patrones semánticos necesarios en la medición de fluidez. Las secuencias de entrada se introducen en el sistema y se pasan por 12 capas transformadoras con autoatención multicabeza para identificar dependencias a largo plazo y relaciones contextuales (véase Figura 2).
El mecanismo de atención sería el siguiente:
(5)
Sean Q, K y V las matrices que representan consulta, clave y valor, respectivamente, y d y k las dimensiones de los vectores clave. La incrustación de tokens CLS es la de resumen, que registra la coherencia semántica global de toda la secuencia de entrada.
El cálculo de la puntuación de fluidez es el siguiente:
(6)
En el que hCLS es la incrustación del token BERT [CLS], y Wreg, son breg los parámetros de la cabeza de regresión, y σ es la función de activación sigmoide que normaliza la salida a [0, 1].
El módulo de corrección
La evaluación de la corrección se centra en la precisión gramatical, la exactitud mecánica y la adhesión a las convenciones estándar del inglés. Esta dimensión aborda los aspectos técnicos de la escritura, incluyendo sintaxis, morfología, puntuación y precisión ortográfica. El componente de corrección no solo evalúa el número de errores lingüísticos, sino que también examina el impacto en la calidad global del texto. A diferencia de la evaluación de fluidez, que enfatiza la coherencia semántica y el flujo natural, el módulo de evaluación de corrección requiere una identificación precisa de errores y una corrección sistemática. El módulo distingue entre diferentes tipos de error, evalúa la gravedad y proporciona correcciones dirigidas para apoyar la mejora del aprendizaje. La pérdida de corrección utiliza el modelo FLAN-T5, que ha sido ajustado para detectar y corregir errores gramaticales. Esta elección se basa en la transformabilidad texto a texto de T5, que permite al sistema no solo encontrar fallos, sino también realizar correcciones relevantes dentro de un sistema. El sistema es una forma codificador-decodificador, y el texto se alimenta en forma de esta transformación: (véase la Figura 3)
(7)
El elemento codificador genera representaciones sensibles al contexto que no solo capturan las tendencias gramaticales, sino también posibles áreas de fallo:
(8)
Con la ayuda de generar variaciones gramaticales apropiadas para errores falsamente identificados, el decodificador genera secuencias corregidas:
(9)
Este tipo de procesamiento bidireccional permite al sistema tener conciencia de los contextos de errores y de cómo deben corregirse, de modo que las pistas sean semánticamente coherentes y se centren en cualquier corrección gramatical.
Cuantificación del error y algoritmo de puntuación
La puntuación de precisión comparó la escritura original con la versión correcta, considerando los errores lingüísticos y la gravedad basados en la posición dentro del texto y la interferencia con el significado. Este método captura la distinción entre tipos de errores en comparación con el impacto en la comprensión textual del texto. La relación entre la frecuencia de errores y la mala calidad del texto se enfatizaba de forma logarítmica en el sistema de calificación. Un paso fundamental en la comparación por token entre el texto original y el texto corregido son dos grados de comparación que se basan en la técnica bit a bit de alineación de cadenas. La segunda etapa implica la identificación y clasificación de tipos de errores basándose en algunas taxonomías lingüísticas conocidas que diferencian entre errores gramaticales (acuerdo sujeto-verbo, consistencia de tiempos y fiabilidad de la estructura sintáctica), errores mecánicos (mayúsculas, puntuación y ortografía) y de uso (elección de palabras, expresión idiomática y apropiación de registro). La tercera etapa es el cálculo de la razón de error basada en la longitud total del texto. El cuarto paso aprovecha el algoritmo de puntuación de decaimiento exponencial, que transforma las proporciones de errores en puntuaciones de corrección directamente interpretables para aproximar la dependencia no aditiva y no lineal entre la frecuencia de errores y la calidad del texto.
El tratamiento matemático del proceso de cuantificación de errores comienza con el cálculo de la proporción de errores instalados, lo que proporciona una tasa normalizada de instalación de errores, lo que a su vez permite hacer una comparación justa de textos de diferentes longitudes:
(10)
(11)
Se estableció un parámetro de calibración de 2,5 de forma empírica validándolo completamente con juicios expertos humanos, de modo que la función de puntuación pueda ofrecer resultados acordes con la comprensión humana en relación con la disminución de la calidad del texto a medida que aumenta la frecuencia de errores. Establecer este valor de parámetro de esta manera garantiza que cualquier texto con una baja tasa de error (Error_Ratio < 0,1) tenga una puntuación alta de corrección, ya que sigue de cerca las reglas del inglés estándar; cualquier texto con una tasa de error moderada (0,1 < Error_Ratio ≤ 0,3) tiene una puntuación intermedia de corrección, lo que indica que existen algunas preocupaciones lingüísticas que, sin embargo, no son directamente desastrosas, y cualquier texto con una alta tasa de error (Error_Ratio > 0,3) ha obtenido una puntuación baja de corrección porque existen preocupaciones lingüísticas críticas que afectan significativamente la posibilidad de comprensión.
El algoritmo de puntuación de corrección para la evaluación de corrección tiene en cuenta sistemáticamente todos los errores localizados y fijados por el sistema basado en T5 como elementos de penalización en el cálculo de la razón final de errores. El mecanismo de crédito de penalización utilizado para los errores gramaticales se representa por la disminución exponencial del crecimiento de la proporción de errores hacia valores altos, lo que significa que la calidad del texto es muy pobre y se convierte en 100 cuando la razón de error es igual a 0, lo que implica que no se detectan absolutamente ningún error. Es un uso perfecto de las convenciones estándar inglesas. Dicha relación matemática asegura que el código de corrección ofrezca una distinción significativa dentro de todo el espectro de niveles de competencia lingüística y responda a pequeños avances sucesivos, que indican adquisiciones reales.
Conjuntos de datos: corpus de formación y evaluación
Los datos de entrenamiento de calidad y alcance suficientes son fundamentales para el rendimiento del sistema de doble modelo. El estudio actual utilizó un conjunto de datos bien diseñado de textos escritos por estudiantes para desarrollar y evaluar el modelo, que se produjo empleando diferentes tareas de redacción. La muestra estaba compuesta por 45 estudiantes universitarios paquistaníes varones y 45 mujeres con una edad media de 19 años, estudiando 'Inglés Funcional' como curso obligatorio. Cada estudiante escribió ocho ensayos durante ocho semanas, incluyendo ensayos previos, ensayos de intervención y ocasiones posteriores al examen. Se permitía a los estudiantes redactar entre 400 y 450 palabras para cada tarea de escritura. Las estadísticas de los conjuntos de datos proporcionan las siguientes características:
70.500 palabras
Longitud media de una frase: 15,7 palabras (DE = 3,2)
Rango de vocabulario (Relación tipo-Token): 0,64 (SD 0,08) Densidad de errores gramaticales: 2,3 en 100 palabras (SD = 1,1)
La justificación y aseguramiento de la calidad de los datos seleccionados
El conjunto de datos elegido estuvo impulsado por algunas consideraciones importantes que permitieron la riqueza y relevancia para el trabajo de investigación sobre evaluación automatizada de escritura. Para empezar, la población estudiantil de Economía fue seleccionada por su naturaleza, similar a la de los estudiantes de EFL en la educación superior paquistaní, lo que permitió la presentación de muestras de escritura más auténticas que reflejan situaciones reales. En segundo lugar, el establecimiento del rango máximo y mínimo potencial de palabras, de 400 a 450 palabras, se informó mediante datos de estudios piloto de que este rango es lo suficientemente complejo lingüísticamente como para ser analizado de forma fiable por una máquina, y al mismo tiempo se mantuvo de un tamaño manejable en términos de evaluaciones humanas consistentes. Cada una de las composiciones fue evaluada por tres profesores de inglés formados (fiabilidad interevaluadora κ = 0,847, dimensión de fluidez y 0,823, dimensión de corrección) en escalas estandarizadas de 10 puntos de calificación de fluidez y corrección. La formación de los evaluadores humanos fue rigurosa y dependió de rúbricas de puntuación desarrolladas respecto a las evaluaciones de escritura IELTS y TOEFL. Los datos consisten en un conjunto de datos anotado por humanos, que puede utilizarse para entrenar y validar modelos para entrenarse con datos anotados por humanos.
Procedimientos de preprocesamiento y validación de datos
El conjunto de datos se preprocesó sistemáticamente e implicó la normalización del texto, la tokenización del texto con el tokenizador BERT WordPiece y la realización de comprobaciones de validación de calidad. No se incluyó a quienes presentaron trabajos incompletos y produjeron texto plagiado para determinar la integridad de los datos. Los últimos datos se dividieron aleatoriamente en entrenamiento (70%, n = 189), validación (15%, n = 41) y conjuntos de prueba (15%, n = 40) mediante muestreo estratificado para equilibrar los niveles de competencia y el tipo de tareas. Análisis lingüístico de un gran corpus de referencia que contiene textos académicos editados profesionalmente, artículos de periódicos y ensayos publicados, que suman aproximadamente 50 millones de palabras. Este corpus proporciona los patrones de lenguaje necesarios para realizar las pruebas de fluidez y ayuda en los procedimientos de detección de errores comparándolos con el uso estándar. En el corpus de referencia, los pasos previos al preprocesamiento e indexación son la tokenización, el etiquetado de partes gramaticales, el análisis sintáctico y el etiquetado semántico para facilitar un acceso eficiente durante la evaluación en tiempo real.
Estrategia de entrenamiento con modelos de fluidez
Se propone un sistema de optimización secuencial para entrenar los datos y lograr fluidez. La formación utilizó características de última generación, incluyendo la programación adaptativa de la tasa de aprendizaje, tamaño progresivo de los lotes y métodos avanzados de regularización que evitan el sobreajuste a medida que avanza el entrenamiento, manteniendo así la eficacia del modelo para identificar patrones lingüísticos indicativos de fluidez lingüística. La tasa de aprendizaje es 5 × 10-4 con un programa de decaimiento lineal, configurado para asegurar que la convergencia se mantenga estable y no oscile alrededor de los valores óptimos de los parámetros. Esta tasa de aprendizaje se elige mediante búsqueda en cuadrícula en [1 x 10-6, 1 x 10-4], siendo 5 x 10-5 el compromiso más adecuado entre la velocidad de convergencia y la estabilidad. El entrenamiento real estará restringido a solo 3 épocas, una configuración optimizada en base a beneficios empíricos mediante el seguimiento de pérdidas de validación para evitar el sobreajuste sin impedir actualizaciones suficientes de parámetros que permitan que el aprendizaje sea efectivo. Se ha realizado una parada temprana de mecanismos con una paciencia de 2 épocas y un delta mínimo de 0,001 para evitar la degradación.
La optimización la realiza el optimizador AdamW, con elecciones simplificadas como β₁ = 0,9 (momento, que controla exponencialmente la decaimiento de las estimaciones del primer momento), β₂ = 0,999 (estimación del segundo momento, que controla exponencialmente la decaiencia de las estimaciones del segundo momento), y ε = 1 × 10⁻8 (término numérico de estabilidad). La regularización por decaimiento de peso (λ = 0,01) evita que las magnitudes de los parámetros crezcan excesivamente grandes, siendo este valor seleccionado mediante análisis de validación del rendimiento a lo largo del rango [0,001, 0,1]. La monitorización compleja es capaz de monitorizar diversas métricas durante el entrenamiento para garantizar el mejor rendimiento de un modelo y evitar el sobreajuste. Incluido en el marco de monitorización están:
Seguimiento de pérdidas: La pérdida de entrenamiento y validación se registra dentro de cada época, y la parada temprana ocurre automáticamente cuando la pérdida de validación deja de mejorar durante dos épocas consecutivas.
Métricas de rendimiento: Los datos de validación se utilizan para calcular los coeficientes de correlación de Pearson entre las puntuaciones predichas y reales cada 100 pasos de entrenamiento.
Detección de gradientes: Se monitorizan normas de gradiente para detectar gradientes nulos y explosivos, y con una norma de gradiente de 1,0 se aplica el recorte de gradiente.
Programación de la tasa de aprendizaje: Se detecta una disminución de la tasa de aprendizaje basada en validación (factor = 0,5) en caso de que se produzca más de una meseta de época.
Relacionado con la regularización: Se encontraron tasas de abandono (0,1 para BERT, 0,3 para cabeza de regresión) mediante ablación sistemática. Durante el proceso de entrenamiento se utilizan varios métodos de regularización basados en prevenir el sobreajuste: (1) regularización de abandono utilizando tasas optimizadas de desconexión por tipo de capa en la red, (2) decaimiento de peso como se explicó anteriormente, (3) parada temprana, determinada por el rendimiento de validación, y (4) aumento de datos basado en la parafraseo del 15 por ciento de los ejemplos de entrenamiento mediante métodos de retrotraducción. Los puntos de control del modelo con mejor rendimiento se guardaron tras cada época, y los modelos con mayor puntuación se seleccionaron en función de las puntuaciones de correlación de validación. La función de pérdida utilizada en la parte de evaluación de fluidez es el Error Cuadrático Medio (MSE), que es la función objetivo principal de la tarea de regresión de predecir las puntuaciones de fluidez continua. La formulación de la pérdida matemáticamente se da como:
(12)
N es el tamaño total de la muestra de entrenamiento, y_pred, i siendo la puntuación de fluidez predicha de la i-ésima muestra, y y_true, i siendo la puntuación de verdad de base correspondiente, tal como la dieron los evaluadores expertos humanos. Esta pérdida es muy útil para desalentar el error real de predicción cuadráticamente, de modo que los errores mayores atraen una penalización mayor, y también es diferenciable. El mecanismo de planificación de la velocidad de aprendizaje es muy avanzado con un proceso bifásico, y comienza con una etapa de calentamiento lineal, seguida de un proceso sistemático de decaimiento para crear características óptimas de convergencia. Esto se hace en la fase de calentamiento, donde la tasa de aprendizaje comienza en cero y cambia gradualmente hasta la tasa máxima, tras lo cual los parámetros del modelo se optimizan en relación con el conjunto de datos de entrenamiento. La expresión matemática de la fase de calentamiento es:
(13)
Tras la fase de calentamiento, la tasa de aprendizaje se reduce de forma sistemáticamente lineal para evitar sobrepasar los valores óptimos de los parámetros y resulta en una convergencia constante. Matemáticamente, la fase de desintegración se lee como:
(14)
En el que t es el paso de entrenamiento actual, lr max es la tasa máxima de aprendizaje alcanzada durante el calentamiento, el calentamiento es el número de pasos asignados a la fase de calentamiento y el total es el número total de pasos de entrenamiento en todas las épocas. El procedimiento de planificación mencionado garantiza un aprendizaje agresivo del modelo en los niveles inferiores y estabilidad en los niveles de convergencia.
Estrategia de entrenamiento del modelo de corrección
El modelo de corrección se basaba en la estrategia de aprendizaje por transferencia utilizando el modelo FLAN-T5 preentrenado para aprovechar todo el conocimiento gramatical disponible según fuera necesario. Esto tenía como objetivo analizar la comprensión general del idioma así como la información específica sobre los errores cometidos por los estudiantes de ESL. El método de aprendizaje por transferencia utiliza el punto de control de síntesis pszemraj/flan-t5-gramática-grande como modelo base, con varias ventajas notables en cuanto a corrección. Como el modelo ya está entrenado y posee una alta capacidad de comprensión del idioma que ha sido entrenada en diversos campos del texto, se adaptará a muchos estilos y temas de escritura. En particular, se ha realizado un ajuste fino específico de gramática en grandes conjuntos de datos de corrección que abarcan múltiples tipos de errores gramaticales como los que se encuentran en la escritura en un segundo idioma. Además, el punto de control comprende potentes sistemas de detección de errores que se prueban frente a los diferentes tipos de errores (es decir, errores morfológicos, sintácticos y semánticos), creando un estándar perfecto de comparación con los parámetros innatos de prueba de corrección del estudio.
El proceso de adaptación de dominio refleja las modificaciones sistemáticas de parámetros que no alteran las capacidades generales de comprensión del lenguaje del modelo preentrenado, sino que introducen las características específicas de la solución de tareas de evaluación de escritura. Este proceso de adaptación tiene la derivación matemática como:
(15)
Aquí θpreentrenado representa los parámetros del modelo preentrenado que codifican la comprensión general del lenguaje y el conocimiento gramatical, y eldominio Δθ representa las actualizaciones específicas de parámetros aprendidas en la tarea de evaluación de escritura objetivo. Las actualizaciones específicas de dominio se calculan mediante optimización basada en gradientes en el conjunto de datos objetivo, asegurando que el modelo desarrolle sensibilidad específica a los tipos de error comunes en la escritura EFL sin interrumpir sus capacidades lingüísticas más amplias.
Experimentos con comparaciones
Para demostrar la funcionalidad de la EG, se propone el coeficiente de correlación de Pearson como el valor clave de la medición, que determina la conexión lineal entre las puntuaciones automatizadas y la experiencia humana. El coeficiente de correlación se encuentra mediante la fórmula:
(16)
Donde xi representa las puntuaciones automáticas, representa las calificaciones humanas y
y
son las medias respectivas. El coeficiente de correlación varía de −1 a 1, con valores cercanos a 1 que indican una fuerte relación positiva entre la evaluación automatizada y la humana.
(17)
(18)
(19)
Comparaciones de modelos de referencia
Para evaluar el rendimiento del EG y demostrar su superioridad frente a los métodos existentes, se realizan comparaciones en profundidad con enfoques establecidos de AWE y métodos tradicionales de métrica única. Estas comparaciones de referencia son esenciales para validar el valor añadido de la arquitectura EG y demostrar que la integración de la evaluación de fluidez y corrección proporciona mejoras medibles respecto a enfoques que se centran en dimensiones individuales de forma aislada. La selección de modelos de referencia abarca cuatro categorías de AWE, cada una reflejando una orientación distinta sobre cómo debe evaluarse la escritura. El primero tiene un único modelo basado en BERT para evaluar la fluidez. Estos modelos utilizan arquitecturas de transformadores para evaluar los patrones textuales de suavidad y coherencia. La segunda categoría, integrada en metodologías lingüísticas tradicionales, se centra en sistemas basados en reglas para la detección de errores gramaticales. Por tanto, el enfoque seguía siendo la corrección, pasando por alto otros aspectos relacionados con la calidad de la escritura, como la cohesión y el contenido. La tercera categoría son los sistemas AWE basados en características, que incluyen indicadores de complejidad lingüística —como la longitud variacional de las oraciones, la diversificación del léxico y la complejidad sintáctica para generar puntuaciones generales de calidad. El cuarto tiene en cuenta los sistemas híbridos combinando diversas características lingüísticas superficiales, a menudo utilizando métodos de conjunto o promedios ponderados. Estos modelos no alcanzan el nivel de sofisticación integrada alcanzado por las arquitecturas neuronales EG. El rendimiento de referencia del modelo se evalúa con tres dimensiones principales. La primera mide la alineación de las calificaciones generadas por el sistema con las valoraciones de expertos humanos formados (profesores de inglés) utilizando rúbricas estandarizadas. La segunda determina la generalizabilidad, identificando si el rendimiento se mantiene consistente en tres ensayos con temas y complejidad variables. La tercera dimensión se basa en la fiabilidad predictiva, evaluando la precisión y estabilidad de la puntuación mediante herramientas estadísticas como el error absoluto medio, el error cuadrático medio raíz y el análisis de intervalos de confianza. En conjunto, estas dimensiones establecen un marco sólido para la comparación y destacan la superioridad de los sistemas EG, especialmente en la obtención de mayor precisión y estabilidad que los enfoques tradicionales.
Grupos experimentales y de control
Este estudio contó con 90 estudiantes de grado en Economía que cursaban un curso funcional de inglés en dos clases intactas. Los datos se tomaron en tres ocasiones: pre-prueba, intervención y post-prueba para seguir el progreso en la precisión y fluidez de la escritura a lo largo del tiempo. Este estudio con sujeto humano fue aprobado por el Consejo Asesor Departamental de la Universidad COMSATS Islamabad, campus de Lahore, Pakistán. Los participantes estuvieron expuestos a dos condiciones: la retroalimentación humana tradicional y la retroalimentación asistida por ordenador. El grupo de control estaba formado por 45 estudiantes, que recibían la retroalimentación tradicional por escrito de un instructor de inglés formado. Los participantes recibieron comentarios escritos sobre los ensayos de los estudiantes en forma de calificaciones holísticas, identificación de errores y recomendaciones en forma de comentarios de un profesor sobre cómo mejorar el trabajo. El grupo experimental, a su vez, incluía a 45 estudiantes que recibieron instrucción de la misma manera en el aula, pero la escritura de los estudiantes se complementó con la ayuda de una rápida retroalimentación automatizada proporcionada por el EG, que les proporcionó la información diagnóstica, tanto en términos de fluidez como de corrección, en unos 30 segundos desde la entrega.
Este estudio se llevó a cabo durante 8 semanas, en las que se realizó una prueba previa (Semana 1) para determinar el rendimiento inicial en la escritura de los sujetos antes de que los estudiantes recibieran una intervención. Durante seis semanas se administró retroalimentación informática con marcadores semánticos de PLN en el grupo experimental y evaluación de los profesores en el grupo de control. Finalmente, la prueba posterior (en la semana 8) se realizó para entender la diferencia entre las medidas de precisión y las puntuaciones de fluidez antes y después del test. Para obtener resultados similares en comparabilidad, se solicitó a los encuestados que realizaran tareas similares por escrito en cada periodo de evaluación, minimizando así las posibles variables de confusión de la dificultad de la tarea y la familiaridad del contenido en la redacción. Para asegurar que los prompts de escritura sean coherentes con el nivel de dificultad, así como para establecer la validez del contenido, se eligieron de manera congruente. Los temas de ensayo se eligieron en función de que los estudiantes cubrieran diversas áreas de contenido para evitar que los participantes tuvieran que realizar una tarea similar durante mucho tiempo.
Durante la fase previa al examen, se pidió a los participantes que redactaran un ensayo de 400–450 palabras y escribieran sobre los objetivos académicos y profesionales. Esta tarea descriptiva se basó en la experiencia personal y las proyecciones futuras, lo que implica la necesidad de organizar la escritura, proporcionar ejemplos claros y hacer una declaración lógica de objetivos y motivación personales. La tarea de redacción de intervención se basaba en diferentes temas, como escribir sobre la rutina diaria de la vida, aficiones, viajar, el primer día en la universidad, días memorables de la vida y momentos de mejores amigos. El tema posterior al examen estaba relacionado con el tema 'Efecto de la tecnología en la comunicación', y la longitud requerida del ensayo era de 400–450 palabras.