Artículo de investigación

Investigando el efecto de la evaluación automatizada de escritura a través de redes neuronales profundas y la evaluación escrita de profesores en el rendimiento de la escritura en inglés

DOI:

10.3791/69995

8 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se empleó la provisión de retroalimentación en forma de dos funciones basadas en la semántica de PLN a través del sistema informático y la retroalimentación escrita del profesor para mejorar la fluidez y corrección de la escritura en inglés de los estudiantes. Los resultados mostraron resultados positivos respecto a la primera.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las tecnologías de aprendizaje de idiomas asistidas por ordenador han logrado los mayores avances en el aprendizaje de idiomas, especialmente en el contexto de la inteligencia artificial (IA), en los últimos años. Existen diversas tecnologías, como la evaluación automatizada de escritura (AWE en adelante) y la puntuación automática de ensayos (AES), que se consideran pilares del aprendizaje de idiomas, no solo en las disciplinas informáticas sino también en la educación. La evaluación solo puede realizarse en forma de puntuaciones holísticas utilizando la tecnología AWE, que ha sido bastante eficaz para mejorar el aprendizaje de idiomas y, por tanto, no puede proporcionar retroalimentación detallada o profunda. Para proporcionar retroalimentación detallada sobre dos elementos principales de un lenguaje (es decir, gramática y fluidez), se ha considerado un sistema de implementación asistido por ordenador que implique modelos de redes neuronales y dos métodos de procesamiento de lenguaje natural basado en semántica (PLN en adelante). Con ese fin, 90 estudiantes universitarios paquistaníes que aprendían inglés como segunda lengua (ESL) fueron asignados aleatoriamente a los grupos de control, retroalimentación del instructor y experimentales. La evaluación asistida por ordenador abarcó una red neuronal. Los resultados de la prueba de comparación entre el modelo base de la AWE y los instructores que calificaron mostraron una correlación entre la retroalimentación asistida por ordenador que utilizó estas redes neuronales. Las implicaciones de tales resultados residen en la pedagogía de la escritura ESL, especialmente en situaciones donde la precisión y fluidez lingüísticas suponen un desafío.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La retroalimentación en la escritura aborda diversos atributos del lenguaje, como la organización, la gramática, la fluidez, el contenido y la mecánica, permitiendo a los estudiantes reescribir o crear un nuevo textoescrito 1,2,3. Actualmente, los profesores de escritura en inglés han sido un gran beneficiario debido a los rápidos cambios y avances del aprendizaje asistido por ordenador de idiomas (CALL en adelante) y la evaluación asistida de escritura por ordenador en forma de AWE o AES, así como la calificación de ensayosescritos 4. Además, la evaluación asistida por ordenador de la escritura en inglés proporciona retroalimentación diagnóstica sobre elementos lingüísticos como el contenido, la gramática, el vocabulario, etc., proporcionando respuestas oportunas, individuales y objetivas al texto escrito de los estudiantes. El sistema AWE también está en posición de dar respuestas claras por escrito a los estudiantes para que interioricen el conocimiento adquirido a través de estas respuestas escritas y aumenten la capacidad cognitiva6de los estudiantes.

El presente estudio se basó en una investigación4, que ofreció el concepto de un aprendizaje de escritura en inglés basado en múltiples estrategias y por ordenador, con la teoría de la retroalimentación en inglés en perspectiva y el proceso de puntuación analítica en mente. Esto incluía otros modelos basados en la semántica de PLN que incorporaban el aprendizaje profundo en la retroalimentación escrita para ofrecer una puntuación elaborada de la retroalimentación escrita. Aborda la limitación de la tecnología previa AWE, que solo enfatiza lo holístico pero no la puntuación analítica y específica. En consecuencia, tiene más que ver con una evaluación precisa e inmediata con calificaciones subcalificadas y totales respecto a una serie de elementos de indicadores lingüísticos para mejorar el aprendizaje de la escritura en inglés entre los estudiantes. Entre las diversas características de la lingüística (es decir, contenidos, complejidades, corrección, fluidez), el presente estudio examinará únicamente la fluidez y el aspecto gramatical de los estudiantes de ESL en Pakistán. Con este fin, el estudio actual sugiere una estrategia de la tecnología de PLN que implica el uso de redes neuronales acompañadas de la evaluación de los profesores.

En el contexto del aprendizaje del idioma paquistaní, los estudiantes paquistaníes se enfrentan a dificultades para aprender la escritura en inglés, aunque consideran que estudiar inglés es obligatorio desde 1º de primaria y continúa hasta 14º. Ahí es donde entran en juego numerosos factores, como cursos incorrectos y el uso de métodos antiguos para explicar lagramática. A nivel universitario, el número de estudiantes que los profesores deben enseñar es bastante considerable, ya que los estudiantes provienen de diversos orígenes que incluyen distintos colegios y escuelas. Esto obliga a los profesores a dedicar gran parte del tiempo a corregir los errores de escritura de los alumnos, y la carga de trabajo es demasiado alta. Por otro lado, los estudiantes daban por sentado el feedback escrito de los profesores y no se esforzaban por reconocer los errores nicorregirlos 8.

Un estudio afirmó que la fluidez está mayormente influenciada por el hecho de que, dado que los estudiantes temen cometer errores, se convierte en una barrera para escribir con fluidez y, por tanto, prefieren evitar errores con más frecuencia que involucrarse con pensamientos. Ocasionalmente hay interferencias del idioma urdu con la escritura inglesa, además de otros factores contextuales. Además, el urdu es la lengua nacional. Como resultado de estos factores contextuales, a los profesores les resulta difícil proporcionar retroalimentación precisa, oportuna y consistente a cada estudiante cuando estos generan resultados escritos o editan los manuscritos. Considerando la teoría de la evaluación de la escritura, este estudio podrá seguir el estudio que emplea una estrategia automática de retroalimentación por escritura automática durante la comparación de la evaluación tradicional del profesor, y adopta la puntuación analítica en lugar de holística para asegurar que los estudiantes obtengan retroalimentación instantánea sobre las dos dimensiones lingüísticas significativas (es decir, gramática y fluidez)4.

Han surgido diferentes productos industriales AWE y AES, entre los que se incluyen Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion, etc. AES/AWE en su etapa inicial de desarrollo se caracteriza principalmente por el sistema tradicional de aprendizaje automático basado en el teoremade Bayes 10, regresiónlineal 11 , etc. Actualmente, el desarrollo extendido del aprendizaje profundo, especialmente la tecnología de redes neuronales, también ha beneficiado notablemente al campo de la retroalimentación por escritura, como las redes neuronales recurrentes oRNN 12, memoria a corto plazolargo 13, redes neuronales convolucionales (CNN)14, enfoqueBERT 15. AWE también recibió beneficios de las estrategias de preentrenamiento empleadas al inicio delPLN 16. Muchos estudios han tenido en cuenta diversas soluciones centradas en redes neuronales, como la generación de muestras adversariales con el propósito de aprender, el aprendizaje mediante Multitarea17, el aprendizaje mediante Autosupervisión18 y los Algoritmos deGrafos 19. Algunos han sugerido diferentes técnicas para abordar el problema de la falta de datos de entrenamiento para redactar feedback20. También existen modelos de puntuación que contribuyen a muchos modelos de redesneuronales 21.

La corrección de errores gramaticales (GEC en adelante) es un método independiente de misiones de PLN, que tiene la capacidad de detectar y corregir automáticamente los errores de composición. El contenido de tareas de GEC está interrelacionado con el de los aspectos AWE. Las tareas AWE se consideran que tienen en cuenta el diagnóstico de errores gramaticales, la mayoría de los cuales deben ser resaltados en la forma correcta. Sin embargo, los estudios de la AWE han prestado menos atención al GEC, y solo unas pocas investigaciones integraron el modelo inicial de GEC en la tecnología AWE. Inicialmente, la investigación sobre GEC elige la mayoría de las veces N-gram22, y el modelode lenguaje 23 , incluyendoBERT 24 , para identificar y corregir errores gramaticales. Sin embargo, las soluciones anteriores no pudieron resolver completamente problemas como el desorden y la omisión de componentes. La arquitectura delcodificador-decodificador 25 ha alcanzado el mismo éxito en GEC al abordar problemas que otros modelos no podían abordar antes. Es importante señalar que las arquitecturas GEC avanzadas utilizaban múltiples modelos para resolver problemas, incluyendo los enfoques basados enTransformers 26.

Diferentes estudios confirmaron la eficacia de AES en comparación con las calificaciones humanas a la hora de evaluar ensayos27,28. Un estudio29 demostró el efecto de la evaluación automatizada en la fluidez en inglés de los estudiantes. Los resultados indicaron que la evaluación automática tuvo un efecto positivo en la fluidez en la escritura en inglés. En contraste, algunos otros estudiosignoranla alta tasa de detección de errores por parte de AES en comparación con las calificaciones humanas. Estudios recientes destacan la creciente eficacia de las herramientas asistidas por IA para la evaluación de la escritura en la educación lingüística. Uno de estosestudios, el 31, hizo una comparación entre la calificación automatizada y la retroalimentación del profesor en el contexto de aprendizaje de estudiantes chinos universitarios.

El papel revolucionario de las herramientas basadas en IA en la redacción académica ha sido activamente reportado en la literatura reciente. La investigación sobre la aplicación de herramientas de escritura impulsadas por IA como complemento a la educación tradicional en inglés inglés destaca la importancia fundamental de la igualdad de oportunidades y el apoyo proactivo del profesorado en la exitosa implementación dela tecnología 32. Los estudios que investigaron la AWE, como Pigai, indicaron la fuerte correlación entre la retroalimentación bajo el apoyo de ordenadores y la mejora de la redacción, revisión y nuevas piezas de escritura enESL 33. Otro estudio ha destacado los beneficios de los autocodificadores variacionales (VAEs) que influyen positivamente en el aspecto de la formación de la escritura en inglés en los estudiantes y obtienen retroalimentación sobre niveles superiores de aprendizaje profundo, especializándose en las diversas característicaslingüísticas 34. Otra investigación sugirió que los sistemas de EA neuronal serían eficaces para usar con GEC basados en PLN, que emplea aprendizaje profundo para ofrecer una evaluación inmediata35.

La mejora de los sistemas multiagente es un paso importante en el desarrollo de tecnologías que ayudan en la escritura. Un ejemplo de ser multiagente, un asistente de refinamiento académico de redacción, el AcademyCraft, basado en el aprendizaje profundo, ha demostrado su capacidad para escribir y dar retroalimentación detallada, facilitando así el soporte de redacción EFL/ESL basado en IA, sobre esquemas analíticoscomplejos 36. De hecho, los estudios de aprendizaje de idiomas basados en tecnología también han identificado patrones emergentes diversos como el aprendizaje profundo, la evaluación automática y la retroalimentación semántica, con análisis de rendimiento que mostraron un aumento gradual y constante en la precisión de la escritura, así como en la implicación delalumnado 37.

Los modelos Transformer-LSTM han mostrado cierta propensión a la calificación automática y a la retroalimentación realizada en la escritura en inglés. Estas arquitecturas híbridas tomaron mutuamente la comprensión contextual de los transformers junto con el procesamiento secuencial de los sistemas LSTM, demostrando una mayor precisión en la gradación gramatical y de coherencia y proporcionando una generación de retroalimentación másmatizada 38. La percepción de los profesores de inglés inglés sobre las herramientas de escritura con IA informa de forma constante mejoras medibles en la organización del contenido y la calidad de la redacción, centrándose en el papel crucial de la ayuda pedagógica para impulsar la utilidad de la integración tecnológica39. Hay menos estudios que comparen la retroalimentación de los profesores y la retroalimentación asistida por ordenador, lo que implica modelos de aprendizaje profundo para explorar el efecto en la escritura en inglés de los estudiantes de ESL en términos de fluidez y gramática.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todo el software y herramientas utilizados en el estudio están listados en la Tabla de Materiales.

Criterios de calificación

La clasificación de evaluación adoptada en el presente estudio aborda dos dominios principales, a saber, fluidez y corrección, que incorporan todos los requisitos para una evaluación integral de la escritura en inglés como lengua extranjera (EFL). Estas dimensiones están destinadas a medir los puntos clave de la calidad de la escritura que ayudan a una comunicación efectiva y a la demostración de habilidades en la competencia lingüística. El módulo de Fluidez mide la naturalidad, la expresividad y la coherencia en la escritura midiendo la suavidad de las ideas, así como la calidad del uso de las palabras y la estructura de las oraciones. El módulo de Corrección se centra en la precisión gramatical precisa, la impecable mecánica y el cumplimiento de las convenciones estándar del inglés y, hipotéticamente, mide y cuenta la erroquia del idioma en varios niveles. (véase la Tabla 1)

Definición de tarea

Siguiendo las condiciones de evaluación automática de la escritura de estudiantes que aprenden inglés, el presente estudio sugiere un nuevo modelo de sistema de evaluación asistida por ordenador de la escritura en inglés. En comparación con estudios anteriores, que han estado limitados por el alcance de los sistemas automatizados de evaluación de escritura, el sistema propuesto ayudará a resolver esas limitaciones mediante la introducción de técnicas innovadoras de aprendizaje profundo que permitan a los usuarios un nivel de análisis lingüístico, alcance de modificación y análisis de retroalimentación a nivel de sistema basado en el extenso procesamiento de datos. Operando sobre dos de los indicadores más significativos de una composición, a saber, la fluidez (cuán natural, coherente y expresiva es la pieza), o la corrección (cuán correctamente escrito está el texto, plagado de errores gramaticales, mecánicos y lingüísticos), con los componentes separados de las redes neuronales, el sistema de doble modelo debe realizar varias evaluaciones. Además, identifica errores en varios niveles lingüísticos, recomienda medidas correctivas y ofrece retroalimentación en forma de lista para permitir a los usuarios mejorar el aprendizaje de idiomas de los estudiantes de forma metódica. Para describir el proceso de cálculo del sistema de evaluación automática asistida por ordenador, sugerimos el siguiente modelo matemático en las fórmulas (1)–(4) (véase la Tabla 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

donde: Puntuación final = la puntuación compuesta de la evaluación de escritura; w1 = peso asignado a la puntuación de fluidez; w2 = peso asignado a la puntuación de corrección; Sf = puntuación de fluidez basada en BERT (normalizada a [0, 1]); Sc = puntuación de corrección por decaimiento exponencial; λ = constante de decaimiento que controla la penalización de error; σ(x) = función de activación sigmoide logística; ErrorRatio = relación de errores respecto al total de tokens en el texto. Las puntuaciones de fluidez se normalizan a [0, 1] mediante la función sigmoide logística σ(x), mientras que la función de decaimiento exponencial se utiliza para puntuar la corrección e imponer una penalización adecuada a la frecuencia de error.

Arquitectura y diseño del sistema

Su arquitectura de sistema utiliza un sistema de dos modelos con una arquitectura de procesamiento paralelo, en la que el análisis de los ensayos de entrada se realiza en paralelo mediante vías de evaluación paralelas. Los módulos de Fluidez y Corrección, a su vez, otorgan las puntuaciones respectivas, y la puntuación compuesta final es la media ponderada de las dos subpuntuaciones. El módulo de corrección también ofrece una sugerencia sobre detección y corrección de errores, además de la puntuación (véase la Figura 1).

El módulo de fluidez

La fluidez en la escritura puede definirse como la naturaleza o el patrón de uso de un idioma en cuanto a la correcta elección del vocabulario, la variedad de la estructura de la oración, la complejidad sintáctica, la coherencia, etc.4. Los modelos de evaluación de fluidez capturan las ideas que se transmiten sin tartamudeos ni resultar torpes, sonando aproximados a las tendencias nativistas de comunicación. La medición tradicional de fluidez se basa en escalas, lo que pone de manifiesto las preocupaciones sobre la fiabilidad entre evaluadores. El sistema propuesto supera esta desventaja al incluir redes neuronales basadas en BERT para inducir automáticamente coherencia semántica y naturalidad lingüística mediante una comprensión situacional profunda. Esta decisión arquitectónica se tomó teniendo en cuenta las fortalezas de BERT, que se ha demostrado eficaz en la identificación de relaciones contextuales y patrones semánticos necesarios en la medición de fluidez. Las secuencias de entrada se introducen en el sistema y se pasan por 12 capas transformadoras con autoatención multicabeza para identificar dependencias a largo plazo y relaciones contextuales (véase Figura 2).

El mecanismo de atención sería el siguiente:

figure-protocol-5(5)

Sean Q, K y V las matrices que representan consulta, clave y valor, respectivamente, y d y k las dimensiones de los vectores clave. La incrustación de tokens CLS es la de resumen, que registra la coherencia semántica global de toda la secuencia de entrada.

El cálculo de la puntuación de fluidez es el siguiente:

figure-protocol-6(6)

En el que hCLS es la incrustación del token BERT [CLS], y Wreg, son breg los parámetros de la cabeza de regresión, y σ es la función de activación sigmoide que normaliza la salida a [0, 1].

El módulo de corrección

La evaluación de la corrección se centra en la precisión gramatical, la exactitud mecánica y la adhesión a las convenciones estándar del inglés. Esta dimensión aborda los aspectos técnicos de la escritura, incluyendo sintaxis, morfología, puntuación y precisión ortográfica. El componente de corrección no solo evalúa el número de errores lingüísticos, sino que también examina el impacto en la calidad global del texto. A diferencia de la evaluación de fluidez, que enfatiza la coherencia semántica y el flujo natural, el módulo de evaluación de corrección requiere una identificación precisa de errores y una corrección sistemática. El módulo distingue entre diferentes tipos de error, evalúa la gravedad y proporciona correcciones dirigidas para apoyar la mejora del aprendizaje. La pérdida de corrección utiliza el modelo FLAN-T5, que ha sido ajustado para detectar y corregir errores gramaticales. Esta elección se basa en la transformabilidad texto a texto de T5, que permite al sistema no solo encontrar fallos, sino también realizar correcciones relevantes dentro de un sistema. El sistema es una forma codificador-decodificador, y el texto se alimenta en forma de esta transformación: (véase la Figura 3)

figure-protocol-7(7)

El elemento codificador genera representaciones sensibles al contexto que no solo capturan las tendencias gramaticales, sino también posibles áreas de fallo:

figure-protocol-8(8)

Con la ayuda de generar variaciones gramaticales apropiadas para errores falsamente identificados, el decodificador genera secuencias corregidas:

figure-protocol-9(9)

Este tipo de procesamiento bidireccional permite al sistema tener conciencia de los contextos de errores y de cómo deben corregirse, de modo que las pistas sean semánticamente coherentes y se centren en cualquier corrección gramatical.

Cuantificación del error y algoritmo de puntuación

La puntuación de precisión comparó la escritura original con la versión correcta, considerando los errores lingüísticos y la gravedad basados en la posición dentro del texto y la interferencia con el significado. Este método captura la distinción entre tipos de errores en comparación con el impacto en la comprensión textual del texto. La relación entre la frecuencia de errores y la mala calidad del texto se enfatizaba de forma logarítmica en el sistema de calificación. Un paso fundamental en la comparación por token entre el texto original y el texto corregido son dos grados de comparación que se basan en la técnica bit a bit de alineación de cadenas. La segunda etapa implica la identificación y clasificación de tipos de errores basándose en algunas taxonomías lingüísticas conocidas que diferencian entre errores gramaticales (acuerdo sujeto-verbo, consistencia de tiempos y fiabilidad de la estructura sintáctica), errores mecánicos (mayúsculas, puntuación y ortografía) y de uso (elección de palabras, expresión idiomática y apropiación de registro). La tercera etapa es el cálculo de la razón de error basada en la longitud total del texto. El cuarto paso aprovecha el algoritmo de puntuación de decaimiento exponencial, que transforma las proporciones de errores en puntuaciones de corrección directamente interpretables para aproximar la dependencia no aditiva y no lineal entre la frecuencia de errores y la calidad del texto.

El tratamiento matemático del proceso de cuantificación de errores comienza con el cálculo de la proporción de errores instalados, lo que proporciona una tasa normalizada de instalación de errores, lo que a su vez permite hacer una comparación justa de textos de diferentes longitudes:

figure-protocol-10(10)

figure-protocol-11(11)

Se estableció un parámetro de calibración de 2,5 de forma empírica validándolo completamente con juicios expertos humanos, de modo que la función de puntuación pueda ofrecer resultados acordes con la comprensión humana en relación con la disminución de la calidad del texto a medida que aumenta la frecuencia de errores. Establecer este valor de parámetro de esta manera garantiza que cualquier texto con una baja tasa de error (Error_Ratio < 0,1) tenga una puntuación alta de corrección, ya que sigue de cerca las reglas del inglés estándar; cualquier texto con una tasa de error moderada (0,1 < Error_Ratio ≤ 0,3) tiene una puntuación intermedia de corrección, lo que indica que existen algunas preocupaciones lingüísticas que, sin embargo, no son directamente desastrosas, y cualquier texto con una alta tasa de error (Error_Ratio > 0,3) ha obtenido una puntuación baja de corrección porque existen preocupaciones lingüísticas críticas que afectan significativamente la posibilidad de comprensión.

El algoritmo de puntuación de corrección para la evaluación de corrección tiene en cuenta sistemáticamente todos los errores localizados y fijados por el sistema basado en T5 como elementos de penalización en el cálculo de la razón final de errores. El mecanismo de crédito de penalización utilizado para los errores gramaticales se representa por la disminución exponencial del crecimiento de la proporción de errores hacia valores altos, lo que significa que la calidad del texto es muy pobre y se convierte en 100 cuando la razón de error es igual a 0, lo que implica que no se detectan absolutamente ningún error. Es un uso perfecto de las convenciones estándar inglesas. Dicha relación matemática asegura que el código de corrección ofrezca una distinción significativa dentro de todo el espectro de niveles de competencia lingüística y responda a pequeños avances sucesivos, que indican adquisiciones reales.

Conjuntos de datos: corpus de formación y evaluación

Los datos de entrenamiento de calidad y alcance suficientes son fundamentales para el rendimiento del sistema de doble modelo. El estudio actual utilizó un conjunto de datos bien diseñado de textos escritos por estudiantes para desarrollar y evaluar el modelo, que se produjo empleando diferentes tareas de redacción. La muestra estaba compuesta por 45 estudiantes universitarios paquistaníes varones y 45 mujeres con una edad media de 19 años, estudiando 'Inglés Funcional' como curso obligatorio. Cada estudiante escribió ocho ensayos durante ocho semanas, incluyendo ensayos previos, ensayos de intervención y ocasiones posteriores al examen. Se permitía a los estudiantes redactar entre 400 y 450 palabras para cada tarea de escritura. Las estadísticas de los conjuntos de datos proporcionan las siguientes características:

70.500 palabras

Longitud media de una frase: 15,7 palabras (DE = 3,2)

Rango de vocabulario (Relación tipo-Token): 0,64 (SD 0,08) Densidad de errores gramaticales: 2,3 en 100 palabras (SD = 1,1)

La justificación y aseguramiento de la calidad de los datos seleccionados

El conjunto de datos elegido estuvo impulsado por algunas consideraciones importantes que permitieron la riqueza y relevancia para el trabajo de investigación sobre evaluación automatizada de escritura. Para empezar, la población estudiantil de Economía fue seleccionada por su naturaleza, similar a la de los estudiantes de EFL en la educación superior paquistaní, lo que permitió la presentación de muestras de escritura más auténticas que reflejan situaciones reales. En segundo lugar, el establecimiento del rango máximo y mínimo potencial de palabras, de 400 a 450 palabras, se informó mediante datos de estudios piloto de que este rango es lo suficientemente complejo lingüísticamente como para ser analizado de forma fiable por una máquina, y al mismo tiempo se mantuvo de un tamaño manejable en términos de evaluaciones humanas consistentes. Cada una de las composiciones fue evaluada por tres profesores de inglés formados (fiabilidad interevaluadora κ = 0,847, dimensión de fluidez y 0,823, dimensión de corrección) en escalas estandarizadas de 10 puntos de calificación de fluidez y corrección. La formación de los evaluadores humanos fue rigurosa y dependió de rúbricas de puntuación desarrolladas respecto a las evaluaciones de escritura IELTS y TOEFL. Los datos consisten en un conjunto de datos anotado por humanos, que puede utilizarse para entrenar y validar modelos para entrenarse con datos anotados por humanos.

Procedimientos de preprocesamiento y validación de datos

El conjunto de datos se preprocesó sistemáticamente e implicó la normalización del texto, la tokenización del texto con el tokenizador BERT WordPiece y la realización de comprobaciones de validación de calidad. No se incluyó a quienes presentaron trabajos incompletos y produjeron texto plagiado para determinar la integridad de los datos. Los últimos datos se dividieron aleatoriamente en entrenamiento (70%, n = 189), validación (15%, n = 41) y conjuntos de prueba (15%, n = 40) mediante muestreo estratificado para equilibrar los niveles de competencia y el tipo de tareas. Análisis lingüístico de un gran corpus de referencia que contiene textos académicos editados profesionalmente, artículos de periódicos y ensayos publicados, que suman aproximadamente 50 millones de palabras. Este corpus proporciona los patrones de lenguaje necesarios para realizar las pruebas de fluidez y ayuda en los procedimientos de detección de errores comparándolos con el uso estándar. En el corpus de referencia, los pasos previos al preprocesamiento e indexación son la tokenización, el etiquetado de partes gramaticales, el análisis sintáctico y el etiquetado semántico para facilitar un acceso eficiente durante la evaluación en tiempo real.

Estrategia de entrenamiento con modelos de fluidez

Se propone un sistema de optimización secuencial para entrenar los datos y lograr fluidez. La formación utilizó características de última generación, incluyendo la programación adaptativa de la tasa de aprendizaje, tamaño progresivo de los lotes y métodos avanzados de regularización que evitan el sobreajuste a medida que avanza el entrenamiento, manteniendo así la eficacia del modelo para identificar patrones lingüísticos indicativos de fluidez lingüística. La tasa de aprendizaje es 5 × 10-4 con un programa de decaimiento lineal, configurado para asegurar que la convergencia se mantenga estable y no oscile alrededor de los valores óptimos de los parámetros. Esta tasa de aprendizaje se elige mediante búsqueda en cuadrícula en [1 x 10-6, 1 x 10-4], siendo 5 x 10-5 el compromiso más adecuado entre la velocidad de convergencia y la estabilidad. El entrenamiento real estará restringido a solo 3 épocas, una configuración optimizada en base a beneficios empíricos mediante el seguimiento de pérdidas de validación para evitar el sobreajuste sin impedir actualizaciones suficientes de parámetros que permitan que el aprendizaje sea efectivo. Se ha realizado una parada temprana de mecanismos con una paciencia de 2 épocas y un delta mínimo de 0,001 para evitar la degradación.

La optimización la realiza el optimizador AdamW, con elecciones simplificadas como β₁ = 0,9 (momento, que controla exponencialmente la decaimiento de las estimaciones del primer momento), β₂ = 0,999 (estimación del segundo momento, que controla exponencialmente la decaiencia de las estimaciones del segundo momento), y ε = 1 × 10⁻8 (término numérico de estabilidad). La regularización por decaimiento de peso (λ = 0,01) evita que las magnitudes de los parámetros crezcan excesivamente grandes, siendo este valor seleccionado mediante análisis de validación del rendimiento a lo largo del rango [0,001, 0,1]. La monitorización compleja es capaz de monitorizar diversas métricas durante el entrenamiento para garantizar el mejor rendimiento de un modelo y evitar el sobreajuste. Incluido en el marco de monitorización están:

Seguimiento de pérdidas: La pérdida de entrenamiento y validación se registra dentro de cada época, y la parada temprana ocurre automáticamente cuando la pérdida de validación deja de mejorar durante dos épocas consecutivas.

Métricas de rendimiento: Los datos de validación se utilizan para calcular los coeficientes de correlación de Pearson entre las puntuaciones predichas y reales cada 100 pasos de entrenamiento.

Detección de gradientes: Se monitorizan normas de gradiente para detectar gradientes nulos y explosivos, y con una norma de gradiente de 1,0 se aplica el recorte de gradiente.

Programación de la tasa de aprendizaje: Se detecta una disminución de la tasa de aprendizaje basada en validación (factor = 0,5) en caso de que se produzca más de una meseta de época.

Relacionado con la regularización: Se encontraron tasas de abandono (0,1 para BERT, 0,3 para cabeza de regresión) mediante ablación sistemática. Durante el proceso de entrenamiento se utilizan varios métodos de regularización basados en prevenir el sobreajuste: (1) regularización de abandono utilizando tasas optimizadas de desconexión por tipo de capa en la red, (2) decaimiento de peso como se explicó anteriormente, (3) parada temprana, determinada por el rendimiento de validación, y (4) aumento de datos basado en la parafraseo del 15 por ciento de los ejemplos de entrenamiento mediante métodos de retrotraducción. Los puntos de control del modelo con mejor rendimiento se guardaron tras cada época, y los modelos con mayor puntuación se seleccionaron en función de las puntuaciones de correlación de validación. La función de pérdida utilizada en la parte de evaluación de fluidez es el Error Cuadrático Medio (MSE), que es la función objetivo principal de la tarea de regresión de predecir las puntuaciones de fluidez continua. La formulación de la pérdida matemáticamente se da como:

figure-protocol-12(12)

N es el tamaño total de la muestra de entrenamiento, y_pred, i siendo la puntuación de fluidez predicha de la i-ésima muestra, y y_true, i siendo la puntuación de verdad de base correspondiente, tal como la dieron los evaluadores expertos humanos. Esta pérdida es muy útil para desalentar el error real de predicción cuadráticamente, de modo que los errores mayores atraen una penalización mayor, y también es diferenciable. El mecanismo de planificación de la velocidad de aprendizaje es muy avanzado con un proceso bifásico, y comienza con una etapa de calentamiento lineal, seguida de un proceso sistemático de decaimiento para crear características óptimas de convergencia. Esto se hace en la fase de calentamiento, donde la tasa de aprendizaje comienza en cero y cambia gradualmente hasta la tasa máxima, tras lo cual los parámetros del modelo se optimizan en relación con el conjunto de datos de entrenamiento. La expresión matemática de la fase de calentamiento es:

figure-protocol-13(13)

Tras la fase de calentamiento, la tasa de aprendizaje se reduce de forma sistemáticamente lineal para evitar sobrepasar los valores óptimos de los parámetros y resulta en una convergencia constante. Matemáticamente, la fase de desintegración se lee como:

figure-protocol-14(14)

En el que t es el paso de entrenamiento actual, lr max es la tasa máxima de aprendizaje alcanzada durante el calentamiento, el calentamiento es el número de pasos asignados a la fase de calentamiento y el total es el número total de pasos de entrenamiento en todas las épocas. El procedimiento de planificación mencionado garantiza un aprendizaje agresivo del modelo en los niveles inferiores y estabilidad en los niveles de convergencia.

Estrategia de entrenamiento del modelo de corrección

El modelo de corrección se basaba en la estrategia de aprendizaje por transferencia utilizando el modelo FLAN-T5 preentrenado para aprovechar todo el conocimiento gramatical disponible según fuera necesario. Esto tenía como objetivo analizar la comprensión general del idioma así como la información específica sobre los errores cometidos por los estudiantes de ESL. El método de aprendizaje por transferencia utiliza el punto de control de síntesis pszemraj/flan-t5-gramática-grande como modelo base, con varias ventajas notables en cuanto a corrección. Como el modelo ya está entrenado y posee una alta capacidad de comprensión del idioma que ha sido entrenada en diversos campos del texto, se adaptará a muchos estilos y temas de escritura. En particular, se ha realizado un ajuste fino específico de gramática en grandes conjuntos de datos de corrección que abarcan múltiples tipos de errores gramaticales como los que se encuentran en la escritura en un segundo idioma. Además, el punto de control comprende potentes sistemas de detección de errores que se prueban frente a los diferentes tipos de errores (es decir, errores morfológicos, sintácticos y semánticos), creando un estándar perfecto de comparación con los parámetros innatos de prueba de corrección del estudio.

El proceso de adaptación de dominio refleja las modificaciones sistemáticas de parámetros que no alteran las capacidades generales de comprensión del lenguaje del modelo preentrenado, sino que introducen las características específicas de la solución de tareas de evaluación de escritura. Este proceso de adaptación tiene la derivación matemática como:

figure-protocol-15(15)

Aquí θpreentrenado representa los parámetros del modelo preentrenado que codifican la comprensión general del lenguaje y el conocimiento gramatical, y eldominio Δθ representa las actualizaciones específicas de parámetros aprendidas en la tarea de evaluación de escritura objetivo. Las actualizaciones específicas de dominio se calculan mediante optimización basada en gradientes en el conjunto de datos objetivo, asegurando que el modelo desarrolle sensibilidad específica a los tipos de error comunes en la escritura EFL sin interrumpir sus capacidades lingüísticas más amplias.

Experimentos con comparaciones

Para demostrar la funcionalidad de la EG, se propone el coeficiente de correlación de Pearson como el valor clave de la medición, que determina la conexión lineal entre las puntuaciones automatizadas y la experiencia humana. El coeficiente de correlación se encuentra mediante la fórmula:

figure-protocol-16(16)

Donde xi representa las puntuaciones automáticas, representa las calificaciones humanas y figure-protocol-17 y figure-protocol-18 son las medias respectivas. El coeficiente de correlación varía de −1 a 1, con valores cercanos a 1 que indican una fuerte relación positiva entre la evaluación automatizada y la humana.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Comparaciones de modelos de referencia

Para evaluar el rendimiento del EG y demostrar su superioridad frente a los métodos existentes, se realizan comparaciones en profundidad con enfoques establecidos de AWE y métodos tradicionales de métrica única. Estas comparaciones de referencia son esenciales para validar el valor añadido de la arquitectura EG y demostrar que la integración de la evaluación de fluidez y corrección proporciona mejoras medibles respecto a enfoques que se centran en dimensiones individuales de forma aislada. La selección de modelos de referencia abarca cuatro categorías de AWE, cada una reflejando una orientación distinta sobre cómo debe evaluarse la escritura. El primero tiene un único modelo basado en BERT para evaluar la fluidez. Estos modelos utilizan arquitecturas de transformadores para evaluar los patrones textuales de suavidad y coherencia. La segunda categoría, integrada en metodologías lingüísticas tradicionales, se centra en sistemas basados en reglas para la detección de errores gramaticales. Por tanto, el enfoque seguía siendo la corrección, pasando por alto otros aspectos relacionados con la calidad de la escritura, como la cohesión y el contenido. La tercera categoría son los sistemas AWE basados en características, que incluyen indicadores de complejidad lingüística —como la longitud variacional de las oraciones, la diversificación del léxico y la complejidad sintáctica para generar puntuaciones generales de calidad. El cuarto tiene en cuenta los sistemas híbridos combinando diversas características lingüísticas superficiales, a menudo utilizando métodos de conjunto o promedios ponderados. Estos modelos no alcanzan el nivel de sofisticación integrada alcanzado por las arquitecturas neuronales EG. El rendimiento de referencia del modelo se evalúa con tres dimensiones principales. La primera mide la alineación de las calificaciones generadas por el sistema con las valoraciones de expertos humanos formados (profesores de inglés) utilizando rúbricas estandarizadas. La segunda determina la generalizabilidad, identificando si el rendimiento se mantiene consistente en tres ensayos con temas y complejidad variables. La tercera dimensión se basa en la fiabilidad predictiva, evaluando la precisión y estabilidad de la puntuación mediante herramientas estadísticas como el error absoluto medio, el error cuadrático medio raíz y el análisis de intervalos de confianza. En conjunto, estas dimensiones establecen un marco sólido para la comparación y destacan la superioridad de los sistemas EG, especialmente en la obtención de mayor precisión y estabilidad que los enfoques tradicionales.

Grupos experimentales y de control

Este estudio contó con 90 estudiantes de grado en Economía que cursaban un curso funcional de inglés en dos clases intactas. Los datos se tomaron en tres ocasiones: pre-prueba, intervención y post-prueba para seguir el progreso en la precisión y fluidez de la escritura a lo largo del tiempo. Este estudio con sujeto humano fue aprobado por el Consejo Asesor Departamental de la Universidad COMSATS Islamabad, campus de Lahore, Pakistán. Los participantes estuvieron expuestos a dos condiciones: la retroalimentación humana tradicional y la retroalimentación asistida por ordenador. El grupo de control estaba formado por 45 estudiantes, que recibían la retroalimentación tradicional por escrito de un instructor de inglés formado. Los participantes recibieron comentarios escritos sobre los ensayos de los estudiantes en forma de calificaciones holísticas, identificación de errores y recomendaciones en forma de comentarios de un profesor sobre cómo mejorar el trabajo. El grupo experimental, a su vez, incluía a 45 estudiantes que recibieron instrucción de la misma manera en el aula, pero la escritura de los estudiantes se complementó con la ayuda de una rápida retroalimentación automatizada proporcionada por el EG, que les proporcionó la información diagnóstica, tanto en términos de fluidez como de corrección, en unos 30 segundos desde la entrega.

Este estudio se llevó a cabo durante 8 semanas, en las que se realizó una prueba previa (Semana 1) para determinar el rendimiento inicial en la escritura de los sujetos antes de que los estudiantes recibieran una intervención. Durante seis semanas se administró retroalimentación informática con marcadores semánticos de PLN en el grupo experimental y evaluación de los profesores en el grupo de control. Finalmente, la prueba posterior (en la semana 8) se realizó para entender la diferencia entre las medidas de precisión y las puntuaciones de fluidez antes y después del test. Para obtener resultados similares en comparabilidad, se solicitó a los encuestados que realizaran tareas similares por escrito en cada periodo de evaluación, minimizando así las posibles variables de confusión de la dificultad de la tarea y la familiaridad del contenido en la redacción. Para asegurar que los prompts de escritura sean coherentes con el nivel de dificultad, así como para establecer la validez del contenido, se eligieron de manera congruente. Los temas de ensayo se eligieron en función de que los estudiantes cubrieran diversas áreas de contenido para evitar que los participantes tuvieran que realizar una tarea similar durante mucho tiempo.

Durante la fase previa al examen, se pidió a los participantes que redactaran un ensayo de 400–450 palabras y escribieran sobre los objetivos académicos y profesionales. Esta tarea descriptiva se basó en la experiencia personal y las proyecciones futuras, lo que implica la necesidad de organizar la escritura, proporcionar ejemplos claros y hacer una declaración lógica de objetivos y motivación personales. La tarea de redacción de intervención se basaba en diferentes temas, como escribir sobre la rutina diaria de la vida, aficiones, viajar, el primer día en la universidad, días memorables de la vida y momentos de mejores amigos. El tema posterior al examen estaba relacionado con el tema 'Efecto de la tecnología en la comunicación', y la longitud requerida del ensayo era de 400–450 palabras.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Validez y fiabilidad del enfoque estadístico

El sistema fue probado con varios métodos estadísticos complementarios que proporcionan evidencia exhaustiva de los efectos del EG en el desarrollo de la escritura. Se trata de un método analítico multifacético que reconoce que las intervenciones educativas están sujetas a un análisis estadístico complejo que no puede reducirse a meras comparaciones de grupos, sino al análisis de patrones de cambio,...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los resultados experimentales demuestran varios logros significativos. En primer lugar, el sistema de doble modelo logró una fuerte correlación con los juicios de expertos humanos (r = 0,923), superando sustancialmente a los enfoques de modelo único y a los sistemas AWE contemporáneos. En segundo lugar, el estudio de intervención controlada reveló mejoras significativas en el rendimiento de escritura de los estudiantes de ESL, con grandes tamaños de efecto (d = 1,28) que superaron a los ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

No hay conflictos de interés entre todos los autores.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Reconocemos el apoyo de COMSATS University Islamabad, campus de Lahore, y de la facultad de inglés para ayudar a recopilar datos de los estudiantes.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
USADOS EN EL ESTUDIO
Marco de Aprendizaje ProfundoPyTorch1.13.1Marco de aprendizaje profundo para la implementación de redes neuronales
Modelos preentrenadosTransformers (Rostro de Abraza)4.21.3Carga de modelos preentrenados, implementaciones de modelos BERT y T5
Modelo de lenguajeBERT (Representaciones Bidireccionales de Codificadores de Transformers)Bert-base-sin cajaEvaluación de la fluidez, evaluación de la coherencia semántica, comprensión contextual
Modelo de lenguajeFLAN-T5 (Red de Lenguaje Ajustada T5)pszemraj/flan-t5-gran-gramática-síntesisCorrección de errores gramaticales, transformación de texto a texto, detección de errores
Computación numéricaNumPy1.23.5Cálculos numéricos, operaciones de matriz para funciones matemáticas
Análisis de datosPandas1.5.2Manipulación de datos, análisis estadístico y preprocesamiento
Aprendizaje automáticoScikit-learn1.1.3Cálculo de métricas estadísticas, análisis de correlación, métricas de evaluación
VisualizaciónMatplotlib3.6.2Visualización de datos, gráficos de progreso de entrenamiento, gráficos de rendimiento
VisualizaciónSeaborn0.12.1Visualización estadística de datos, mapas de calor de correlación
Kit de herramientas NLPNLTK (Kit de herramientas de lenguaje natural)3.7Preprocesamiento de texto, tokenización, análisis lingüístico
Procesamiento de PLNSpaCy3.4.4Preprocesamiento avanzado de PLN, etiquetado de POS, análisis sintáctico
TokenizaciónTokenizadores0.13.2Tokenización rápida para tokenización BERT WordPiece y T5
ESTADÍSTICO Y DE ANÁLISIS
Software estadísticoSoftware estadístico SPSSVersión 26.0Análisis estadístico, pruebas t por muestras independientes, ANOVA, análisis de correlación
Conjunto de datos de entrenamientoKaggle ASAP DatasetVersión de 2012Referencia de corpus de entrenamiento (el 90% de los modelos AWE utilizan este conjunto de datos)
PYTHON
Optimizadortorch.optim.AdamWPyTorch 1.13.1Optimización del modelo con regularización de decaimiento de pesos (λ=0,01), β 1=0,9, β 2=0,999, ε=1× 10-8
Pérdida / Activacióntorch.nn.functionalPyTorch 1.13.1Activación sigmoide, funciones de pérdida, regularización de dropout
Carga de datostorch.utils.data.DataLoaderPyTorch 1.13.1Tamaño progresivo por lotes (4→ 16), carga y agrupación de datos
Tokenizacióntransformadores. AutoTokenizerTransformadores 4.21.3Tokenización BERT de WordPiece, preprocesamiento de texto
Carga de modelostransformadores. AutomodeloTransformadores 4.21.3Carga de modelos preentrenados para arquitecturas BERT y T5
Control de pendientetorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Recorte de gradiente (umbral: 1.0) para la estabilidad del entrenamiento
Programación LRtorch.optim.lr_schedulerPyTorch 1.13.1Programación de la velocidad de aprendizaje con decaimiento lineal y calentamiento
Métricassklearn.metricsScikit-learn 1.1.3Correlación Pearson, MAE, cálculo RMSE para evaluación
IMPLEMENTACIÓN DE REDES NEURONALES PYTHON
Clase Baseantorcha.nn.MóduloPyTorch 1.13.1Clase base para arquitecturas de redes neuronales personalizadas (Fluency & Fluency & Módulos de corrección)
Capas linealesantorcha.nn.LinealPyTorch 1.13.1Implementación de cabezas de regresión lineal (768→ 512→ 256→ 128→ 1 neurona)
RegularizaciónTorch.nn.AbandonoPyTorch 1.13.1Regularización de abandono (0,1 para BERT, 0,3 para cabeza de regresión)
Activacióntorch.nn.functional.sigmoidPyTorch 1.13.1Activación sigmoide para la normalización de la puntuación de fluidez [0,1]
Activacióntorch.nn.functional.reluPyTorch 1.13.1Activación de ReLU en capas de regresión para transformaciones no lineales
Transformadortransformadores. BertModelTransformadores 4.21.312 capas transformadoras con autoatención multicabeza para la evaluación de la fluidez
Seq2Seqtransformadores. T5Para
Generación Condicional
Transformadores 4.21.3Arquitectura codificador-decodificador para corrección de errores gramaticales
Función de pérdidatorch.nn.MSELossPyTorch 1.13.1Función de pérdida de error cuadrático medio para el entrenamiento de regresión de fluidez
LIBRERÍAS DE EVALUACIÓN Y MÉTRICAS DE PYTHON
Correlaciónscipy.stats.pearsonrSciPy 1.9.3Coeficiente de correlación de Pearson para la concordancia modelo-humano
Métrica de errorsklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Cálculo del Error Absoluto Medio (MAE) para la precisión de la predicción
Métrica de errorsklearn.metrics.mean_squared_errorScikit-learn 1.1.3Error cuadrático medio raíz (RMSE) para la evaluación de la magnitud del error
Prueba estadísticascipy.stats.ttest_indSciPy 1.9.3Prueba t de muestras independientes para pruebas de significación estadística
Matriz de correlaciónnumpy.corrcoefNumPy 1.23.5Cálculo de matrices de correlación para la fiabilidad entre evaluadores
Correlación de datosPandas. DataFrame.corrPandas 1.5.2Análisis de correlación de datos e informes estadísticos
Visualizaciónmatplotlib.pyplotMatplotlib 3.6.2Visualización del rendimiento, gráficos de correlación, gráficos de progreso de entrenamiento
Mapa de calorseaborn.heatmapSeaborn 0.12.1Visualización de matrices de correlación y presentación estadística de datos
PROCESAMIENTO DE TEXTO EN PYTHON Y BIBLIOTECAS NLP
Procesamiento de textore (Expresiones regulares)Python 3.9+ integradoCoincidencia de patrones de texto, limpieza de datos y preprocesamiento
Gestión de la configuraciónJSONPython 3.9+ integradoManejo de archivos de configuración, almacenamiento de parámetros del modelo
SerializaciónPepinilloPython 3.9+ integradoSerialización de modelos y guardado/carga de puntos de control
Seguimiento del progresoQDM4.64.1Barras de progreso para bucles de entrenamiento y procesamiento de datos
TalaTalaPython 3.9+ integradoRegistro del progreso del entrenamiento, seguimiento de errores y depuración
ReproducibilidadaleatorioPython 3.9+ integradoConfiguración aleatoria de semillas para experimentos reproducibles
Sistema de archivosOSPython 3.9+ integradoOperaciones del sistema de archivos, gestión de rutas de modelos
Análisis CLIargparsePython 3.9+ integradoAnálisis de argumentos en línea de comandos para configuraciones de entrenamiento
PLATAFORMAS COMERCIALES AWE / AES (referenciado)
Plataforma ComercialPigai.orgPlataforma comercial AWEEvaluación de escritura en inglés inglés chino, sistemas automatizados de retroalimentación
Plataforma ComercialBingo EnglishSistema AWE comercialApoyo al aprendizaje del idioma inglés, desarrollo de habilidades de escritura
Plataforma educativaMi accesoPlataforma de escritura educativaEvaluación de escritura y entrega de comentarios por parte de los estudiantes
Máquina de puntuaciónE-raterMotor automatizado de puntuación ETSCalificación de ensayos de examen estandarizado, evaluación holística
Herramienta de evaluaciónE-escriboHerramienta de evaluación de la escrituraEvaluación de escritura académica y retroalimentación diagnóstica
Servicio de prácticaCriterionServicio de práctica de redacción ETSDesarrollo de habilidades de escritura y retroalimentación automatizada
Modelo de lenguaje de IAChatGPTModelo de lenguaje OpenAIRetroalimentación y evaluación de escritura asistida por IA (referenciado en la literatura)
ARQUITECTURAS DE APRENDIZAJE PROFUNDO (referenciado en literatura)
ArquitecturaRedes neuronales recurrentes (RNN)Cai, 2019Procesamiento secuencial de texto — Sistemas de retroalimentación por redacción y evaluación automatizada
ArquitecturaMemoria a corto plazo largo (LSTM)Jin et al., 2018Modelado de dependencias a largo plazo & mdash; Puntuación automatizada de ensayos y análisis de secuencias
ArquitecturaRedes Neuronales Convolucionales (CNN)Dong et al., 2017Reconocimiento local de patrones y mdash; Clasificación de texto y extracción de características para la puntuación
ArquitecturaHíbrido transformador-LSTMXuan, 2025Procesamiento combinado contextual y secuencial y mdash; Generación automática de puntuación y retroalimentación
ArquitecturaAutocodificadores variacionales (VAEs)Kumar et al., 2024Modelado generativo y mdash; Desarrollo mejorado de habilidades de escritura y retroalimentación personalizada
ArquitecturaSistemas MultiagenteThompson et al., 2024Procesamiento colaborativo de IA y mdash; asistencia avanzada de escritura (plataforma AcademiCraft)
MecanismoMecanismos de atenciónDong et al., 2017Autoatención y atención multi-cabezas — mejora del rendimiento AES y comprensión contextual
TÉCNICAS TRADICIONALES DE APRENDIZAJE AUTOMÁTICO (Referenciado)
Método estadísticoTeorema de BayesRudner & Liang, 2002Enfoque tradicional de ML y mdash; Desarrollo temprano de AES/AWE y puntuación probabilística
Método estadísticoRegresión linealPhandi et al., 2015Modelado estadístico y mdash; Evaluación de escritura basada en características y predicción de puntuaciones
Método de aprendizajeAprendizaje por preferencia de rangoChen & Él, 2013Metodología basada en rankings y mdash; Puntuación comparativa de ensayos y modelado de preferencias
Modelo de lenguajeModelos N-gramXie et al., 2015Modelado estadístico del lenguaje & mdash; corrección de errores gramaticales y reconocimiento de patrones
ArquitecturaArquitectura codificador-decodificadorGe et al., 2018Modelado secuencia a secuencia & mdash; Corrección de errores gramaticales y transformación de texto
ESTÁNDARES Y MARCOS DE EVALUACIÓN
Estándar de EvaluaciónEvaluación de Redacción IELTSAdaptación de la rúbrica de puntuaciónCriterios estandarizados de evaluación para fluidez y corrección
Estándar de EvaluaciónEvaluación de Escritura TOEFLEstándares de escritura académicaEvaluación de competencia y puntuación estandarizada
Medida estadísticaTamaño del efecto d de Cohen0,2=pequeño, 0,5=mediano, 0,8=grandeEvaluación práctica de la importancia para la efectividad de la intervención
Medida de fiabilidadFiabilidad entre evaluadores (κ)Fluidez: 0,847 / Corrección: 0,823Coeficiente de Kappa y mdash; Validación de la consistencia y la conformidad por parte del evaluador humano

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Aprendizaje de Lenguas Asistido por OrdenadorModelos de Redes NeuronalesProcesamiento del Lenguaje NaturalCalificaci n Automatizada de EnsayosPedagog a de la Escritura para ESLRetroalimentaci n GramaticalFluidez en la Escritura

Artículos relacionados