$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La intensa globalización de la educación y las tecnologías digitales ha incrementado la necesidad de evaluar científicamente y de forma creíble el nivel de escritura en inglés para la enseñanza de idiomas, el desarrollo académico y el avance profesional1. Las evaluaciones convencionales de escritura, tal como las practican la calificación humana, pueden medir aspectos subjetivos de la escritura como la exhaustividad de la argumentación y la idoneidadcultural, pero son susceptibles a largos tiempos de entrega, altos costes laborales y sesgos debido a la experiencia y preferencias delevaluador 3,4. Estas limitaciones son especialmente agudas en prácticas a gran escala, como los exámenes de idiomas internacionales (IELTS, TOEFL) u otros cursos de inglés impartidos en universidades donde la puntuación manual no puede ser todo lo necesario en términos de retroalimentación instantánea y cobertura5.
Los sistemas AWE se han utilizado ampliamente en este contexto debido a su procesamiento en tiempo real, estandarización yescalabilidad 6. Herramientas populares como Grammarly (que se centra en errores gramaticales y refinamiento de estilo) y ETS Criterion (que cumple con normas formales de escritura) son actualmente utilizadas por millones de estudiantes en educación K-12, escuelas de idiomas, educación superior y formaciónindividual 7. Aunque estos son los beneficios, la eficiencia tecnológica y la aplicabilidad educativa de los sistemas AWE siguen siendo objeto de debate8. Técnicamente hablando, los sistemas existentes son muy precisos en dimensiones objetivas, incluyendo la detección de errores y la diversidad léxica, donde la correlación con la puntuación humana puede ser superior a 0,859. Sin embargo, en áreas más subjetivas, como la relevancia del contenido, la argumentación lógica y la organización de un texto, las correlaciones suelen ser inferiores a 0,7010. Tal desproporcionación conlleva el riesgo de promover una precisión superficial entre los alumnos a costa de la competencia general en la escritura11.
La cuestión de la equidad también limita la utilidad educativa de la AWE. Los estudios actuales también tienden a centrarse en los indicadores agregados de precisión, descuidando la posibilidad de desviaciones que perjudiquen sistemáticamente a algunos grupos12. De forma indicativa, las características del interidioma compartido por los aprendices de chino o español se confundirían con errores, lo que resultaría en una subestimaciónsistemática 13,14. Además, la aceptación subjetiva del feedback de IA por parte de los estudiantes es generalmente pococonocida. Las encuestas indican que casi un tercio de los estudiantes no nativos reporta una inadecuación entre las puntuaciones de IA y el rendimiento real, mientras que los procesos de precisión técnica, equidad grupal y satisfacción del alumno siguen siendo pococomprendidos 16.
Estas debilidades reflejan las carencias del paradigma clásico de precisión17. Un marco que solo considere la alineación entre la IA y la puntuación humana no puede captar cuestiones de equidad ni de confianza del alumno en el sistema. En la práctica, el valor educativo de la AWE debe cumplir tres condiciones simultáneamente: precisión técnica, equidad entre grupos y aceptación por parte delalumno 18. La ausencia de un enfoque de validación tan integral ayuda a explicar por qué los sistemas AWE disfrutan de una adopción generalizada pero de una confianza limitada en la práctica educativa19,20.
Para abordar este desafío, el presente estudio introduce un marco de validación multinivel que integra la precisión técnica, la equidad grupal e individual, y la percepción del aprendiz en una estructura coherente. El marco XAI propuesto está diseñado para implementarse de forma práctica dentro de las plataformas AWE existentes, proporcionando a profesores y estudiantes diagnósticos de equidad y explicaciones transparentes de las puntuaciones, y puede aplicarse en cursos de escritura o clases de preparación para exámenes para evaluar su capacidad de mejorar la equidad, la interpretabilidad y la utilidad instruccional en entornos reales de evaluación.
En este contexto, la hipótesis es un AFMM para investigar el papel mediador de la equidad percibida en la determinación de la relación entre precisión y satisfacción, así como el papel moderador de la competencia lingüística en la sensibilidad a la equidad. Por lo tanto, contribuye de dos maneras: tanto teóricamente enriqueciendo los modelos de evaluación de la AWE al describir la equidad como una de las dimensiones clave de validación junto con la precisión y la percepción, como al proporcionar a los desarrolladores estrategias para maximizar la equidad, a los educadores con criterios de selección de sistemas sensibles al grupo, y el valor educativo de la AWE explicando la forma en que se forman las percepciones de los estudiantes. Además de la educación, el marco también está alineado con el concepto más amplio de XAI, demostrando cómo la equidad y la percepción del usuario pueden mejorar la transparencia, la confianza y la aceptación en otros ámbitos como la sanidad, los sistemas autónomos y la ciberseguridad.
Preguntas de investigación:
1.To qué grado demuestra el sistema AWE precisión técnica y equidad entre diferentes grupos de lengua materna y competencia?
2. ¿Cómo puede un marco de evaluación multinivel basado en XAI mejorar la transparencia y la equidad en la evaluación automatizada de redacción en inglés?
REVISIÓN DE LA LITERATURA:
Se examinaron los factores que afectan la aceptación de la retroalimentación AWE por parte de los estudiantes universitarios utilizando un Modelo de Aceptación Tecnológica (TAM)21 ampliado. A partir de datos de encuestas de 448 estudiantes chinos que usaron MEB, se determinó que la utilidad, facilidad de uso e intención tuvieron una influencia significativa en la norma subjetiva, la confianza, la autoeficacia, la retroalimentación cognitiva y las características del sistema. Sin embargo, el estudio se limitó a una sola nación y a un solo grupo de estudiantes, lo que limita la aplicabilidad de la generalización. Para explorar cómo responden los estudiantes chinos de EFL a la retroalimentación del PigaiAWE 22, un estudio analizó las presentaciones repetidas (n = 5) de estudiantes universitarios. Se señaló un énfasis temprano en la corrección de errores, una baja captación de retroalimentación lingüística y un profundo progresivo en la respuesta. Sin embargo, el tamaño de la muestra era muy limitado, al igual que el sistema AWE, que restringe la aplicabilidad y generalizabilidad. Se examinaron las creencias de los profesores de EFL sobre la aplicación de la herramienta de calificación de IA (CoGrader) para identificar los factores que influyen en suspuntos de vista 23. A través de un estudio de métodos mixtos con 10 profesores universitarios saudíes, una encuesta y una entrevista revelaron que había opiniones positivas mixtas, pero reticencia a estar completamente seguros de la fiabilidad y del reemplazo completo de los profesores. Esto dificulta la generalización debido a la muestra limitada y al entorno de un solo país.
Considerando los avances en lingüística de corpus y tecnología de IA, un estudio investigó los marcosAES 24. Empleó PCA para mejorar los indicadores lingüísticos que evaluan la calidad de la escritura y descubrió que combinar microcaracterísticas con características agregadas definía la calidad de la escritura de forma más eficaz que las características agregadas por sí solas. El enfoque AES no lineal basado en la Regresión en Bosque Aleatorio superó a los demás enfoques. Además, SHAP identificó elementos esenciales del lenguaje para cada atributo evaluado, aumentando la transparencia del sistema mediante una IA explicable. Los resultados pueden ayudar a mejorar los métodos multidimensionales en la redacción, la evaluación y la educación. El sistema de colaboración hombre-máquina se introdujo para abordar los retos de anotar escritos árabes, que a menudo son costosos y consumen mucho tiempo. El método considera ensayos basados en siete aspectos de la literatura con la ayuda de un LLM. Los procesos de validación y las tácticas de prompting se personalizaron para garantizar la consistencia y la precisión. La cooperación resulta en un mayor suministro de recursos etiquetados y no afecta a la calidad de la evaluación, demostrando que es un método escalable de anotación de datos adecuado para lenguajes con menos recursos.
El uso de la IA en el ámbito educativo ofrece la oportunidad de reducir significativamente los requisitos de calificación y mejorar la educación en escritura25,26. Al mismo tiempo, los investigadores han subrayado que la precisión de la IA no es el único aspecto relevante para su uso responsable. Existen principios de equidad y reducción de sesgos, seguridad y privacidad, responsabilidad, explicabilidad, transparencia, efecto educativo, integridad y desarrollo continuo. Investigaciones recientes han evaluado empíricamente la puntuación de disparos cero basada en GPT-4o, con un enfoque en estos requisitos. La investigación se centró en las percepciones que los educadores tenían hacia los ADWT respecto al aspecto de la integridadeducativa 27. El estudio transversal que involucró a 100 estudiantes de posgrado y profesores de 10 materias sugiere que, a pesar de que los docentes atribuyen los beneficios de los ADWT para alcanzar el objetivo educativo, presenta algunas limitaciones, como accesibilidad limitada, falta de conocimiento y preocupación por su impacto en la integridad y la creatividad. La investigación sugería que, a medida que las tecnologías de IA se integran más en la educación, las preocupaciones éticas y la participación de los grupos de interés son necesarias para su uso exitoso y responsable. La investigación investigó la eficacia de las tecnologías de IA en comparación con evaluadores humanos en la evaluación de ensayos presentados por estudiantes deEFL 28. Al evaluar 30 ensayos, se reveló que, aunque la IA ofrecía comentarios de alta calidad en cuanto a contenido, lenguaje, organización y corrección, constantemente proporcionaba puntuaciones más bajas que los evaluadores humanos. Además, la IA proporcionaba retroalimentación más completa, pero las puntuaciones de las distintas herramientas de IA no eran sustancialmente diferentes.
Carencia en la investigación:
Actualmente, la mayoría de las investigaciones sobre la investigación en AWE evalúan la precisión o la aceptación por parte de los usuarios. Muy pocos examinan si las diferencias de puntuación perjudican sistemáticamente a los grupos de lengua materna o de competencia. Aunque estudios previos han examinado la aceptación por parte de los usuarios o están limitados a un sistema AWE específico de un país y tamaño de muestra concretos, surgen dudas sobre la generalizabilidad. Aunque tanto SHAP como PCA son estrategias XAI y se desarrollaron para aumentar la transparencia, ningún estudio ha examinado los mecanismos de equidad ni cómo los estudiantes utilizan la retroalimentación de IA de la AWE. No existen marcos extensos en la literatura que contemplen dimensiones definidas de precisión, análisis de equidad y percepciones del alumno. No existe ningún ejemplo de un modelo explicable de evaluación que tenga en cuenta la precisión intra e interevaluadora, la equidad y las percepciones del alumno. En esta investigación se proponen y validan un marco explicable, TLEF, y un modelo combinado, AFMM, para evaluar la precisión, la equidad y las percepciones del aprendiz al mismo tiempo entre estudiantes multilingües y con diversas competencias.