$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio se llevó a cabo en la Escuela de Humanidades y Artes de la Universidad de Vuelo de Aviación Civil de China, utilizando datos educativos desidentificados recogidos en el entorno del curso. No se incluyó información personal directamente identificable en el conjunto de datos analítico. Todos los participantes fueron informados del propósito y procedimientos del estudio, y se obtuvo el consentimiento informado por escrito antes de la participación. La participación era voluntaria, y la no participación o la retirada del componente de investigación no afectaban la asistencia a los cursos, las calificaciones ni el acceso a la instrucción regular. Según el marco de práctica investigadora aplicable de la Universidad de Vuelo de Aviación Civil de China, los estudios basados en datos educativos de riesgo mínimo desidentificados pueden no requerir una revisión ética formal. Todos los materiales desidentificados se almacenaban en archivos protegidos por contraseña accesibles solo para el equipo de investigación. La ética y el flujo de participantes se muestran en la Figura 1.
1. Reclutamiento de participantes y perfilado de referencia
Un total de 525 estudiantes fueron reclutados de cursos universitarios relacionados con inglés o traducción. Se incluyeron estudiantes de grado y posgrado de disciplinas como lingüística, literatura y estudios internacionales. Todos los voluntarios fueron evaluados antes de la inscripción. Solo se incluyeron a los estudiantes que estaban cursando un curso de inglés o traducción y que tenían al menos un nivel intermedio de inglés basado en los registros institucionales, cursos previos o evidencia académica equivalente. Se excluyeron a los estudiantes con amplia experiencia profesional en traducción. Se registraron edad, género, nivel académico, campo de estudio, experiencia previa con apoyo a la traducción asistida por IA y frecuencia base de uso de herramientas. Las características de los participantes se presentaron en la Tabla 1.
2. Diseño instruccional y flujo de trabajo de intervención
Se implementó una intervención en el aula de ocho semanas en la que la enseñanza convencional de traducción siguió siendo el modo principal de enseñanza y el apoyo a la traducción asistida por IA se utilizó como un andamiaje complementarioestructurado 11. En la Semana 0, se completó la evaluación inicial. Desde la Semana 1 hasta la Semana 8, se asignaba una tarea de traducción cada semana, y todos los participantes debían seguir la misma secuencia instructiva. Al final de la semana 8, se repitió la batería de evaluación utilizada al inicio. Tras la fase cuantitativa, se realizaron entrevistas semiestructuradas con un subgrupo seleccionado con fines teleológicos. El flujo de trabajo general se muestra en la Figura 2.
3. Evaluación de la línea base
Todas las medidas de referencia se administraron en un aula supervisada bajo instrucciones y condiciones de tiempo idénticas. Se utilizó una tarea de traducción basada en un texto fuente de unas 300 palabras. Se seleccionó un pasaje que contenía segmentos tanto literales como culturalmente matizados para que los estudiantes demostraran precisión léxica, control sintáctico, fidelidad semántica y comprensión contextual12. El uso de herramientas externas estaba prohibido durante las pruebas de referencia. Todos los guiones terminados se anonimizaban antes de la puntuación. Cada escritura fue puntuada de forma independiente por dos evaluadores formados utilizando una rúbrica que cubre la precisión léxica, la adecuación gramatical y sintáctica, la completitud semántica y la contextualización cultural. Si la discrepancia de puntuación superaba el rango de tolerancia predefinido, era necesario discutir hasta alcanzar una puntuación de consenso.
Tras la tarea de traducción, se aplicó y puntuó la Escala de Estrés Percibido de 10 ítems según el procedimiento estándar, con puntuaciones más altas indicando un mayor estréspercibido 13. A continuación, se aplicó y se puntuó la escala de 7 ítems para el Trastorno de Ansiedad Generalizada utilizando el método publicado, con puntuaciones más altas indicando una mayor severidad dela ansiedad 14. Finalmente, se administró una breve medida de confianza en la traducción utilizando un formato Likert de cinco puntos. Los ítems representativos, los rangos de puntuación y las definiciones de variables se proporcionaron en la Tabla 2.
4. Integración semanal estandarizada del soporte de traducción asistida por IA
Durante cada semana de intervención, se asignaba una tarea de traducción que se ajustaba lo más posible en género y dificultad a las otras tareas semanales. Los estudiantes debían completar la tarea en el mismo orden cada semana. Primero, el texto fuente se leía de forma independiente y se marcaban elementos léxicos difíciles, estructuras sintácticas o expresiones cargadas culturalmente. En segundo lugar, se preparó un borrador inicial o una breve nota describiendo los problemas de traducción previstos. En tercer lugar, la consulta de sistemas de traducción asistida por IA aprobados solo se permitía durante la redacción y la revisión. No se permitía la entrega directa de la salida generada por máquina sin editar.
Se requería que los estudiantes evaluaran todas las sugerencias de máquinas retenidas o rechazadas utilizando los mismos cuatro criterios cada semana: ajuste léxico, naturalidad sintáctica, coherencia del discurso y adecuación cultural. Para cada tarea semanal se requería la entrega del texto fuente marcado, el borrador asistido por máquina y la traducción revisada final. Tras la entrega, se organizó una discusión estructurada entre compañeros utilizando los mismos temas cada semana para que los estudiantes explicaran dónde la salida automatizada era útil, engañosa, demasiado literal o inapropiada en el contexto. Este diseño sigue la evidencia actual que muestra que la traducción automática es más útil desde el punto de vista educativo cuando se integra en comparación y revisión guiada, en lugar de usarse como sustituto del juicio humano15.
5. Monitorización y categorización del uso de herramientas
El uso de herramientas asistidas por IA se realizó durante toda la intervención de ocho semanas. Después de cada tarea semanal, los participantes debían completar un breve registro de uso en línea informando si se utilizó soporte automatizado, qué función servía, con qué frecuencia se consultaba y en qué momento entraba en el proceso de traducción. Se proporcionaron categorías de respuesta estandarizadas en la Semana 1 para que los participantes utilizaran los mismos criterios de reporte durante todo el estudio. Al final de la Semana 8, los registros semanales se agregaron y la frecuencia de uso general se clasificó como uso diario, semanal u ocasional. Las definiciones operativas de estas categorías se muestran en la Figura 3.
6. Evaluación posterior a la intervención
Al final de la Semana 8, se repitió la misma batería de evaluación que se usó al principio. Se utilizó un texto de traducción posterior a la intervención que se ajustó lo más posible al texto base en longitud, género y dificultad. Las condiciones administrativas, el momento, la rúbrica de evaluación y el flujo de trabajo del evaluador se mantuvieron consistentes con los procedimientos de referencia. Se aplicaron la misma Escala de Estrés Percibido, la misma escala de Trastorno de Ansiedad Generalizada y la misma medida de confianza en la traducción en el mismo orden que se usó al inicio.
7. Procedimientos cualitativos de entrevista y análisis temático
Tras la evaluación posterior a la intervención, 40 estudiantes fueron seleccionados de forma intencionada para entrevistas semiestructuradas, asegurando variación en género, nivel académico y experiencia previa con apoyo de traducción asistida por IA. Las entrevistas se realizaron presencialmente o mediante un formato aprobado de reunión online, utilizando la misma guía de entrevistas para todos los participantes. Se hicieron preguntas sobre estrategias de uso de herramientas, carga cognitiva percibida, cambios en la confianza, evaluación de la producción de la máquina y preocupaciones sobre la sobredependencia. Todas las entrevistas fueron grabadas en audio con el consentimiento de los participantes y transcritas textualmente.
Las transcripciones se analizaron mediante análisis temático. Se pidió a dos investigadores que leyeran todas las transcripciones de forma independiente, generaran códigos iniciales, compararan los resultados de codificación, fusionaran códigos superpuestos y refinaran temas candidatos mediante revisiones repetidas de las transcripciones. Tras la fase inicial de codificación, se calculó el acuerdo entre evaluadores y se reportó el kappa de Cohen. La lógica analítica siguió procedimientos establecidos para el análisis temático en la investigacióncualitativa 16.
8. Análisis cuantitativo y de métodos mixtos
Se utilizaron estadísticas descriptivas para resumir las características de los participantes y las puntuaciones iniciales. Se utilizaron comparaciones de muestras emparejadas para evaluar las diferencias previas a la post-publicación en la precisión de la traducción, el estrés percibido, la ansiedad y la confianza. Se utilizaron múltiples modelos de regresión para identificar predictores de la precisión de la traducción tras la intervención, con el rendimiento inicial, la frecuencia de uso de herramientas asistidas por IA y variables psicológicas introducidas como variables independientes. Se utilizaron pruebas de chi cuadrado para examinar asociaciones entre categorías de uso y resultados categóricos, y los coeficientes de correlación de Pearson se emplearon para evaluar la dirección y la fuerza de las asociaciones entre la precisión de la traducción, la frecuencia de uso, el estrés percibido, la ansiedad y la confianza. La significación estadística se estableció en alfa = 0,05 mediante pruebas bilatérales. Los hallazgos cuantitativos y cualitativos se integraron en la fase de interpretación según procedimientos estándar de métodosmixtos 17.