Diseño de experimentos de enseñanza
Este estudio utilizó la versión básica de código abierto de DeepSeek, basándose en la interfaz de API abierta de la plataforma para las llamadas al programa. El conjunto completo de cinco textos de plantillas de indicaciones, cuatro niveles de ejemplos de tareas, etiquetas de categorías de anotación de transferencia y reglas de mapeo de coincidencia de plantillas de errores de redacción se compiló en el apéndice complementario. El sistema tenía parámetros de llamada fijos: un coeficiente de temperatura de 0.7, y la longitud generada se limitaba dinámicamente según el tipo de pregunta de redacción. Seguía estrictamente una secuencia fija de reconstrucción semántica > ajuste estilístico > adaptación cultural, ejecutando llamadas en cadena de indicaciones anidadas. La salida del modelo fue seleccionada manualmente por el instructor para obtener un texto efectivo en la enseñanza en el aula.
En este estudio se invitó a tres profesores universitarios de redacción en inglés a tiempo completo, con más de cinco años de experiencia, a participar en la calificación manual. Todos los evaluadores recibieron una formación estandarizada antes de la calificación oficial, familiarizándose con las dimensiones de evaluación, el sistema de puntuación de 5 puntos, la transferencia cultural, la sintaxis, el discurso y otros detalles de calificación, y completaron una calibración previa. Todos los ensayos de los estudiantes fueron calificados independientemente por dos profesores en un modo de doble calificación ciega. Si la diferencia entre las puntuaciones de los dos evaluadores superaba 1 punto (sobre 5), un tercer profesor senior actuaba como árbitro en la calificación, y el promedio de las dos puntuaciones válidas se tomaba como la puntuación manual final para esa muestra. Dos grupos de evaluadores participaron en la fase de evaluación con distintos fines de investigación. Tres profesores universitarios de redacción en inglés a tiempo completo, con más de cinco años de experiencia docente, realizaron la doble calificación ciega de todas las muestras de redacción estudiantil en el experimento formal, y un tercer profesor senior actuó como árbitro cuando las discrepancias en la calificación superaban 1 punto en la escala de 5 puntos. En contraste, cinco evaluadores participaron en la prueba de fiabilidad interevaluador mediante el Coeficiente de Correlación Intraclase (ICC), realizada por separado para verificar la consistencia de los criterios de evaluación entre los evaluadores. La diferencia en el número de evaluadores se debe a requisitos funcionales distintos: los tres profesores principales garantizaron la calificación práctica de los datos experimentales, mientras que el panel ampliado de cinco evaluadores proporcionó evidencia más sólida sobre la fiabilidad de todo el sistema de evaluación.
La complejidad sintáctica, la puntuación de estructura del texto mediante BERT y la similitud semántica se puntúan todas en una escala de 0 a 5 puntos. Los pesos para cada dimensión se establecieron según los estándares de enseñanza e investigación en redacción en idiomas extranjeros: sintaxis 0,35, estructura del texto 0,35, y lógica y cultura 0,3. Los valores de peso se basaron en sistemas cuantitativos maduros de evaluación de redacción en el mismo campo. El módulo de calificación automática de IA se calibró utilizando umbrales basados en 15 ensayos modelo previamente clasificados. La calificación humana siguió una escala de calificación unificada de cinco puntos. La puntuación automatizada y la calibración humana se combinaron para una verificación previa al experimento antes de la evaluación formal.
La tarea docente se llevó a cabo en torno a los objetivos de transferencia de tres niveles «sintaxis-estructura-cultura», con tres rondas de entrenamiento, cada una con una duración de una semana. La primera ronda implicó la reescritura a nivel de oración para mejorar la diversidad sintáctica y la precisión expresiva; la segunda ronda consistió en la reconstrucción estructural a nivel de párrafo para mejorar la organización del párrafo y la coherencia lógica; la tercera ronda incluyó la transferencia a nivel cultural para fortalecer la conciencia pragmática intercultural y la adaptabilidad expresiva. Dado que se recopilaron mediciones repetidas de los mismos participantes a lo largo de una prueba previa, tres rondas secuenciales de entrenamiento y una prueba posterior, se adoptó el análisis de varianza de medidas repetidas (RM-ANOVA) como enfoque estadístico principal para examinar los efectos principales del grupo (experimental frente a control), los efectos principales del momento de la prueba, así como el efecto de interacción grupo × tiempo, que reflejaba si los cambios en las puntuaciones durante el entrenamiento diferían entre las dos cohortes. Se verificó el supuesto de esfericidad mediante la prueba de Mauchly; se aplicó la corrección de Greenhouse–Geisser si se violaba la esfericidad. Las pruebas t para muestras independientes se reservaron únicamente para comparaciones post hoc por pares entre grupos en puntos temporales individuales, mientras que la correlación de Pearson y la d de Cohen se utilizaron para la cuantificación de la consistencia en la puntuación y del tamaño del efecto, respectivamente.
Todos los análisis estadísticos se especificaron previamente antes de la recolección de datos. Se utilizaron pruebas t para muestras independientes para comparar los indicadores de escritura antes y después entre dos grupos, asumiendo como hipótesis nula principal que no existen diferencias entre grupos en el rendimiento de transferencia escrita. Se empleó el análisis de correlación de Pearson para cuantificar la asociación lineal entre la calificación automática mediante IA y las evaluaciones manuales del profesor, y se calculó la d de Cohen como tamaño del efecto estandarizado para las comparaciones entre grupos. El umbral de significancia se estableció en α = 0,05 para todas las pruebas de hipótesis, y se calcularon intervalos de confianza del 95 % junto con todas las estadísticas de prueba. Se utilizó SPSS 26.0 para realizar todos los cálculos estadísticos. No hubo datos faltantes en las puntuaciones de las pruebas estudiantiles ni en los conjuntos de datos del cuestionario, ya que todos los participantes completaron la formación completa de tres rondas y las evaluaciones correspondientes; por lo tanto, no fue necesario realizar imputación ni eliminación de casos por valores faltantes.
Construcción del sistema de índices de evaluación
Para evaluar exhaustivamente el desempeño de los estudiantes en el entrenamiento de transferencia escrita en inglés, este estudio construyó un sistema de evaluación multidimensional que abarcó los objetivos de transferencia de tres niveles: «sintaxis-estructura-cultura», integró la capacidad lingüística, la respuesta del modelo, la retroalimentación docente y la autorreflexión, y estableció seis indicadores principales. En primer lugar, el «índice de transferencia escrita» fue un indicador de evaluación integral que incluyó la diversidad sintáctica, la claridad estructural y la adaptabilidad cultural, combinando la calificación automática del sistema y la calificación manual del profesor para un análisis cuantitativo. La «puntuación de complejidad sintáctica» utilizó tecnología de procesamiento de lenguaje natural para extraer características como la longitud promedio de las oraciones, el número de niveles de anidamiento de cláusulas y la frecuencia de uso de frases verbales, con el fin de evaluar la riqueza y complejidad de las oraciones de los estudiantes. El análisis de «coincidencia con el estilo académico» examinó la proporción de uso de voz pasiva y la proporción de vocabulario formal, basándose en un modelo de PLN (Procesamiento de Lenguaje Natural), para determinar si el texto cumplía con las normas estilísticas de la escritura académica en inglés. Además, el estudio introdujo una dimensión de evaluación subjetiva, recopilando mediante cuestionarios a docentes sus opiniones sobre la aceptación y la utilidad práctica de las sugerencias generadas por el modelo, con el fin de evaluar el impacto real del aprendizaje asistido por inteligencia artificial. Los «cambios en las calificaciones de revisión docente» reflejaron el impacto del aprendizaje asistido por IA en la mejora de la calidad de la escritura, comparando las calificaciones que los profesores asignaron a los ensayos de los estudiantes antes y después del experimento. Por último, la «autoevaluación estudiantil de la capacidad de transferencia» utilizó la tabla de cognición de transferencia para guiar a los estudiantes en la autoevaluación de su dominio de aspectos como estructura, sintaxis y cultura, fortaleciendo así su conciencia metacognitiva y sus habilidades de reflexión. Las descripciones específicas y las fuentes de datos de cada indicador se muestran en Tabla 3.
Los indicadores sintácticos y estilísticos se calcularon automáticamente mediante análisis de dependencias y clasificación basada en BERT, con puntuaciones normalizadas que oscilan entre 0 y 5; la evaluación manual utiliza una escala de 5 puntos. Las fórmulas de cálculo para la complejidad sintáctica utilizaron el número total de palabras dividido por el número de cláusulas como denominador principal. Fuente de datos original: composiciones escritas del pretest y del posttest de los 60 estudiantes inscritos.
Resultados experimentales y análisis
Para presentar de manera intuitiva las diferencias integrales del desempeño de los estudiantes en las tres dimensiones de transferencia sintáctica, transferencia estructural y transferencia cultural, la Figura 3 compara el índice promedio de transferencia escrita de los estudiantes en el grupo experimental y el grupo de control antes y después del experimento: la Figura 3 muestra la diferencia en las puntuaciones promedio entre el grupo experimental y el grupo de control en las tres dimensiones de transferencia sintáctica, transferencia estructural y transferencia cultural. El grupo experimental mostró una mejora significativa en la capacidad de transferencia en cada dimensión tras el experimento, y el círculo exterior del gráfico de radar es notablemente más grande que el círculo interior, lo que indica que el método de optimización de instrucciones basado en el modelo DeepSeek tiene un efecto positivo en la promoción del desarrollo de la capacidad de transferencia escrita en inglés de los estudiantes. En contraste, los diversos indicadores de capacidad de transferencia del grupo de control permanecieron relativamente sin cambios antes y después del experimento. La mejora general fue limitada, lo que indica que los métodos de enseñanza tradicionales o las herramientas asistidas por IA que no habían optimizado las instrucciones del sistema tienen un papel limitado en el entrenamiento de la transferencia. Resultó difícil estimular eficazmente el potencial de aprendizaje de los estudiantes en la transferencia lingüística multidimensional.
Los índices promedio de transferencia escrita del grupo experimental en las dimensiones de transferencia sintáctica, transferencia estructural y transferencia cultural antes del experimento fueron 3,0, 2,9 y 2,8, respectivamente, los cuales aumentaron a 4,3, 4,1 y 4,5 tras el experimento, con incrementos de 1,3, 1,2 y 1,7 respectivamente, lo que indica que el método de enseñanza tuvo un buen efecto de intervención en distintos niveles de transferencia. Las puntuaciones del grupo control antes del experimento fueron 3,0, 3,0 y 2,9. Después del experimento, los valores aumentaron a 3,4, 3,3 y 3,2 respectivamente, valores significativamente más bajos que los del grupo experimental. Es particularmente notable que, en la dimensión de transferencia cultural, el grupo experimental mostró la mejora más significativa, al pasar de 2,8 a 4,5, un incremento de 1,7 puntos, considerablemente mayor que el aumento de 0,3 puntos del grupo control. Este resultado sugiere que el método de enseñanza propuesto desempeña un papel importante para ayudar a los estudiantes a identificar y adaptarse a las normas de expresión cultural en inglés. Esto no solo se reflejó en ajustes a la forma lingüística, sino también en el fortalecimiento de la conciencia pragmática intercultural de los estudiantes y en la profundidad de su comprensión de los hábitos de expresión cultural del idioma de destino. La transferencia lingüística se reflejó principalmente en la complejidad sintáctica, la adaptación del estilo lingüístico y otros aspectos. El estudio utilizó tecnología automatizada de PLN para realizar un análisis profundo de los textos escritos por los estudiantes, extraer características lingüísticas clave y combinarlas con las calificaciones de los profesores para evaluar sistemáticamente los cambios en la capacidad de transferencia lingüística de los estudiantes a lo largo de tres rondas de tareas.
Complejidad sintáctica y estilo lingüístico
En cuanto a la complejidad sintáctica, el estudio registró la longitud promedio de las oraciones y el número de niveles de anidamiento de cláusulas en los textos generados por los estudiantes tras completar la tarea de escritura designada en cada ronda de actividades. Estos dos indicadores se utilizaron ampliamente para medir la complejidad de la expresión lingüística. Reflejaron eficazmente el nivel de desarrollo de los estudiantes en diversidad de oraciones y capacidad de organización estructural, como se muestra en Figura 4.
En la evolución longitudinal de la complejidad sintáctica, el grupo experimental mostró una clara tendencia ascendente en las tres rondas de tareas, lo que refleja la promoción efectiva del entrenamiento de transferencia en la capacidad de los estudiantes para expresar su estructura lingüística. Desde la perspectiva de la longitud media de la oración, el grupo experimental aumentó de 12,5 palabras en la Tarea 1 a 16,1 palabras en la Tarea 3, lo que representa un incremento de 3,6 palabras, significativamente mayor que el aumento del grupo de control, que solo fue de 0,9 palabras en el mismo periodo (de 12,4 a 13,3). De manera similar, desde la perspectiva de la dimensión de complejidad estructural, medida por el número de niveles de anidamiento de cláusulas, el grupo experimental pasó de 1,8 niveles a 2,7 niveles, mientras que el grupo de control aumentó de 1,7 a 1,9 niveles, con un incremento relativamente lento. Para verificar más a fondo si la diferencia en complejidad sintáctica entre ambos grupos de estudiantes es estadísticamente significativa, el estudio utilizó pruebas t de muestras independientes para analizar la longitud media de la oración y el número de niveles de anidamiento de cláusulas en las tres etapas de la tarea. Los resultados mostraron que existe una diferencia significativa entre el grupo experimental y el grupo de control en cuanto a la longitud media de la oración, t(58) = 4,23, p < 0,001, d de Cohen = 0,98; también hubo una diferencia significativa en el número de niveles de anidamiento de cláusulas, t(58) = 3,15, p = 0,002, d de Cohen = 0,78. Esta comparación mostró que el entrenamiento sistemático de transferencia no solo mejoró la capacidad de los estudiantes para construir oraciones complejas, sino que también reforzó su dominio de las estrategias de organización gramatical. En particular, durante la tercera etapa de la tarea, los estudiantes del grupo experimental demostraron mayor flexibilidad en el uso de cláusulas de múltiples niveles y estructuras oracionales complejas. Esto reflejó un cambio notable en su transferencia lingüística, pasando de un nivel «funcional» a un nivel más «estratégico». La vía de entrenamiento orientada a la transferencia mejoró continuamente las habilidades sintácticas de transferencia de los estudiantes, superando eficazmente las limitaciones de la escritura de oraciones aisladas y los patrones de expresión fijos que suelen observarse en la enseñanza tradicional. En cuanto a la adaptación del estilo lingüístico, el estudio extrajo los textos escritos por los estudiantes antes y después del experimento. Utilizó el modelo de PLN (procesamiento del lenguaje natural) para determinar la proporción de vocabulario formal y la frecuencia de uso de la voz pasiva como indicadores principales para evaluar la adecuación al estilo lingüístico académico. Estos indicadores reflejaron si los estudiantes poseen la conciencia lingüística y la capacidad expresiva necesarias para adaptarse al estilo objetivo en la escritura en inglés. Los resultados correspondientes se muestran en Figura 5.
Figura 5 muestra los cambios en la coincidencia de estilo académico del grupo experimental y del grupo de control antes y después de la tarea, centrándose principalmente en dos indicadores clave: la proporción de vocabulario formal y la frecuencia de uso de la voz pasiva. En general, tras completar el entrenamiento de transferencia basado en el modelo DeepSeek, la capacidad de adaptación al estilo académico del grupo experimental mejoró significativamente, lo que demuestra la eficacia de este método de enseñanza para fomentar en los estudiantes la conciencia sobre las normas lingüísticas y su habilidad para adaptarse a estilos académicos. En cuanto a la proporción de vocabulario formal, el grupo experimental aumentó de 0,42 antes de la tarea a 0,56 después, un incremento relativamente notable. En contraste, el grupo de control aumentó solo ligeramente, de 0,43 a 0,48, lo que sugiere una mejora limitada. Este resultado indica que, tras recibir orientación sistemática mediante indicaciones y retroalimentación del modelo, los estudiantes del grupo experimental mostraron mayor tendencia a utilizar un vocabulario formal acorde con los requisitos del estilo académico durante el proceso de escritura, y su estilo lingüístico se aproximó progresivamente a los estándares de la escritura académica en inglés. En cuanto a la frecuencia de uso de la voz pasiva, el grupo experimental aumentó significativamente de 0,18 antes de la tarea a 0,27 después, lo que representa un incremento de 0,09; en contraste, el grupo de control aumentó únicamente en 0,02.
Para verificar aún más si los cambios anteriores son estadísticamente significativos, el estudio realizó una prueba t para muestras independientes con los datos antes y después de la tarea. Los resultados mostraron que el grupo experimental tuvo una mejora significativa en la proporción de vocabulario formal, t(58) = 3,89, p < 0,001, d de Cohen = 0,92; el aumento en la frecuencia de uso de la voz pasiva también fue significativo, t(58) = 4,56, p < 0,001, d de Cohen = 1,05. Esto indicó que los estudiantes del grupo experimental habían progresado sustancialmente en la adaptación del estilo lingüístico, y que este progreso no fue fortuito, sino el resultado del efecto combinado de la orientación sistemática mediante indicaciones y la retroalimentación del modelo.
Verificación estadística
Además, para verificar aún más la fiabilidad del contenido generado por inteligencia artificial (IA) en la práctica docente, el estudio también comparó los puntajes promedio del contenido generado por IA y del contenido generado por profesores bajo diferentes tipos de instrucciones. La consistencia entre ambos se evaluó calculando el coeficiente de correlación de Pearson. Los resultados comparativos relevantes se muestran en Tabla 4. La Tabla 4 muestra la consistencia entre el contenido generado por IA y los puntajes otorgados por profesores en cinco tipos de instrucciones orientadas a la transferencia. Desde la perspectiva del puntaje medio, el puntaje de la IA fue ligeramente inferior al del profesor en general, pero la diferencia estuvo dentro de un rango razonable en la mayoría de los tipos de tareas, lo que indica que el modelo DeepSeek presenta alta estabilidad y valor de referencia al evaluar tareas de transferencia escrita. Bajo la instrucción de transferencia sintáctica, el puntaje promedio del profesor fue de 4,1 y el de la IA fue de 4,0, con una diferencia de solo 0,1 entre ambos. En las instrucciones de transferencia estructural y lógica, el puntaje de la IA fue solo 0,1 puntos menor que el del profesor, lo que indica que el modelo puede simular adecuadamente los criterios de evaluación del profesor en estas tareas, que implican un alto grado de estructura lingüística y reglas claras. En contraste, las desviaciones en los puntajes bajo las instrucciones de transferencia cultural y de registro son relativamente evidentes, con puntajes de IA de 3,6 y 3,7, respectivamente, que son 0,2 puntos menores que los puntajes del profesor, lo que refleja que la IA aún presenta ciertas limitaciones al abordar tareas con alto grado de subjetividad, como las implicaciones semánticas y la pragmática cultural. La fiabilidad entre evaluadores se evaluó mediante el coeficiente de correlación intraclase (ICC) (n = 5 evaluadores). El ICC general para la calificación manual fue de 0,86, y los ICC por cada dimensión oscilaron entre 0,82 y 0,89, lo que indica una concordancia satisfactoria entre evaluadores.
Un análisis adicional del coeficiente de correlación de Pearson reveló que la consistencia de las puntuaciones bajo diversos estímulos fue muy alta, lo que indica que la puntuación de la IA no solo era cercana al juicio del profesor en cuanto al valor, sino que también presentaba una buena relación lineal en su tendencia de calificación. Entre ellos, el coeficiente de consistencia del estímulo de transferencia sintáctica fue el más alto, con 0,87, mientras que los estímulos de transferencia estructural y transferencia lógica fueron de 0,83 y 0,85, respectivamente, lo que indica que los resultados de evaluación de la IA en cuanto a complejidad sintáctica, organización de párrafos y coherencia lógica son altamente consistentes con el juicio del profesor. Esto podría deberse a que estas tareas tienen objetivos claros y características lingüísticas cuantificables, lo que facilitó el reconocimiento por parte del modelo y un juicio estable. El coeficiente de correlación del estímulo de transferencia de dominio es de 0,81. Aunque disminuyó ligeramente, aún demuestra una capacidad de evaluación fuerte, lo que indica que la IA posee cierto grado de juicio a nivel de adaptación estilística. Sin embargo, el coeficiente de consistencia del estímulo de transferencia cultural fue de solo 0,79, lo cual es más bajo que los otros tipos, pero aún dentro de un rango aceptable.
Para examinar la aplicabilidad de diferentes tipos de indicaciones en la práctica docente y el grado de aceptación por parte de los profesores, se diseñó un cuestionario de satisfacción sobre la respuesta a indicaciones. Se invitó a cinco profesores de inglés (numerados T1–T5) a calificar las sugerencias generadas por cinco tipos de indicaciones utilizando una escala de cinco niveles (muy insatisfecho hasta muy satisfecho), como se muestra en Figura 6: las puntuaciones de los cinco profesores para los cinco tipos de indicaciones varían algo, pero en general el reconocimiento fue alto. Entre ellos, las indicaciones de "transferencia sintáctica" y "transferencia cultural" obtuvieron las puntuaciones más altas, con un promedio de 4,0, lo que refleja una alta practicidad y adaptabilidad en la enseñanza. En contraste, la indicación de "transferencia de registro" obtuvo puntuaciones relativamente bajas, con un promedio de solo 2,4, y algunos profesores, como T4 y T5, asignaron las puntuaciones más bajas, lo que indica que su orientación y adaptabilidad en aplicaciones docentes aún necesitan mejorarse.
A nivel individual, hubo diferencias evidentes en las tendencias de calificación de los profesores. La calificación general de T1 fue positiva, lo que indica un alto grado de aceptación de la escritura asistida por IA, mientras que las calificaciones de T5 fueron bajas en múltiples dimensiones de Prompt, especialmente en «transferencia de registro» y «transferencia lógica». Esta diferencia podría estar relacionada con la experiencia docente, la preferencia lingüística o la familiaridad de los profesores con las herramientas de IA, lo que sugiere que en el diseño futuro de Prompt será necesario considerar mecanismos de adaptación personalizada para aumentar la aceptación entre diferentes grupos de profesores. Para verificar más a fondo el efecto real de la enseñanza asistida por IA en la mejora de la calidad de escritura de los estudiantes, el estudio comparó los cambios en las calificaciones generales del grupo experimental y del grupo de control, evaluadas por los profesores, antes y después del experimento. Los resultados de la comparación se muestran en Figura 7.
Como se muestra en la Figura 7, las puntuaciones totales del grupo experimental y del grupo de control, evaluadas por los profesores antes y después del experimento, mostraron diferencias significativas. En general, tras la intervención docente basada en la optimización de la instrucción mediante el modelo DeepSeek, la puntuación total del grupo experimental presentó una marcada tendencia al alza. En contraste, el cambio de puntuación en el grupo de control fue relativamente moderado. La puntuación media otorgada por los profesores al grupo experimental antes del experimento fue de 59,1 puntos, y tras el experimento aumentó significativamente hasta 74,4 puntos, lo que representa un incremento de 15,3 puntos. Esto indicó que la enseñanza asistida por inteligencia artificial tuvo un impacto positivo en la calidad de la escritura de los estudiantes. A partir del gráfico de caja, se observó que el rango de distribución de las puntuaciones del grupo experimental también se amplió. En particular, la caja de puntuaciones tras el experimento es claramente más alta que antes, y los valores máximo superior y mínimo inferior han aumentado, lo que indica una mejora significativa en el nivel general de los estudiantes. En contraste, los cambios de puntuación en el grupo de control fueron relativamente limitados. Antes del experimento, la puntuación media del grupo de control fue de 60,1 puntos, y tras el experimento fue de 64,9 puntos, lo que representa un incremento de 4,8 puntos. Este aumento fue mucho menor que el del grupo experimental, y la caja de puntuaciones del grupo de control no cambió mucho antes y después del experimento, lo que indica que los métodos docentes tradicionales o las herramientas asistidas por IA no optimizadas tienen un efecto limitado en la mejora de la calidad de la escritura.
Además, este estudio utilizó la tabla de cognición de transferencia para guiar a los estudiantes a través de tres rondas de autoevaluación sobre su desarrollo de habilidades en ajuste estructural, transformación de oraciones y expresión cultural, entre otros aspectos, con el fin de reflejar la tendencia de cambio en la conciencia metacognitiva de los estudiantes y su dominio de las estrategias de transferencia. Los resultados se muestran en Figura 8. De acuerdo con los datos del gráfico radial sobre la autoevaluación de los estudiantes respecto a su capacidad de transferencia mostrados en Figura 8, la autoevaluación de los estudiantes en las cinco dimensiones —transferencia estructural, transferencia sintáctica, transferencia cultural, transferencia de registro y transferencia lógica— en las tres rondas de tareas mostró una tendencia de aumento continuo, lo que indica que, bajo la intervención docente con optimización instruccional basada en el modelo DeepSeek, la capacidad de los estudiantes para utilizar estrategias de transferencia mejoró significativamente. En la primera ronda de tareas, las puntuaciones de autoevaluación de los estudiantes fueron generalmente bajas. Entre las cinco dimensiones, la "transferencia estructural" y la "transferencia lógica" obtuvieron 3,2 y 3,0 puntos respectivamente, mientras que la "transferencia cultural" y la "transferencia de registro" obtuvieron 2,5 y 2,7 puntos, lo que indica que los estudiantes aún tenían dificultades para identificar y utilizar estrategias de transferencia. En la segunda ronda de tareas, las puntuaciones de cada ítem mejoraron: la "transferencia estructural" aumentó a 3,8, la "transferencia sintáctica" a 3,5 y la "transferencia lógica" a 3,7. Esto mostró que, con la orientación del profesor y el apoyo de las retroalimentaciones del modelo, los estudiantes fueron dominando gradualmente los aspectos clave de las operaciones básicas de transferencia y comenzaron a aplicarlas en la escritura real. En la tercera ronda de tareas, las puntuaciones de autoevaluación de los estudiantes aumentaron significativamente: la "transferencia estructural" y la "transferencia lógica" alcanzaron 4,5 y 4,3 puntos respectivamente, y las demás dimensiones también se estabilizaron por encima de 4,0 puntos, lo que evidencia el efecto sostenido de varias rondas de entrenamiento en transferencia para mejorar el control de los estudiantes sobre las formas lingüísticas y su capacidad de construcción textual. En esta etapa, los estudiantes ya habían formado un bucle cognitivo básico cerrado entre la comprensión, la ejecución y la reflexión sobre las estrategias de transferencia. Además de la retroalimentación del profesor, el estudio distribuyó un cuestionario de satisfacción sobre la función de escritura asistida por IA a todos los estudiantes del grupo experimental, y se recopilaron un total de 30 cuestionarios válidos. El cuestionario evaluó el desempeño de la IA en tres módulos funcionales: sugerencias de reescritura, optimización estructural y ayudas culturales, y solicitaba a los estudiantes seleccionar opciones según cinco niveles de criterios. Los resultados se muestran en Tabla 5.
De acuerdo con los resultados de la encuesta de satisfacción estudiantil sobre las funciones de escritura asistida por IA que se muestran en la Tabla 5, los estudiantes del grupo experimental hicieron comentarios generalmente positivos sobre el desempeño de la IA en los tres módulos funcionales de sugerencias de reescritura, optimización estructural y sugerencias culturales, lo que muestra las buenas perspectivas de aplicación de los sistemas de escritura asistida por IA para mejorar la eficiencia del entrenamiento en escritura y la calidad del apoyo docente. En conjunto, más del 90 % de los estudiantes expresaron estar «muy satisfechos» o «satisfechos» en los dos ítems funcionales de «sugerencias de reescritura» y «optimización estructural», entre los cuales «sugerencias de reescritura» obtuvo el nivel más alto de satisfacción, alcanzando el 91 %, lo que indica que los estudiantes reconocieron ampliamente la capacidad de la IA en la reconstrucción sintáctica y el pulido lingüístico. En comparación, la satisfacción con la función de «sugerencias culturales» fue relativamente menor, aunque alcanzó el 83 %, lo que indica que, si bien la IA enfrenta cierta complejidad y subjetividad al orientar la expresión intercultural, su papel en ayudar a los estudiantes a identificar y ajustar las interferencias culturales propias del idioma materno aún fue reconocido por la mayoría. En cuanto a la insatisfacción, el porcentaje de estudiantes que eligieron «insatisfecho» o «muy insatisfecho» en las tres funciones fue inferior al 5 %, lo que indica que las funciones asistidas por IA tuvieron una buena usabilidad y aceptación en la mayoría de los escenarios de aplicación. Cabe destacar que la proporción de estudiantes que calificaron como «regular» en el ítem «sugerencias culturales» fue relativamente alta, lo que sugiere que la IA actual podría no cumplir plenamente con las expectativas de los estudiantes al abordar cuestiones de adaptación cultural, y aún existe margen de mejora. Un análisis integral revela que el método de optimización de instrucciones basado en DeepSeek ha sido ampliamente reconocido por los estudiantes, especialmente por su apoyo a la forma lingüística.
ANOVA de medidas repetidas
Se realizó un análisis de varianza de medidas repetidas de dos vías (RM-ANOVA) para examinar los efectos del grupo (factor entre sujetos: grupo experimental frente al grupo control) y el tiempo (factor intra-sujetos: preprueba, Tarea 1, Tarea 2, Tarea 3, postprueba), así como su interacción sobre el rendimiento de transferencia en la escritura en inglés de los estudiantes. La prueba de Mauchly indicó una violación del supuesto de esfericidad (p < 0,05), por lo que se aplicó la corrección de Greenhouse–Geisser para ajustar los grados de libertad de los efectos intra-sujetos. Todos los análisis se basaron en n = 30 participantes por grupo. Los resultados se muestran en Tabla 6:
Los resultados del ANOVA de medidas repetidas con corrección de Greenhouse–Geisser indicaron efectos principales significativos del Grupo, el Tiempo y la interacción Grupo × Tiempo en todas las dimensiones medidas (p < 0,001). Para el Índice de Transferencia General, se observó un efecto principal significativo del Grupo (F(1,58) = 76,32), junto con un efecto significativo del Tiempo (F(2,14,124,12) = 92,75) y una interacción Grupo × Tiempo significativa (F(2,14,124,12) = 68,49), lo que sugiere que los cambios en el rendimiento general de transferencia a lo largo del tiempo difirieron significativamente entre los grupos.
De manera similar, la transferencia sintáctica mostró efectos significativos del Grupo (F(1,58) = 52,18), del Tiempo (F(2,11,122,38) = 71,26) y de la interacción Grupo × Tiempo (F(2,11,122,38) = 45,73), lo que indica patrones diferenciales de desarrollo en la capacidad de transferencia sintáctica entre los grupos y los puntos de medición. Para la Transferencia Estructural, también se identificaron efectos significativos del Grupo (F(1,58)=48,65), del Tiempo (F(2,09,121,22) = 67,81) y de la interacción (F(2,09,121,22) = 41,36), reflejando mejoras consistentes con trayectorias dependientes del grupo. Notablemente, la Transferencia Cultural presentó los efectos más fuertes, con un efecto significativo del Grupo (F(1,58) = 81,44), un efecto pronunciado del Tiempo (F(2,07,119,96) = 98,52) y una interacción Grupo × Tiempo robusta (F(2,07,119,96) = 79,27), lo que sugiere el patrón de crecimiento más sustancial y diferenciado en esta dimensión. En general, todos los índices muestran efectos estadísticamente significativos, confirmando que la intervención ejerció un impacto estable y diferenciado sobre el desarrollo de la transferencia a lo largo del tiempo.
DISPONIBILIDAD DE LOS DATOS:
Todos los datos generados o analizados durante este estudio se incluyen en este artículo. Los datos brutos de evaluación se proporcionan en Tabla Suplementaria 1.

Figura 1: Pasos para la transformación de la estructura de la oración. (A) Estrategias para combinar y fortalecer verbos con el fin de mejorar la estructura de la oración. (B) Transformaciones alternativas del sujeto, incluyendo sujetos en forma de gerundio, infinitivo y nominalizados. (C) Uso de frases no finitas para aumentar la variedad y concisión de la oración. (D) Ejemplos de versiones finales pulidas que demuestran un estilo académico mejorado y una expresión en inglés intercultural. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Diagrama del árbol evolutivo de tareas. Presenta la estructura progresiva de tareas de transferencia de cuatro niveles, que van desde el nivel de oración, párrafo, discurso hasta el nivel cultural. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Comparación de la capacidad de transferencia escrita antes y después del experimento. El gráfico de radar muestra las puntuaciones obtenidas antes y después del experimento en las dimensiones de transferencia sintáctica, estructural y cultural por parte del grupo experimental y del grupo control. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Gráfico de tendencia de complejidad sintáctica. Se muestra el cambio en la longitud promedio de las oraciones y en el número de niveles de anidamiento de cláusulas a lo largo de tres tareas de entrenamiento. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 5: Coincidencia de terminología académica. Esta figura muestra las variaciones en la proporción de vocabulario formal y la frecuencia de voz pasiva antes y después de la intervención. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Mapa de calor de satisfacción en las respuestas a las indicaciones. Aquí se resumen las calificaciones de cinco tipos de plantillas de indicaciones proporcionadas por los profesores participantes. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Gráfico de caja de los cambios en las calificaciones de los profesores. El gráfico de caja muestra la distribución y los cambios generales en las puntuaciones de escritura evaluadas por los profesores para dos grupos antes y después del experimento. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Gráfico radial de la capacidad de transferencia autoevaluada por los estudiantes. Muestra las puntuaciones de autoevaluación de los estudiantes en cinco dimensiones de transferencia durante tres rondas de entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.
| Entrada | Operación del docente | Tipo de indicio | Operación del estudiante | Salida | Criterios de evaluación |
| Borradres originales de escritura de los estudiantes (oraciones/párrafos/ensayos) | 1. Clasificar los tipos de transferencia y niveles de tarea 2. Ajustar los parámetros del indicio si es necesario | Indicio único de transferencia / Cadena anidada de indicio en tres etapas | 1. Aprender estrategias de transferencia 2. Revisar los borradres según la retroalimentación de la IA 3. Realizar la autoevaluación | Texto revisado por IA + borrador final revisado por el estudiante | Complejidad sintáctica, racionalidad estructural, adecuación cultural, coherencia lógica, normalización del registro (escala 0–5) |
Tabla 1: Tabla Resumen del Flujo de Trabajo. Esta tabla resume el flujo de trabajo operativo completo de la formación de transferencia de escritura en inglés asistida por IA, que abarca los materiales de entrada, las operaciones del profesor y del estudiante, los tipos de indicaciones, las salidas finales y los criterios de evaluación correspondientes.
| Categoría del proyecto | Contenido |
| Comprensión de los objetivos de la misión | Describa brevemente los objetivos de migración de esta ronda de tareas de redacción, como ajuste estructural, adaptación cultural y conversión del lenguaje. |
| Estrategia de migración utilizada | Indique las estrategias de migración que adoptó (se permiten selecciones múltiples): |
| Ajuste estructural |
| Transformación de oraciones |
| Cambio de lenguaje |
| Manifestación cultural |
| Fortalecimiento de la conexión lógica |
| Otra: _______ |
| Ejemplos y instrucciones de reescritura | Seleccione 1–2 oraciones reescritas, muestre las versiones antes y después de la reescritura, y explique las razones de los cambios y los objetivos deseados de transferencia. |
| Dificultades y dudas encontradas | Describa cualquier dificultad que haya encontrado durante la migración o preguntas que haya tenido sobre una expresión específica. |
Calificación de autoevaluación
(sobre 5 puntos) | Califique su reescritura del texto según los siguientes tres aspectos: |
| • Precisión en la aplicación de estrategias (/5) |
| • Naturalidad y fluidez de la expresión (/5) |
| • Adecuación cultural (/5) |
| Objetivos futuros de mejora en la redacción | Describa brevemente la transferibilidad que le gustaría reforzar u optimizar en la próxima ronda de entrenamiento |
Tabla 2: Tabla de cognición sobre transferencia. Se utiliza una escala de calificación del 1 al 5 (1 = sin dominio, 5 = dominio completo) para la autoevaluación por parte de los estudiantes de las estrategias de transferencia escrita.
| Nombre del indicador | Descripción | Fuente de datos |
| Índice de transferencia escrita (0–5) | Un indicador cuantitativo que mide de forma integral la capacidad de transferencia lingüística, que abarca tres niveles: sintaxis, estructura y cultura. | Calificación automática del sistema + calificación manual de los profesores |
| Puntuación de complejidad sintáctica | Incluye la longitud media de la oración, el número de incrustaciones de cláusulas, la riqueza de las frases verbales, etc. | Análisis automático de procesamiento de lenguaje natural (NLP) |
| Coincidencia con el estilo académico | ¿Cumple con los estándares de escritura académica en inglés? | Juicio del modelo de procesamiento de lenguaje natural |
| Satisfacción con la respuesta al estímulo | Aceptación y evaluación práctica por parte de los profesores de las sugerencias generadas por el modelo | Cuestionario para profesores |
| Cambios en la calificación de la revisión del profesor | Comparación de las calificaciones de los profesores antes y después del experimento para reflejar la mejora en la calidad de la escritura | Registros de calificaciones de los profesores |
| Capacidad de transferencia autoevaluada por los estudiantes | Los estudiantes evalúan por sí mismos su dominio de diferentes dimensiones de transferencia | Rellenar el formulario de conciencia sobre la transferencia |
Tabla 3: Resumen de los indicadores de evaluación, descripciones y fuentes de datos. Esta tabla aclara las definiciones, métodos de medición y fuentes originales de datos para cada indicador central de evaluación en este estudio.
| Tipo de indicio | Calificación promedio de los docentes | Promedio de la puntuación de IA | Coeficiente de correlación de Pearson |
| Transferencia estructural | 4 | 3.9 | 0.83 |
| Transferencia sintáctica | 4.1 | 4 | 0.87 |
| Transferencia cultural | 3.8 | 3.6 | 0.79 |
| Transferencia de registro | 3.9 | 3.7 | 0.81 |
| Transferencia lógica | 4.2 | 4.1 | 0.85 |
Tabla 4: Comparación de la consistencia entre el contenido generado por inteligencia artificial y las calificaciones de los profesores. Los resultados demuestran la consistencia entre el contenido generado por inteligencia artificial y las calificaciones de los profesores en diferentes tipos de instrucciones.
| Elementos de función | Muy satisfecho | Satisfecho | Regularmente | Insatisfecho | Muy insatisfecho |
| Sugerencia de reescritura | 66% | 25% | 7% | 1.50% | 0.50% |
| Optimización estructural | 60% | 30% | 7% | 2% | 1% |
| Consejos culturales | 55% | 28% | 12% | 3.50% | 1.50% |
Tabla 5: Estadísticas de la encuesta sobre la satisfacción de los estudiantes con las funciones asistidas por IA. Las estadísticas muestran la distribución de la satisfacción estudiantil respecto a las funciones de reescritura por IA, optimización estructural y prompts culturales.
| Medida | Grupo F(gl) | Tiempo F(gl)GG | Grupo × Tiempo F(gl)GG | p |
| Índice General de Transferencia | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| Transferencia Sintáctica | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| Transferencia Estructural | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| Transferencia Cultural | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
Tabla 6: Resumen de los resultados del ANOVA de medidas repetidas. Presenta los resultados del ANOVA de medidas repetidas de dos factores para el rendimiento general en la transferencia de escritura y sus tres subdimensiones, incluyendo los efectos principales del grupo, el tiempo y la interacción grupo por tiempo. Abreviaturas: GG = corrección de Greenhouse–Geisser.
Tabla suplementaria 1: Evaluación de los datos brutos. Incluye los datos brutos utilizados en todos los análisis de este estudio.Haga clic aquí para descargar este archivo.