Declaración ética
Este estudio se llevó a cabo de acuerdo con los estándares éticos del Comité de Revisión Institucional (IRB) de la Universidad de Chengdu, China (Aprobación: 202509). Todos los participantes proporcionaron su consentimiento informado por escrito antes de participar. El estudio se ajustó a las directrices institucionales para la investigación que involucra a sujetos humanos, garantizando la participación voluntaria, la confidencialidad y el derecho a retirarse en cualquier momento sin penalización.
Para mantener la confidencialidad, todos los datos recogidos fueron anonimizados mediante identificadores codificados, y la información personal se almacenó por separado de los datos de investigación en archivos protegidos por contraseña accesibles solo para los investigadores principales. El diseño del cuestionario incorporó medidas para minimizar la incomodidad psicológica, especialmente para preguntas sobre ansiedad, y a los participantes se les proporcionó información de contacto de los servicios de orientación universitaria en caso de que surgiera algún malestar por la participación en la encuesta. Para abordar posibles desequilibrios de poder en la relación profesor-alumno, el reclutamiento y la recopilación de datos fueron realizados por asistentes de investigación formados en lugar de docentes de curso, y se aseguró a los participantes que sus respuestas no afectarían a su rendimiento académico ni a su relación con el profesorado.
Este estudio empleó un diseño cuantitativo y transversal que involucró a 290 estudiantes chinos de grado en inglés inglés de una universidad pública. Se reclutó participantes de diversos años académicos y disciplinas mediante muestreo de conveniencia con representación proporcional y completó cuestionarios en papel en aulas controladas durante sesiones regulares, que requirieron aproximadamente 25 minutos. La batería de cuestionarios incluyó escalas validadas que midían el estilo de enseñanza, la alfabetización digital, el uso de ChatGPT, la motivación, la ansiedad y la creatividad. Para minimizar el sesgo, asistentes de investigación formados administraron los cuestionarios utilizando contramedidas procedimentales como la separación psicológica de los ítems. Tras la recogida de datos, las respuestas se analizaron utilizando software estadístico y software de Modelado de Ecuaciones Estructurales de Mínimos Cuadrados Parciales (PLS-SEM), incluyendo cribado de datos, evaluación de modelos de medición, pruebas de modelos estructurales y análisis de mediación mediante un procedimiento de arranque con 5.000 remuestramientos.
Diseño de investigación
Este estudio empleó un diseño de investigación cuantitativo y transversal para examinar las relaciones entre el estilo de enseñanza, el uso de ChatGPT, la alfabetización digital, la motivación, la ansiedad y la creatividad entre los estudiantes de EFL. Se consideró apropiado un enfoque transversal para capturar una instantánea de estas variables en un momento específico, permitiendo el análisis de sus interrelaciones sin las exigencias temporales de la investigación longitudinal. El diseño facilitó la prueba de un modelo de mediación hipotético en el que la motivación sirve como mecanismo que vincula el estilo de enseñanza, el uso de ChatGPT y la alfabetización digital para reducir la ansiedad y aumentar la creatividad.
Datos y muestra
El marco de muestreo consistió en todos los estudiantes de grado matriculados en cursos de Inglés como Lengua Extranjera (EFL) en una universidad pública de China durante el curso académico 2024–2025. Los criterios de elegibilidad requerían que los participantes fueran (a) hablantes nativos de chino, (b) estuvieran matriculados en al menos un curso obligatorio de EFL, y (c) no tuvieran formación formal previa en herramientas de aprendizaje de idiomas basadas en IA más allá de cursos generales. Se utilizó un enfoque estratificado de muestreo por conveniencia, con asignación proporcional entre los cursos académicos (primero, segundo, tercero, cuarto curso) y áreas disciplinarias (humanidades, ciencias sociales, ciencias naturales, ingeniería). Los tamaños objetivo de las comunidades se establecieron en un 25% por año académico y un 25% por área disciplinaria, basándose en la distribución general de estudiantes de la universidad. La muestra final estaba compuesta por 290 estudiantes de grado en lengua extranjera. De los 328 estudiantes a los que se les abordó durante las sesiones regulares, 11 declinaron participar (tasa de no participación = 3,4%) y 27 proporcionaron cuestionarios incompletos (tasa de respuesta incompleta = 8,2%), lo que dio una tasa de respuesta final utilizable del 88,4% (290/328). El cálculo a priori del tamaño de la muestra se realizó usando G*Power 3.1 con la familia de pruebas F, regresión múltiple lineal: modelo fijo, desviación R2 desde cero como prueba. Los parámetros de entrada fueron: tamaño del efecto f2 = 0,15 (tamaño medio convencional para investigación conductual), α err prob = 0,05, potencia (1-β err prob) = 0,95, y número de predictores = 3 (estilo de enseñanza, uso de ChatGPT, alfabetización digital) para el resultado de la motivación. El cálculo arrojó un tamaño mínimo de muestra requerido de 119 para detectar unR 2 significativo. Para tener en cuenta aún más el modelo completo de SEM (incluyendo caminos indirectos y variables endógenas adicionales), aplicamos la regla más conservadora de 10 casos por parámetro estimado. Con 29 parámetros estimados en nuestro modelo, el tamaño de muestra requerido era de 290, que coincide exactamente con la muestra final. Así, la muestra obtenida está totalmente potenciada tanto para análisis basados en regresión como para análisis SEM.
Participantes y procedimiento
Los participantes fueron reclutados mediante muestreo estratificado por conveniencia para garantizar la proporcionalidad entre los años académicos (primero a cuarto) y los antecedentes disciplinares (humanidades, ciencias e ingeniería). Los tamaños de los condominios en la muestra final fueron: estudiantes de primer curso (n = 72, 24,8%), estudiantes de segundo (n = 74, 25,5%), juniors (n = 71, 24,5%), cuarto curso (n = 73, 25,2%); y humanidades (n = 76, 26,2%), ciencias sociales (n = 68, 23,4%), ciencias naturales (n = 72, 24,8%), ingeniería (n = 74, 25,5%). La muestra estaba compuesta por un 62 % de mujeres y un 38 % de hombres, con una edad media de 20,3 años (DE = 1,7). La recogida de datos se realizaba durante las clases regulares de EFL. Asistentes de investigación formados administraban cuestionarios en papel en entornos de aula controlada para garantizar la estandarización. Antes de la administración de la encuesta, se informó a todos los estudiantes elegibles presentes en clase sobre el propósito del estudio, su naturaleza voluntaria y sus medidas de confidencialidad (respuestas anónimas, almacenamiento seguro de datos). Se excluyeron los estudiantes que no cumplieron los criterios de elegibilidad (n = 6, sin matrícula en EFL) o que declinaron la participación (n = 11); Las razones de la negativa incluyeron limitaciones de tiempo (n = 7) y la incomodidad con el uso de tecnología autoinformado (n = 4). La batería de cuestionarios tardó aproximadamente 25 minutos en completarse e incluyó escalas validadas para todos los constructos. Para mitigar el sesgo común del método, se aplicaron contramedidas procedimentales (por ejemplo, separación psicológica de ítems de la escala, anonimato de las respuestas). Además, el sesgo común por método se evaluó mediante la prueba de un solo factor de Harman, y el primer factor representó menos del 50% de la varianza total, lo que indica que el sesgo común por método no fue una preocupación principal en este estudio.
Medidas de estudio
Todas las escalas se adaptaron al contexto chino de la lengua extranjera extranjera mediante un riguroso procedimiento de traducción y adaptación. Dos investigadores bilingües tradujeron de forma independiente los elementos originales en inglés al chino, y un tercer investigador reconcilió discrepancias para producir una versión preliminar. Esta versión fue retrotraducida al inglés por dos traductores diferentes, y cualquier inconsistencia se resolvió mediante la discusión con el equipo de investigación. Las versiones chinas fueron luego probadas en piloto con 30 estudiantes de inglés inglés de grado (que no formaban parte de la muestra principal) para comprobar claridad y comprensión, lo que resultó en pequeños ajustes en la redacción. Para cada escala, las respuestas se recogieron en una escala de Likert de 5 puntos que iba de 1 (totalmente en desacuerdo) a 5 (totalmente de acuerdo). Se utilizaron puntuaciones sumadas o promediadas para cada constructo, con puntuaciones más altas indicando niveles más altos de la variable respectiva. Todas las escalas adaptadas se utilizaron con permiso de los autores originales o bajo términos de licencia abierta cuando correspondía. No se retiraron elementos de las escalas originales salvo donde se indica a continuación; La retención de elementos se basaba en cargas factoriales > 0,40 y relevancia teórica. En cuanto al uso de ChatGPT, el estudio evaluó la interacción auto-reportada de los estudiantes con la versión gratuita de ChatGPT (GPT-3.5/4 disponible por web o aplicación móvil durante el curso académico 2024–2025). Todos los participantes tenían acceso igualitario a la herramienta, ya que la universidad no restringía ChatGPT; sin embargo, el uso real variaba según el lugar. La escala medía la frecuencia de uso de ChatGPT (que iba de "nunca" a "diario"), los tipos de tareas de aprendizaje de idiomas para las que se empleaba (por ejemplo, ampliación de vocabulario, corrección gramatical, redacción de ensayos, práctica de conversación y corrección de errores) y la calidad percibida de la interacción (por ejemplo, utilidad, claridad de la retroalimentación). La escala no distinguía entre versiones específicas de ChatGPT, ya que las actualizaciones de versiones se produjeron durante el periodo de recogida de datos; en su lugar, los participantes informaron de la versión que usaron principalmente, con más del 90% reportando GPT-3,5 o GPT-4. A continuación se proporcionan ejemplos detallados de ítems y notas de adaptación para cada constructo.
Este estudio empleó escalas rigurosamente validadas, adaptadas cuidadosamente al contexto educativo EFL, para evaluar las variables clave: enfoques de enseñanza, competencia digital, integración con ChatGPT, ansiedad al aprender idiomas, motivación del alumnado y pensamiento creativo. Las herramientas de medición fueron elegidas por su fiabilidad demostrada y su capacidad para evaluar de forma exhaustiva cada constructo. Para examinar los métodos de enseñanza, la investigación utilizó una versión modificada del Inventario de Estilo de Enseñanza34 de Grasha, que evalúa cinco enfoques pedagógicos distintos: autoritativo, experto, Profesor modelo personal, facilitador y delegador. Para evaluar la alfabetización digital, el estudio incorporó una versión modificada de la escala desarrollada por Rodríguez-de-Dueños et al.35, que consta de 29 ítems en seis dominios clave: (1) alfabetización técnica, (2) alfabetización en protección de datos personales, (3) alfabetización en evaluación crítica, (4) alfabetización en seguridad de dispositivos, (5) alfabetización en procesamiento de información y (6) alfabetización en comunicación digital. Este marco multidimensional proporcionó una evaluación exhaustiva de las capacidades digitales de los estudiantes necesarias para la educación contemporánea. El uso de ChatGPT se evaluó utilizando una escala de 8 ítems adaptada de Abbas et al.36, centrándose en la interacción de los estudiantes con la herramienta de IA para tareas de aprendizaje de idiomas. Esta escala recoge el uso percibido y autoinformado de ChatGPT por parte de los estudiantes en tareas de aprendizaje de idiomas, en lugar de la frecuencia de uso objetivo. La ansiedad en el aula de lenguas extranjeras (FLCA) se midió utilizando una escala adaptada basada en Briesmaster yBriesmaster 37. Este instrumento examinó la ansiedad en tres dimensiones críticas: Aprensión en la Comunicación, Ansiedad en el Examen y Miedo a la Evaluación Negativa, con 10, 10 y 7 ítems, respectivamente. La motivación de los estudiantes se evaluó utilizando una escala adaptada de Kanoksilapatham et al.38, midiendo tres dimensiones clave: Promoción y prevención de la instrumentalidad, Etnocentrismo e integración, y Actitud hacia el aprendizaje del inglés. La báscula incluía un total de 20 elementos. La creatividad de los estudiantes de EFL se midió mediante una escala adaptada de Govindasamy et al.39, que evaluó cuatro dimensiones: Originalidad, Flexibilidad, Fluidez y Elaboración. Cada dimensión se medía usando tres ítems.
Métodos de análisis de datos
Los datos recogidos se analizaron utilizando un enfoque analítico en dos etapas que combina SPSS (Versión 27) y Modelado de Ecuaciones Estructurales de Mínimos Cuadrados Parciales (PLS-SEM) mediante software SmartPL. Se realizaron análisis iniciales de datos y análisis preliminares utilizando SPSS para examinar la calidad de los datos, incluyendo comprobaciones de valores faltantes, valores atípicos y supuestos de normalidad. Menos del 2% de los puntos de datos faltaban completamente al azar (MCAR), como confirmó la prueba MCAR de Little (χ2 = 18,24, p = 0,212), y se manejaron usando el algoritmo de expectativa-maximización para preservar el poder estadístico. El conjunto de datos demostró normalidad univariante aceptable (asimetría < |2|, kurtosis < |7|) y normalidad multivariante (coeficiente de Mardia = 18,37, p < 0,001), justificando el uso tanto de pruebas paramétricas como de PLS-SEM, que es robusta a la no normalidad. Aunque la normalidad univariante era aceptable, el coeficiente de Mardia indicaba una violación de la normalidad multivariante (p < 0,001). Sin embargo, esto no supone una preocupación ya que PLS-SEM es robusto a distribuciones de datos no normales.
El análisis de fiabilidad reveló una fuerte consistencia interna para todas las escalas (α > de Cronbach 0,82, fiabilidad compuesta > 0,85), mientras que el análisis factorial exploratorio confirmó las estructuras factoriales anticipadas con todos los elementos cargando limpiamente sobre sus respectivas construcciones (cargas > 0,65, cargas cruzadas < 0,40).
Para la prueba de hipótesis, PLS-SEM fue seleccionado frente al SEM basado en covarianza debido a su mejor manejo de modelos complejos con tamaños de muestra pequeños a medianos y su capacidad para maximizar la varianza explicada en constructos endógenos. El análisis siguió el procedimiento de dos pasos: primero evaluando el modelo de medición y luego evaluando el modelo estructural. El modelo de medición reflectiva demostró validez convergente adecuada (varianza media extraída > 0,50 para todos los constructos) y validez discriminante, confirmada tanto por el criterio de Fornell-Larcker como por la relación heterorasgo-monorasgo (HTMT < 0,85). En el modelo estructural, los coeficientes de trayectoria se estimaron mediante un procedimiento de arranque con 5.000 remuestreos para generar estimaciones estables e intervalos de confianza. El poder predictivo del modelo se evaluó mediante valores de R2 para variables endógenas (motivación = 0,53, ansiedad = 0,41, creatividad = 0,38) y relevancia predictiva (Q2 > 0), calculando tamaños de efecto (f2) para determinar el impacto sustantivo. Los análisis de mediación emplearon el método bootstrap corregido por sesgo para probar efectos indirectos, estableciendo una mediación significativa cuando los intervalos de confianza del 95% excluyeron cero.
Todos los constructos se modelaron como reflectivos (modo A) basándose en consideraciones teóricas, ya que se asumía que cada variable latente causaba sus indicadores observados. No se eliminaron elementos de ninguna escala, ya que todos los elementos mostraron cargas exteriores por encima del umbral de 0,50 (que iban de 0,62 a 0,89) y todos los valores medios de varianza extraída (AVE) superaron 0,50, confirmando la validez convergente. Para las pruebas de mediación, el modelo estructural incluyó caminos directos desde los tres antecedentes (estilo de enseñanza, uso de ChatGPT, alfabetización digital) hasta la motivación, desde la motivación hasta la ansiedad y desde la ansiedad hasta la creatividad. También se estimaron trayectorias directas desde antecedentes a ansiedad y desde antecedentes hacia creatividad para evaluar la mediación parcial frente a la total. La mediación completa se determinó basándose en los criterios de que (a) los efectos indirectos (antecedentes → motivación → ansiedad) eran significativos (intervalo de confianza bootstrap corregido por sesgo del 95% excluyendo cero), y (b) los efectos directos de los antecedentes de la ansiedad dejaron de ser significativos tras incluir al mediador, mientras que los efectos directos de los antecedentes a la creatividad nunca fueron significativos. Todos los análisis utilizaron el algoritmo PLS-SEM en SmartPLS 4 con esquema de ponderación de camino, iteraciones máximas establecidas en 300 y criterio de parada de 1,0e-7. El bootstrapping se realizó con 5.000 submuestras, intervalos de confianza corregidos por sesgo y acelerados (BCa) al 95%, y sin opción de cambios de signo. El ajuste al modelo se evaluó utilizando el residuo cuadrático medio de raíz estandarizado (SRMR = 0,061), que está por debajo del umbral recomendado de 0,08.