Artículo de método

Un flujo de trabajo reproducible de puntuación de encuestas y árbol de decisión C5.0 para clasificar el pensamiento de orden superior autoinformado en el aprendizaje apoyado por IA generativa

DOI:

10.3791/71447

5 de junio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo presenta un flujo de trabajo reproducible para recopilar datos de encuestas autoinformadas, puntuar variables relacionadas con el aprendiz, dicotomizar puntuaciones de pensamiento de orden superior y aplicar un árbol de decisión C5.0 para demostrar la clasificación interpretable del aprendiz en el aprendizaje académico apoyado por inteligencia artificial generativa.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La inteligencia artificial generativa se utiliza cada vez más en la educación superior, pero los investigadores aún necesitan procedimientos transparentes para recopilar, puntuar y organizar los datos de encuestas a nivel de alumno en este contexto que cambia rápidamente. Este artículo presenta un flujo de trabajo reproducible de puntuación de encuestas y árbol de decisión C5.0 para clasificar el pensamiento de orden superior autoinformado entre estudiantes universitarios que han utilizado herramientas de inteligencia artificial generativa para el aprendizaje académico. El protocolo abarca el reclutamiento de participantes, la administración de cuestionarios, el cribado de la calidad de respuesta, el cálculo de puntuaciones compuestas, la codificación binaria, la partición de pruebas de entrenamiento, la construcción de árboles C5.0, la poda, la exportación de resultados del modelo y la interpretación de rutas de clasificación basadas en nodos. El flujo de trabajo se demuestra utilizando un conjunto de datos de encuestas de una sola universidad con 776 estudiantes de grado recogido en China entre el 7 y el 15 de marzo de 2023. El pensamiento de orden superior se operacionaliza como una puntuación de cuestionario auto-reportada en lugar de como un rendimiento cognitivo observado directamente. En el conjunto de datos demostrativo, el árbol podado conservó ocho variables relacionadas con el aprendizaje: ansiedad por inteligencia artificial generativa, confianza en la inteligencia artificial generativa, uso problemático de smartphones, procrastinación académica, rendimiento académico, educación parental, emociones negativas y actitudes hacia la inteligencia artificial generativa. El modelo retenido alcanzó un 89,52% de precisión en el subconjunto de entrenamiento y un 86,21% en el subconjunto de pruebas. Sin embargo, la evaluación específica de la clase mostró un rendimiento desigual, con una llamada sustancialmente más débil para la clase Low-HOT que para la clase High-HOT. Por lo tanto, el árbol debe interpretarse como una demostración auxiliar e interpretable del flujo de trabajo, en lugar de como una herramienta de cribado validada. Este protocolo puede apoyar a investigadores que requieran un procedimiento documentado y repetible para el perfilado de aprendices basado en encuestas en entornos de aprendizaje apoyados por inteligencia artificial generativa.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El pensamiento de orden superior es una preocupación central en la educación superior porque se espera que el aprendizaje universitario vaya más allá del recuerdo de conocimientos fácticos hacia el análisis, la evaluación, la reflexión, la resolución de problemas y la creaciónde conocimiento. Revisiones posteriores de la taxonomía de Bloom aclararon aún más que el aprendizaje avanzado implica no solo recordar y comprender, sino también aplicar, analizar, evaluar y crear conocimiento en contextos cada vez máscomplejos 2. Esta distinción es importante para el protocolo actual porque el pensamiento de orden superior no se trata como una simple puntuación de logro, sino como un constructo a nivel de aprendiz que requiere una cuidadosa operativización antes de poder analizarse. En la investigación educativa, el pensamiento de orden superior también se ha relacionado con el razonamiento crítico, la monitorización metacognitiva y la transferencia del aprendizaje entre contextosproblemáticos 3. Para el aprendizaje apoyado por tecnología, este tema es especialmente importante porque los estudiantes a menudo necesitan conectar conceptos, evaluar la información generada y tomar decisiones durante actividades de resolución de problemas, en lugar de simplemente recibir contenidodidáctico 4.

La rápida expansión de la inteligencia artificial generativa ha hecho que la medición del pensamiento de orden superior sea más complicada. Las herramientas de inteligencia artificial generativa pueden producir texto, código, imágenes, explicaciones, resúmenes y otras formas de apoyo académico a partir de patrones aprendidos a partir de conjuntos de datos a granescala 5. Los grandes modelos de lenguaje, incluido ChatGPT, se hicieron especialmente visibles en la educación superior durante el periodo inicial de adopción pública a finales de 2022 y principios de 20236. En entornos académicos, los estudiantes pueden utilizar estas herramientas para la búsqueda de información, la explicación de conceptos, el desarrollo de esquemas, la generación de ideas, la revisión de trabajos, el apoyo en la traducción y otras actividades relacionadas con los cursos. Estos usos pueden reducir la carga de trabajo rutinaria, pero también pueden cambiar la forma en que los estudiantes asignan la atención, juzgan la calidad de la información y regulan su propio esfuerzo cognitivo. Por esta razón, la investigación sobre el aprendizaje apoyado por inteligencia artificial generativa requiere procedimientos que documenten claramente cómo se recogen, califican, codifican e interpretan las variables a nivel de aprendizaje.

Trabajos previos sobre aprendizaje digital y híbrido han demostrado que la tecnología puede apoyar el pensamiento de orden superior cuando los estudiantes permanecen activamente comprometidos con las tareas de aprendizaje en lugar de usar el entorno de formapasiva. 7. Los estudios de aprendizaje móvil y mejorado por tecnología han sugerido de manera similar que la interacción entre iguales, la percepción del aprendizaje y el compromiso activo son relevantes para las tendencias de pensamiento de orden superior delos estudiantes 8. También se han utilizado enfoques de minería de datos para explorar cómo los comportamientos de aprendizaje en línea se asocian con habilidades de pensamiento de orden superior, mostrando el valor de organizar los datos educativos en patrones interpretables para elaprendiz 9. Una parte sustancial de la investigación sobre el uso de la tecnología ha sido informada por el Modelo de Aceptación de la Tecnología, que explica el comportamiento de uso a través de la utilidad percibida y la facilidad de usopercibida 10. Sin embargo, el aprendizaje apoyado por inteligencia artificial generativa se diferencia de los contextos digitales anteriores porque los estudiantes interactúan con sistemas que generan respuestas abiertas, moldean la confianza y pueden estimular o reducir el compromiso crítico. Por lo tanto, un protocolo para este tema no solo debe registrar si los estudiantes aceptan la tecnología, sino también documentar cómo se preparan para su análisis indicadores emocionales, conductuales, académicos y contextuales.

Varias variables relacionadas con el aprendiz son especialmente relevantes en este contexto. La confianza en la inteligencia artificial puede influir en si los estudiantes dependen de la producción generada, la cuestionan o la integran en el trabajo académico conprecaución 11. La ansiedad hacia la tecnología o la inteligencia artificial también puede importar, aunque no debe interpretarse en una sola dirección sin precaución empírica12. El uso problemático de smartphones es otro indicador conductual relevante porque la atención fragmentada y la distracción relacionada con el dispositivo pueden interferir con el compromiso cognitivo sostenido durante el estudio13. Investigaciones más generales sobre aprendizaje sugieren además que las estrategias de aprendizaje autorregulado están asociadas con el rendimiento académico en entornos online y apoyados por tecnología14. La investigación basada en la indagación y el aprendizaje cooperativo también indican que el aprendizaje significativo depende de cómo los estudiantes participan en las tareas de aprendizaje, organizan la evidencia y construyenexplicaciones 15. Estas consideraciones apoyan el uso de un flujo de trabajo de encuestas multivariables en lugar de una medida limitada de la exposición a la inteligencia artificial generativa por sí sola.

La Teoría de la Carga Cognitiva proporciona una justificación adicional para documentar indicadores emocionales y conductuales en el mismo flujo de trabajo. Debido a que la memoria de trabajo es limitada, la información excesiva o mal organizada puede interferir con el aprendizaje y la resoluciónde problemas 16. En el aprendizaje apoyado por inteligencia artificial generativa, este problema se hace visible cuando los estudiantes se encuentran con abundantes resultados generados, explicaciones inconsistentes, sugerencias irrelevantes o fuentes de información en competencia. También se ha demostrado que la actividad emocional está relacionada con la carga cognitiva durante el aprendizaje multimedia, lo que sugiere que los estados afectivos pueden influir en cómo los estudiantes procesan la información en entornos ricos en tecnología17. Al mismo tiempo, las discusiones actuales sobre la inteligencia artificial general y la educación futura han enfatizado que la inteligencia artificial podría transformar las prácticas de aprendizaje más rápido de lo que los sistemas instruccionales tradicionales puedenadaptarse 18. Estas condiciones hacen necesario utilizar un método que registre no solo las actitudes tecnológicas, sino también la condición emocional, la autorregulación, el bagaje académico y las variables contextuales. En el flujo de trabajo actual, estas variables se tratan como indicadores de auto-informe, no como rastros conductuales observados directamente o mecanismos causales.

Una dificultad metodológica es que los perfiles de los aprendices rara vez se forman solo por una variable. Los datos de encuestas educativas suelen contener combinaciones en capas de indicadores emocionales, conductuales, académicos, contextuales y relacionados con la tecnología. Los modelos convencionales de regresión son útiles para estimar asociaciones netas, pero son menos intuitivos cuando el objetivo es mostrar ramificaciones condicionales, diferenciación de subgrupos y clasificación basada en reglas. El análisis de árboles de decisión proporciona un enfoque complementario porque recursivamente divide los casos en ramas interpretables y hace visible la secuencia de clasificación a través de estructuras denodos 19. En comparación con modelos de aprendizaje automático más complejos, un solo árbol de decisión es más fácil de inspeccionar, explicar y exportar como parte de un flujo de trabajo reproducible. En comparación con el modelado lineal estándar, puede mostrar cómo las combinaciones de indicadores del aprendiz forman caminos prácticos de clasificación en datoseducativos 20. Sin embargo, un solo árbol también es sensible al desequilibrio de clases, decisiones de particionamiento, ajustes de poda y características de muestra. Por esa razón, el árbol de decisión en este protocolo se utiliza como un paso auxiliar de clasificación interpretable, no como un motor de predicción universal o un modelocausal 21.

Este artículo presenta un flujo de trabajo reproducible de puntuación por encuestas y árbol de decisión C5.0 para clasificar el pensamiento de orden superior autoinformado en el aprendizaje académico apoyado por inteligencia artificial generativa. El flujo de trabajo se demuestra con un único conjunto de datos universitario de 776 estudiantes de grado recogido en China entre el 7 y el 15 de marzo de 2023. El resultado es una puntuación de cuestionario de pensamiento de orden superior auto-reportada que está dicotomizada para la clasificación auxiliar; No es una medida directa del rendimiento cognitivo demostrado. La exposición a la inteligencia artificial generativa en esta demostración se refiere al uso autoinformado por parte de los estudiantes de herramientas de inteligencia artificial generativa para actividades académicas relacionadas con los cursos durante las cuatro semanas anteriores, incluyendo búsqueda de información, explicación de conceptos, generación de ideas, redacción de esquemas y revisión de tareas. El uso de la herramienta no se verificó mediante registros de plataforma, historiales de avisos ni rastreos de actividad en tiempo real.

El propósito del protocolo no es afirmar que el árbol retenido se generalice a todas las instituciones, cohortes o entornos actuales de inteligencia artificial generativa. Esta precaución es necesaria porque los datos de demostración se recogieron en una universidad durante una ventana corta a principios de 2023, cuando la exposición de los estudiantes a la inteligencia artificial generativa aún se desarrollaba rápidamente. En cambio, la contribución del artículo radica en hacer que todo el procedimiento sea repetible: definir el contexto de la encuesta, administrar el cuestionario, filtrar respuestas, puntuar constructos, documentar la fiabilidad, aplicar una regla de codificación fija, particionar el conjunto de datos, entrenar y podar un árbol C5.0, exportar los resultados del modelo e interpretar rutas de clasificación basadas en nodos con atención al rendimiento específico de cada clase. Este flujo de trabajo centrado en el método puede ayudar a investigadores educativos, investigadores orientados al aula y analistas instruccionales a reproducir o adaptar un enfoque transparente para el perfilado de estudiantes basado en encuestas en el aprendizaje apoyado por inteligencia artificial generativa.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio, con participantes humanos, fue revisado y aprobado por el Comité de Ética de la Escuela de Ciencias de la Educación de la Universidad Normal de Yili (Referencia nº LZEDU2023003). El estudio se llevó a cabo del 7 al 15 de marzo de 2023. El comité determinó que el estudio cumplía los requisitos para la exención ética porque solo implicaba procedimientos anónimos y voluntarios de cuestionarios, sin ningún daño físico, psicológico o social para los participantes. Todos los participantes proporcionaron su consentimiento electrónico informado antes de completar el cuestionario.

Antes del análisis, sustituye los registros de los encuestados por números de caso no reversibles y elimina todos los identificadores directos. No conservar nombres, números de identificación de estudiantes, números de teléfono, nombres de cuenta, identificadores de clase, direcciones de Protocolo de Internet, identificadores de dispositivos ni marcadores de cuentas de plataforma en bruto en el archivo analítico. Utiliza solo información de control duplicada para el cribado de respuestas, y luego elimínala antes de bloquear el conjunto de datos analítico.

1. Establecer el entorno de la encuesta y el procedimiento de muestreo

  1. Definir el entorno de estudio y los criterios de elegibilidad
    1. Realizar la encuesta en la Universidad Politécnica de Liuzhou, Región Autónoma Zhuang de Guangxi, China, del 7 al 15 de marzo de 2023.
    2. Define la población objetivo como los estudiantes de grado actualmente matriculados en la universidad participante.
    3. Incluye a los estudiantes que informen haber utilizado al menos una herramienta de inteligencia artificial generativa para el aprendizaje académico relacionado con los cursos durante las 4 semanas anteriores.
    4. Define el uso académico elegible como búsqueda de información, explicación de conceptos, generación de ideas, redacción de esquemas, revisión de trabajos, apoyo en traducción, asistencia relacionada con el código u otras tareas relacionadas con el curso.
    5. Excluye a los estudiantes que reporten solo uso de entretenimiento, charlas casuales, experimentación no relacionada con el estudio u otro uso no relacionado con el curso.
    6. Excluir a los encuestados que no sean estudiantes actuales, no informar sobre el uso académico de inteligencia artificial generativa, rechazar el consentimiento electrónico informado ni presentar cuestionarios inválidos según las normas de selección a continuación.
    7. Registrar la exposición a la inteligencia artificial generativa mediante elementos de autoinforme que cubran la categoría o nombre de la herramienta, la frecuencia aproximada de uso durante las 4 semanas anteriores y las tareas académicas apoyadas por la herramienta. No trates estos datos de exposición como registros verificados de uso de plataformas.
  2. Construir el marco de muestreo y reclutar participantes
    1. Obtén el marco de muestreo de la institución de grado de la universidad participante. El marco cubre a más de 15.000 estudiantes repartidos en 46 especialidades.
    2. Aplicar muestreo aleatorio estratificado por categoría de especialidad y nivel de año para elaborar la lista de invitados, de modo que estudiantes de diferentes áreas disciplinarias y etapas de estudio estén representados en la muestra invitada.
    3. Aplica muestreo aleatorio estratificado por categoría principal y nivel de año para elaborar la lista de invitados.
    4. Invita a 800 estudiantes seleccionados mediante un aviso de reclutamiento estandarizado.
    5. Distribuye el código de respuesta rápida de la plataforma de cuestionarios online solo a los estudiantes invitados durante periodos no docentes, como los descansos o las sesiones de asesoramiento al alumno.
    6. Registra todo el proceso de selección y selección. En este flujo de trabajo, se invitó a 800 estudiantes y se devolvieron 792 cuestionarios. Se excluyeron dieciséis cuestionarios: 4 por uso no elegible de inteligencia artificial generativa, 3 por envío duplicado, 5 por tiempo de finalización por debajo del umbral mínimo y 4 por patrones de respuesta lineales inválidos. La muestra analítica final contenía 776 cuestionarios válidos.

2. Configurar procedimientos de administración de cuestionarios y privacidad de datos

  1. Configura el cuestionario online
    1. Crea y distribuye el cuestionario utilizando la plataforma de cuestionarios en línea, también conocida como Questionnaire Star.
    2. Habilitar la distribución rápida de códigos de respuesta, respuestas obligatorias por ítems de escala, exportación en tiempo de envío, comprobación de controles duplicados y exportación de hojas de cálculo.
    3. Bloquea el cuestionario dirigido al encuestado antes de recoger la primera respuesta válida. Mantén sin cambios la redacción de los ítems, el orden del artículo, los anclajes de respuesta, las instrucciones, las etiquetas de escala, el texto de consentimiento y la ruta de acceso durante todo el periodo de la encuesta.
    4. Pon todos los objetos de la escala como artículos necesarios. No utilices imputación post hoc para respuestas de escala.
    5. Habilitar el control de una sola presentación mediante la opción de plataforma menos identificable disponible. Utiliza marcadores generados solo a nivel de cuenta, dispositivo o plataforma para el filtro duplicado.
  2. Estandarizar las condiciones de completación
    1. Pide a los encuestados que completen el cuestionario de forma individual, de una sola sesión y sin discusión entre compañeros.
    2. Instruye a los encuestados a responder según su uso académico real de la inteligencia artificial generativa durante las 4 semanas anteriores.
    3. Pide a los encuestados que completen el cuestionario en un entorno tranquilo y eviten el cambio de dispositivo, pausas prolongadas o acceso repetido tras la entrega.
    4. Pon la ventana de tiempo de finalización prevista en 530 minutos. Utiliza el tiempo de finalización solo como indicador de calidad de respuesta.

3. Filtrar respuestas y bloquear el conjunto de datos analítico

  1. Exportar el archivo de respuesta en bruto
    1. Exporta el archivo en bruto del cuestionario desde la plataforma de cuestionarios online una vez que cierre la ventana de la encuesta.
    2. Preserva la exportación en bruto antes de la exclusión, la puntuación, la codificación o la construcción del modelo.
    3. Asignar números de caso no identificables a todos los registros devueltos antes de la selección. En este flujo de trabajo, asigna números de caso a los 792 cuestionarios devueltos.
  2. Aplicar reglas de exclusión por calidad de respuesta
    1. Excluye los registros sin consentimiento electrónico informado.
    2. Excluye los registros que no cumplan con el estado actual de estudiante o la elegibilidad académica.
    3. Excluye registros con respuestas no demográficas de escala después de la exportación. En este flujo de trabajo, los ajustes de respuesta obligatoria evitaban la falta de respuestas de escala.
    4. Utiliza un umbral medio de tiempo de finalización de 2 s por cada ítem cerrado para identificar registros que probablemente no reflejen lecturas y procesamiento de respuestas a nivel de ítem. Excluye los registros por debajo de este umbral.
    5. Inspecciona los registros completados en menos de 5 minutos o más de 30 minutos como posibles respuestas de baja calidad o interrumpidas. Conservar los registros fuera de esta ventana temporal solo cuando la comprobación de duplicados y la inspección del patrón de respuesta no indiquen que se completó inválidamente.
    6. Utiliza la respuesta en línea recta como un indicador adicional de calidad de respuesta. Excluye los registros en los que se selecciona la misma opción de respuesta para al menos el 90% de los elementos a escala Likert, ya que este patrón sugiere un compromiso limitado con el contenido del artículo.
    7. Excluye las presentaciones duplicadas basadas en marcadores duplicados de la plataforma y conserva el registro válido completo más antiguo.
    8. Conserva el cuestionario dirigido al encuestado como Archivo Suplementario 1.
    9. Conserva el registro de selección como Archivo Suplementario 2. El registro de selección debe informar de los estudiantes invitados, cuestionarios devueltos, cuestionarios excluidos, motivos de exclusión y casos finales retenidos.
  3. Crear el conjunto de datos analítico bloqueado
    1. Conserva los 776 cuestionarios válidos tras el cribado. Bloquea el cuestionario dirigido al encuestado y el conjunto de datos analítico antes de puntuar para asegurarte de que la redacción del ítem, los criterios de elegibilidad, las decisiones de exclusión y las definiciones de variables no cambien tras la recogida de datos.
    2. Elimina identificadores directos, marcas de tiempo brutas, marcadores a nivel de cuenta, trazas a nivel de dispositivo y marcadores de control duplicados antes del análisis. Utiliza este paso de desidentificación para proteger el anonimato de los participantes y evitar que el conjunto de datos analítico se vincule a estudiantes individuales.
    3. Guarda el conjunto de datos de casos 776 desidentificado como el conjunto de datos analítico bloqueado.
    4. Utiliza el conjunto de datos analítico bloqueado como única fuente para puntuación, codificación y clasificación.

4. Medir variables relacionadas con el aprendiz

  1. Organiza el cuestionario
    1. Divide el cuestionario en cuatro secciones: consentimiento informado, formación demográfica y académica, exposición a la inteligencia artificial generativa y escalas relacionadas con el aprendizaje.
    2. Registrar género, edad, carrera, curso y rendimiento académico autodeclarado.
    3. Registrar la exposición a la inteligencia artificial generativa por categoría de herramienta, frecuencia aproximada de uso y tareas académicas apoyadas.
    4. Mide el pensamiento de orden superior auto-reportado, ansiedad por la inteligencia artificial generativa, confianza en la inteligencia artificial generativa, emociones negativas, actitudes hacia la inteligencia artificial generativa, uso problemático de smartphones, procrastinación académica y educación parental.
    5. Traten todas las variables basadas en escalas como indicadores de encuestas de autoinforme, no como observaciones conductuales directas ni como rendimiento cognitivo observado directamente.
  2. Definir medidas retenidas
    1. Mide el pensamiento de orden superior autoinformado con un instrumento retenido de 23 ítems que cubra resolución de problemas, pensamiento crítico, trabajo en equipo, comunicación einnovación 22.
    2. Mide la ansiedad por inteligencia artificial generativa con una escala de ansiedad tecnológica adaptada de 11ítems 23.
    3. Mide la confianza en la inteligencia artificial generativa con una escala de confianza adaptada en automatización de 12ítems 24.
    4. Mide las emociones negativas con un conjunto adaptado de Escalas de Depresión-Ansiedad y Estrés de 21 ítems que se utiliza como indicador generalde emociones negativas 25. No interpretes esta puntuación como un diagnóstico clínico.
    5. Mide las actitudes hacia la inteligencia artificial generativa con una escala de 18 ítems adaptada a la tecnología-actitud26.
    6. Mide el uso problemático de smartphones con la Escala de Adicción a Smartphones Versión Corta adaptada para la encuesta estudiantil, contexto27.
    7. Mide la procrastinación académica con una escala de procrastinación académicade 16 ítems 28.
    8. Mide el rendimiento académico con un ítem de autoinforme de 5 puntos: 1 = muy por debajo de la media, 2 = por debajo de la media, 3 = medio, 4 = por encima de la media y 5 = excelente.
    9. Mide la educación parental con un ítem contextual de autoinforme de 5 puntos: 1 = muy poco apoyador, 2 = poco apoyador, 3 = neutral o mixto, 4 = apoyador y 5 = altamente apoyador.
  3. Especificar anclajes de respuesta y procedimientos de adaptación
    1. Utiliza un formato de respuesta tipo Likert de 1 a 5 para variables de escala retenidas.
    2. Utiliza los anclajes generales: 1 = fuertemente en desacuerdo, 2 = desacuerdo, 3 = neutral o incierto, 4 = de acuerdo y 5 = totalmente de acuerdo.
    3. Administrar el cuestionario en chino para asegurar que los encuestados completen todos los ítems de la escala en el contexto de instrucción y lenguaje utilizado en la universidad participante.
    4. Adaptar los ítems fuente mediante traducción directa, revisión de expertos, ajuste de redacción para aprendizaje apoyado por inteligencia artificial generativa y comprobación piloto de legibilidad para preservar el significado del constructo pretendido y mejorar la claridad contextual para los encuestados chinos de grado.
    5. Utiliza la revisión de expertos para comprobar si los elementos adaptados se mantienen consistentes con los constructos originales, los anclajes de respuesta, la dirección de puntuación y el contexto del estudio. Revisa solo la redacción que pueda causar ambigüedad, desajuste de contexto o malentendidos en el entorno de aprendizaje apoyado por inteligencia artificial generativa.
    6. Incluye la redacción de los ítems, anclas de respuesta, orden de los ítems, dirección de puntuación y etiquetas finales de variables en el Archivo Suplementario 1.

5. Puntuar medidas y verificar la calidad de la medición

  1. Prepara el archivo de trabajo puntuado
    1. Abre el conjunto de datos analítico bloqueado en IBM SPSS Statistics 26.0.
    2. Conserva un encuestado por fila y un elemento o variable por columna.
    3. Comprueba valores faltantes, rangos de respuesta, etiquetas de los artículos y nombres de variables.
    4. Guarda un conjunto de datos filtrado a nivel de ítem antes de calcular las puntuaciones compuestas.
  2. Calcular puntuaciones compuestas
    1. Calcular una puntuación media compuesta a nivel de encuestado para cada constructo multiítem.
    2. Solo se invierte la puntuación en los elementos identificados como con clave inversa en la clave de puntuación antes del cálculo de la puntuación compuesta.
    3. No puntues a la inversa los elementos negativos derivados de DASS21 en este flujo de trabajo porque todos los elementos retenidos se puntuan en la misma dirección, con valores más altos que indican una experiencia emocional negativa más fuerte.
    4. No calcules puntuaciones compuestas a partir de escalas parcialmente transformadas.
    5. Guarda un archivo de trabajo de puntuación continua tras el cálculo de la puntuación compuesta.
  3. Verificar la calidad de la medición interna
    1. Calcula la alfa de Cronbach para cada escala multi-ítems retenida en IBM SPSS Statistics 26.0. Utiliza el alfa de Cronbach como un índice de consistencia interna que indica si los ítems dentro de la misma escala muestran suficiente coherencia para el cálculo de puntuaciones compuestas.
    2. Inspeccionar las correlaciones corregidas entre el total de elementos y los valores alfa-si-ítem-eliminado para cada escala retenida. Utiliza correlaciones corregidas entre el total de ítems y comprobar si cada ítem está suficientemente alineado con la puntuación total de su propia escala tras excluir ese ítem del cálculo total.
    3. Utiliza valores alfa-si-elemento-eliminado para identificar elementos que podrían reducir la consistencia interna si se mantienen. No eliminar los ítems automáticamente solo por motivos estadísticos; Retener o eliminar un elemento solo después de comprobar su significado del constructo, la dirección de puntuación y la consistencia con el cuestionario adaptado.
    4. Realizar las pruebas de Kaiser-Meyer-Olkin y Bartlett para el conjunto de escalas adaptado.
    5. Informa de los valores alfa de Cronbach clave en el texto principal.
    6. Proporciona el registro completo de puntuación y medición como Tabla Suplementaria 1. Incluye el recuento de ítems, rango de respuesta, anclas de respuesta, dirección de puntuación, elementos con clave inversa, regla de puntuación compuesta, alfa de Cronbach, resultado corregido de comprobación de correlación entre el total de ítems, resultado de comprobación alfa-si-ítem-eliminado y etiqueta final de variables.

6. Convertir las puntuaciones continuas en entradas auxiliares de clasificación

  1. Aplicar codificación binaria
    1. Utiliza el archivo de trabajo de la partitura continua como archivo fuente.
    2. Recodifica el pensamiento de orden superior autoinformado como variable objetivo binaria.
    3. Las puntuaciones en código ≤3 son 0 y las puntuaciones >3 como 1.
    4. Aplicar el mismo umbral a todos los predictores retenidos tras el cálculo de la puntuación compuesta.
    5. Utiliza el umbral de 3 como punto medio de la escala de respuesta de 1–5 para crear una regla de codificación transparente y reproducible.
    6. Realizar dicotomización solo para crear entradas binarias para la demostración del árbol de decisión C5.0.
    7. Revisa el número de clases después de la dicotomización.
    8. Conserva el archivo de trabajo de la puntuación continua.
  2. Crear el archivo de análisis codificado
    1. Genera un nuevo archivo de análisis codificado en binario.
    2. Recodifica la ansiedad por inteligencia artificial generativa, la confianza en la inteligencia artificial, el uso problemático de smartphones, la procrastinación académica, el rendimiento académico, la educación parental, las emociones negativas y las actitudes hacia la inteligencia artificial generativa usando el mismo umbral.
    3. Verifica el número de clases para cada variable binaria.
    4. Informa de la regla de codificación y el número de clases en la Tabla 1.
    5. Conserva el archivo de análisis codificado en binario.
    6. Proporciona la estructura del archivo de análisis codificado como Archivo Suplementario 3.

7. Construir el clasificador auxiliar del árbol de decisión C5.0

  1. Configurar el entorno de modelado
    1. Abre IBM SPSS Modeler 18.4 en un sistema operativo Windows 10 de 64 bits.
    2. Importa el archivo de análisis codificado en binario.
    3. Asigna como campo objetivo el pensamiento binario auto-reportado de orden superior.
    4. Asigna todas las demás variables binarias retenidas como campos de entrada.
    5. Verifica nombres de campos, etiquetas de valor y roles de destino/entrada.
    6. Anota el nombre del software, la versión, el sistema operativo, la implementación de C5.0, el nombre del archivo del proyecto y la fecha de análisis en la Tabla Suplementaria 2.
  2. Particionar el conjunto de datos
    1. Dividir los 776 casos en una división 70:30 entre entrenamiento y pruebas.
    2. Usa la semilla aleatoria fija 20230307.
    3. Aplicar la partición estratificada por el objetivo de pensamiento binario de orden superior.
    4. Asigna 544 casos al subconjunto de entrenamiento y 232 casos al subconjunto de pruebas.
    5. Verifica los conteos de bajo HOT y alto en el conjunto de datos completo, el subconjunto de entrenamiento y el subconjunto de pruebas.
    6. Conserva el registro de partición en la Tabla Suplementaria 2.
  3. Entrena y poda el árbol C5.0
    1. Entrena un clasificador C5.0 en el subconjunto de entrenamiento.
    2. Usa la relación de ganancia como la reglade selección dividida 29.
    3. Define la entropía como:
      Entropía(D) = −Σpilog2(pi)
      donde pi es la proporción de casos en la clase i dentro del conjunto de datos D.
    4. Defina la razón de ganancia como:
      Relación de ganancia (D, C) = [Entropía(D) − Entropía(D|C)]/SplitInfo (D, C)
      donde C es la variable de división candidata.
    5. Permite la poda para reducir ramas demasiado específicas que puedan encajar en el ruido del subconjunto de entrenamiento.
    6. Utiliza los siguientes ajustes C5.0: poda = activada; impulso = desactivado; número de ensayos = 1; Costes de clasificación errónea = no aplicado; Pesos de clase = no aplicados; registros mínimos por rama filial = 2; Poda global = habilitada; elevación de subárboles = habilitado; factor de confianza = 0,25; reglas de parada = configuración predeterminada del IBM SPSS Modeler C5.0, salvo que se indique lo contrario.
    7. No aplique sobremuestreo sintético, ponderación de clases ni aprendizaje sensible a costes en el flujo de trabajo principal.
    8. Exporta el árbol inicial y el árbol podado retenido.
    9. Guarda la estructura final del nodo, resúmenes de nodos terminales, salida de importancia de variables, reglas de clasificación y ajustes de modelo.
  4. Desequilibrio de clases de documentos
    1. Calcular la distribución de bajo HOT y alto HOT antes del entrenamiento del modelo.
    2. Registrar la tasa de falta de información como la proporción mayoritaria de la clase en el conjunto completo de datos y el subconjunto de pruebas.
    3. Interpreta el árbol como una salida de clasificación auxiliar interpretable en lugar de como un modelo de cribado optimizado.
    4. Para futuras aplicaciones orientadas al cribado, consideren los pesos de clase, el aprendizaje sensible a los costes, el remuestreo, particiones repetidas de prueba de tren, la validación cruzada k-fold o el ajuste de umbrales.

8. Evaluar y preservar la salida de clasificación

  1. Resultados de rendimiento de exportación
    1. Aplica el árbol podado retenido al subconjunto de entrenamiento.
    2. Exporta la matriz de confusión del entrenamiento, la precisión, la recuperación específica de clase, la precisión específica de clase y la salida del nodo terminal.
    3. Aplica el mismo árbol al subconjunto de pruebas.
    4. Exporta la matriz de confusión de pruebas, precisión, recuperación específica de clase, precisión específica de clase y salida del nodo terminal.
    5. Calcula la llamada como TP/(TP + FN).
    6. Calcula la precisión como TP/(TP + FP).
    7. Calcular la precisión general como casos correctamente clasificados divididos por el total de casos.
    8. Calcular la tasa de no información y comparar la precisión de las pruebas con la línea base de la clase mayoritaria.
    9. Informa métricas específicas de cada clase junto con la precisión general.
  2. Salidas de interpretabilidad de exportación
    1. Exporta la tabla de importancia variable con los valores numéricos.
    2. Exporta el diagrama final del árbol con el tamaño de la muestra del nodo, la clase predicha, la distribución de clases y la probabilidad de clase.
    3. Si el diagrama completo del árbol está visualmente saturado, proporciona una figura principal simplificada y coloca la tabla completa de nodos en el Archivo Suplementario 4.
    4. Resúmenes de nodos terminales de exportación incluyendo ruta de regla, tamaño de muestra de nodo, clase predicha, bajo recuento de HOT, alto recuento de HOT y confianza en la clasificación.
    5. Describe una o dos vías representativas de clasificación en los Resultados Representativos.
  3. Preservar el paquete de reproducibilidad
    1. Conservar el archivo de respuesta en bruto, registro de desidentificación, registro de filtrado, conjunto de datos a nivel de ítem filtrado, archivo de trabajo de puntuación continua, archivo de análisis codificado en binario, tabla de flujo de muestreo, clave de puntuación, tabla de fiabilidad, archivo de proyecto C5.0, archivo de árbol inicial, archivo de árbol podado, salida de importancia, tabla de nodos terminales, matrices de confusión y resúmenes de modelos exportados.
    2. Proporciona la Tabla Suplementaria 1 como registro de puntuación y medición.
    3. Proporciona la Tabla Suplementaria 2 como configuración del modelo y registro de salida.
    4. Proporciona el Archivo Suplementario 1 como cuestionario dirigido al encuestado.
    5. Proporciona el Archivo Suplementario 2 como registro de muestras de cribado.
    6. Proporciona el Archivo Suplementario 3 como estructura de archivo de análisis codificado.
    7. Proporcionar el Archivo Suplementario 4 como salida de nodo terminal y de importancia variable.
    8. Conservar el camino de flujo de trabajo como: exportación de cuestionarios en bruto, > registro de desidentificación y filtrado, > conjunto de datos a nivel de ítem filtrado > archivo de trabajo de puntuación continua > archivo de análisis codificado binario > partición de entrenamiento/pruebas > árbol inicial C5.0 > árbol C5.0 podado > exportado resultados de clasificación > paquete suplementario de reproducibilidad.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Estadísticas descriptivas de variables retenidas

La Tabla 2 informa de las estadísticas descriptivas de las variables de encuesta de autoinforme retenidas en el conjunto de datos de puntuación continua antes de la recodificación binaria. La puntuación media autodeclarada de pensamiento de orden superior fue de 3,71 (DE = 0,68), que superaba el umbral fijo de 3 en la escala de respuesta del 1–5. La confianza en la inteligencia ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo presenta un flujo de trabajo reproducible de puntuación por encuestas y árbol de decisión C5.0 para organizar los datos autoinformados de los aprendices en el aprendizaje académico apoyado por inteligencia artificial generativa. Su principal contribución es metodológica más que predictiva. El flujo de trabajo especifica cómo definir el contexto de la encuesta, filtrar respuestas, puntuar constructos de múltiples ítems, aplicar una regla de codificación fija en punto medio,...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros en competencia ni relaciones personales que pudieran haber influido en el trabajo reportado en este artículo.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación fue apoyada por el Proyecto de Reforma Educativa de la Región Autónoma 2024 "Investigación sobre el mecanismo de compartición de recursos educativos ideológicos y políticos de alta calidad en los planes de estudio entre universidades orientales y occidentales" (Proyecto nº: XJGXJGZH2024011).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
IBM SPSS ModelerIBM Corp.Versión 18.4Utilizado para partición de datos estratificados 70:30, construcción de árboles de decisión C5.0, poda, evaluación de clasificación y exportación de salida de árbol.
Estadísticas IBM SPSSIBM Corp.Versión 26.0Se utiliza para comprobación de datos, cálculo de puntuaciones compuestas, análisis de fiabilidad, comprobación de frecuencia y recodificación binaria.
Dispositivo encuestado conectado a InternetDispositivo propiedad del demandadoSmartphone, tableta o portátil con acceso al navegadorUtilizado por los encuestados para completar el cuestionario en línea. No se proporcionó ningún dispositivo específico para el estudio.
Microsoft ExcelMicrosoft Corp.Microsoft 365 o Excel 2019 o posteriorSe utiliza para revisión de registros de filtrado, verificación de código, formateo de tablas y comprobación de salidas exportadas.
Función de distribución de código QRWenjuanxing / Estrella de CuestionarioFunción de código QR integrada de enlace de cuestionarioSe utiliza para proporcionar acceso estandarizado a cuestionarios a los estudiantes invitados durante la ventana de la encuesta.
Ajuste silencioso de finalización de levantamientoUniversidad participantePausa no docente o entorno de asesoramiento al alumnoSe utiliza para reducir la variación respuesta-contexto durante la finalización de un cuestionario en una sola sesión.
Directorio seguro de almacenamiento de datosAutores / institución participanteAlmacenamiento institucional controlado por accesoSe utiliza para preservar exportaciones en bruto, conjuntos de datos filtrados, conjuntos puntuados, conjuntos codificados, archivos de modelos, registros y salidas exportadas con control de versiones.
Plataforma de encuestas en línea Wenjuanxing / Questionnaire StarChangsha Ranxing Information Technology Co., Ltd.Plataforma web; acceso a través de la web oficial de WenjuanxingSe utiliza para la construcción de cuestionarios, distribución de códigos QR, ajustes de respuesta obligatoria, comprobación de control de duplicados, exportación de marcas de tiempo y exportación de hojas de cálculo.
Sistema operativo WindowsMicrosoft Corp.Windows 10, 64 bitsEntorno operativo para IBM SPSS Statistics 26.0 y IBM SPSS Modeler 18.4.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Inteligencia Artificial GenerativaPerfilado del EstudianteProcrastinaci n Acad micaUso Problem tico del Tel fono InteligentePrecisi n del ModeloCuestionario de AutoinformeClasificaci n Basada en Nodos

Artículos relacionados