Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Evaluación del compromiso conductual en aulas universitarias mediante detección de objetos por vídeo basada en aprendizaje profundo

244 vistas

DOI:

10.3791/69299

17 de marzo de 2026

En este artículo

Resumen

Este estudio evalúa el compromiso conductual de los estudiantes detectando sus comportamientos en vídeos de aulas universitarias utilizando un algoritmo de aprendizaje profundo. Se identifican siete comportamientos que están positivamente correlacionados con el compromiso en el aprendizaje y se utiliza un modelo de puntuación para evaluar la implicación general de los estudiantes individuales y de la clase.

Resumen

Este estudio tiene como objetivo evaluar la participación de los estudiantes en el aprendizaje en las aulas universitarias utilizando la detección de objetos por vídeo basada en aprendizaje profundo. Para ello, mediante análisis de correlación, esta investigación identificó primero siete comportamientos en el aula que presentan una correlación altamente positiva con el compromiso en el aprendizaje como indicadores para medir el compromiso de los estudiantes; luego recopiló 30 vídeos sincronizados de enseñanza real en aula de 6 clases de la Universidad de Ciencia y Tecnología de Shandong (SDUST) y los dividió en un conjunto de entrenamiento y otro de prueba. Tras anotarse manualmente los siete comportamientos en los datos de entrenamiento, se entrenó un algoritmo de aprendizaje automático de forma supervisada sobre este conjunto. Una vez entrenado, el modelo generaba anotaciones iniciales para los datos restantes sin etiquetar. Para lograr un reconocimiento de conducta en el aula más preciso y eficiente, este estudio seleccionó dos algoritmos representativos, a saber, Faster R-CNN y YOLOv5s, para experimentos de detección de conducta. A partir de una comparación de su rendimiento en detección en términos de precisión y coste temporal, en este estudio se seleccionaron YOLOv5 para la detección de comportamiento en el aula. Finalmente, este estudio utilizó el método de grupos focales para asignar puntuaciones a cada comportamiento y desarrollar un modelo de puntuación de compromiso en el aprendizaje a tres niveles. Basado en datos conductuales medidos automáticamente, el modelo permite una evaluación automática y en tiempo real del compromiso con el aprendizaje tanto a nivel individual como de clase.

Introducción

El compromiso con el aprendizaje, que se refiere a la participación, concentración y esfuerzo de los estudiantes en el aprendizaje, consiste en el compromiso conductual, el compromiso emocional y el compromisocognitivo 1. La implicación de los estudiantes revela su situación de aprendizaje y ayuda a los profesores a ajustar las estrategias deenseñanza 2. Sin embargo, la implicación en el aprendizaje en el aula se evalúa principalmente a través de los autoinformes de los estudiantes y las observaciones de los profesores3. La alta proporción de profesores por alumno en las universidades chinas hace que los profesores requieran mucho tiempo y esfuerzo utilizar métodos manuales tradicionales para la evaluación del compromiso en el aprendizaje.

En los últimos años, con la creciente popularidad de las aulas inteligentes de grabación y retransmisión en China, la medición automática del compromiso del aprendizaje basada en vídeos en el aula se ha vueltoposible 4. Desde la perspectiva de la enseñanza en aula mejorada por tecnología inteligente, este estudio aplicó métodos de aprendizaje profundo para detectar comportamientos de los estudiantes en vídeos universitarios y propuso un modelo de puntuación para medir automáticamente el compromiso conductual de los estudiantes.

Una breve revisión de los estudios de compromiso conductual
Existen tres niveles principales de implicación conductual: (1) A nivel de la escuela, se refiere al entusiasmo de los estudiantes por participar en actividadesextracurriculares 5. (2) A nivel de aula, incluye los comportamientos positivos de los estudiantes en clase, como el cumplimiento del orden de clase, y conductas destructivas, como faltar a clase o hablar en curso. (3) A nivel del proceso de aprendizaje, se refiere a la participación y comportamientos de los estudiantes en tareas de aprendizaje, como hacer preguntas y completardeberes 7. Actualmente, los métodos para evaluar el compromiso conductual pueden clasificarse en tres categorías: manuales, semiautomáticos y métodosautomáticos 8.

Los métodos manuales, como el autoinforme, las entrevistas, la observación del profesor y otros métodos tradicionales de evaluación, requieren mucho trabajo y son difíciles de garantizar la objetividad y la precisión. El análisis de registros es un método representativo de evaluación semiautomática que analiza principalmente los datos de los registros de aprendizaje de los estudiantes recogidos en plataformas de aprendizaje, incluyendo indicadores como la frecuencia de inicio de sesión, la duración en línea y la precisión de las respuestas. Este método puede evaluar el compromiso de aprendizaje de los estudiantes de forma más objetiva; sin embargo, el gran volumen y la complejidad de los datos suponen desafíos para el procesamientoposterior 4. El método automático se basa en la visión por ordenador, utilizando dispositivos inteligentes, como plataformas de grabación y radiodifusión, para capturar las expresiones, gestos, comportamientos y otras señales visuales de los estudiantes en clase, principalmente para evaluar el comportamiento en el aula. En comparación con los dos métodos anteriores, este enfoque permite una medición rápida del compromiso conductual mediante ordenadores y algoritmos y es menos susceptible a interferenciassubjetivas 9.

Una breve revisión de la evaluación de compromiso conductual basada en la detección de objetos
Con el auge del aprendizaje profundo, las técnicas de detección de objetos se aplican cada vez más al análisis del compromiso del aprendizaje. Los algoritmos de detección de objetos realizan la clasificación y localización de objetos en imágenes basadas en redes neuronales convolucionales. En aulas inteligentes equipadas con sistemas de grabación de vídeo, estos algoritmos pueden reconocer información visual relacionada con las posturas, gestos y expresiones faciales de los estudiantes a partir de vídeos del aula, permitiendo así la identificación automática de los comportamientos de los estudiantes y la evaluación de su implicación conductual. En consecuencia, el estado de aprendizaje en el aula reflejado por los comportamientos no verbales de los estudiantes puede interpretarseeficazmente 9.

Se han empleado diversos equipos y algoritmos para recopilar e identificar los múltiples comportamientos no verbales de los estudiantes a partir de vídeos. Rahman et al.10 y Zaletelj yKošir 11 utilizaron sensores Kinect para recopilar la línea de visión, información facial, características de postura corporal de los estudiantes, etc., y analizaron el nivel de atención de los estudiantes utilizando algoritmos de aprendizaje automático. Whitehill et al.8 utilizaron una cámara web con iPad para registrar las expresiones faciales de los estudiantes y entrenar un modelo de reconocimiento, demostrando que la técnica de aprendizaje automático es igual a la observación humana en cuanto a la precisión de la evaluación del compromiso con el aprendizaje. Sukumaran y Manoharan12 detectaron el compromiso del estudiante usando señales EGG. Ashwin y Guddeti13 utilizaron redes neuronales convolucionales para analizar vídeos en el aula en un entorno de laboratorio y detectar comportamientos no verbales, como expresiones faciales, posturas de manos y posturas corporales, con el fin de evaluar la implicación en el aprendizaje. Bai et al.14 utilizaron Faster R-CNN con fusión multiplexada de características para lograr la detección de comportamientos en el aula, como estudiar, dormir y cabeza abajo, mediante aprendizaje por transferencia. Deng et al.9 analizaron vídeos de aulas remotas combinando técnicas de aprendizaje profundo Faster R-CNN y propusieron un método para lograr el reconocimiento de conducta y la medición de la participación en el aula basado en las posturas de cabeza, mano y cuerpo de los estudiantes.

Los primeros estudios se realizaron principalmente en entornos de laboratorio, muchos de los cuales se centraron en un solo individuo en un único escenario10, 11, 12, 13, mientras que estudios más recientes han examinado cada vez más entornos reales de aula9, 14, 15, 16, 17, 18, 19. Además, la gama de comportamientos examinados se ha vuelto cada vez más diversa. Por ejemplo, Bai et al.14 y Ouyang et al.15 analizaron vídeos en clase en los que solo se identificaron dos comportamientos—cabeza arriba y cabeza abajo—. Deng et al.9 investigaron vídeos en aulas de primaria y ampliaron las categorías de comportamiento detectadas desde los movimientos de la cabeza hasta los movimientos de manos y cuerpos. Zhang y suscolegas 16 recopilaron cinco tipos de comportamientos de los estudiantes: mirar hacia arriba, mirar hacia abajo, dormir, mirar alrededor y bostezar.

Sin embargo, dado que los datos se recogieron en aulas de primaria, donde los estudiantes suelen estar sentados en posiciones fijas, el rango de comportamientos observables seguía siendo relativamente limitado. Por ello, estudios posteriores se han centrado cada vez más en las aulas universitarias. Muchas aulas universitarias son grandes, con alrededor de un centenar de estudiantes sentados al azar, lo que dificulta detectar el comportamiento de los estudiantes. Además, en entornos reales de aula universitaria, los estudiantes muestran una mayor diversidad conductual e interactividad, incluyendo interacciones con profesores, compañeros, pizarras y libros de texto. Yan et al.17 propusieron un método de reconocimiento de postura basado en aprendizaje profundo, BetaPose, diseñado para mejorar la precisión del reconocimiento de postura en escenas de aulas concurridas. Tan et al.18 incorporaron un módulo de atención coordinada (CA) en la red YOLOv9, y el modelo resultante CA-YOLOv9 se aplicó al reconocimiento de siete comportamientos en el aula en entornos universitarios complejos con grandes poblaciones estudiantiles. Wang et al.19 propusieron una red bidireccional de aumento de características (BATNet) para identificar los comportamientos de los estudiantes en aulas inteligentes, especialmente para objetivos pequeños y ocluidos.

Con el desarrollo de los algoritmos, la velocidad y precisión en la detección de conductas se han mejorado considerablemente; Sin embargo, los estudios actuales han ignorado la explicación de si existe una correlación entre los comportamientos detectados en el aula y la implicación de los estudiantes, dejando sin respuesta preguntas como si ciertos comportamientos pueden usarse como parámetros para medir el compromiso conductual y qué comportamientos pueden reflejar eficazmente el compromiso en el aprendizaje. Además, es necesario encontrar una forma explícita de mostrar el compromiso conductual de los estudiantes. Así, este estudio identificó comportamientos en el aula altamente relacionados con la participación de los estudiantes mediante análisis de correlación; Mientras tanto, se desarrolló un sistema de puntuación para construir un modelo de evaluación del compromiso conductual. En consecuencia, se puede lograr una medición automática del compromiso conductual tanto para estudiantes individuales como para toda la clase.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Todos los vídeos se obtuvieron y utilizaron conforme a las prácticas éticas actuales de investigación humana según lo prescrito por la Universidad de Ciencia y Tecnología de Shandong. Se ha recibido la aprobación para el uso de los datos.

En primer lugar, se realizó un análisis de correlación para identificar los comportamientos de los estudiantes que pudieran servir como indicadores de compromiso conductual. Tras establecer el conjunto de datos mediante extracción de tramas y dividirlo en un conjunto de entrenamiento y un conjunto de prueba, se ejecutaron dos algoritmos representativos para la detección de objetos en el conjunto de entrenamiento y se compararon en términos de precisión y eficiencia. Finalmente, se seleccionó el algoritmo con mejor rendimiento (YOLO-v5s) para ejecutarse en el conjunto de pruebas y realizar la detección de comportamiento. La Figura 1 presenta el diagrama de flujo del proceso de identificación y detección de los comportamientos de los estudiantes.

figure-protocol-1
Figura 1. Diagrama de flujo de identificación y detección de comportamientos de los estudiantes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Identificación de indicadores
Antes de realizar experimentos de detección de objetos, era necesario identificar comportamientos no verbales que indicaran el compromiso conductual de los estudiantes. Hasta la fecha, los estudios sobre el compromiso conductual basados en la detección de objetos han logrado éxito en detectar una variedad de conductas no verbales, incluyendo línea de visión, información facial y posturacorporal 9,10,11,12,13,14. Sin embargo, aún no se ha debatido si ciertos comportamientos están justificados como indicadores del compromiso conductual de los estudiantes. Así, en este estudio, se utilizó un análisis de correlación entre los comportamientos de los estudiantes y su nivel de compromiso conductual para identificar conductas indicativas de implicación conductual.

(1) Prueba de compromiso conductual
Este estudio seleccionó a 122 estudiantes de grado de cuatro clases naturales de estudiantes no licenciados en Filología Inglesa en SDUST-Jinan como muestra para un estudio correlacional. Primero, se emplearon escalas de autoinforme para recopilar datos de compromiso conductual de los 122 estudiantes, con el objetivo de comprender su estado de compromiso conductual desde una perspectiva de experiencia interna. Dado que los datos de vídeo del aula para este estudio se obtuvieron de clases de "Inglés Académico", se adoptó el instrumento de evaluación multidimensional para la participación en el aprendizaje en aulas universitarias de inglés, desarrollado por RenQingmei 20 . Este instrumento está diseñado específicamente para el entorno de enseñanza de lenguas extranjeras del chino extranjero y emplea la misma categorización clásica del compromiso en el aprendizaje que este estudio, abarcando tres dimensiones: conductual, afectivo y cognitivo. Entre ellos, el instrumento de compromiso conductual consta de nueve ítems, correspondientes a la interacción profesor-alumno (por ejemplo, "Respondo activamente a preguntas planteadas por el profesor en clase de inglés"), esfuerzo individual (por ejemplo, "Considero cuidadosamente las dificultades encontradas durante el aprendizaje en clase de inglés"), interacción entre compañeros (por ejemplo, "Colaboro con otros estudiantes para completar tareas de aprendizaje en clase de inglés"), etc. Cada ítem se presenta en un formato de escala de 5 puntos Likert, con opciones de respuesta como "casi nunca, rara vez, a veces, a menudo, siempre", puntuadas del 1 al 5, requiriendo que los estudiantes seleccionen la opción que mejor se alinee con su experiencia de aprendizaje. Los estudiantes que obtuvieron 15 puntos o menos fueron clasificados como estudiantes de bajo engagement, aquellos que obtuvieron entre 16 y 30 puntos como estudiantes de compromiso moderado y aquellos que obtuvieron entre 31 y 45 puntos como estudiantes de alto engagement. Finalmente, se recopilaron 120 escalas válidas, con 17 estudiantes en la categoría de bajo engagement, 45 en la de compromiso moderado y 58 en la de alto engagement.

(2) Identificación de conductas
Mientras tanto, se recopilaron cuatro vídeos grabados que suman 50 minutos de clases completas de "Inglés Académico" en estas cuatro clases. Con un fotograma dibujado cada 15 segundos, finalmente se extrajeron 200 imágenes para su observación. Basándose en la repetida visualización de muestras de vídeo por tres estudiantes, este estudio identificó inicialmente 12 tipos de comportamientos de los estudiantes en el aula: mirar alrededor, usar el móvil, discutir, deambular, moverse, comer o beber, tomar notas o leer, escuchar atentamente, levantarse (para responder a una pregunta), bostezar, dormir y usar el ordenador. Ejemplos de los 12 comportamientos se muestran en la Figura 2.

figure-protocol-2
Figura 2. Ejemplos de 12 comportamientos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Cada tipo iba acompañado de descripciones detalladas de características visuales y contexto espaciotemporal, formando el Procedimiento Operativo Estándar para la Anotación de Comportamiento en el Aula, que aseguraba la coherencia conceptual entre las anotaciones. La Tabla 1 muestra las 12 categorías de comportamiento de los estudiantes y las descripciones de cada conducta.

Mirar alrededor incluía girar la cabeza hacia la izquierda, derecha y atrás de forma significativa. Se consideraba que los estudiantes estaban en una discusión si giraban la cabeza y abrían la boca. En el escenario del aula, escuchar atentamente se asociaba con mirar directamente la pizarra o al profesor que estaba delante de ellos; Cuando la mirada se dirigía a otro lado, era muy probable que el estudiante estuviera vagando. Cuando el estudiante mostraba una postura de cabeza baja y había un objeto como un libro o un cuaderno, este comportamiento podía identificarse como tomar notas o leer un libro. Cuando el comportamiento implicaba una postura de pie y el estudiante estaba de pie en su asiento con la boca abierta, se consideraba que respondía a una pregunta en posición de pie; Si el estudiante no estaba en su asiento, se consideraba que estaba dando un paso por otro, lo que podría indicar que el estudiante llegó tarde a clase o salió del aula, etc. Cuando un estudiante apoyaba la cabeza en el escritorio, se identificaba como dormido. Cuando un estudiante sostenía comida o bebida en las manos, el comportamiento se identificaba como comer o beber. Una boca abierta o una postura conductual que estira el cuerpo indicaban que el alumno estaba bostezando.

Categoría de comportamientoDescripción del comportamiento
Buscando alrededorMovimiento evidente de la cabeza hacia la derecha, izquierda o atrás
Uso del teléfono móvilTocar un móvil con las manos
DebatiendoBoca abierta, acompañada de un movimiento de cabeza
VagandoUna mirada vidriosa en lugares irrelevantes
Dando vueltasApartándose del asiento
Comer o beberBoca abierta y en contacto con comida o agua
Tomar notas o leerTomar notas o mirar un libro
Escuchando con atenciónMirando la pizarra o al profesor
Levantarse (para responder preguntas)De pie en el asiento con la boca abierta
BostezandoBoca abierta o estiramiento corporal
DurmiendoCabeza sobre el escritorio
Uso del ordenadorUn ordenador abierto sobre el escritorio

Tabla 1: Categorías y descripciones del comportamiento de los estudiantes.

(3) Análisis de correlación
Utilizando los criterios anteriores, se invitó a 12 profesores experimentados a ver vídeos de los 120 estudiantes y registrar sus tipos y frecuencias de comportamiento. Los comportamientos se identificaron según la Tabla 1. Los profesores se dividieron en cuatro grupos, con tres profesores en cada grupo. Cada grupo era responsable de registrar a 30 estudiantes, y cada uno de los tres profesores registró de forma independiente los comportamientos de 30 alumnos. El Alfa de Cronbach (denominado α) es un indicador para medir la consistencia interna de una escala o cuestionario. El rango de valores del alfa de Cronbach es de 0 a 1, y α ≥ 0,8 suele interpretarse como una buena consistenciainterna 21. Si hubo un alto grado de consistencia (α > 0,8, es decir, un alto grado de consistencia) en la frecuencia de un tipo particular de comportamiento entre los tres profesores, la frecuencia de ese comportamiento se registró como la media de las tres frecuencias. Posteriormente, con los datos representando por un lado las frecuencias de diferentes comportamientos de cada estudiante y, por otro, sus niveles de compromiso conductual, se realizó un análisis de correlación entre ambos factores. El resultado se muestra en la Tabla 2.

ComportamientosCompromiso conductual
Comer o beberCorrelación Pearson.319**
Sig. (de dos colas)0.004
N120
BostezandoCorrelación Pearson-.335**
Sig. (de dos colas)0
N120
DebatiendoCorrelación Pearson.546**
Sig. (de dos colas)0
N120
Dando vueltasCorrelación Pearson-.774**
Sig. (de dos colas)0
N120
ErrarCorrelación Pearson.293**
Sig. (de dos colas)0.008
N120
Buscando alrededorCorrelación Pearson-.834**
Sig. (de dos colas)0
N120
Lectura o toma de notasCorrelación Pearson.912**
Sig. (de dos colas)0
N120
Escuchando con atenciónCorrelación Pearson.881**
Sig. (de dos colas)0
N120
De pieCorrelación Pearson.330**
(para responder a una pregunta)Sig. (de dos colas)0
N120
DurmiendoCorrelación Pearson-.411**
Sig. (de dos colas)0
N120
UsandoCorrelación Pearson.591**
Teléfono móvilSig. (de dos colas)0
N120
Uso del ordenadorCorrelación Pearson.362**
Sig. (de dos colas)0.001
N120

Tabla 2: Resultados del análisis de correlación.

En el análisis de correlación, r es el coeficiente de correlación, que se refiere al grado de correlación lineal entre dos variables, que va de −1 a 1. Según el grado de relación, la correlación puede clasificarse en los siguientes tipos:
Alta correlación (│r│ ≥ 0,70)
Correlación media (0,40 ≤ │r│ ≤ 0,70)
Baja correlación (│r│ ≤ 0,40)

Según la dirección de la relación, puede clasificarse en los siguientes tipos:
Correlación positiva (r > 0)
Correlación negativa (r < 0)
Sin correlación (r = 0)

En la Tabla 1 se pueden ver siete comportamientos, incluyendo mirar alrededor (r = −0,834**, p < 0,05), usar el teléfono móvil (r = 0,591**, p < 0,05), discutir (r = 0,546, p < 0,05), dar vueltas (r = −0,774**, p < 0,05), tomar notas o leer (r = 0,912**, p < 0,05), escuchar atentamente (r = −0,881**, p < 0,05) y dormir (r = −0,411**, p < 0,05), tenían una correlación alta o media con el compromiso conductual, mientras que comportamientos como comer o beber (r = 0,319**, p = 0,04), levantarse (para responder a una pregunta) (r = 0,330**, p = 0,00), bostezar (r = −0,335**, p < 0,05), deambular (r = 0,293, p > 0,05) y usar el ordenador (r = 0,362, p < 0,05) presentaban una correlación baja o nula con el compromiso conductual. A partir del análisis de correlación, este estudio identificó finalmente siete comportamientos como indicadores de compromiso con el aprendizaje: mirar alrededor, usar el teléfono móvil, discutir, moverse, tomar notas o leer, escuchar atentamente y dormir.

Establecimiento del conjunto de datos
Los datos de vídeo utilizados en este estudio se recogieron de la plataforma de grabación directa de SDUST, que proporcionó vídeos sincronizados de la enseñanza real en aula del curso "Inglés Académico". Se recopilaron diez vídeos de cuatro promociones de estudiantes que no eran estudiantes de Filología Inglesa, cada uno de aproximadamente 50 minutos de duración, para establecer un conjunto de datos entrenable sobre el comportamiento de los estudiantes en el aula. Con un fotograma dibujado cada 15 s, se extrajeron finalmente 2.000 imágenes con una resolución de 1.920 × 1.080.

División del conjunto de datos
El experimento dividió el conjunto de datos de comportamiento del estudiante en dos partes completamente independientes: un conjunto de entrenamiento y un conjunto de pruebas, como se muestra en la Tabla 3, sin imágenes compartidas. El conjunto de datos abarcaba los siete comportamientos de los estudiantes. El conjunto de entrenamiento y el conjunto de pruebas se utilizaron para los parámetros del modelo de entrenamiento y para evaluar la precisión, respectivamente. Los parámetros de entrenamiento se establecieron como se muestra en la Tabla 4.

Conjunto de datosNúmero de imágenes
Total2830
Conjunto de entrenamiento2111
Conjunto de pruebas719

Tabla 3: División del conjunto de datos de comportamiento de los estudiantes.

ParámetroValor
Tasa de aprendizaje0.01
Impulso0.937
Declive de peso0.0005
Época100
Tamaño del lote16

Tabla 4: Establecimiento de los parámetros experimentales.

Para evitar fugas de datos causadas por la aparición del mismo estudiante en subconjuntos diferentes y para preservar la continuidad temporal natural de los comportamientos, se adoptó un método llamado "División Temporal Estratificada".

Disyunción de sujeto: El conjunto de datos estaba dividido por identificadores únicos de estudiantes, asegurando que los estudiantes en los conjuntos de entrenamiento, validación y prueba fueran mutuamente excluyentes.

Partición temporal: Los vídeos estaban ordenados cronológicamente. El primer 70% de los segmentos temporales se usó para entrenamiento, el siguiente 15% para validación y el 15% final para pruebas. Este método simulaba mejor la generalización temporal del mundo real en comparación con la división aleatoria.

Equilibrio de clases: Para categorías infrarrepresentadas como "dormido" y "uso de teléfono móvil", se aplicó un sobremuestreo moderado dentro del conjunto de entrenamiento para asegurar que el modelo aprendiera características de todas las categorías.

Anotación de conjunto de datos de entrenamiento
Se utilizó una herramienta de anotación de código abierto para anotar manualmente los datos de entrenamiento. La herramienta se empleaba para la anotación de cajas delimitadoras. El flujo de trabajo específico era el siguiente: (1) Se extrajeron fotogramas clave a una tasa fija (1 fotograma/s) a partir de vídeos de vigilancia que cubrían diferentes escuelas, franjas horarias y tipos de cursos, seguido de procesos de anonimización como el desenfoque facial; (2) Siguiendo el procedimiento estándar de anotación, los anotadores usaron cajas rectangulares para delimitar con precisión al estudiante que realiza un comportamiento específico y asignaron la etiqueta de categoría correspondiente; (3) Las anotaciones se exportaban como archivos XML en formato PASCAL VOC.

Para garantizar la calidad de la etiqueta, especialmente para evitar errores en la distinción de comportamientos ambiguos (por ejemplo, discutir vs. divagar), se implementó un mecanismo colaborativo de "Anotación-Arbitraje en Tres Etapas":

Anotación inicial: Cada fotograma clave era anotado de forma independiente por tres anotadores entrenados. Cada etiqueta consta de una etiqueta de categoría y un recuadro delimitador.

Verificación de consistencia: Se calcularon la intersección sobre la unión y la consistencia de categorías entre anotaciones. Las cajas delimitadoras, que son el resultado de una anotación inicial con IoU > 0,8 y etiquetas de categoría idénticas, se consideraban "anotaciones consistentes". Las cajas delimitadoras con etiquetas de categoría IoU ≤ 0,8 o no idénticas se consideraban "anotaciones inconsistentes".

Arbitraje experto: Para anotaciones inconsistentes (por ejemplo, casos ambiguos como "mirar alrededor" frente a "discutir"), un panel de expertos con experiencia docente tomó la decisión final basándose en el vídeo fragmentado, el contexto conductual y el conocimiento pedagógico previo. La determinación final se realiza verificando la precisión de la etiqueta mediante la inspección del segmento de vídeo fuente del fotograma clave.

La anotación reveló que los comportamientos de los estudiantes se caracterizaban por objetivos múltiples, intensivos y pequeños, como se muestra en la Figura 3.

figure-protocol-3
Figura 3. Un ejemplo de anotación de imágenes en el aula. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Los alumnos en clase mostraban comportamientos como escuchar con atención, usar el móvil y leer o tomar apuntes con frecuencia, mientras que la frecuencia de moverse, deambular, etc., era relativamente baja. La Figura 4 muestra la distribución de comportamientos en el aula en el conjunto de datos de entrenamiento.

figure-protocol-4
Figura 4. Distribución de comportamientos en el conjunto de datos de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Detección del comportamiento de los estudiantes
Los marcos de detección de objetos basados en aprendizaje profundo se dividieron principalmente en doscategorías: 22: métodos de dos etapas, representados por la serie Faster R-CNN, y métodos de una etapa, representados por YOLO. Para la primera categoría, los métodos de detección en dos etapas generaban primero propuestas de región utilizando una Red de Propuestas de Región (RPN) antes de realizar cálculos detallados de probabilidad de clase y regresión en caja delimitadora. Para la segunda categoría, los métodos de una etapa simplificaron el proceso de detección al predecir simultáneamente clases de objetos y cajas delimitadoras en una sola etapa. Aunque los métodos de dos etapas surgieron antes en el desarrollo del campo, los enfoques de una sola etapa han ganado popularidad debido a su arquitectura simplificada y eficiencia computacional. Para lograr un reconocimiento de comportamiento en clase más preciso y eficiente, este estudio seleccionó algoritmos representativos de ambas categorías, concretamente Faster R-CNN23,24 y YOLO-v525,26, para realizar experimentos de detección de conducta en el aula, y comparó los resultados de detección de ambos algoritmos antes de decidir finalmente cuál se utilizará para la detección de conducta en este estudio.

Para evaluar eficientemente los resultados experimentales, se centró en la precisión general de la detección frente al coste temporal de cada modelo algorítmico. Se utilizaron la Precisión Media Media (mAP) y el tiempo de entrenamiento (h) para medir ambos modelos.

Se detectaron siete categorías de comportamientos para reconocimiento mediante ambos métodos, y los valores medios de precisión de detección (PA) se registraron en la Tabla 5. Entre ellas, los YOLO-v5 superaron a Faster R-CNN en la detección de tres categorías de acciones: desplazarse, escuchar atentamente las clases y usar teléfonos móviles, con valores de AP del 100%, 62,7% y 31,8%, respectivamente.

Modelo de RedDebatiendoDando vueltasEscuchando con atenciónMirando alrededorDurmiendoTomar notas o leerUso del teléfono móvil
R-CNN más rápido32.699.545.49.32252.626.8
YOLO-v5s17.810062.73.8195131.8

Tabla 5: La precisión media de los dos algoritmos para una sola clase.

El tiempo de entrenamiento y la precisión media de detección de las dos redes clásicas de detección en el conjunto de prueba en un IoU de 0,5 se muestran en la Tabla 6. Aunque la cadena Faster R-CNN tenía mayor precisión, su duración era relativamente larga. En comparación, los YOLO-v5 tenían un tiempo de funcionamiento un 30% más corto con solo una reducción del 0,3% en la precisión, demostrando una mayor mejora en la eficiencia. Dada la necesidad de la detección en tiempo real del comportamiento de los estudiantes en el aula en este estudio, se esperaba que el tiempo de formación para la red fuera lo más corto posible. Considerando tanto la precisión de la detección como el coste temporal de los modelos entrenados en el conjunto de entrenamiento, este artículo concluyó que YOLO-v5s era más adecuado para la detección del comportamiento de los estudiantes en el aula.

Modelo de RedhmAP@0,5 (%)
R-CNN más rápido2.8841.17
YOLO-v5s2.01640.87

Tabla 6: Comparación del rendimiento de detección.

Por ello, se eligió YOLO-v5s para realizar la detección de conducta en el aula en este estudio. Los resultados de detección producidos por YOLO-v5 se ilustran en la Figura 5, mostrando la detección continua de comportamientos multi-objetivo junto con las etiquetas correspondientes.

figure-protocol-5
Figura 5. Ejemplos de resultados de detección del conjunto de pruebas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

(1) Aumento y preprocesamiento de datos
Para mejorar la robustez y generalización del modelo, se empleó durante el entrenamiento una estrategia de aumento de datos compuestos, incluyendo transformaciones afines aleatorias, jitter de color y oclusión aleatoria. Todas las imágenes se redimensionaron uniformemente a 640 × 640 píxeles.

(2) Estrategia de entrenamiento
El proceso de formación se dividió en tres fases:
Fase de columna vertebral congelada (Épocas 1-100): La red de columna vertebral estaba congelada y solo se entrenaba la cabeza de detección, usando una baja tasa de aprendizaje para el calentamiento.
Fase completa de ajuste fino de red (Épocas 101-250): Todas las capas de red se descongelaron. Un planificador de recocido coseno ajustaba la tasa de aprendizaje.
Fase de refinamiento (Épocas 251-300): Se aplicó la Media Móvil Exponencial para estabilizar el entrenamiento y se redujo la intensidad de la ampliación de datos para el refinamiento del modelo.

Para abordar el desequilibrio de clases, se aplicaron pesos específicos de clase inversamente proporcionales a sus frecuencias en el conjunto de entrenamiento a la función de pérdida.

(3) Postprocesamiento y optimización temporal
Para mantener la consistencia temporal en los comportamientos en el aula, se aplicó un filtro de consistencia temporal tras la inferencia del modelo. Específicamente, para un objetivo detectado en una secuencia de vídeo, su categoría de comportamiento debía identificarse en al menos tres fotogramas consecutivos para ser confirmada, filtrando así los falsos positivos transitorios.

Establecimiento del método de puntuación del compromiso conductual
Este estudio utilizó el método de grupos focales para asignar puntuaciones a cada comportamiento. Se invitó a veinte profesores universitarios de primera línea a valorar la implicación de las siete categorías de comportamiento basándose en su experiencia en gestión del aula. Los 20 profesores llevaban más de 10 años enseñando y habían impartido una amplia variedad de cursos en múltiples disciplinas. Las puntuaciones de compromiso oscilaron entre 0 y 3, con 0-1 indicando bajo compromiso, 1-2 indicando compromiso medio y 2-3 indicando alto compromiso. Si hubo un alto grado de consistencia (α > 0,8) en las valoraciones de varios evaluadores para un tipo particular de comportamiento, la implicación de ese comportamiento se midió promediando las valoraciones individuales de los profesores. Las valoraciones finales para cada tipo de comportamiento se muestran en la Tabla 7.

Tipo de comportamientoMirando alrededorUso del teléfono móvilDebatiendoDando vueltasToma de notas o lecturaescuchando atentamentedurmiendo
Puntuación de enfrentamiento0.91.21.90.62.72.80.2

Tabla 7: Valoraciones de comportamiento.

La fórmula para el compromiso conductual de cada estudiante es

figure-protocol-6

ESi = compromiso conductual del estudiante, Sj = puntuación de conducta, fj = frecuencia de comportamiento j.

Suponiendo que el número de conductas detectadas en un alumno en una clase era 100, incluyendo 4 "discutir", 68 "escuchar atentamente", 25 "leer/tomar notas" y 3 "mirar alrededor", la puntuación global de compromiso personal del estudiante era (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. Tomando toda la clase como referencia, el compromiso conductual se dividió en cuatro niveles según la división a intervalos iguales de una escala de 0 a 3: una puntuación inferior a 0,75 se definió como "no implicado", 0,76-1,5 como "ligeramente implicado", 1,6-2,25 como "comprometido" y 2,26-3 como "muy implicado"; por lo tanto, el estudiante fue evaluado como "muy comprometido" con la clase.

El compromiso conductual de toda la clase se refería a la puntuación media de todos los estudiantes. La fórmula para el compromiso conductual de la clase es:

figure-protocol-7

Ec = compromiso conductual de la clase, E S = compromiso conductual de un determinado alumno, n = número de estudiantes

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Al detectar conductas y utilizar el modelo de puntuación, se logró una medición automática del compromiso conductual de los estudiantes. Tomando una clase en el vídeo como ejemplo, el compromiso conductual en tiempo real de cada estudiante podría calcularse basándose en los resultados de detección conductual y el modelo de puntuación. La Figura 6 ilustra el compromiso conductual de dos estudiantes en esta clase, mostrando sus niveles de impl...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio permitió el reconocimiento y la medición automática del compromiso conductual. En comparación con estudios anteriores, los comportamientos identificados eran más representativos de las aulas universitarias (como el uso del teléfono móvil), y la evaluación del compromiso conductual se presentó en cifras, lo que facilitó su intuición de ver. Este enfoque de medición automática permitió a los profesores evaluar de manera eficiente y clara la implicación de los estudiantes indiv...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Esta investigación fue financiada por el Programa del Fondo de Planificación de Ciencias Sociales de Shandong (23CRWJ11).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Vídeos en el aulaLos datos de vídeo utilizados en este estudio se recopilan de la plataforma de grabación directa de la Universidad de Ciencia y Tecnología de Shandong (SDUST), que son vídeos sincronizados de la enseñanza real en el aula del curso de Inglés Académico. Se recopilaron 30 vídeos de 6 clases de estudiantes no licenciados en Filología Inglesa, de unos 50 minutos cada uno, para establecer un conjunto de datos entrenable de los estudiantes Comportamiento en el aula.
IBM SPSS Estadísticas 26IBMSPSS para Windows es un paquete de software modular que integra funciones de entrada, organización y análisis de datos. Sus funciones básicas incluyen gestión de datos, análisis estadístico, análisis de gráficos, gestión de resultados, etc. SPSS se utiliza principalmente para análisis de consistencia y análisis de correlación en este artículo.
Etiquetado 1.8.6El etiquetado es una herramienta visual de anotación de imágenes. Está escrito en Python y utiliza Qt como interfaz gráfica. Las anotaciones se guardan como archivos XML en el formato PASCAL VOC, que utiliza ImageNet. Además, es compatible con el formato YOLO. Se utiliza para conjuntos de datos necesarios para redes de detección de objetos como Faster R-CNN, YOLO y SSD para anotar objetos en imágenes.
MMDetection 2.22.0MMDetection, 2.22.0, MMDetection es una caja de herramientas para detección de objetos que incluye métodos de detección de objetos enriquecidos, segmentación de instancias y segmentación panorámica, así como componentes y módulos relacionados.

Referencias

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Detecci n del comportamiento en el aulaEvaluaci n del compromiso en el aprendizajeFaster R CNNYOLOv5sAprendizaje supervisadoEvaluaci n en tiempo realAn lisis de correlaci n