Todos los vídeos se obtuvieron y utilizaron conforme a las prácticas éticas actuales de investigación humana según lo prescrito por la Universidad de Ciencia y Tecnología de Shandong. Se ha recibido la aprobación para el uso de los datos.
En primer lugar, se realizó un análisis de correlación para identificar los comportamientos de los estudiantes que pudieran servir como indicadores de compromiso conductual. Tras establecer el conjunto de datos mediante extracción de tramas y dividirlo en un conjunto de entrenamiento y un conjunto de prueba, se ejecutaron dos algoritmos representativos para la detección de objetos en el conjunto de entrenamiento y se compararon en términos de precisión y eficiencia. Finalmente, se seleccionó el algoritmo con mejor rendimiento (YOLO-v5s) para ejecutarse en el conjunto de pruebas y realizar la detección de comportamiento. La Figura 1 presenta el diagrama de flujo del proceso de identificación y detección de los comportamientos de los estudiantes.

Figura 1. Diagrama de flujo de identificación y detección de comportamientos de los estudiantes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Identificación de indicadores
Antes de realizar experimentos de detección de objetos, era necesario identificar comportamientos no verbales que indicaran el compromiso conductual de los estudiantes. Hasta la fecha, los estudios sobre el compromiso conductual basados en la detección de objetos han logrado éxito en detectar una variedad de conductas no verbales, incluyendo línea de visión, información facial y posturacorporal 9,10,11,12,13,14. Sin embargo, aún no se ha debatido si ciertos comportamientos están justificados como indicadores del compromiso conductual de los estudiantes. Así, en este estudio, se utilizó un análisis de correlación entre los comportamientos de los estudiantes y su nivel de compromiso conductual para identificar conductas indicativas de implicación conductual.
(1) Prueba de compromiso conductual
Este estudio seleccionó a 122 estudiantes de grado de cuatro clases naturales de estudiantes no licenciados en Filología Inglesa en SDUST-Jinan como muestra para un estudio correlacional. Primero, se emplearon escalas de autoinforme para recopilar datos de compromiso conductual de los 122 estudiantes, con el objetivo de comprender su estado de compromiso conductual desde una perspectiva de experiencia interna. Dado que los datos de vídeo del aula para este estudio se obtuvieron de clases de "Inglés Académico", se adoptó el instrumento de evaluación multidimensional para la participación en el aprendizaje en aulas universitarias de inglés, desarrollado por RenQingmei 20 . Este instrumento está diseñado específicamente para el entorno de enseñanza de lenguas extranjeras del chino extranjero y emplea la misma categorización clásica del compromiso en el aprendizaje que este estudio, abarcando tres dimensiones: conductual, afectivo y cognitivo. Entre ellos, el instrumento de compromiso conductual consta de nueve ítems, correspondientes a la interacción profesor-alumno (por ejemplo, "Respondo activamente a preguntas planteadas por el profesor en clase de inglés"), esfuerzo individual (por ejemplo, "Considero cuidadosamente las dificultades encontradas durante el aprendizaje en clase de inglés"), interacción entre compañeros (por ejemplo, "Colaboro con otros estudiantes para completar tareas de aprendizaje en clase de inglés"), etc. Cada ítem se presenta en un formato de escala de 5 puntos Likert, con opciones de respuesta como "casi nunca, rara vez, a veces, a menudo, siempre", puntuadas del 1 al 5, requiriendo que los estudiantes seleccionen la opción que mejor se alinee con su experiencia de aprendizaje. Los estudiantes que obtuvieron 15 puntos o menos fueron clasificados como estudiantes de bajo engagement, aquellos que obtuvieron entre 16 y 30 puntos como estudiantes de compromiso moderado y aquellos que obtuvieron entre 31 y 45 puntos como estudiantes de alto engagement. Finalmente, se recopilaron 120 escalas válidas, con 17 estudiantes en la categoría de bajo engagement, 45 en la de compromiso moderado y 58 en la de alto engagement.
(2) Identificación de conductas
Mientras tanto, se recopilaron cuatro vídeos grabados que suman 50 minutos de clases completas de "Inglés Académico" en estas cuatro clases. Con un fotograma dibujado cada 15 segundos, finalmente se extrajeron 200 imágenes para su observación. Basándose en la repetida visualización de muestras de vídeo por tres estudiantes, este estudio identificó inicialmente 12 tipos de comportamientos de los estudiantes en el aula: mirar alrededor, usar el móvil, discutir, deambular, moverse, comer o beber, tomar notas o leer, escuchar atentamente, levantarse (para responder a una pregunta), bostezar, dormir y usar el ordenador. Ejemplos de los 12 comportamientos se muestran en la Figura 2.

Figura 2. Ejemplos de 12 comportamientos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Cada tipo iba acompañado de descripciones detalladas de características visuales y contexto espaciotemporal, formando el Procedimiento Operativo Estándar para la Anotación de Comportamiento en el Aula, que aseguraba la coherencia conceptual entre las anotaciones. La Tabla 1 muestra las 12 categorías de comportamiento de los estudiantes y las descripciones de cada conducta.
Mirar alrededor incluía girar la cabeza hacia la izquierda, derecha y atrás de forma significativa. Se consideraba que los estudiantes estaban en una discusión si giraban la cabeza y abrían la boca. En el escenario del aula, escuchar atentamente se asociaba con mirar directamente la pizarra o al profesor que estaba delante de ellos; Cuando la mirada se dirigía a otro lado, era muy probable que el estudiante estuviera vagando. Cuando el estudiante mostraba una postura de cabeza baja y había un objeto como un libro o un cuaderno, este comportamiento podía identificarse como tomar notas o leer un libro. Cuando el comportamiento implicaba una postura de pie y el estudiante estaba de pie en su asiento con la boca abierta, se consideraba que respondía a una pregunta en posición de pie; Si el estudiante no estaba en su asiento, se consideraba que estaba dando un paso por otro, lo que podría indicar que el estudiante llegó tarde a clase o salió del aula, etc. Cuando un estudiante apoyaba la cabeza en el escritorio, se identificaba como dormido. Cuando un estudiante sostenía comida o bebida en las manos, el comportamiento se identificaba como comer o beber. Una boca abierta o una postura conductual que estira el cuerpo indicaban que el alumno estaba bostezando.
| Categoría de comportamiento | Descripción del comportamiento |
| Buscando alrededor | Movimiento evidente de la cabeza hacia la derecha, izquierda o atrás |
| Uso del teléfono móvil | Tocar un móvil con las manos |
| Debatiendo | Boca abierta, acompañada de un movimiento de cabeza |
| Vagando | Una mirada vidriosa en lugares irrelevantes |
| Dando vueltas | Apartándose del asiento |
| Comer o beber | Boca abierta y en contacto con comida o agua |
| Tomar notas o leer | Tomar notas o mirar un libro |
| Escuchando con atención | Mirando la pizarra o al profesor |
| Levantarse (para responder preguntas) | De pie en el asiento con la boca abierta |
| Bostezando | Boca abierta o estiramiento corporal |
| Durmiendo | Cabeza sobre el escritorio |
| Uso del ordenador | Un ordenador abierto sobre el escritorio |
Tabla 1: Categorías y descripciones del comportamiento de los estudiantes.
(3) Análisis de correlación
Utilizando los criterios anteriores, se invitó a 12 profesores experimentados a ver vídeos de los 120 estudiantes y registrar sus tipos y frecuencias de comportamiento. Los comportamientos se identificaron según la Tabla 1. Los profesores se dividieron en cuatro grupos, con tres profesores en cada grupo. Cada grupo era responsable de registrar a 30 estudiantes, y cada uno de los tres profesores registró de forma independiente los comportamientos de 30 alumnos. El Alfa de Cronbach (denominado α) es un indicador para medir la consistencia interna de una escala o cuestionario. El rango de valores del alfa de Cronbach es de 0 a 1, y α ≥ 0,8 suele interpretarse como una buena consistenciainterna 21. Si hubo un alto grado de consistencia (α > 0,8, es decir, un alto grado de consistencia) en la frecuencia de un tipo particular de comportamiento entre los tres profesores, la frecuencia de ese comportamiento se registró como la media de las tres frecuencias. Posteriormente, con los datos representando por un lado las frecuencias de diferentes comportamientos de cada estudiante y, por otro, sus niveles de compromiso conductual, se realizó un análisis de correlación entre ambos factores. El resultado se muestra en la Tabla 2.
| Comportamientos | | Compromiso conductual |
| Comer o beber | Correlación Pearson | .319** |
| Sig. (de dos colas) | 0.004 |
| N | 120 |
| Bostezando | Correlación Pearson | -.335** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Debatiendo | Correlación Pearson | .546** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Dando vueltas | Correlación Pearson | -.774** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Errar | Correlación Pearson | .293** |
| Sig. (de dos colas) | 0.008 |
| N | 120 |
| Buscando alrededor | Correlación Pearson | -.834** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Lectura o toma de notas | Correlación Pearson | .912** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Escuchando con atención | Correlación Pearson | .881** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| De pie | Correlación Pearson | .330** |
| (para responder a una pregunta) | Sig. (de dos colas) | 0 |
| N | 120 |
| Durmiendo | Correlación Pearson | -.411** |
| Sig. (de dos colas) | 0 |
| N | 120 |
| Usando | Correlación Pearson | .591** |
| Teléfono móvil | Sig. (de dos colas) | 0 |
| N | 120 |
| Uso del ordenador | Correlación Pearson | .362** |
| Sig. (de dos colas) | 0.001 |
| N | 120 |
Tabla 2: Resultados del análisis de correlación.
En el análisis de correlación, r es el coeficiente de correlación, que se refiere al grado de correlación lineal entre dos variables, que va de −1 a 1. Según el grado de relación, la correlación puede clasificarse en los siguientes tipos:
Alta correlación (│r│ ≥ 0,70)
Correlación media (0,40 ≤ │r│ ≤ 0,70)
Baja correlación (│r│ ≤ 0,40)
Según la dirección de la relación, puede clasificarse en los siguientes tipos:
Correlación positiva (r > 0)
Correlación negativa (r < 0)
Sin correlación (r = 0)
En la Tabla 1 se pueden ver siete comportamientos, incluyendo mirar alrededor (r = −0,834**, p < 0,05), usar el teléfono móvil (r = 0,591**, p < 0,05), discutir (r = 0,546, p < 0,05), dar vueltas (r = −0,774**, p < 0,05), tomar notas o leer (r = 0,912**, p < 0,05), escuchar atentamente (r = −0,881**, p < 0,05) y dormir (r = −0,411**, p < 0,05), tenían una correlación alta o media con el compromiso conductual, mientras que comportamientos como comer o beber (r = 0,319**, p = 0,04), levantarse (para responder a una pregunta) (r = 0,330**, p = 0,00), bostezar (r = −0,335**, p < 0,05), deambular (r = 0,293, p > 0,05) y usar el ordenador (r = 0,362, p < 0,05) presentaban una correlación baja o nula con el compromiso conductual. A partir del análisis de correlación, este estudio identificó finalmente siete comportamientos como indicadores de compromiso con el aprendizaje: mirar alrededor, usar el teléfono móvil, discutir, moverse, tomar notas o leer, escuchar atentamente y dormir.
Establecimiento del conjunto de datos
Los datos de vídeo utilizados en este estudio se recogieron de la plataforma de grabación directa de SDUST, que proporcionó vídeos sincronizados de la enseñanza real en aula del curso "Inglés Académico". Se recopilaron diez vídeos de cuatro promociones de estudiantes que no eran estudiantes de Filología Inglesa, cada uno de aproximadamente 50 minutos de duración, para establecer un conjunto de datos entrenable sobre el comportamiento de los estudiantes en el aula. Con un fotograma dibujado cada 15 s, se extrajeron finalmente 2.000 imágenes con una resolución de 1.920 × 1.080.
División del conjunto de datos
El experimento dividió el conjunto de datos de comportamiento del estudiante en dos partes completamente independientes: un conjunto de entrenamiento y un conjunto de pruebas, como se muestra en la Tabla 3, sin imágenes compartidas. El conjunto de datos abarcaba los siete comportamientos de los estudiantes. El conjunto de entrenamiento y el conjunto de pruebas se utilizaron para los parámetros del modelo de entrenamiento y para evaluar la precisión, respectivamente. Los parámetros de entrenamiento se establecieron como se muestra en la Tabla 4.
| Conjunto de datos | Número de imágenes |
| Total | 2830 |
| Conjunto de entrenamiento | 2111 |
| Conjunto de pruebas | 719 |
Tabla 3: División del conjunto de datos de comportamiento de los estudiantes.
| Parámetro | Valor |
| Tasa de aprendizaje | 0.01 |
| Impulso | 0.937 |
| Declive de peso | 0.0005 |
| Época | 100 |
| Tamaño del lote | 16 |
Tabla 4: Establecimiento de los parámetros experimentales.
Para evitar fugas de datos causadas por la aparición del mismo estudiante en subconjuntos diferentes y para preservar la continuidad temporal natural de los comportamientos, se adoptó un método llamado "División Temporal Estratificada".
Disyunción de sujeto: El conjunto de datos estaba dividido por identificadores únicos de estudiantes, asegurando que los estudiantes en los conjuntos de entrenamiento, validación y prueba fueran mutuamente excluyentes.
Partición temporal: Los vídeos estaban ordenados cronológicamente. El primer 70% de los segmentos temporales se usó para entrenamiento, el siguiente 15% para validación y el 15% final para pruebas. Este método simulaba mejor la generalización temporal del mundo real en comparación con la división aleatoria.
Equilibrio de clases: Para categorías infrarrepresentadas como "dormido" y "uso de teléfono móvil", se aplicó un sobremuestreo moderado dentro del conjunto de entrenamiento para asegurar que el modelo aprendiera características de todas las categorías.
Anotación de conjunto de datos de entrenamiento
Se utilizó una herramienta de anotación de código abierto para anotar manualmente los datos de entrenamiento. La herramienta se empleaba para la anotación de cajas delimitadoras. El flujo de trabajo específico era el siguiente: (1) Se extrajeron fotogramas clave a una tasa fija (1 fotograma/s) a partir de vídeos de vigilancia que cubrían diferentes escuelas, franjas horarias y tipos de cursos, seguido de procesos de anonimización como el desenfoque facial; (2) Siguiendo el procedimiento estándar de anotación, los anotadores usaron cajas rectangulares para delimitar con precisión al estudiante que realiza un comportamiento específico y asignaron la etiqueta de categoría correspondiente; (3) Las anotaciones se exportaban como archivos XML en formato PASCAL VOC.
Para garantizar la calidad de la etiqueta, especialmente para evitar errores en la distinción de comportamientos ambiguos (por ejemplo, discutir vs. divagar), se implementó un mecanismo colaborativo de "Anotación-Arbitraje en Tres Etapas":
Anotación inicial: Cada fotograma clave era anotado de forma independiente por tres anotadores entrenados. Cada etiqueta consta de una etiqueta de categoría y un recuadro delimitador.
Verificación de consistencia: Se calcularon la intersección sobre la unión y la consistencia de categorías entre anotaciones. Las cajas delimitadoras, que son el resultado de una anotación inicial con IoU > 0,8 y etiquetas de categoría idénticas, se consideraban "anotaciones consistentes". Las cajas delimitadoras con etiquetas de categoría IoU ≤ 0,8 o no idénticas se consideraban "anotaciones inconsistentes".
Arbitraje experto: Para anotaciones inconsistentes (por ejemplo, casos ambiguos como "mirar alrededor" frente a "discutir"), un panel de expertos con experiencia docente tomó la decisión final basándose en el vídeo fragmentado, el contexto conductual y el conocimiento pedagógico previo. La determinación final se realiza verificando la precisión de la etiqueta mediante la inspección del segmento de vídeo fuente del fotograma clave.
La anotación reveló que los comportamientos de los estudiantes se caracterizaban por objetivos múltiples, intensivos y pequeños, como se muestra en la Figura 3.

Figura 3. Un ejemplo de anotación de imágenes en el aula. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Los alumnos en clase mostraban comportamientos como escuchar con atención, usar el móvil y leer o tomar apuntes con frecuencia, mientras que la frecuencia de moverse, deambular, etc., era relativamente baja. La Figura 4 muestra la distribución de comportamientos en el aula en el conjunto de datos de entrenamiento.

Figura 4. Distribución de comportamientos en el conjunto de datos de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Detección del comportamiento de los estudiantes
Los marcos de detección de objetos basados en aprendizaje profundo se dividieron principalmente en doscategorías: 22: métodos de dos etapas, representados por la serie Faster R-CNN, y métodos de una etapa, representados por YOLO. Para la primera categoría, los métodos de detección en dos etapas generaban primero propuestas de región utilizando una Red de Propuestas de Región (RPN) antes de realizar cálculos detallados de probabilidad de clase y regresión en caja delimitadora. Para la segunda categoría, los métodos de una etapa simplificaron el proceso de detección al predecir simultáneamente clases de objetos y cajas delimitadoras en una sola etapa. Aunque los métodos de dos etapas surgieron antes en el desarrollo del campo, los enfoques de una sola etapa han ganado popularidad debido a su arquitectura simplificada y eficiencia computacional. Para lograr un reconocimiento de comportamiento en clase más preciso y eficiente, este estudio seleccionó algoritmos representativos de ambas categorías, concretamente Faster R-CNN23,24 y YOLO-v525,26, para realizar experimentos de detección de conducta en el aula, y comparó los resultados de detección de ambos algoritmos antes de decidir finalmente cuál se utilizará para la detección de conducta en este estudio.
Para evaluar eficientemente los resultados experimentales, se centró en la precisión general de la detección frente al coste temporal de cada modelo algorítmico. Se utilizaron la Precisión Media Media (mAP) y el tiempo de entrenamiento (h) para medir ambos modelos.
Se detectaron siete categorías de comportamientos para reconocimiento mediante ambos métodos, y los valores medios de precisión de detección (PA) se registraron en la Tabla 5. Entre ellas, los YOLO-v5 superaron a Faster R-CNN en la detección de tres categorías de acciones: desplazarse, escuchar atentamente las clases y usar teléfonos móviles, con valores de AP del 100%, 62,7% y 31,8%, respectivamente.
| Modelo de Red | Debatiendo | Dando vueltas | Escuchando con atención | Mirando alrededor | Durmiendo | Tomar notas o leer | Uso del teléfono móvil |
| R-CNN más rápido | 32.6 | 99.5 | 45.4 | 9.3 | 22 | 52.6 | 26.8 |
| YOLO-v5s | 17.8 | 100 | 62.7 | 3.8 | 19 | 51 | 31.8 |
Tabla 5: La precisión media de los dos algoritmos para una sola clase.
El tiempo de entrenamiento y la precisión media de detección de las dos redes clásicas de detección en el conjunto de prueba en un IoU de 0,5 se muestran en la Tabla 6. Aunque la cadena Faster R-CNN tenía mayor precisión, su duración era relativamente larga. En comparación, los YOLO-v5 tenían un tiempo de funcionamiento un 30% más corto con solo una reducción del 0,3% en la precisión, demostrando una mayor mejora en la eficiencia. Dada la necesidad de la detección en tiempo real del comportamiento de los estudiantes en el aula en este estudio, se esperaba que el tiempo de formación para la red fuera lo más corto posible. Considerando tanto la precisión de la detección como el coste temporal de los modelos entrenados en el conjunto de entrenamiento, este artículo concluyó que YOLO-v5s era más adecuado para la detección del comportamiento de los estudiantes en el aula.
| Modelo de Red | h | mAP@0,5 (%) |
| R-CNN más rápido | 2.88 | 41.17 |
| YOLO-v5s | 2.016 | 40.87 |
Tabla 6: Comparación del rendimiento de detección.
Por ello, se eligió YOLO-v5s para realizar la detección de conducta en el aula en este estudio. Los resultados de detección producidos por YOLO-v5 se ilustran en la Figura 5, mostrando la detección continua de comportamientos multi-objetivo junto con las etiquetas correspondientes.

Figura 5. Ejemplos de resultados de detección del conjunto de pruebas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
(1) Aumento y preprocesamiento de datos
Para mejorar la robustez y generalización del modelo, se empleó durante el entrenamiento una estrategia de aumento de datos compuestos, incluyendo transformaciones afines aleatorias, jitter de color y oclusión aleatoria. Todas las imágenes se redimensionaron uniformemente a 640 × 640 píxeles.
(2) Estrategia de entrenamiento
El proceso de formación se dividió en tres fases:
Fase de columna vertebral congelada (Épocas 1-100): La red de columna vertebral estaba congelada y solo se entrenaba la cabeza de detección, usando una baja tasa de aprendizaje para el calentamiento.
Fase completa de ajuste fino de red (Épocas 101-250): Todas las capas de red se descongelaron. Un planificador de recocido coseno ajustaba la tasa de aprendizaje.
Fase de refinamiento (Épocas 251-300): Se aplicó la Media Móvil Exponencial para estabilizar el entrenamiento y se redujo la intensidad de la ampliación de datos para el refinamiento del modelo.
Para abordar el desequilibrio de clases, se aplicaron pesos específicos de clase inversamente proporcionales a sus frecuencias en el conjunto de entrenamiento a la función de pérdida.
(3) Postprocesamiento y optimización temporal
Para mantener la consistencia temporal en los comportamientos en el aula, se aplicó un filtro de consistencia temporal tras la inferencia del modelo. Específicamente, para un objetivo detectado en una secuencia de vídeo, su categoría de comportamiento debía identificarse en al menos tres fotogramas consecutivos para ser confirmada, filtrando así los falsos positivos transitorios.
Establecimiento del método de puntuación del compromiso conductual
Este estudio utilizó el método de grupos focales para asignar puntuaciones a cada comportamiento. Se invitó a veinte profesores universitarios de primera línea a valorar la implicación de las siete categorías de comportamiento basándose en su experiencia en gestión del aula. Los 20 profesores llevaban más de 10 años enseñando y habían impartido una amplia variedad de cursos en múltiples disciplinas. Las puntuaciones de compromiso oscilaron entre 0 y 3, con 0-1 indicando bajo compromiso, 1-2 indicando compromiso medio y 2-3 indicando alto compromiso. Si hubo un alto grado de consistencia (α > 0,8) en las valoraciones de varios evaluadores para un tipo particular de comportamiento, la implicación de ese comportamiento se midió promediando las valoraciones individuales de los profesores. Las valoraciones finales para cada tipo de comportamiento se muestran en la Tabla 7.
| Tipo de comportamiento | Mirando alrededor | Uso del teléfono móvil | Debatiendo | Dando vueltas | Toma de notas o lectura | escuchando atentamente | durmiendo |
| Puntuación de enfrentamiento | 0.9 | 1.2 | 1.9 | 0.6 | 2.7 | 2.8 | 0.2 |
Tabla 7: Valoraciones de comportamiento.
La fórmula para el compromiso conductual de cada estudiante es

ESi = compromiso conductual del estudiante, Sj = puntuación de conducta, fj = frecuencia de comportamiento j.
Suponiendo que el número de conductas detectadas en un alumno en una clase era 100, incluyendo 4 "discutir", 68 "escuchar atentamente", 25 "leer/tomar notas" y 3 "mirar alrededor", la puntuación global de compromiso personal del estudiante era (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. Tomando toda la clase como referencia, el compromiso conductual se dividió en cuatro niveles según la división a intervalos iguales de una escala de 0 a 3: una puntuación inferior a 0,75 se definió como "no implicado", 0,76-1,5 como "ligeramente implicado", 1,6-2,25 como "comprometido" y 2,26-3 como "muy implicado"; por lo tanto, el estudiante fue evaluado como "muy comprometido" con la clase.
El compromiso conductual de toda la clase se refería a la puntuación media de todos los estudiantes. La fórmula para el compromiso conductual de la clase es:

Ec = compromiso conductual de la clase, E S = compromiso conductual de un determinado alumno, n = número de estudiantes