Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Évaluation de l’engagement comportemental dans les salles de classe universitaires via la détection vidéo d’objets basée sur l’apprentissage profond

244 vues

DOI :

10.3791/69299

17 mars 2026

Dans cet article

Résumé

Cette étude évalue l’engagement comportemental des étudiants en détectant leurs comportements dans des vidéos en classe universitaire à l’aide d’un algorithme d’apprentissage profond. Sept comportements positivement corrélés à l’engagement de l’apprentissage sont identifiés, et un modèle de notation est utilisé pour évaluer l’engagement global des élèves individuels et de la classe.

Résumé

Cette étude vise à évaluer l’engagement des étudiants dans les classes universitaires en utilisant la détection vidéo d’objets basée sur l’apprentissage profond. Pour ce faire, par analyse de corrélation, cette recherche a d’abord identifié sept comportements en classe présentant une corrélation très positive avec l’engagement en apprentissage comme indicateurs pour mesurer l’engagement des élèves ; puis elle a rassemblé 30 vidéos synchronisées d’enseignement réel en classe provenant de 6 classes de l’Université des Sciences et Technologies du Shandong (SDUST) et les a divisées en un ensemble de formation et un ensemble de test. Après que les sept comportements aient été annotés manuellement dans les données d’entraînement, un algorithme d’apprentissage automatique était alors entraîné de manière supervisée sur cet ensemble. Une fois entraîné, le modèle générait des annotations initiales pour les données restantes non étiquetées. Pour obtenir une reconnaissance du comportement en classe plus précise et efficace, cette étude a sélectionné deux algorithmes représentatifs, à savoir Faster R-CNN et YOLOv5s, pour les expériences de détection du comportement. Sur la base d’une comparaison de leurs performances de détection en termes de précision et de coût en temps, les YOLOv5 ont été sélectionnés pour la détection du comportement en classe dans cette étude. Enfin, cette étude a utilisé la méthode des groupes de discussion pour attribuer des scores à chaque comportement et développer un modèle de notation de l’engagement à trois niveaux. Basé sur des données comportementales mesurées automatiquement, le modèle permet une évaluation automatique et en temps réel de l’engagement à l’apprentissage, tant au niveau individuel qu’en classe.

Introduction

L’engagement dans l’apprentissage, qui désigne la participation, la concentration et les efforts d’apprentissage des élèves, comprend l’engagement comportemental, l’engagement émotionnel et l’engagementcognitif 1. L’engagement des élèves révèle leur situation d’apprentissage et aide les enseignants à adapter leurs stratégiesd’enseignement 2. Cependant, l’engagement de l’apprentissage en classe est principalement évalué par les auto-rapports des élèves et les observations desenseignants 3. Le ratio élevé enseignants-élèves dans les universités chinoises signifie qu’il faut beaucoup de temps et d’efforts aux enseignants pour utiliser les méthodes manuelles traditionnelles d’évaluation de l’engagement dans l’apprentissage.

Ces dernières années, avec la popularité croissante des salles de classe intelligentes d’enregistrement et de diffusion en Chine, la mesure automatique de l’engagement apprenant basée sur les vidéos en classe est devenuepossible 4. Du point de vue de l’enseignement en classe amélioré par des technologies intelligentes, cette étude a appliqué des méthodes d’apprentissage profond pour détecter les comportements des étudiants dans les vidéos universitaires et a proposé un modèle de notation pour mesurer automatiquement l’engagement comportemental des étudiants.

Un bref aperçu des études sur l’engagement comportemental
Il existe trois principaux niveaux d’engagement comportemental : (1) Au niveau de l’école, il s’agit de l’enthousiasme des élèves à participer à des activitésextrascolaires 5. (2) Au niveau de la classe, elle inclut les comportements positifs des élèves en classe, tels que le respect de l’ordre de classe, ainsi que les comportements destructeurs, comme sécher les cours ou parler enclasse 6. (3) Au niveau du processus d’apprentissage, il fait référence à la participation et aux comportements des élèves dans les tâches d’apprentissage, telles que poser des questions et faire desdevoirs 7. Actuellement, les méthodes d’évaluation de l’engagement comportemental peuvent être globalement classées en trois catégories : manuelle, semi-automatique et automatique8.

Les méthodes manuelles, y compris l’auto-évaluation, les entretiens, l’observation des enseignants et d’autres méthodes traditionnelles d’évaluation, sont laborieuses et difficiles à garantir d’objectivité et de précision. L’analyse des journaux est une méthode d’évaluation semi-automatique représentative qui analyse principalement les données des journaux d’apprentissage collectées par les élèves sur les plateformes d’apprentissage, y compris des indicateurs tels que la fréquence de connexion, la durée en ligne et la précision des réponses. Cette méthode permet d’évaluer l’engagement des élèves de manière plus objective ; cependant, le volume important et la complexité des données posent des défis pour les traitements ultérieurs4. La méthode automatique repose sur la vision par ordinateur, utilisant des dispositifs intelligents, tels que des plateformes d’enregistrement et de diffusion, pour capturer les expressions, gestes, comportements et autres indices visuels des élèves en classe, principalement pour évaluer le comportement en classe. Comparée aux deux méthodes précédentes, cette approche permet une mesure rapide de l’engagement comportemental via des ordinateurs et des algorithmes et est moins sensible à l’interférencesubjective 9.

Une brève revue de l’évaluation de l’engagement comportemental basée sur la détection d’objets
Avec l’essor de l’apprentissage profond, les techniques de détection d’objets sont de plus en plus appliquées à l’analyse de l’engagement dans l’apprentissage. Les algorithmes de détection d’objets réalisent la classification et la localisation des objets dans les images basées sur des réseaux neuronaux convolutionnels. Dans les salles de classe intelligentes équipées de systèmes d’enregistrement vidéo, de tels algorithmes peuvent reconnaître les informations visuelles liées aux postures, gestes et expressions faciales des élèves à partir des vidéos en classe, permettant ainsi l’identification automatique des comportements des élèves et l’évaluation de leur engagement comportemental. Par conséquent, l’état d’apprentissage en classe reflété par les comportements non verbaux des élèves peut être interprétéefficacement 9.

Divers équipements et algorithmes ont été utilisés pour collecter et identifier les multiples comportements non verbaux des élèves à partir de vidéos. Rahman et al.10 ainsi que Zaletelj et Košir11 ont utilisé des capteurs Kinect pour collecter la ligne de vue, les informations faciales, les caractéristiques de la posture corporelle, etc., des élèves, et ont analysé leur niveau d’attention à l’aide d’algorithmes d’apprentissage automatique. Whitehill et al.8 ont utilisé une webcam iPad pour enregistrer les expressions faciales des élèves afin d’entraîner un modèle de reconnaissance, prouvant que la technique d’apprentissage automatique est équivalente à l’observation humaine en termes de précision de l’évaluation de l’engagement dans l’apprentissage. Sukumaran et Manoharan12 ont détecté l’engagement de l’élève grâce aux signaux EGG. Ashwin et Guddeti13 ont utilisé des réseaux neuronaux convolutionnels pour analyser des vidéos en classe en laboratoire afin de détecter des comportements non verbaux, tels que les expressions faciales, les postures des mains et les postures corporelles, afin d’évaluer l’engagement à l’apprentissage. Bai et al.14 ont utilisé Faster R-CNN avec fusion de caractéristiques multiplexée pour détecter des comportements en classe, tels que l’étude, le sommeil et la tête baissée, par apprentissage par transfert. Deng et al.9 ont analysé des vidéos en classe à distance en combinant les techniques d’apprentissage profond Faster R-CNN et ont proposé une méthode permettant d’atteindre la reconnaissance du comportement et la mesure de l’engagement en classe basée sur les postures de tête, de mains et du corps des élèves.

Les premières études ont été principalement menées en laboratoire, dont beaucoup se concentraient sur un seul individu dans un seul scénario10, 11, 12, 13, tandis que des études plus récentes ont de plus en plus examiné les environnements réels de classe9, 14, 15, 16, 17, 18, 19. De plus, la gamme de comportements examinés est devenue de plus en plus diversifiée. Par exemple, Bai et al.14 et Ouyang et al.15 ont analysé des vidéos en classe dans lesquelles seuls deux comportements — tête levée et tête baissée — étaient identifiés. Deng et al.9 ont étudié des vidéos de classe d’école primaire et élargi les catégories de comportements détectés, passant des mouvements de la tête aux mouvements de la main et du corps. Zhang et sescollègues de 16 ans ont recueilli cinq types de comportements des élèves, notamment regarder vers le haut, regarder vers le bas, dormir, regarder autour de lui et bâiller.

Cependant, comme les données ont été collectées dans les salles de classe des écoles primaires, où les élèves sont généralement assis à des positions fixes, la gamme des comportements observables est restée relativement limitée. Ainsi, les études ultérieures se sont de plus en plus concentrées sur les salles de classe universitaires. De nombreuses salles de classe universitaires sont grandes, avec environ une centaine d’étudiants souvent assis au hasard, ce qui rend plus difficile la détection du comportement des étudiants. De plus, dans les vraies classes universitaires, les étudiants présentent une plus grande diversité comportementale et interactivité, incluant des interactions avec les enseignants, les camarades, les tableaux noirs et les manuels. Yan et al.17 ont proposé une méthode de reconnaissance de posture basée sur l’apprentissage profond, BetaPose, conçue pour améliorer la précision de la reconnaissance de posture dans des scènes de classe très fréquentées. Tan et al.18 ont intégré un module d’attention coordonnée (CA) dans le réseau YOLOv9, et le modèle CA-YOLOv9 résultant a été appliqué à la reconnaissance de sept comportements en classe dans des environnements universitaires complexes avec de grandes populations étudiantes. Wang et al.19 ont proposé un réseau bidirectionnel d’augmentation des caractéristiques (BATNet) pour identifier les comportements des élèves dans des classes intelligentes, en particulier pour les cibles petites et occultées.

Avec le développement des algorithmes, la rapidité et la précision de la détection du comportement ont été grandement améliorées ; Cependant, les études actuelles ont ignoré l’explication de la corrélation entre les comportements détectés en classe et l’engagement des élèves, laissant sans réponse des questions telles que la possibilité que certains comportements puissent servir de paramètres pour mesurer l’engagement comportemental, et quels comportements peuvent refléter efficacement l’engagement de l’apprentissage. De plus, il faut trouver un moyen explicite de montrer l’engagement comportemental des élèves. Ainsi, cette étude a identifié des comportements en classe fortement liés à l’engagement des élèves par l’analyse de corrélation ; Parallèlement, un système de notation a été développé pour construire un modèle d’évaluation de l’engagement comportemental. Par conséquent, une mesure automatique de l’engagement comportemental peut être réalisée tant pour les élèves individuels que pour la classe dans son ensemble.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Toutes les vidéos ont été obtenues et utilisées conformément aux pratiques éthiques actuelles de recherche humaine telles que prescrites par l’Université des Sciences et Technologies du Shandong. L’approbation a été obtenue pour l’utilisation des données.

Premièrement, une analyse de corrélation a été réalisée pour identifier les comportements des élèves pouvant servir d’indicateurs d’engagement comportemental. Après que le jeu de données ait été établi par extraction de trames et divisé en un ensemble d’entraînement et un ensemble de test, deux algorithmes représentatifs pour la détection d’objets ont été exécutés dans l’ensemble d’entraînement et comparés en termes de précision et d’efficacité. Enfin, l’algorithme de meilleure performance (YOLO-v5s) a été sélectionné pour fonctionner sur l’ensemble de tests afin d’effectuer la détection de comportement. La Figure 1 présente l’organigramme du processus d’identification et de détection des comportements des élèves.

figure-protocol-1
Figure 1. Organigramme d’identification et de détection des comportements des élèves. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Identification des indicateurs
Avant de réaliser des expériences de détection d’objets, il fallait identifier les comportements non verbaux indiquant l’engagement comportemental des élèves. À ce jour, des études sur l’engagement comportemental basées sur la détection d’objets ont réussi à détecter une variété de comportements non verbaux, notamment la ligne de vue, l’information faciale et la posturecorporelle 9,10,11,12,13,14. Cependant, la question de savoir si certains comportements sont justifiés comme indicateurs de l’engagement comportemental des élèves n’a pas encore été discutée. Ainsi, dans cette étude, une analyse de corrélation entre les comportements des élèves et leur niveau d’engagement comportemental a été utilisée pour identifier les comportements indicatifs de l’engagement comportemental.

(1) Test d’engagement comportemental
Cette étude a sélectionné 122 étudiants de premier cycle issus de quatre classes naturelles de non-étudiants en anglais à SDUST-Jinan comme échantillon pour une étude corrélationnelle. Tout d’abord, des échelles d’auto-évaluation ont été utilisées pour collecter des données d’engagement comportemental auprès des 122 élèves, visant à comprendre leur statut d’engagement comportemental d’un point de vue d’expérience interne. Étant donné que les données vidéo de la classe pour cette étude proviennent de cours « Academic English », l’outil d’évaluation multidimensionnel pour l’engagement de l’apprentissage dans les salles de classe universitaires d’anglais, développé par RenQingmei 20 , a été adopté. Cet instrument est spécifiquement conçu pour l’enseignement des langues étrangères chinoises et utilise la même catégorisation classique de l’engagement à l’apprentissage que cette étude, englobant trois dimensions : engagement comportemental, affectif et cognitif. Parmi eux, l’instrument d’engagement comportemental comprend neuf éléments, correspondant à l’interaction enseignant-élève (par exemple, « Je réponds activement aux questions posées par l’enseignant en cours d’anglais »), l’effort individuel (par exemple, « J’examine attentivement les difficultés rencontrées pendant l’apprentissage en cours d’anglais »), l’interaction entre pairs (par exemple, « Je collabore avec d’autres élèves pour accomplir des tâches d’apprentissage en cours d’anglais »), etc. Chaque élément est présenté dans un format Likert à l’échelle de 5 points, avec des options de réponse telles que « presque jamais, rarement, parfois, souvent, toujours », notées de 1 à 5, obligeant les élèves à choisir l’option qui correspond le mieux à leur expérience d’apprentissage. Les élèves ayant obtenu 15 points ou moins ont été classés comme élèves à faible engagement, ceux obtenant 16 à 30 points comme étudiants à engagement modéré, et ceux obtenant 31 à 45 points comme étudiants à fort engagement. Enfin, 120 échelles valides ont été collectées, avec 17 élèves dans la catégorie faible engagement, 45 dans la catégorie modéré et 58 dans la catégorie à fort engagement.

(2) Identification du comportement
Par ailleurs, quatre vidéos enregistrées totalisant 50 minutes issues des cours d'« anglais académique » pleinement suivis dans ces quatre cours ont été collectées. Avec un cadre dessiné tous les 15 s, 200 images étaient finalement extraites pour observation. Sur la base de visionnages répétés des vidéos par trois élèves, cette étude a initialement identifié 12 types de comportements en classe : regarder autour d’eux, utiliser son téléphone portable, discuter, se promener, manger ou boire, prendre des notes ou lire, écouter attentivement, se lever (pour répondre à une question), bâiller, dormir et utiliser l’ordinateur. Des exemples des 12 comportements sont présentés à la Figure 2.

figure-protocol-2
Figure 2. Exemples de 12 comportements. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Chaque type était accompagné de descriptions détaillées des caractéristiques visuelles et du contexte spatiotemporel, formant la procédure opérationnelle standard pour l’annotation comportementale en classe, assurant la cohérence conceptuelle entre les annotations. Le tableau 1 présente les 12 catégories de comportement des élèves ainsi que les descriptions de chacun de ces comportements.

Regarder autour de lui impliquait de tourner la tête vers la gauche, la droite et l’arrière de façon significative. Les élèves étaient considérés comme en discussion s’ils tournaient la tête et ouvraient la bouche. Dans le contexte de la classe, écouter attentivement était associé au fait de regarder directement le tableau noir ou l’enseignant debout devant eux ; Quand le regard se tournait ailleurs, l’élève était très probablement en train de s’égarer. Lorsque l’élève affichait une posture tête baissée, et qu’il y avait un objet comme un livre ou un carnet, ce comportement pouvait être identifié comme la prise de notes ou la lecture d’un livre. Lorsque le comportement impliquait une posture debout et que l’élève était debout à sa place la bouche ouverte, il était considéré comme répondant à une question debout ; Si l’élève était en démarche, il était considéré comme étant en train de se promener, ce qui pouvait indiquer qu’il était en retard en cours ou qu’il avait quitté la classe, etc. Lorsqu’un élève posait sa tête sur le bureau, il était identifié comme dormant. Lorsqu’un élève tenait de la nourriture ou des boissons dans ses mains, ce comportement était identifié comme manger ou boire. Une bouche grande ouverte ou une posture comportementale d’étirement du corps indiquaient que l’élève bâillait.

Catégorie de comportementDescription du comportement
On regarde autour de moiMouvement évident de la tête vers la droite, la gauche ou l’arrière
Utilisation du téléphone mobileToucher un téléphone portable avec les mains
DiscussionBouche ouverte, accompagnée d’un mouvement de la tête
erranceUn regard vitreux fixé sur des lieux sans importance
Faire le tourEn se retirant du siège
Manger ou boireBouche ouverte et en contact avec la nourriture ou l’eau
Prendre des notes ou lirePrendre des notes ou regarder un livre
Écouter attentivementFixer le tableau noir ou le professeur
Se lever (pour répondre aux questions)Debout à la chaise, la bouche grande ouverte
BâillementBouche ouverte ou étirement du corps
DormirTête sur le bureau
Utilisation de l’ordinateurUn ordinateur ouvert sur le bureau

Tableau 1 : Catégories et descriptions des comportements des élèves.

(3) Analyse de corrélation
En utilisant les critères ci-dessus, 12 enseignants expérimentés ont été invités à regarder des vidéos des 120 élèves et à enregistrer leurs types et fréquences comportementales. Les comportements ont été identifiés selon le tableau 1. Les enseignants étaient répartis en quatre groupes, avec trois enseignants dans chaque groupe. Chaque groupe était responsable de l’enregistrement de 30 élèves, chacun des trois enseignants enregistrant indépendamment les comportements de 30 élèves. L’Alpha de Cronbach (appelé α) est un indicateur permettant de mesurer la cohérence interne d’une échelle ou d’un questionnaire. L’intervalle de valeurs de l’alpha de Cronbach est de 0 à 1, et α ≥ 0,8 est généralement interprété comme une bonne cohérence interne21. S’il y avait un haut degré de cohérence (α > 0,8, c’est-à-dire un haut degré de cohérence) dans la fréquence d’un type particulier de comportement chez les trois enseignants, la fréquence de ce comportement était enregistrée comme la moyenne des trois fréquences. Par la suite, les données représentant d’une part la fréquence des différents comportements de chaque élève, et de l’autre leur niveau d’engagement comportemental, une analyse de corrélation entre les deux facteurs a été réalisée. Le résultat est présenté dans le tableau 2.

ComportementsEngagement comportemental
Manger ou boireCorrélation de Pearson.319**
Sig. (à deux queues)0.004
N120
BâillementCorrélation de Pearson-.335**
Sig. (à deux queues)0
N120
DiscussionCorrélation de Pearson.546**
Sig. (à deux queues)0
N120
Faire le tourCorrélation de Pearson-.774**
Sig. (à deux queues)0
N120
ErranceCorrélation de Pearson.293**
Sig. (à deux queues)0.008
N120
On regarde autour de moiCorrélation de Pearson-.834**
Sig. (à deux queues)0
N120
Lecture ou prise de notesCorrélation de Pearson.912**
Sig. (à deux queues)0
N120
Écouter attentivementCorrélation de Pearson.881**
Sig. (à deux queues)0
N120
Se leverCorrélation de Pearson.330**
(pour répondre à une question)Sig. (à deux queues)0
N120
DormirCorrélation de Pearson-.411**
Sig. (à deux queues)0
N120
UtilisationCorrélation de Pearson.591**
Téléphone portableSig. (à deux queues)0
N120
Utilisation de l’ordinateurCorrélation de Pearson.362**
Sig. (à deux queues)0.001
N120

Tableau 2 : Résultats de l’analyse de corrélation.

En analyse de corrélation, r est le coefficient de corrélation, faisant référence au degré de corrélation linéaire entre deux variables, allant de −1 à 1. Selon le degré de relation, la corrélation peut être classée en les types suivants :
Forte corrélation (│r│ ≥ 0,70)
Corrélation moyenne (0,40 ≤ │r│ ≤ 0,70)
Faible corrélation (│r│ ≤ 0,40)

Selon la direction de la relation, elle peut être classée en les types suivants :
Corrélation positive (r > 0)
Corrélation négative (r < 0)
Aucune corrélation (r = 0)

D’après le tableau 1, on peut voir que sept comportements, dont regarder autour de lui (r = −0,834**, p < 0,05), utiliser le téléphone portable (r = 0,591**, p < 0,05), discuter (r = 0,546, p < 0,05), faire le tour (r = −0,774**, p < 0,05), prendre des notes ou lire (r = 0,912**, p < 0,05), écouter attentivement (r = −0,881**, p < 0,05), et dormir (r = −0,411**, p < 0,05), présentaient une corrélation élevée ou moyenne avec l’engagement comportemental, tandis que des comportements tels que manger ou boire (r = 0,319**, p = 0,04), se lever (pour répondre à une question) (r = 0,330**, p = 0,00), bâiller (r = −0,335**, p < 0,05), errer (r = 0,293, p > 0,05) et utiliser l’ordinateur (r = 0,362, p < 0,05) présentaient une corrélation faible ou nulle avec l’engagement comportemental. Sur la base de l’analyse de corrélation, cette étude a finalement identifié sept comportements comme indicateurs de l’engagement à l’apprentissage, à savoir regarder autour de soi, utiliser un téléphone portable, discuter, se promener, prendre des notes ou lire, écouter attentivement et dormir.

Établissement de l’ensemble de données
Les données vidéo utilisées dans cette étude ont été collectées sur la plateforme d’enregistrement direct de SDUST, qui a fourni des vidéos synchronisées de l’enseignement en classe réel du cours « Academic English ». Dix vidéos de quatre classes d’étudiants non en anglais ont été collectées, chacune d’environ 50 minutes, afin d’établir un ensemble de données entraînable sur le comportement des élèves en classe. Avec une image dessinée tous les 15 s, 2 000 images étaient finalement extraites avec une résolution de 1 920 × 1 080.

Répartition des jeux de données
L’expérience a divisé le jeu de données comportementale des élèves en deux parties complètement indépendantes : un ensemble d’entraînement et un ensemble de test, comme montré dans le tableau 3, sans images partagées. Le jeu de données couvrait les sept comportements des élèves. L’ensemble d’entraînement et l’ensemble de test étaient utilisés respectivement pour les paramètres du modèle d’entraînement et l’évaluation de la précision. Les paramètres d’entraînement étaient définis comme indiqué dans le tableau 4.

Ensemble de donnéesNombre d’images
Total2830
Ensemble d’entraînement2111
Ensemble d’essai719

Tableau 3 : Répartition des ensembles de données comportementales des élèves.

ParamètreValeur
Taux d’apprentissage0.01
Élan0.937
Perte de poids0.0005
Époque100
Taille du lot16

Tableau 4 : Définition des paramètres expérimentaux.

Pour éviter la fuite de données causée par l’apparition du même étudiant dans des sous-ensembles différents et pour préserver la continuité temporelle naturelle des comportements, une méthode de « Splitation Temporelle Stratifiée » a été adoptée.

Disjonction sujette : Le jeu de données était partitionné par identifiants d’étudiant uniques, garantissant que les étudiants des ensembles d’entraînement, de validation et de test étaient mutuellement exclusifs.

Partition temporelle : Les vidéos étaient classées chronologiquement. Les 70 % premiers des segments temporels ont été utilisés pour l’entraînement, les 15 % suivants pour la validation, et les 15 % restants pour les tests. Cette méthode simulait mieux la généralisation temporelle réelle comparée à la découpe aléatoire.

Équilibrage des classes : Pour les catégories sous-représentées telles que « dormant » et « utilisant un téléphone portable », un suréchantillonnage modéré a été appliqué dans l’ensemble d’entraînement afin de garantir que le modèle apprenne les caractéristiques de toutes les catégories.

Annotation de l’ensemble de données d’entraînement
Un outil d’annotation open source a été utilisé pour annoter manuellement les données d’entraînement. L’outil était utilisé pour l’annotation de boîtes englobantes. Le flux de travail spécifique était le suivant : (1) Les images clés étaient extraites à un rythme fixe (1 image/s) à partir de vidéos de surveillance couvrant différentes écoles, créneaux horaires et types de cours, suivies d’un traitement d’anonymisation comme le flou facial ; (2) Suivant la procédure standard d’annotation, les annotateurs utilisaient des cases rectangulaires pour délimiter précisément l’élève effectuant un comportement spécifique et assignaient l’étiquette de catégorie correspondante ; (3) Les annotations étaient exportées sous forme de fichiers XML au format PASCAL VOC.

Pour garantir la qualité des étiquettes, notamment pour éviter les erreurs de distinction entre comportements ambigus (par exemple, discuter vs. errer), un mécanisme collaboratif « Annotation-Arbitrage en trois étapes » a été mis en place :

Annotation initiale : Chaque image clé était annotée indépendamment par trois annotateurs entraînés. Chaque étiquette se compose d’une étiquette de catégorie et d’une boîte englobante.

Vérification de la cohérence : L’intersection sur l’Union et la cohérence des catégories entre les annotations ont été calculées. Les boîtes englobantes, qui sont le résultat d’une annotation initiale avec IoU > 0,8 et des étiquettes de catégorie identiques, étaient considérées comme des « annotations cohérentes ». Les boîtes englobantes avec des étiquettes de catégorie IoU ≤ 0,8 ou non identiques étaient considérées comme des « annotations incohérentes ».

Arbitrage d’experts : Pour les annotations incohérentes (par exemple, des cas ambigus tels que « regarder autour » vs. « discuter »), un panel d’experts ayant une expérience pédagogique prenait la décision finale en se basant sur le clip vidéo, le contexte comportemental et les connaissances pédagogiques antérieures. La détermination finale est prise en vérifiant la précision de l’étiquette par l’inspection du segment vidéo source de l’image clé.

L’annotation a révélé que les comportements des élèves étaient caractérisés par des cibles multiples, intensives et petites, comme le montre la Figure 3.

figure-protocol-3
Figure 3. Un exemple d’annotation d’images de classe. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Les élèves en classe ont montré des comportements tels qu’écouter attentivement, utiliser un téléphone portable, lire ou prendre des notes fréquemment, tandis que la fréquence des déplacements, des errances, etc. était relativement faible. La figure 4 montre la répartition des comportements en classe dans le jeu de données d’entraînement.

figure-protocol-4
Figure 4. Distribution des comportements dans le jeu de données d’entraînement. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Détection des comportements des élèves
Les cadres de détection d’objets basés sur l’apprentissage profond étaient principalement divisés en deux catégories: 22 : les méthodes à deux étapes, représentées par la série Faster R-CNN, et les méthodes à un seul étape, représentées par YOLO. Pour la première catégorie, les méthodes de détection en deux étapes ont d’abord généré des propositions de région en utilisant un Réseau de Proposition de Région (RPN) avant d’effectuer des calculs détaillés de probabilité de classe et une régression par boîtes englobantes. Pour la seconde catégorie, les méthodes à une étape ont simplifié le processus de détection en prédisant simultanément les classes d’objets et les boîtes englobantes en une seule étape. Alors que les méthodes à deux étapes sont apparues plus tôt dans le développement du domaine, les approches à une étape ont gagné en popularité grâce à leur architecture simplifiée et leur efficacité de calcul. Pour obtenir une reconnaissance du comportement en classe plus précise et efficace, cette étude a sélectionné des algorithmes représentatifs des deux catégories, à savoir Faster R-CNN23,24 et YOLO-v525,26, pour mener des expériences de détection du comportement en classe, et a comparé les résultats de détection des deux algorithmes avant de finalement choisir l’algorithme utilisé pour la détection du comportement dans cette étude.

Afin d’évaluer efficacement les résultats expérimentaux, l’accent a été mis sur la précision globale de la détection par rapport au coût temporel de chaque modèle algorithmique. La Précision Moyenne Moyenne (mAP) et le temps d’entraînement (h) ont été utilisés pour mesurer les deux modèles.

Sept catégories de comportements ont été détectées pour reconnaissance par les deux méthodes, et les valeurs moyennes de précision de détection (AP) ont été enregistrées dans le tableau 5. Parmi eux, les YOLO-v5 ont surpassé Faster R-CNN dans la détection de trois catégories d’actions : se déplacer, écouter attentivement les cours et utiliser des téléphones portables, avec des valeurs AP de 100 %, 62,7 % et 31,8 % respectivement.

Modèle de réseauDiscussionFaire le tourÉcouter attentivementEn regardant autour de luiDormirPrendre des notes ou lireUtilisation du téléphone mobile
R-CNN plus rapide32.699.545.49.32252.626.8
YOLO-v5s17.810062.73.8195131.8

Tableau 5 : La précision moyenne des deux algorithmes pour une seule classe.

Le temps d’entraînement et la précision moyenne de détection des deux réseaux de détection classiques sur l’ensemble de test à un IoU de 0,5 sont présentés dans le tableau 6. Bien que le réseau Faster R-CNN ait une précision plus élevée, sa durée d’utilisation était relativement longue. En comparaison, les YOLO-v5 avaient une durée de fonctionnement 30 % plus courte avec seulement une réduction de précision de 0,3 %, démontrant une amélioration plus importante de l’efficacité. Compte tenu de la nécessité de détecter en temps réel le comportement des élèves en classe dans cette étude, il était attendu que le temps de formation pour le réseau soit aussi court que possible. En tenant compte à la fois de la précision de la détection et du coût en temps des modèles entraînés sur l’ensemble d’entraînement, cet article a conclu que YOLO-v5s était plus adapté à la détection du comportement des élèves en classe.

Modèle de réseauhmAP@0,5 ( %)
R-CNN plus rapide2.8841.17
YOLO-v5s2.01640.87

Tableau 6 : Comparaison des performances de détection.

Ainsi, YOLO-v5s a été choisi pour effectuer la détection du comportement en classe dans cette étude. Les résultats de détection produits par YOLO-v5 sont illustrés à la Figure 5, montrant la détection continue du comportement multi-cible avec les étiquettes correspondantes.

figure-protocol-5
Figure 5. Exemples de résultats de détection de l’ensemble de test. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

(1) Augmentation et prétraitement des données
Pour renforcer la robustesse et la généralisation des modèles, une stratégie d’augmentation des données composites a été employée pendant l’entraînement, incluant des transformations affines aléatoires, le jitter de couleur et l’occlusion aléatoire. Toutes les images ont été uniformément redimensionnées à 640 × 640 pixels.

(2) Stratégie d’entraînement
Le processus de formation a été divisé en trois phases :
Phase de la colonne vertébrale gelée (époques 1-100) : Le réseau de la colonne vertébrale était gelé, et seule la tête de détection était entraînée, utilisant un faible taux d’apprentissage pour l’échauffement.
Phase complète de réglage fin du réseau (Époques 101-250) : Toutes les couches réseau ont été dégelées. Un planificateur de recuit cosinus ajustait le taux d’apprentissage.
Phase de raffinement (Époques 251-300) : Une moyenne mobile exponentielle a été appliquée pour stabiliser l’entraînement, et l’intensité de l’augmentation des données a été réduite pour le raffinement du modèle.

Pour corriger le déséquilibre de classe, des poids spécifiques à chaque classe inversement proportionnels à leurs fréquences dans l’ensemble d’entraînement ont été appliqués à la fonction de perte.

(3) Post-traitement et optimisation temporelle
Pour maintenir la cohérence temporelle des comportements en classe, un filtre de cohérence temporelle a été appliqué après l’inférence du modèle. Plus précisément, pour une cible détectée dans une séquence vidéo, sa catégorie de comportement devait être identifiée dans au moins trois images consécutives pour être confirmée, filtrant ainsi ainsi les faux positifs transitoires.

Établissement d’une méthode de notation comportementale de l’engagement
Cette étude a utilisé la méthode des groupes de discussion pour attribuer des scores à chaque comportement. Vingt enseignants universitaires de première ligne ont été invités à évaluer l’engagement des sept catégories de comportement en fonction de leur expérience en gestion de classe. Les 20 enseignants enseignaient depuis plus de 10 ans et avaient donné un large éventail de cours dans plusieurs disciplines. Les scores d’engagement variaient de 0 à 3, 0-1 indiquant un faible engagement, 1-2 un engagement moyen, et 2-3 un engagement élevé. S’il y avait un degré élevé de cohérence (α > 0,8) dans les évaluations de plusieurs évaluateurs pour un type particulier de comportement, l’engagement de ce comportement était mesuré en moyennant les évaluations individuelles des enseignants. Les évaluations finales pour chaque type de comportement sont présentées dans le tableau 7.

Type de comportementEn regardant autour de luiUtilisation du téléphone portableDiscussionFaire le tourPrise de notes ou lectureÉcouter attentivementDormant
Score d’engagement0.91.21.90.62.72.80.2

Tableau 7 : Évaluations du comportement.

La formule d’engagement comportemental de chaque élève est la suivante

figure-protocol-6

ESi = engagement comportemental de l’élève, Sj = score du comportement, fj = fréquence du comportement j.

En supposant que le nombre de comportements détectés chez un élève dans une classe était de 100, incluant 4 « discussion », 68 « écoute attentive », 25 « lecture/prise de notes » et 3 « observation autour de lui », le score global d’engagement personnel de l’élève était (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. En prenant l’ensemble du cours comme référence, l’engagement comportemental a été divisé en quatre niveaux selon une division à intervalles égaux d’une échelle de 0 à 3 : un score inférieur à 0,75 était défini comme « non engagé », 0,76-1,5 comme « légèrement engagé », 1,6-2,25 comme « engagé » et 2,26-3 comme « très engagé » ; Ainsi, l’élève a été évalué comme « très engagé » pour la classe.

L’engagement comportemental de toute la classe faisait référence au score moyen de tous les élèves. La formule pour l’engagement comportemental de la classe est la suivante :

figure-protocol-7

Ec = engagement comportemental de la classe, ES = engagement comportemental d’un certain élève, n = nombre d’élèves

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

En détectant les comportements et en utilisant le modèle de notation, une mesure automatique de l’engagement comportemental des élèves a été obtenue. En prenant un cours dans la vidéo par exemple, l’engagement comportemental en temps réel de chaque élève pourrait être calculé à partir des résultats de détection comportementale et du modèle de notation. La Figure 6 illustre l’engagement comportemental de deux élèves dans cette classe, afficha...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude a permis de reconnaître et de mesurer automatiquement l’engagement comportemental. Comparés aux études précédentes, les comportements identifiés étaient plus représentatifs des salles de classe universitaires (comme l’utilisation du téléphone portable), et l’évaluation de l’engagement comportemental était présentée en chiffres, ce qui rendait la perception intuitive. Cette approche de mesure automatique a permis aux enseignants d’évaluer efficacement et clairement l’engagemen...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Cette recherche a été soutenue par le programme du Fonds de planification des sciences sociales du Shandong (23CRWJ11).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Vidéos en classeLes données vidéo utilisées dans cette étude sont collectées sur la plateforme d’enregistrement direct de l’Université des Sciences et Technologies du Shandong (SDUST), qui sont des vidéos synchronisées de l’enseignement en classe réel du cours d’anglais académique. 30 vidéos de 6 classes de non-étudiants en anglais ont été collectées, d’environ 50 minutes chacune, afin d’établir un ensemble de données entraînable des étudiants Comportement en classe.
IBM SPSS Statistiques 26IBMSPSS pour Windows est un logiciel modulaire qui intègre des fonctions de saisie, d’organisation et d’analyse de données. Ses fonctions de base incluent la gestion des données, l’analyse statistique, l’analyse des graphiques, la gestion des résultats, etc. SPSS est principalement utilisé dans cet article pour l’analyse de cohérence et l’analyse de corrélation.
Étiquetage 1.8.6L’étiquetage est un outil d’annotation visuelle d’images. Il est écrit en Python et utilise Qt comme interface graphique. Les annotations sont enregistrées sous forme de fichiers XML au format PASCAL VOC, utilisé par ImageNet. De plus, il prend en charge le format YOLO. Il est utilisé pour les ensembles de données nécessaires aux réseaux de détection d’objets tels que Faster R-CNN, YOLO et SSD afin d’annoter des objets dans les images.
MMDetection 2.22.0MMDetection, 2.22.0, MMDetection est une boîte à outils de détection d’objets qui inclut des méthodes de détection d’objets riches, de segmentation d’instance et de segmentation panoramique, ainsi que des composants et modules associés.

Références

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

D tection du comportement en classevaluation de l engagement dans l apprentissageFaster R CNNYOLOv5sApprentissage supervisvaluation en temps r elAnalyse de corr lation