Article de recherche

Reconnaissance du comportement en classe via un transformateur et un mécanisme d’attention : application dans l’évaluation de la qualité de l’enseignement pour l’éducation médicale par IA

DOI :

10.3791/69052

15 août 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un système d’IA basé sur Transformer pour reconnaître le comportement en classe dans l’enseignement de la médecine et des soins infirmiers. À l’aide de données multimodales, le système évalue l’engagement et les états émotionnels des apprenants. Les résultats démontrent une plus grande précision par rapport aux modèles traditionnels, ce qui permet un retour d’information en temps réel et un meilleur soutien à la qualité de l’enseignement et à la santé mentale des élèves.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un système d’intelligence artificielle basé sur Transformer conçu pour la reconnaissance du comportement en classe, visant à améliorer l’évaluation de la qualité de l’enseignement et le suivi de la santé mentale dans l’enseignement de la médecine et des soins infirmiers. Le modèle utilise des données multimodales, en particulier la vidéo, l’audio et les mouvements squelettiques, pour évaluer les indicateurs clés de l’engagement des élèves, tels que la capacité d’attention, la fréquence des interactions et les fluctuations émotionnelles. Une nouvelle stratégie de fusion multimodale, combinée à des mécanismes d’attention spatio-temporelle, permet au système de capturer des comportements complexes en classe avec une précision et une robustesse améliorées. Les résultats expérimentaux sur les ensembles de données EduSense et SBU Kinect démontrent que la méthode proposée surpasse considérablement les modèles traditionnels en termes de précision et de taux de fausses alertes. De plus, les études d’ablation confirment la contribution des modules d’attention spatiale et temporelle à la capacité de reconnaissance du système. Le cadre prend en charge la rétroaction en temps réel et la cartographie visuelle du comportement, offrant une valeur pratique dans les environnements d’apprentissage par l’expérience. Cette approche fournit une solution évolutive et adaptative pour la surveillance du comportement en classe et soutient les stratégies d’intervention précoce en éducation médicale.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Avec les défis croissants en matière de santé mentale chez les étudiants en soins infirmiers et en médecine en raison du stress académique et clinique, l’intégration de l’intelligence artificielle dans les environnements de classe peut fournir non seulement un suivi de qualité de l’enseignement, mais aussi un soutien psychologique en temps réel. Cette étude positionne la reconnaissance du comportement dans l’éducation médicale pour soutenir l’apprentissage par l’expérience et promouvoir le bien-être des étudiants1. La salle de classe intelligente fait référence à un nouveau modèle éducatif de haute qualité qui combine des processus d’enseignement intelligents et personnalisés grâce à l’application de technologies de pointe, telles que les technologies de l’information, l’intelligence artificielle, les mégadonnées et l’Internet des objets, pour faciliter la gestion de l’enseignement et l’interaction en classe 2,3,4. Actuellement, avec le développement de technologies telles que les caméras et les capteurs, les données comportementales collectées en classe comprennent non seulement des vidéos, mais aussi des données multimodales, telles que la voix et l’audio5. Cependant, le traitement de ces informations et données spatio-temporelles complexes et l’extraction précise de caractéristiques comportementales précieuses sont les principaux défis auxquels est confronté le domaine de la reconnaissance intelligente du comportement en classe 6,7. Les approches existantes de reconnaissance comportementale reposent principalement sur l’extraction de caractéristiques à partir de sources de données monomodales, telles que les flux vidéo en classe ou les images séquentielles8. Bien que ces méthodes puissent détecter des événements comportementaux grossiers, elles ne parviennent souvent pas à modéliser l’évolution temporelle et les nuances spatiales des gestes, des expressions ou des facteurs de fréquence d’interaction des élèves essentiels à la compréhension du bien-être et de la concentration de l’apprenant9. De plus, les modèles actuels manquent de mécanismes robustes pour fusionner des sources de données hétérogènes telles que les indices audio et les mouvements squelettiques, ce qui limite leur sensibilité aux comportements affectifs ou désengagés10. Pour remédier à ces limitations, cette étude propose un système de reconnaissance du comportement de la classe basé sur un transformateur amélioré avec des mécanismes d’attention spatio-temporelle. En tirant parti de la capacité du Transformer à modéliser des dépendances à longue portée et en la combinant avec des stratégies de fusion de caractéristiques multimodales, le système proposé vise à améliorer la précision de la classification des comportements tout en permettant une visualisation en temps réel des indicateurs d’engagement et émotionnels. L’objectif ultime est de soutenir l’évaluation dynamique de la qualité de l’enseignement et la rétroaction sur la santé mentale intégrée dans la formation médicale, en offrant une solution évolutive et adaptative pour surveiller et améliorer à la fois l’efficacité pédagogique et le bien-être de l’apprenant.

L’évaluation propose un nouveau système de reconnaissance comportementale basé sur Transformer qui combine des mécanismes d’attention spatio-temporelle avec une fusion de données multimodale (entrées vidéo et squelette) adaptée à l’observation intelligente en classe dans l’enseignement de la médecine et des soins infirmiers. Contrairement aux modèles existants, le nouveau modèle facilite l’attention précise et en temps réel des élèves et la détection de l’état émotionnel, ce qui est précieux pour l’évaluation de la qualité de l’enseignement et le bien-être psychologique.

Œuvres connexes
La salle de classe intelligente est un nouvel environnement d’enseignement qui utilise les technologies de l’information modernes pour améliorer l’interaction pédagogique, l’apprentissage personnalisé et la gestion de l’enseignement. Il peut utiliser des méthodes d’enseignement intelligentes pour améliorer l’efficacité et la qualité de l’enseignement tout en offrant aux étudiants des expériences d’apprentissage plus riches et plus personnalisées. Par conséquent, de nombreux chercheurs du monde entier ont fait des recherches sur la technologie intelligente et l’enseignement en classe. Radosavljevic et al. ont proposé un modèle de classe intelligent basé sur l’intelligence environnementale, qui évalue les niveaux de fatigue des élèves et ajuste les stratégies d’apprentissage en analysant leurs données d’activité scolaire quotidienne pour optimiser les résultats d’apprentissage11. Tai T. Y a étudié l’effet des assistants personnels intelligents sur l’amélioration de la capacité d’expression orale d’une langue étrangère et a constaté que l’utilisation de Google Assistant améliorait considérablement la capacité d’expression des locuteurs non natifs, avec des effets similaires à ceux des locuteurs natifs dans la communication12. Chen et al. ont découvert dans le cadre de leurs recherches que l’utilisation de chatbots comme outils d’enseignement pouvait répondre rapidement aux besoins des étudiants, améliorer l’interactivité et démontrer l’application potentielle de la technologie intelligente en classe13. La recherche a mis au point une méthode d’évaluation de l’efficacité de l’enseignement en classe basée sur le mode d’enseignement intelligent, qui a amélioré la précision de l’évaluation en utilisant l’algorithme de recherche de coucou et l’apprentissage extrêmemachine 14.

La reconnaissance du comportement dans les salles de classe intelligentes est une technologie clé pour réaliser un enseignement personnalisé et optimiser la gestion de classe. Il peut surveiller l’état du comportement des élèves en temps réel et fournir un retour d’information efficace. Grâce à la reconnaissance du comportement, les enseignants peuvent comprendre avec précision la participation et la concentration des élèves, améliorant ainsi l’efficacité de l’enseignement et aidant à la prise de décision. Dans ce contexte, des chercheurs du monde entier ont mené des recherches approfondies sur la reconnaissance intelligente du comportement en classe. La recherche a proposé un système de surveillance visuelle en temps réel basé sur l’intelligence artificielle, qui utilisait l’apprentissage automatique pour former des modèles de reconnaissance du comportement des élèves afin d’aider les enseignants à mieux surveiller la participation des élèves et l’interaction en classe, optimisant ainsi la qualité de l’enseignement15. Chonggao P a obtenu la reconnaissance du comportement des élèves en temps réel et a amélioré la précision de l’analyse du comportement en classe dans l’enseignement à distance en combinant l’analyse de clustering et l’algorithme de forêt aléatoire, ainsi que le modèle de squelette humain16. Wu S a développé un modèle de reconnaissance du comportement des étudiants qui combine l’optimisation de l’essaim de particules et l’algorithme du voisin le plus proche, favorisant la précision de la reconnaissance des émotions pour répondre aux besoins pratiques de l’enseignement en classe17. Le système ACORN proposé par Ramakrishnan et al. a utilisé l’apprentissage automatique multimodal et des réseaux neuronaux convolutifs combinés pour analyser l’audio, les expressions faciales et les données d’image. L’intégration de ces caractéristiques par le biais de réseaux convolutifs temporels a permis d’évaluer automatiquement l’atmosphère de la salle de classe et de réaliser des progrès préliminaires18.

En résumé, les recherches existantes ont proposé diverses techniques basées sur l’apprentissage automatique et l’apprentissage profond pour la reconnaissance intelligente du comportement en classe, couvrant des domaines tels que la détection de la fatigue des élèves, l’analyse des sentiments et la surveillance des interactions en classe. Cependant, il existe encore quelques lacunes dans la recherche actuelle, et de nombreuses méthodes manquent de temps réel et d’évolutivité suffisantes dans les applications pratiques, ce qui rend difficile l’adaptation à des scénarios de classe complexes et changeants. Par conséquent, l’étude propose une méthode intelligente de reconnaissance du comportement en classe avec Transformer et AM. L’innovation de la recherche réside dans l’utilisation de la puissante capacité de modélisation temporelle du Transformer combinée à la FA spatio-temporelle pour capturer avec précision les moments et les régions comportementales clés dans la salle de classe, et l’intégration de plusieurs sources d’information, telles que la vidéo et l’audio, grâce à la fusion de données multimodales pour améliorer l’exhaustivité et la précision de la reconnaissance comportementale.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude utilise des ensembles de données accessibles au public qui ne contiennent aucune information personnellement identifiable. Toutes les données utilisées dans la recherche ont été anonymisées pour garantir la confidentialité des participants. Le consentement éclairé de tous les participants a été obtenu au moment de la collecte des données, et l’étude respecte les directives éthiques. Le protocole explique la méthode de reconnaissance intelligente du comportement en classe, qui consiste en l’extraction de caractéristiques basée sur la fusion de données multimodales et la reconnaissance spatio-temporelle du comportement basée sur Transformer et l’attention. Les performances de l’ensemble de la méthode sont optimisées grâce à un entraînement conjoint.

1. Collecte de données multimodèles

La collecte de données multimodale impliquait la collecte de données synchronisées sur le comportement en classe à partir de deux ensembles de données : l’ensemble de données EduSense et l’ensemble de données d’interaction Kinect SBU. EduSense a enregistré des enregistrements réels de salles de classe universitaires, et SBU Kinect a enregistré des séquences squelettiques basées sur l’interaction. Les ensembles de données contenaient des flux vidéo, des indices audio et des informations 3D sur les articulations squelettiques pour modéliser les postures et les mouvements des élèves. Le prétraitement des données garantissait l’alignement temporel et l’élimination du bruit pour le nettoyage. Cette convergence a permis de surveiller le comportement de bout en bout, d’enregistrer les gestes visuels et les mouvements du corps dans de nombreuses situations d’apprentissage.

2. Extraction de caractéristiques basée sur la fusion de données multimodales

En ciblant la question de la reconnaissance du comportement des élèves dans les salles de classe intelligentes, une méthode de reconnaissance intelligente du comportement en classe avec Transformer et AM est proposée. En raison de la nature complexe des salles de classe comptant de nombreux élèves, les changements de facteurs au sein de la scène peuvent interférer avec la reconnaissance du comportement des élèves. De plus, l’extraction d’une seule caractéristique présente des limites telles que des informations incomplètes, une sensibilité aux interférences environnementales et une difficulté à capturer des comportements complexes19,20. Par conséquent, l’étude propose d’abord une méthode d’extraction de caractéristiques en classe d’étudiant basée sur la fusion de données multimodales. Cette méthode combine des données provenant de modalités vidéo et squelettiques, en utilisant leur complémentarité pour obtenir une extraction plus complète et plus précise des caractéristiques du comportement des élèves. En particulier, chaque séquence vidéo d’entrée est divisée par image. Les trames sont introduites dans un R-CNN plus rapide pré-entraîné pour localiser les régions humaines d’intérêt. Les régions détectées sont introduites dans un réseau de neurones convolutif pour obtenir des caractéristiques visuelles temporelles. Pour la modalité squelettique, les positions articulaires 3D sont posées sous forme de séquences et encodées à l’aide d’un modèle BERT pré-entraîné pour obtenir des dépendances temporelles et spatiales. Ceux-ci sont normalisés et intégrés avant d’être introduits dans le réseau de fusion multimodal. Parmi eux, la modalité vidéo est principalement responsable de la capture de caractéristiques visuelles telles que les mouvements et les expressions des élèves, tandis que la modalité squelettique décrit avec précision les changements de posture des élèves grâce à des informations sur les points articulaires. Alors que la modalité vidéo s’appuie sur les caractéristiques globales de la perception visuelle, tandis que la modalité squelettique s’appuie sur les caractéristiques visuelles globales pour représenter le comportement humain, la modalité squelettique se concentre sur les changements dynamiques de la position articulaire, conduisant à des différences sémantiques significatives entre les deux21. Par conséquent, il est nécessaire de développer un réseau de fusion multimodal spécialisé pour modéliser efficacement la corrélation entre les deux modalités. Le réseau de fusion multimodal est illustré à la figure 1.

Dans la figure 1, le réseau est principalement divisé en trois modules. Parmi eux, l’entrée du module de traitement de la modalité vidéo est une séquence vidéo, qui est extraite via un réseau neuronal convolutif basé sur une région plus rapide (Faster R-CNN) pour l’extraction de caractéristiques. Le traitement de la modalité vidéo commence par la traduction des prises de vue vidéo en classe en entrées image par image pour l’extraction de caractéristiques. Les images sont traitées avec un réseau neuronal convolutif basé sur une région plus rapide (R-CNN plus rapide) avec une base ResNet-50 entraînée sur ImageNet. Le réseau traite les images RVB redimensionnées à 224 × 224 pixels, ce qui permet d’obtenir des cartes visuelles de haut niveau avec des caractéristiques spatiales et spécifiques à l’objet de l’activité des élèves. Ces caractéristiques sont ensuite saisies dans un module d’auto-attention, qui apprend les relations temporelles entre les images avant de les encoder en plongements spatio-temporels via une couche Transformer. Cela permet de préserver les signaux comportementaux faibles, tels que les inclinaisons de la tête ou les levées de main, dans l’intégration de représentations pour une fusion ultérieure. Les caractéristiques vidéo extraites sont capturées par le module d’auto-attention pour capturer les relations temporelles et spatiales au sein de la modalité vidéo, puis modélisées par un transformateur pour générer des vecteurs d’intégration pour les informations spatio-temporelles de la séquence vidéo. L’entrée du module de traitement de la modalité squelettique est une séquence squelettique, qui est traitée par la représentation d’encodeur bidirectionnelle à partir de transformateurs (BERT) pour extraire les caractéristiques temporelles et spatiales des articulations squelettiques. Pour les données squelettiques, la pose de chaque élève est modélisée sous la forme d’une séquence de coordonnées conjointes 2D à partir des vidéos de la classe à l’aide d’un estimateur de pose basé sur OpenPose. Ces séquences sont converties en jetons d’intégration dans lesquels chaque jeton correspond à une trame avec 18 points clés. Le contexte temporel et les dépendances de ces séquences conjointes sont modélisés à l’aide d’un modèle BERT (Bidirectional Encoder Representations from Transformers). Le modèle utilise 12 couches de transformateur, 8 têtes d’attention et une taille cachée de 768, qui est l’architecture standard de base BERT. Le modèle est affiné au cours de l’entraînement pour acquérir des modèles articulaires spécifiques au comportement. Les plongements de sortie représentent les caractéristiques structurelles et liées au mouvement du comportement des élèves qui sont ensuite combinées avec les caractéristiques de la modalité vidéo. Par la suite, les caractéristiques squelettiques sont ensuite agrégées en caractéristiques spatiales et temporelles par le biais d’opérations de CNN et de mise en commun 3D, générant des vecteurs intégrés du squelette en tant que représentations de caractéristiques de la modalité squelettique.

3. Module de fusion d’attention croisée

Dans le module de fusion d’attention croisée, l’étude utilise le mécanisme d’attention multi-têtes (MHAM) pour construire la relation d’interaction entre la modalité vidéo et la modalité squelettique, et extrait en outre des caractéristiques de fusion plus compactes par le biais d’opérations CNN 3D et de mise en commun des caractéristiques de fusion multimodale générées. Le processus de fusion est accompli à l’aide d’un réseau d’attention à deux flux, dans lequel les plongements temporels de chaque modalité sont transmis par des CNN 3D et des GRU bidirectionnels. Les flux de données multimodaux sont alignés à l’aide de modules d’attention multi-têtes (MHAM), avec une attention par produit scalaire mise à l’échelle pour atteindre les dépendances intermodales. Les intégrations sont ensuite regroupées pour s’attaquer à la complexité dimensionnelle et envoyées à une couche Softmax entièrement connectée pour classification.

Dans les réseaux de fusion multimodaux, le module d’auto-attention est utilisé pour modéliser la dépendance temporelle et spatiale au sein d’un seul mode, tandis que le module de fusion d’attention croisée est utilisé pour établir l’association et l’interaction d’informations entre différents modes. Par conséquent, les deux sont très importants. Le module d’auto-attention capture les dépendances internes de la séquence d’entrée en calculant la relation entre la requête Q, la clé K et la valeur V. Le calcul de Q, de la clé K et de la valeur V est indiqué dans l’équation (1). Où figure-protocol-1 se trouvent respectivement les matrices de requête, de clé et de valeur ; dk est la dimensionnalité du vecteur clé, et dk est la dimensionnalité des vecteurs valeur. Le facteur de dimension dk est adopté afin d’éviter que les produits scalaires ne deviennent grands, ce qui influencerait la stabilité des pentes pendant l’entraînement.

figure-protocol-2(1)

Dans l’équation (1), figure-protocol-3 représente les caractéristiques d’entrée, où n est la longueur de la séquence d’entrée, dmodèle est la dimension des caractéristiques, et WQ, WK et WV représentent trois ensembles de matrices de projection pouvant être apprises. Grâce à ces mappages matriciels, les fonctionnalités d’entrée sont transformées en requêtes, clés et valeurs. Le produit scalaire de la requête Q et la clé K sont utilisés pour calculer les poids d’attention et les mettre à l’échelle, comme le montre l’équation (2).

figure-protocol-4(2)

Dans l’équation (2), dk représente la dimension de l’interrogation de Q et de la clé K, et softmax désigne la fonction softmax utilisée pour obtenir la matrice de pondération de l’attention. La mise à l’échelle peut efficacement éviter le problème de la faible taille du dégradé en raison de valeurs de produit scalaire excessives causées par la dimensionnalité. La matrice de pondération de l’attention est appliquée à la valeur V pour obtenir la sortie Z du module d’auto-attention, comme le montre l’équation (3).

figure-protocol-5(3)

Dans l’équation (3), aij signifie le poids d’attention du ième vecteur de requête sur le j ème vecteur clé. La structure spécifique du module de fusion d’attention croisée est indiquée à la figure 2.

À partir de la figure 2, ce module commence principalement à traiter les caractéristiques d’entrée des modalités squelettiques et vidéo. Tout d’abord, la séquence squelette et la séquence vidéo sont soumises séparément à des couches convolutives 3D pour extraire des caractéristiques spatio-temporelles, puis ces caractéristiques spatio-temporelles sont modélisées à l’aide d’unités récurrentes bidirectionnelles fermées (Bi-GRU) pour la modélisation temporelle. Ensuite, les caractéristiques des deux modalités sont extraites à travers les MHAM pour extraire des corrélations au sein des modalités. Chaque modalité réalise une représentation interne des caractéristiques par le biais de mécanismes de requêtes, de clés et de valeurs. Ensuite, un regroupement temporel moyen est effectué sur les entités de sortie afin de réduire la complexité de la dimension temporelle. Après le regroupement, les caractéristiques multimodales sont regroupées statistiquement pour calculer la moyenne et l’écart-type de chaque modalité, et enfin produire la reconnaissance et la classification de l’action de l’étudiant via une couche entièrement connectée (FCL) et un classificateur Softmax. Par conséquent, l’extraction de caractéristiques basée sur la fusion de données multimodale proposée dans l’étude utilise l’auto-attention et les AM croisés pour capturer et modéliser avec précision les caractéristiques spatio-temporelles du comportement des élèves en fusionnant les données de la vidéo et des modalités squelettiques, améliorant ainsi la précision et l’exhaustivité de la reconnaissance du comportement des élèves dans les salles de classe intelligentes.

4. Reconnaissance du comportement spatio-temporel basée sur le transformateur et l’attention

L’extraction de caractéristiques basée sur la fusion de données multimodales permet d’obtenir une amélioration préliminaire de l’exhaustivité et de la précision du comportement des élèves en fusionnant les données de la vidéo et des modalités squelettiques. Cependant, dans le contexte des salles de classe intelligentes, le comportement des élèves change souvent au fil du temps, et le même comportement peut présenter des caractéristiques différentes à différents points temporels et régions spatiales. S’appuyer uniquement sur des informations statiques fusionnées à partir de caractéristiques multimodales ne peut pas capturer pleinement les relations dynamiques spatio-temporelles complexes dans la séquence de comportement22,23. Par conséquent, d’autres recherches proposent une modélisation du comportement spatio-temporel et de la FA basée sur Transformer. L’étude a choisi Vision Transformer (ViT) comme architecture de réseau, qui peut modéliser les informations spatio-temporelles globales des entrées par self-AM et a une plus grande capacité à capturer les dépendances spatio-temporelles. Après la fusion multimodale, les caractéristiques fusionnées sont à nouveau représentées à l’aide d’un transformateur de vision (ViT) pour prévoir le comportement spatio-temporel. Les cartes de caractéristiques de l’entrée sont divisées en patchs disjoints de 16 × 16, intégrées linéairement dans des vecteurs unidimensionnels et codées en position pour préserver l’ordre spatial. La structure ViT comporte 12 blocs d’encodeur Transformer, constitués de couches d’auto-attention multi-têtes (8 têtes) et de couches feed-forward dont la dimension cachée est de 768. Pour améliorer la saillance comportementale, des modules d’attention spatiale (SA) et d’attention temporelle (TA) sont suggérés. Le module SA encourage la pertinence des caractéristiques dans les zones spatiales via l’activation de Tanh, tandis que le module TA met en évidence les cadres temporels importants via l’activation de ReLU. Ces deux flux d’attention sont ensuite combinés avec l’épine dorsale ViT via une méthode d’entraînement en deux étapes, de sorte que le modèle apprend à capturer efficacement l’évolution dynamique du comportement en classe. La structure de ViT est illustrée à la figure 3.

Dans la figure 3, dans ViT, l’entrée d’origine est une image qui est segmentée en plusieurs petits blocs de taille fixe, chacun représenté comme faisant partie de l’image, et aplati linéairement en un vecteur unidimensionnel. Étant donné que le Transformer ne peut pas percevoir les informations de localisation, chaque petit bloc est intégré avec des informations de localisation avant d’être saisi dans le Transformer pour s’assurer qu’il peut capturer la relation de position spatiale relative entre différents petits blocs. Le module de base de ViT est l’encodeur Transformer, qui est composé de plusieurs blocs d’encodage Transformer empilés. Les blocs d’encodage sont composés d’un MHAM et d’un réseau de neurones feed-forward. Le MHAM capture les dépendances entre les séquences d’entrée en parallèle, tandis que le réseau neuronal à anticipation effectue des transformations non linéaires sur les résultats pour améliorer la capacité du modèle à capturer et à exprimer des informations globales. Une fois que l’encodeur Transformer a traité tous les petits éléments d’information, la sortie de la dernière couche d’encodage est transmise à la tête Perceptron multicouche (tête MLP), qui produit les résultats finaux de reconnaissance et de classification des actions de l’étudiant.

En pratique, chaque cadre est divisé en 16 × 16 patchs qui ne se chevauchent pas, aplatis et intégrés à la position afin de maintenir les relations spatiales. Les intégrations de patchs sont traitées séquentiellement par des encodeurs de transformateur empilés dans l’architecture ViT. Le module d’attention spatiale (SA) utilise l’activation tanh pour faire varier l’attention entre les zones d’intérêt dans chaque image, et le module d’attention temporelle (TA) utilise ReLU pour mettre en évidence les images temporellement importantes. Ce mécanisme à double attention permet une modélisation efficace de la dynamique du comportement dans l’espace et le temps.

Pour améliorer encore les performances de ViT dans des séquences comportementales complexes, l’attention spatiale (SA) et l’attention temporelle (TA) sont introduites pour permettre à ViT non seulement de sélectionner de manière autonome des articulations spatiales importantes, mais aussi de se concentrer sur les comportements à différents points temporels, capturant ainsi mieux les changements dynamiques spatio-temporels du comportement. Le module SA et le module TA sont indiqués à la figure 4.

Dans la figure 4A, le module SA traite les informations de dimension spatiale de l’entrée en passant les caractéristiques de l’image actuelle dans la couche ViT pour extraire les états cachés. Ceux-ci sont combinés avec les caractéristiques du cadre précédent et intégrés conjointement dans la FCL. Le FCL effectuera une transformation linéaire sur les entités pour générer des représentations de caractéristiques latentes. Par la suite, il est transmis à la fonction d’activation Tanh pour mapper la sortie à la plage de [-1,1], améliorant ainsi la non-linéarité et permettant de mieux distinguer les caractéristiques importantes et non importantes. Enfin, les caractéristiques sont normalisées par le biais d’une couche de normalisation pour garantir que les caractéristiques de sortie ont une échelle relativement stable. Dans la figure 4B, le module TA se concentre davantage sur les informations clés contenues dans chaque cadre dans la dimension temporelle. Contrairement à Tanh dans SA, le module TA utilise la fonction d’activation ReLU pour supprimer les valeurs négatives et ne conserve que la sortie des valeurs positives, supprimant efficacement les informations de bruit négatives et améliorant la capacité de capture temporelle du modèle.

5. Méthode de formation conjointe

Pour résoudre efficacement le problème des caractéristiques spatio-temporelles biaisées et redondantes causées par l’influence mutuelle entre ViT, le module SA et le module TA dans la reconnaissance du comportement spatio-temporel basée sur le transformateur et l’attention, une méthode d’entraînement conjointe est adoptée pour optimiser les trois modules. Le processus spécifique est illustré à la figure 5.

Dans la figure 5, la stratégie d’entraînement conjointe saisit d’abord les paramètres d’entraînement du modèle, définit la structure du réseau et les hyperparamètres. Par la suite, une pré-formation distincte est dispensée sur l’AS et l’AT afin de mieux apprendre les caractéristiques locales. Il convient de noter que lors du pré-entraînement d’un modèle, les poids de l’autre modèle sont maintenus fixes et ne sont pas mis à jour. Après avoir terminé la pré-formation individuelle, la couche ViT est combinée pour l’entraînement. Ensuite, deux modèles d’attention seront fixés, et le réseau ViT principal sera entraîné séparément. Enfin, en entraînant conjointement le réseau ViT principal, les modules SA et TA, le réseau global est optimisé pour générer le modèle final de reconnaissance intelligente du comportement en classe. La procédure d’entraînement s’effectue par étapes : (1) pré-entraînement autonome des modules SA et TA avec des paramètres ViT gelés, (2) entraînement par étapes de ViT avec des poids de module d’attention gelés, et (3) réglage fin de bout en bout de tous les composants avec l’optimiseur Adam (taux d’apprentissage = 0,001, taille de lot = 64, époques = 100). L’approche stabilise l’apprentissage des fonctionnalités et réduit les interférences entre les modules lors de l’optimisation.

Dans l’ensemble, la méthode de reconnaissance intelligente du comportement en classe proposée combine la vidéo et les modalités squelettiques pour modéliser les relations spatio-temporelles par l’auto-attention et les AM croisés. En utilisant la capacité de modélisation spatio-temporelle globale de ViT et en combinant des modules spatiaux et TA, le modèle est optimisé pour capturer les comportements clés et la dynamique temporelle, ce qui permet une reconnaissance plus complète et plus précise du comportement des étudiants. Les opérations de fusion critiques, dans lesquelles des représentations de caractéristiques multimodales sont combinées, sont effectuées dans l’architecture considérée. Plus précisément, les caractéristiques spatiales apprises par CNN sont connectées aux caractéristiques temporelles du Bi-LSTM. Cette sortie est ensuite fusionnée avec les caractéristiques de MHAM augmentées par l’attention avant la tâche de classification. Ces opérations de fusion sont cruciales pour la fusion de vues complémentaires des données comportementales et sont mises en évidence dans les figures 1 et 5.

L’algorithme 1 illustre la combinaison de données multimodales, d’informations squelettiques, de texte et de vidéos, à l’aide de modèles basés sur ViT, BERT et GCN pour extraire des caractéristiques informatives dans une classe. La représentation conjointe est ensuite marquée pour identifier le comportement de l’élève, avec une plus grande précision grâce à l’apprentissage intermodal.

Algorithme 1 : Processus de reconnaissance comportementale multimodale à l’aide de ViT, BERT et GCN.

Initialiser:

Modèle BERT pré-entraîné

Modèle R-CNN plus rapide pré-entraîné

Modèle ViT pré-entraîné

Modèle GCN pour les données squelettes

Classificateur (par exemple, MLP ou transformateur)

Charger le jeu de données :

Pour chaque échantillon dans un ensemble de données multimodales :

Extraire des images vidéo

Extraire la transcription audio

Extraction des données du squelette (OpenPose ou MediaPipe)

Étape 1 : Traitement de la modalité vidéo

Pour chaque image de la vidéo :

Appliquer R-CNN plus rapide pour détecter les objets/participants

Appliquer Vision Transformer (ViT) pour extraire des fonctions au niveau de l’image

Agréger les entités au fil du temps pour la représentation temporelle

Étape 2 : Traitement de la modalité de texte

Prétraitement du texte de la transcription :

Tokeniser à l’aide du tokenizer BERT

Passer les tokens via le modèle BERT

Extraire des plongements contextuels à partir du jeton [CLS] ou du regroupement moyen

Étape 3 : Traitement de la modalité squelettique

Pour chaque séquence de squelette :

Normaliser les coordonnées

Passez par GCN ou ST-GCN pour extraire les caractéristiques de mouvement

Étape 4 : Fusion des fonctionnalités

Concaténation ou fusible d’attention :

Fonctionnalités vidéo

Caractéristiques du texte

Caractéristiques squelettiques

Obtenir une représentation multimodale unifiée

Étape 5 : Classification

Transmettre la représentation fusionnée au classificateur final

Prédire l’étiquette du comportement de la classe (p. ex., attentif, distrait)

Étape 6 : Évaluation

Comparer les prédictions avec la réalité terrain

Métriques de calcul : exactitude, précision, rappel, score F1

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour évaluer l’efficacité et la supériorité de la méthode de reconnaissance du comportement en classe intelligente avec Transformer et AM, une vérification et une analyse expérimentales des performances ont été effectuées. Tout d’abord, l’environnement et les paramètres expérimentaux ont été configurés, comme indiqué dans le tableau 1.

Sur la base du tableau 1, l’étude a sélectionné l’ensemble de données EduSense et l’ensemble de données d’interaction Kinect S...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Une méthode de reconnaissance comportementale pour les salles de classe intelligentes basée sur Transformer et AM a été proposée pour relever les défis du comportement complexe des élèves et de la reconnaissance multimodale des données. Un réseau ViT doté d’une capacité globale de modélisation spatio-temporelle a été construit en intégrant des données provenant de la vidéo et des modalités squelettiques, et l’auto-attention et les AM croisés ont été utilisés pour capturer les caractérist...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à divulguer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aucun.

CONTRIBUTION DE L’AUTEUR :
Liu Lei : Responsable de la conception et de la conception de la recherche ; a proposé la méthode de fusion de données multimodale basée sur Transformer pour la reconnaissance intelligente du comportement en classe. Dirigé le développement du modèle et du plan expérimental, géré la collecte et le traitement des données, et rédigé le manuscrit initial. A contribué à l’analyse et à la discussion des résultats expérimentaux.

He Zhihua : A fourni une orientation générale et une supervision de l’étude ; contribué au cadre de recherche et à l’appui méthodologique. Participer à l’optimisation du modèle et à l’analyse expérimentale, examiner et réviser le manuscrit, assurer la conformité aux normes éthiques et donner l’approbation finale pour la soumission. Responsable de la correspondance.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
128 Go de RAM DDR4Plusieurs fournisseurshttps://www.crucial.com/memory/ddr4Mémoire suffisante pour le traitement multimodal des données
SSD 2 To Stockagehttps://www.samsung.com/ssdPlusieurs fournisseursPour le stockage des ensembles de données et des modèles
BERT (Configuration de base)Hugging Facehttps://huggingface.co/bert-base-uncasedModèle de langage pour l’intégration de séquences squelettiques
CUDA 11.1 ToolkitNVIDIAhttps://developer.nvidia.com/cuda-toolkitPermet l’accélération GPU pour PyTorch
Bibliothèque cuDNN 8.0NVIDIAhttps://developer.nvidia.com/cudnnaccélérée par GPU pour les réseaux neuronaux
profonds EduSense DatasetCarnegie Mellon Universityhttps://www.cs.cmu.edu/~./edusenseEnsemble de données
de classe universitaire réelleCapteur d’objets R-CNN (ResNet-50)Open Source (PyTorch)https://github.com/facebookresearch/detectron2Utilisé pour l’extraction de caractéristiques vidéo
Processeur Intel Xeon E5-2680 v4 ProcesseurIntelhttps://www.intel.com/products/xeon-e5-2680-v4hautes performances pour l’entraînement de modèles
MatplotlibOpen Sourcehttps://matplotlib.orgUtilisé pour le traçage des mesures
NVIDIA Tesla V100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100Utilisé pour l’entraînement et l’inférence ; prend en charge la reconnaissance comportementale en temps réel
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeExtrait les points clés squelettiques 2D des images vidéo
Cadre PyTorch 1.8 CadreOpen Sourcehttps://www.pytorch.orgBibliothèque d’apprentissage profond utilisée pour développement de modèles
SBU Kinect Interaction DatasetStony Brook Universityhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectEnsemble de données squelettiques basé sur l’interaction
TensorBoardOpen Source (Googlehttps://www.tensorflow.org/tensorboardUtilisé pour la visualisation de l’entraînement
Ubuntu 20.04 LTS Système d’exploitationCanonicalhttps://www.ubuntu.com/downloadSystème d’exploitation Linux utilisé comme environnement de développement
Vision Transformer (ViT)Google / Hugging Facehttps://huggingface.co/google/vit-base-patch16-224Utilisé pour la modélisation globale du comportement spatio-temporel
Bibliothèque de performance

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Mod le TransformerFusion MultimodaleAttention SpatiotemporelleEngagement des tudiantsR troaction en Temps R elCartographie Comportementale
Vidéo bientôt disponible

Articles connexes