Forschungsartikel

Verhaltenserkennung im Klassenzimmer über Transformer und Aufmerksamkeitsmechanismus: Anwendung in der Qualitätsevaluation der Lehre für die KI-Medizinausbildung

DOI:

10.3791/69052

15. August 2025

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wird ein Transformer-basiertes KI-System zur Erkennung von Verhalten im Klassenzimmer in der Medizin- und Pflegeausbildung vorgestellt. Anhand multimodaler Daten bewertet das System das Engagement und den emotionalen Zustand der Lernenden. Die Ergebnisse zeigen eine höhere Genauigkeit im Vergleich zu herkömmlichen Modellen, die Echtzeit-Feedback und eine verbesserte Unterstützung für die Lehrqualität und die psychische Gesundheit der Studierenden ermöglichen.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wird ein Transformer-basiertes System der künstlichen Intelligenz vorgestellt, das für die Verhaltenserkennung im Klassenzimmer entwickelt wurde und darauf abzielt, die Bewertung der Lehrqualität und die Überwachung der psychischen Gesundheit in der medizinischen und pflegerischen Ausbildung zu verbessern. Das Modell verwendet multimodale Daten, insbesondere Video-, Audio- und Skelettbewegungen, um Schlüsselindikatoren für das Engagement der Schüler zu bewerten, wie z. B. Aufmerksamkeitsspanne, Interaktionshäufigkeit und emotionale Schwankungen. Eine neuartige multimodale Fusionsstrategie, kombiniert mit raumzeitlichen Aufmerksamkeitsmechanismen, ermöglicht es dem System, komplexe Verhaltensweisen im Klassenzimmer mit verbesserter Präzision und Robustheit zu erfassen. Experimentelle Ergebnisse mit den EduSense- und SBU-Kinect-Datensätzen zeigen, dass die vorgeschlagene Methode traditionelle Modelle sowohl in Bezug auf die Genauigkeit als auch auf die Fehlalarmrate deutlich übertrifft. Darüber hinaus bestätigen Ablationsstudien den Beitrag von räumlichen und zeitlichen Aufmerksamkeitsmodulen zur Erkennungsfähigkeit des Systems. Das Framework unterstützt Echtzeit-Feedback und visuelles Verhaltensmapping und bietet damit einen praktischen Mehrwert in erfahrungsbasierten Lernumgebungen. Dieser Ansatz bietet eine skalierbare und adaptive Lösung für die Verhaltensüberwachung im Klassenzimmer und unterstützt Frühinterventionsstrategien in der medizinischen Ausbildung.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Angesichts der zunehmenden Herausforderungen für die psychische Gesundheit von Krankenpflege- und Medizinstudenten aufgrund von akademischem und klinischem Stress kann die Integration künstlicher Intelligenz in den Unterricht nicht nur eine Überwachung der Unterrichtsqualität, sondern auch eine psychologische Unterstützung in Echtzeit bieten. Diese Studie positioniert die Verhaltenserkennung in der medizinischen Ausbildung, um erfahrungsorientiertes Lernen zu unterstützen und das Wohlbefinden der Studierenden zu fördern1. Intelligentes Klassenzimmer bezieht sich auf ein neues und qualitativ hochwertiges Bildungsmodell, das intelligente und personalisierte Unterrichtsprozesse durch die Anwendung modernster Technologien wie Informationstechnologie, künstliche Intelligenz, Big Data und das Internet der Dinge kombiniert, um das Unterrichtsmanagement und die Interaktion im Klassenzimmer zu unterstützen 2,3,4. Derzeit, mit der Entwicklung von Technologien wie Kameras und Sensoren, umfassen die im Klassenzimmer gesammelten Verhaltensdaten nicht nur Videos, sondern auch multimodale Daten wie Sprache und Audio5. Der Umgang mit diesen komplexen raumzeitlichen Informationen und Daten und die genaue Extraktion wertvoller Verhaltensmerkmale aus ihnen sind jedoch die größten Herausforderungen im Bereich der intelligenten Verhaltenserkennungim Klassenzimmer 6,7. Bestehende Ansätze zur Verhaltenserkennung beruhen in erster Linie auf der Extraktion von Merkmalen aus einzelmodalen Datenquellen, wie z. B. Videostreams im Klassenzimmer oder sequenziellen Bildern8. Während diese Methoden grobe Verhaltensereignisse erkennen können, können sie oft nicht die zeitliche Entwicklung und die räumlichen Nuancen der Gesten, Ausdrücke oder Interaktionsfrequenzfaktoren der Schüler modellieren, die für das Verständnis des Wohlbefindens und der Konzentration der Lernenden entscheidend sind9. Darüber hinaus fehlen den aktuellen Modellen robuste Mechanismen, um heterogene Datenquellen wie Audiohinweise und Skelettbewegungen zu fusionieren, was ihre Empfindlichkeit gegenüber affektivem oder unbeteiligtem Verhalten einschränkt10. Um diese Einschränkungen zu beheben, schlägt diese Studie ein transformatorbasiertes Verhaltenserkennungssystem im Klassenzimmer vor, das durch räumlich-zeitliche Aufmerksamkeitsmechanismen erweitert wird. Durch die Nutzung der Fähigkeit des Transformers, langfristige Abhängigkeiten zu modellieren und sie mit multimodalen Merkmalsfusionsstrategien zu kombinieren, zielt das vorgeschlagene System darauf ab, die Präzision der Verhaltensklassifizierung zu verbessern und gleichzeitig eine Echtzeit-Visualisierung von Engagement- und emotionalen Indikatoren zu ermöglichen. Das ultimative Ziel ist es, die dynamische Bewertung der Lehrqualität und das eingebettete Feedback zur psychischen Gesundheit in der medizinischen Ausbildung zu unterstützen und eine skalierbare, adaptive Lösung zur Überwachung und Verbesserung sowohl der Unterrichtswirksamkeit als auch des Wohlbefindens der Lernenden anzubieten.

Die Evaluierung schlägt ein neuartiges Transformer-basiertes Verhaltenserkennungssystem vor, das raumzeitliche Aufmerksamkeitsmechanismen mit multimodaler Datenfusion (Video- und Skeletteingaben) kombiniert, das auf die intelligente Beobachtung im Klassenzimmer in der Medizin- und Pflegeausbildung zugeschnitten ist. Im Gegensatz zu bestehenden Modellen ermöglicht das neue Modell eine genaue Echtzeit-Aufmerksamkeit der Schüler und die Erkennung des emotionalen Zustands, was sowohl für die Bewertung der Unterrichtsqualität als auch für das psychische Wohlbefinden wertvoll ist.

Verwandte Werke
Das intelligente Klassenzimmer ist eine neue Unterrichtsumgebung, die moderne Informationstechnologie nutzt, um die Unterrichtsinteraktion, das personalisierte Lernen und das Unterrichtsmanagement zu verbessern. Es kann intelligente Lehrmethoden nutzen, um die Effizienz und Qualität des Unterrichts zu verbessern und den Schülern gleichzeitig reichhaltigere und persönlichere Lernerfahrungen zu bieten. Daher haben viele Wissenschaftler auf der ganzen Welt an intelligenter Technologie und Unterricht im Klassenzimmer geforscht. Radosavljevic et al. schlugen ein intelligentes Klassenmodell vor, das auf Umweltintelligenz basiert, das den Ermüdungsgrad der Schüler bewertet und Lernstrategien anpasst, indem es ihre täglichen akademischen Aktivitätsdaten analysiert, um die Lernergebnisse zu optimieren11. Tai T. Y untersuchte die Wirkung intelligenter persönlicher Assistenten auf die Verbesserung der Sprechfähigkeit von Fremdsprachen und stellte fest, dass die Verwendung von Google Assistant die Sprechfähigkeit von Nicht-Muttersprachlern signifikant verbesserte, mit ähnlichen Effekten wie Muttersprachler in der Kommunikation12. Chen et al. fanden in ihrer Forschung heraus, dass der Einsatz von Chatbots als Lehrmittel schnell auf die Bedürfnisse der Schüler reagieren, die Interaktivität verbessern und die potenzielle Anwendung intelligenter Technologie im Klassenzimmer demonstrieren kann13. Die Forschung entwickelte eine Methode zur Bewertung der Wirksamkeit des Unterrichts im Klassenzimmer, die auf dem intelligenten Unterrichtsmodus basierte, der die Genauigkeit der Bewertung durch die Verwendung des Kuckuckssuchalgorithmus und der extremen Lernmaschine14 verbesserte.

Die Verhaltenserkennung in intelligenten Klassenzimmern ist eine Schlüsseltechnologie, um personalisierten Unterricht zu erreichen und das Klassenraummanagement zu optimieren. Es kann den Verhaltensstatus der Schüler in Echtzeit überwachen und effektives Feedback geben. Durch die Verhaltenserkennung können Lehrer die Beteiligung und den Fokus der Schüler genau verstehen, wodurch die Effektivität des Unterrichts verbessert und die Entscheidungsfindung unterstützt wird. In diesem Zusammenhang haben Wissenschaftlerinnen und Wissenschaftler weltweit umfangreiche Forschungen zur intelligenten Verhaltenserkennung im Klassenzimmer durchgeführt. Die Forschung schlug ein visuelles Echtzeit-Überwachungssystem auf Basis künstlicher Intelligenz vor, das maschinelles Lernen nutzt, um Modelle zur Verhaltenserkennung von Schülern zu trainieren, um Lehrern zu helfen, die Beteiligung der Schüler und die Interaktion im Klassenzimmer besser zu überwachen und so die Unterrichtsqualität zu optimieren15. Chonggao P erreichte eine Echtzeit-Verhaltenserkennung von Schülern und verbesserte die Genauigkeit der Verhaltensanalyse im Klassenzimmer im Fernunterricht durch die Kombination von Clustering-Analyse und Random-Forest-Algorithmus sowie dem menschlichen Skelettmodell16. Wu S entwickelte ein Modell zur Verhaltenserkennung von Schülern, das die Optimierung von Partikelschwärmen und den K-Nearest-Neighbor-Algorithmus kombiniert und so die Genauigkeit der Emotionserkennung fördert, um den praktischen Anforderungen des Unterrichts gerecht zu werden17. Das von Ramakrishnan et al. vorgeschlagene ACORN-System nutzte multimodales maschinelles Lernen und kombinierte Convolutional Neural Networks, um Audio, Gesichtsausdrücke und Bilddaten zu analysieren. Die Integration dieser Merkmale durch zeitliche Faltungsnetzwerke führte zu einer automatischen Bewertung der Unterrichtsatmosphäre und machte vorläufige Fortschritte18.

Zusammenfassend lässt sich sagen, dass die bestehende Forschung verschiedene auf maschinellem Lernen und Deep Learning basierende Techniken für die intelligente Verhaltenserkennung im Klassenzimmer vorgeschlagen hat, die Bereiche wie die Erkennung von Ermüdung von Schülern, die Stimmungsanalyse und die Überwachung von Interaktionen im Klassenzimmer abdecken. Allerdings gibt es noch einige Defizite in der aktuellen Forschung, und vielen Methoden fehlt es an ausreichender Echtzeit und Skalierbarkeit in der praktischen Anwendung, was die Anpassung an komplexe und sich verändernde Unterrichtsszenarien erschwert. Daher schlägt die Studie eine intelligente Methode zur Verhaltenserkennung im Klassenzimmer mit Transformer und AM vor. Die Innovation der Forschung liegt in der Nutzung der leistungsstarken zeitlichen Modellierungsfähigkeit des Transformers in Kombination mit räumlich-zeitlicher AM, um wichtige Verhaltensmomente und -regionen im Klassenzimmer genau zu erfassen, und in der Integration mehrerer Informationsquellen wie Video und Audio durch multimodale Datenfusion, um die Vollständigkeit und Genauigkeit der Verhaltenserkennung zu verbessern.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie werden öffentlich zugängliche Datensätze verwendet, die keine personenbezogenen Daten enthalten. Alle Daten, die in der Studie verwendet werden, wurden anonymisiert, um die Privatsphäre der Teilnehmer zu gewährleisten. Zum Zeitpunkt der Datenerhebung wurde von allen Teilnehmern eine Einverständniserklärung eingeholt, und die Studie hält sich an ethische Richtlinien. Das Protokoll erklärt die intelligente Verhaltenserkennungsmethode für Klassenzimmer, die aus der Merkmalsextraktion auf der Grundlage multimodaler Datenfusion und der raumzeitlichen Verhaltenserkennung auf der Grundlage von Transformer und Aufmerksamkeit besteht. Die Performance der gesamten Methode wird durch gemeinsames Training optimiert.

1. Datenerfassung mit mehreren Modellen

Bei der multimodalen Datenerfassung wurden synchronisierte Daten zum Verhalten im Klassenzimmer aus zwei Datensätzen gesammelt: dem EduSense-Datensatz und dem SBU-Kinect-Interaktionsdatensatz. EduSense zeichnete reale Aufnahmen von Universitäten und Klassenzimmern auf, und SBU Kinect zeichnete interaktionsbasierte Skelettsequenzen auf. Die Datensätze enthielten Videostreams, Audiohinweise und 3D-Skelettgelenkinformationen zur Modellierung von Körperhaltungen und Bewegungen der Schüler. Die Datenvorverarbeitung garantierte die zeitliche Ausrichtung und die Entfernung von Rauschen für die Reinigung. Diese Konvergenz ermöglichte eine End-to-End-Verhaltensüberwachung, die Aufzeichnung visueller Gesten und Körperbewegungen in vielen Lernsituationen.

2. Merkmalsextraktion auf Basis multimodaler Datenfusion

Speziell für das Problem der Verhaltenserkennung von Schülern in intelligenten Klassenzimmern wird eine Methode zur intelligenten Verhaltenserkennung im Klassenzimmer mit Transformer und AM vorgeschlagen. Aufgrund der Komplexität von Klassenzimmern mit vielen Schülern können Änderungen der Faktoren innerhalb der Szene die Erkennung des Schülerverhaltens beeinträchtigen. Darüber hinaus weist die Extraktion einzelner Merkmale Einschränkungen auf, wie z. B. unvollständige Informationen, Anfälligkeit für Umwelteinflüsse und Schwierigkeiten bei der Erfassung komplexer Verhaltensweisen19,20. Daher wird in der Studie zunächst eine Methode zur Extraktion von Merkmalen im Klassenzimmer vorgeschlagen, die auf multimodaler Datenfusion basiert. Diese Methode kombiniert Daten aus Video- und Skelettmodalitäten und nutzt deren Komplementarität, um eine umfassendere und genauere Merkmalsextraktion des Schülerverhaltens zu erreichen. Insbesondere wird jede eingegebene Videosequenz frameweise aufgeteilt. Frames werden in ein vortrainiertes Faster R-CNN eingespeist, um menschliche Bereiche von Interesse zu lokalisieren. Die detektierten Regionen werden in ein Convolutional Neural Network Backbone eingespeist, um zeitliche visuelle Merkmale zu erhalten. Für die skelettale Modalität werden 3D-Gelenkpositionen als Sequenzen posiert und mit einem vortrainierten BERT-Modell kodiert, um zeitliche und räumliche Abhängigkeiten zu erhalten. Diese werden normalisiert und eingebettet, bevor sie in das multimodale Fusionsnetzwerk eingespeist werden. Unter ihnen ist die Videomodalität hauptsächlich für die Erfassung visueller Merkmale wie Bewegungen und Ausdrücke der Schüler verantwortlich, während die Skelettmodalität die Haltungsänderungen der Schüler durch gemeinsame Punktinformationen genau beschreibt. Während sich die Videomodalität auf die globalen Merkmale der visuellen Wahrnehmung stützt, während die skelettale Modalität globale visuelle Merkmale zur Darstellung des menschlichen Verhaltens verwendet, konzentriert sich die skelettale Modalität auf die dynamischen Veränderungen der Gelenkposition, was zu signifikanten semantischen Unterschieden zwischen den beiden führt21. Daher ist es notwendig, ein spezialisiertes multimodales Fusionsnetzwerk zu entwickeln, um die Korrelation zwischen den beiden Modalitäten effektiv zu modellieren. Das multimodale Fusionsnetz ist in Abbildung 1 dargestellt.

In Abbildung 1 ist das Netzwerk hauptsächlich in drei Module unterteilt. Unter ihnen ist die Eingabe des Videomodalitätsverarbeitungsmoduls eine Videosequenz, die durch ein Faster Region-based Convolutional Neural Network (Faster R-CNN) zur Merkmalsextraktion extrahiert wird. Die Behandlung der Videomodalität beginnt mit der Übersetzung von Videoaufnahmen aus dem Klassenzimmer in Frame-by-Frame-Eingaben für die Merkmalsextraktion. Die Frames werden mit einem Faster Region-Based Convolutional Neural Network (Faster R-CNN) mit einer ResNet-50-Basis behandelt, die auf ImageNet trainiert wurde. Das Netzwerk behandelt RGB-Frames, die auf 224 × 224 Pixel verkleinert wurden, was zu visuellen Merkmalskarten auf hoher Ebene mit räumlichen und objektspezifischen Merkmalen der Schüleraktivität führt. Diese Features werden dann in ein Self-Attention-Modul eingegeben, das die zeitlichen Beziehungen zwischen Frames lernt, bevor es sie über einen Transformer-Layer in raumzeitliche Einbettungen kodiert. Dadurch bleiben schwache Verhaltenssignale wie Kopfneigungen oder Handheben in eingebetteten Repräsentationen für eine spätere Fusion erhalten. Die extrahierten Videomerkmale werden vom Selbstaufmerksamkeitsmodul erfasst, um die zeitlichen und räumlichen Beziehungen innerhalb der Videomodalität zu erfassen, und dann weiter von einem Transformator modelliert, um Einbettungsvektoren für die raumzeitlichen Informationen der Videosequenz zu generieren. Die Eingabe des Skelettmodalitätsverarbeitungsmoduls ist eine Skelettsequenz, die durch Bidirectional Encoder Representation from Transformers (BERT) verarbeitet wird, um zeitliche und räumliche Merkmale von Skelettgelenken zu extrahieren. Für Skelettdaten wird die Pose jedes Schülers als Sequenz von 2D-Gelenkkoordinaten aus den Unterrichtsvideos mit einem OpenPose-basierten Posenschätzer modelliert. Diese Sequenzen werden in Einbettungstoken umgewandelt, in denen jedes Token einem Frame mit 18 Schlüsselpunkten entspricht. Der zeitliche Kontext und die Abhängigkeiten dieser Gelenksequenzen werden mit Hilfe eines BERT-Modells (Bidirectional Encoder Representations from Transformers) modelliert. Das Modell verwendet 12 Transformatorschichten, 8 Aufmerksamkeitsköpfe und eine versteckte Größe von 768, was der Standard-BERT-Basisarchitektur entspricht. Das Modell wird während des Trainings fein abgestimmt, um verhaltensspezifische Gelenkmuster zu erfassen. Die Ausgabeeinbettungen stellen die strukturellen und bewegungsbezogenen Merkmale des Schülerverhaltens dar, die anschließend mit Videomodalitätsmerkmalen kombiniert werden. Anschließend werden die Skelettmerkmale durch 3D-CNN- und Pooling-Operationen weiter zu räumlichen und zeitlichen Merkmalen aggregiert, wobei eingebettete Vektoren des Skeletts als Merkmalsrepräsentationen der Skelettmodalität generiert werden.

3. Cross-Attention-Fusion-Modul

Im Cross-Attention-Fusionsmodul verwendet die Studie den Multi-Head-Attention-Mechanismus (MHAM), um die Interaktionsbeziehung zwischen Videomodalität und Skelettmodalität zu konstruieren, und extrahiert weiter kompaktere Fusionsmerkmale durch 3D-CNN und Pooling-Operationen aus den generierten multimodalen Fusionsmerkmalen. Der Fusionsprozess wird unter Verwendung eines Zwei-Stream-Aufmerksamkeitsnetzwerks durchgeführt, bei dem die zeitlichen Einbettungen jeder Modalität durch 3D-CNNs und bidirektionale GRUs geleitet werden. Die multimodalen Datenströme werden mit Hilfe von Multi-Head Attention Modules (MHAM) ausgerichtet, wobei die Punktproduktaufmerksamkeit skaliert wird, um intermodale Abhängigkeiten zu erreichen. Die Einbettungen werden dann gepoolt, um die Dimensionskomplexität zu bewältigen, und zur Klassifizierung an eine vollständig verbundene Softmax-Schicht gesendet.

In multimodalen Fusionsnetzwerken wird das Self-Attention-Modul verwendet, um die zeitliche und räumliche Abhängigkeit innerhalb eines einzelnen Modus zu modellieren, während das Cross-Attention-Fusion-Modul verwendet wird, um die Assoziation und Informationsinteraktion zwischen verschiedenen Modi herzustellen. Daher ist beides sehr wichtig. Das Self-Attention-Modul erfasst die internen Abhängigkeiten der Eingabesequenz, indem es die Beziehung zwischen der Abfrage Q, dem Schlüssel K und dem Wert V berechnet. Die Berechnung von Q, Schlüssel K und Wert V ist in Gleichung (1) dargestellt. Dabei figure-protocol-1 befinden sich die Abfrage-, Schlüssel- und Wertmatrizen. dk ist die Schlüsselvektordimensionalität und dk ist die Dimensionalität der Wertvektoren. Der Maßfaktor dk wird gewählt, um zu verhindern, dass die Punktprodukte zu groß werden, was die Stabilität von Gradienten während des Trainings beeinflussen würde.

figure-protocol-2(1)

In Gleichung (1) figure-protocol-3 werden die Eingabe-Features dargestellt, wobei n die Länge der Eingabesequenz ist, dasd-Modell die Dimension der Features und WQ, WK und WV drei Sätze erlernbarer Projektionsmatrizen darstellen. Durch diese Matrixzuordnungen werden die Eingabe-Features in Abfragen, Schlüssel und Werte transformiert. Das Punktprodukt von Abfrage Q und Schlüssel K wird verwendet, um Aufmerksamkeitsgewichte zu berechnen und zu skalieren, wie in Gleichung (2) gezeigt.

figure-protocol-4(2)

In Gleichung (2) stellt dk die Dimension der Abfrage von Q und Schlüssel K dar, und softmax bezeichnet die Softmax-Funktion, die zum Abrufen der Aufmerksamkeitsgewichtsmatrix verwendet wird. Durch die Skalierung kann das Problem, dass der Gradient aufgrund überhöhter Punktproduktwerte, die durch die Dimensionalität verursacht werden, zu klein ist, effektiv verhindert werden. Die Aufmerksamkeitsgewichtsmatrix wird auf den Wert V angewendet, um den Ausgang Z des Selbstaufmerksamkeitsmoduls zu erhalten, wie in Gleichung (3) gezeigt.

figure-protocol-5(3)

In Gleichung (3) bedeutet einij die Aufmerksamkeitsgewichtung des i-ten Abfragevektors auf dem j ten Schlüsselvektor. Die spezifische Struktur des Cross-Attention-Fusionsmoduls ist in Abbildung 2 dargestellt.

Ab Abbildung 2 beginnt dieses Modul hauptsächlich mit der Verarbeitung von Eingabemerkmalen aus Skelett- und Videomodalitäten. Zuerst werden die Skelettsequenz und die Videosequenz separat 3D-Faltungsschichten unterzogen, um raumzeitliche Merkmale zu extrahieren, und dann werden diese raumzeitlichen Merkmale mit Bidirektionalen Gated Recurrent Units (Bi-GRUs) für die zeitliche Modellierung modelliert. Als nächstes werden die Merkmale der beiden Modalitäten durch MHAMs weiter extrahiert, um Korrelationen innerhalb der Modalitäten zu extrahieren. Jede Modalität erreicht die Merkmalsdarstellung intern durch Mechanismen von Abfragen, Schlüsseln und Werten. Anschließend wird ein zeitgemitteltes Pooling für die Ausgabe-Features durchgeführt, um die Komplexität der Zeitdimension zu reduzieren. Nach dem Pooling werden die multimodalen Merkmale statistisch gepoolt, um den Mittelwert und die Standardabweichung jeder Modalität zu berechnen und schließlich die Aktionserkennung und -klassifizierung des Schülers über eine vollständig verbundene Schicht (FCL) und einen Softmax-Klassifikator auszugeben. Daher nutzt die in der Studie vorgeschlagene Merkmalsextraktion auf der Grundlage multimodaler Datenfusion Selbstaufmerksamkeit und Kreuz-AMs, um die raumzeitlichen Merkmale des Schülerverhaltens durch die Fusion von Daten aus Video- und Skelettmodalitäten genau zu erfassen und zu modellieren, wodurch die Genauigkeit und Vollständigkeit der Verhaltenserkennung von Schülern in intelligenten Klassenzimmern verbessert wird.

4. Raumzeitliche Verhaltenserkennung basierend auf Transformer und Aufmerksamkeit

Die Merkmalsextraktion auf Basis der multimodalen Datenfusion erreicht eine erste Verbesserung der Vollständigkeit und Genauigkeit des Schülerverhaltens durch die Fusion von Daten aus Video- und Skelettmodalitäten. Im Kontext intelligenter Klassenzimmer ändert sich das Verhalten der Schüler jedoch oft im Laufe der Zeit, und das gleiche Verhalten kann zu verschiedenen Zeitpunkten und räumlichen Regionen unterschiedliche Merkmale aufweisen. Sich ausschließlich auf statische Informationen zu verlassen, die aus multimodalen Merkmalen fusioniert sind, kann die komplexen raumzeitlichen dynamischen Beziehungen in der Verhaltenssequenz22, 23 nicht vollständig erfassen. Daher wird in der weiteren Forschung eine raumzeitliche Verhaltensmodellierung und AM auf Basis von Transformer vorgeschlagen. Die Studie wählte Vision Transformer (ViT) als Netzwerkarchitektur, der die globalen raumzeitlichen Informationen von Eingaben durch Selbst-AM modellieren kann und eine stärkere Fähigkeit hat, raumzeitliche Abhängigkeiten zu erfassen. Nach der multimodalen Fusion werden die fusionierten Merkmale erneut mit einem Vision Transformer (ViT) dargestellt, um das raumzeitliche Verhalten vorherzusagen. Die Feature-Maps in der Eingabe werden in disjunkte 16 × 16 Patches aufgeteilt, linear in eindimensionale Vektoren eingebettet und positionscodiert, um die räumliche Reihenfolge beizubehalten. Die ViT-Struktur besteht aus 12 Transformer-Encoder-Blöcken, die aus Multi-Head-Self-Attention (8 Köpfen) und Feed-Forward-Schichten mit einer versteckten Dimension von 768 bestehen. Um die Verhaltensauffälligkeit zu verbessern, werden die Module Spatial Attention (SA) und Temporal Attention (TA) vorgeschlagen. Das SA-Modul fördert die Feature-Relevanz in räumlichen Bereichen durch die Tanh-Aktivierung, während das TA-Modul wichtige zeitliche Rahmen durch ReLU-Aktivierung hervorhebt. Diese beiden Aufmerksamkeitsströme werden anschließend über eine zweistufige Trainingsmethode mit dem ViT-Backbone kombiniert, so dass das Modell lernt, die dynamische Entwicklung des Verhaltens im Klassenzimmer effizient zu erfassen. Die Struktur von ViT ist in Abbildung 3 dargestellt.

In Abbildung 3 ist die ursprüngliche Eingabe in ViT ein Bild, das in mehrere kleine Blöcke fester Größe segmentiert ist, die jeweils als Teil des Bildes dargestellt werden, und linear zu einem eindimensionalen Vektor abgeflacht wird. Da der Transformer keine Positionsinformationen wahrnehmen kann, wird jeder kleine Block mit Positionsinformationen eingebettet, bevor er in den Transformer eingegeben wird, um sicherzustellen, dass er die relative räumliche Positionsbeziehung zwischen verschiedenen kleinen Blöcken erfassen kann. Das Kernmodul von ViT ist der Transformer-Encoder, der aus mehreren gestapelten Transformer-Codierungsblöcken besteht. Die Codierungsblöcke bestehen aus einem MHAM und einem neuronalen Feed-Forward-Netzwerk. Das MHAM erfasst die Abhängigkeiten zwischen den Eingabesequenzen parallel, während das neuronale Feedforward-Netz nichtlineare Transformationen an den Ergebnissen durchführt, um die Fähigkeit des Modells zur Erfassung und zum Ausdruck globaler Informationen zu verbessern. Nachdem der Transformer-Encoder alle kleinen Informationen verarbeitet hat, wird die Ausgabe der letzten Codierungsschicht an den Multi-Layer Perceptron Head (MLP Head) übergeben, der die endgültigen Ergebnisse zur Erkennung und Klassifizierung von Schüleraktionen ausgibt.

In der Praxis wird jeder Frame in nicht überlappende 16 × 16 Patches aufgeteilt, abgeflacht und positionsbezogen eingebettet, um räumliche Beziehungen zu erhalten. Patch-Embeddings werden sequentiell von gestapelten Transformer-Encodern in der ViT-Architektur verarbeitet. Das Modul Spatial Attention (SA) nutzt die Tanh-Aktivierung, um die Aufmerksamkeit über Interessenbereiche innerhalb jedes Frames hinweg zu variieren, und das Temporal Attention (TA)-Modul nutzt ReLU, um zeitlich wichtige Frames hervorzuheben. Dieser Zwei-Augen-Mechanismus ermöglicht eine effektive Modellierung der Dynamik des Raum- und Zeitverhaltens.

Um die Leistung von ViT in komplexen Verhaltenssequenzen weiter zu verbessern, werden räumliche Aufmerksamkeit (SA) und zeitliche Aufmerksamkeit (TA) eingeführt, um ViT nicht nur in die Lage zu versetzen, wichtige räumliche Gelenke autonom auszuwählen, sondern sich auch auf Verhaltensweisen zu verschiedenen Zeitpunkten zu konzentrieren, um die raumzeitlichen dynamischen Verhaltensänderungen besser zu erfassen. Das SA-Modul und das TA-Modul sind in Abbildung 4 dargestellt.

In Abbildung 4A verarbeitet das SA-Modul die räumlichen Dimensionsinformationen der Eingabe, indem es die Features des aktuellen Frames an die ViT-Schicht übergibt, um die ausgeblendeten Zustände zu extrahieren. Diese werden mit den Features des Vorgängerrahmens kombiniert und gemeinsam in den FCL eingespeist. Die FCL führt eine lineare Transformation für die Features durch, um latente Feature-Repräsentationen zu generieren. Anschließend wird es an die Tanh-Aktivierungsfunktion übergeben, um den Ausgang auf den Bereich von [-1,1] abzubilden, wodurch die Nichtlinearität verbessert und eine bessere Unterscheidung zwischen wichtigen und unwichtigen Merkmalen vorgenommen wird. Schließlich werden die Features durch einen Normalisierungs-Layer normalisiert, um sicherzustellen, dass die Ausgabe-Features einen relativ stabilen Maßstab aufweisen. In Abbildung 4B konzentriert sich das TA-Modul mehr auf die Schlüsselinformationen, die in jedem Frame in der zeitlichen Dimension enthalten sind. Im Gegensatz zu Tanh in SA verwendet das TA-Modul die ReLU-Aktivierungsfunktion, um negative Werte zu unterdrücken, und behält nur die Ausgabe positiver Werte bei, wodurch negative Rauschinformationen effektiv entfernt und die zeitliche Erfassungsfähigkeit des Modells verbessert werden.

5. Methode des gemeinsamen Trainings

Um das Problem der verzerrten und redundanten raumzeitlichen Merkmale, die durch die gegenseitige Beeinflussung zwischen ViT, SA-Modul und TA-Modul bei der raumzeitlichen Verhaltenserkennung auf Basis von Transformer und Aufmerksamkeit verursacht werden, effektiv zu lösen, wird eine gemeinsame Trainingsmethode zur Optimierung der drei Module angewendet. Der spezifische Prozess ist in Abbildung 5 dargestellt.

In Abbildung 5 gibt die gemeinsame Trainingsstrategie zunächst die Trainingsparameter des Modells ein, legt die Netzwerkstruktur und die Hyperparameter fest. Anschließend wird ein separates Vortraining zu SA und TA durchgeführt, um die lokalen Besonderheiten besser kennenzulernen. Es ist erwähnenswert, dass während des Vortrainings eines Modells die Gewichte des anderen Modells konstant gehalten und nicht aktualisiert werden. Nach Abschluss des individuellen Vortrainings wird die ViT-Schicht für das Training kombiniert. Dann werden zwei Aufmerksamkeitsmodelle festgelegt und das Haupt-ViT-Netzwerk separat trainiert. Schließlich wird durch das gemeinsame Training der Hauptmodule des ViT-Netzwerks, der SA und des TA das gesamte Netzwerk optimiert, um das endgültige Modell für die intelligente Verhaltenserkennung im Klassenzimmer zu generieren. Der Trainingsablauf erfolgt schrittweise: (1) autonomes Vortraining der SA- und TA-Module mit eingefrorenen ViT-Parametern, (2) schrittweises Training von ViT mit eingefrorenen Aufmerksamkeitsmodulgewichten und (3) End-to-End-Feinabstimmung aller Komponenten zusammen mit dem Adam-Optimierer (Lernrate = 0,001, Batchgröße = 64, Epochen = 100). Der Ansatz stabilisiert das Merkmalslernen und reduziert Interferenzen zwischen Modulen während der Optimierung.

Insgesamt kombiniert die vorgeschlagene intelligente Verhaltenserkennungsmethode im Klassenzimmer Video- und Skelettmodalitäten, um raumzeitliche Beziehungen durch Selbstaufmerksamkeit und Cross-AMs zu modellieren. Durch die Nutzung der globalen raumzeitlichen Modellierungsfunktion von ViT und die Kombination von räumlichen und TA-Modulen wird das Modell optimiert, um wichtige Verhaltensweisen und zeitliche Dynamiken zu erfassen und eine umfassendere und genauere Erkennung des Schülerverhaltens zu erreichen. Kritische Fusionsoperationen, bei denen multimodale Merkmalsdarstellungen kombiniert werden, werden in der betrachteten Architektur durchgeführt. Insbesondere sind die räumlichen Merkmale, die von CNN gelernt werden, mit den zeitlichen Merkmalen des Bi-LSTM verbunden. Diese Ausgabe wird dann vor der Klassifizierungsaufgabe mit aufmerksamkeitsverstärkten Funktionen von MHAM fusioniert. Diese Fusionsoperationen sind entscheidend für die Fusion komplementärer Ansichten von Verhaltensdaten und werden in Abbildung 1 und Abbildung 5 hervorgehoben.

Algorithmus 1 veranschaulicht die kombinierten multimodalen Daten-, Skelett-, Text- und Videoinformationen unter Verwendung von ViT-, BERT- und GCN-basierten Modellen, um informative Merkmale in einer Klasse zu extrahieren. Die gemeinsame Darstellung wird dann markiert, um das Verhalten der Schüler zu identifizieren, mit höherer Genauigkeit durch intermodales Lernen.

Algorithmus 1: Prozess der multimodalen Verhaltenserkennung mit ViT, BERT und GCN.

Initialisieren:

Vortrainiertes BERT-Modell

Vortrainiertes schnelleres R-CNN-Modell

Vortrainiertes ViT-Modell

GCN-Modell für Skelettdaten

Klassifikator (z. B. MLP oder Transformer)

Datensatz laden:

Für jede Stichprobe im multimodalen Datensatz:

Extrahieren von Videoframes

Audio-Transkript extrahieren

Extrahieren von Skelettdaten (OpenPose oder MediaPipe)

Schritt 1: Verarbeitung der Videomodalität

Für jedes Bild im Video:

Wenden Sie schnelleres R-CNN an, um Objekte/Teilnehmer zu erkennen

Wenden Sie Vision Transformer (ViT) an, um Features auf Frame-Ebene zu extrahieren

Aggregieren von Features im Zeitverlauf für die zeitliche Darstellung

Schritt 2: Verarbeitung der Textmodalität

Transkripttext vorverarbeiten:

Tokenisieren Sie mit dem BERT-Tokenizer

Übergeben von Token durch das BERT-Modell

Extrahieren von kontextbezogenen Einbettungen aus dem [CLS]-Token oder dem durchschnittlichen Pooling

Schritt 3: Verarbeitung der Skelettmodalität

Für jede Skelettsequenz:

Normalisieren von Koordinaten

Durchlaufen Sie GCN oder ST-GCN, um Bewegungsmerkmale zu extrahieren

Schritt 4: Merkmalsfusion

Verketten oder Aufmerksamkeitssicherung:

Video-Funktionen

Text-Features

Skelett-Eigenschaften

Erhalten Sie eine einheitliche multimodale Darstellung

Schritt 5: Klassifizierung

Übergeben Sie die fusionierte Darstellung an den endgültigen Klassifikator

Prognose des Verhaltens im Klassenzimmer (z. B. aufmerksam, abgelenkt)

Schritt 6: Evaluierung

Vergleichen Sie Vorhersagen mit Ground Truth

Berechnen von Metriken: Genauigkeit, Präzision, Abruf, F1-Punktzahl

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um die Wirksamkeit und Überlegenheit der erhobenen intelligenten Verhaltenserkennungsmethode im Klassenzimmer mit Transformer und AM zu bewerten, wurde eine experimentelle Leistungsüberprüfung und -analyse durchgeführt. Zunächst wurden die experimentelle Umgebung und die Parameter konfiguriert, wie in Tabelle 1 dargestellt.

Basierend auf Tabelle 1 wählte die Studie das EduSense-Dataset und das SBU Kinect Interaction Dataset als experimentelle Datasets mit den ...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Es wurde eine Verhaltenserkennungsmethode für intelligente Klassenzimmer auf Basis von Transformer und AM vorgeschlagen, um die Herausforderungen des komplexen Schülerverhaltens und der multimodalen Datenerkennung zu bewältigen. Ein ViT-Netzwerk mit globaler raumzeitlicher Modellierungsfähigkeit wurde durch die Integration von Daten aus Video- und Skelettmodalitäten konstruiert, und Selbstaufmerksamkeit und Kreuz-AMs wurden verwendet, um raumzeitliche Merkmale des Verhaltens zu erfassen....

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nichts.

BEITRAG DES AUTORS:
Liu Lei: Verantwortlich für die Konzeption und Gestaltung der Forschung; schlug die Transformer-basierte multimodale Datenfusionsmethode für die intelligente Verhaltenserkennung im Klassenzimmer vor. Leitete die Entwicklung des Modells und des Versuchsdesigns, leitete die Datenerfassung und -verarbeitung und verfasste das erste Manuskript. Mitwirkung an der Analyse und Diskussion von experimentellen Ergebnissen.

He Zhihua: Bot die allgemeine Anleitung und Aufsicht über die Studie; trug zum Forschungsrahmen und zur methodischen Unterstützung bei. Teilnahme an der Modelloptimierung und experimentellen Analyse, Überprüfung und Überarbeitung des Manuskripts, Sicherstellung der Einhaltung ethischer Standards und endgültige Genehmigung zur Einreichung. Verantwortlich für die Korrespondenz.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
128 GB DDR4 RAMMehrere Anbieterhttps://www.crucial.com/memory/ddr4Ausreichend Arbeitsspeicher für die multimodale Datenverarbeitung
2 TB SSD-SpeicherAnbieterhttps://www.samsung.com/ssdZum Speichern von Datensätzen und Modellen
BERT (Basiskonfiguration)Hugging Facehttps://huggingface.co/bert-base-uncasedSprachmodell für die Einbettung von Skelettsequenzen
CUDA 11.1 ToolkitNVIDIAhttps://developer.nvidia.com/cuda-toolkitErmöglicht die GPU-Beschleunigung für PyTorch
cuDNN 8.0-BibliothekNVIDIAhttps://developer.nvidia.com/cudnnGPU-beschleunigte Bibliothek für tiefe neuronale Netze
EduSense-DatensatzCarnegie Mellon Universityhttps://www.cs.cmu.edu/~./edusenseReal-life University Classroom Dataset
Schnelleres R-CNN (ResNet-50)Open Source (PyTorch)https://github.com/facebookresearch/detectron2Objektdetektor für die Extraktion von Videomerkmalen
Intel Xeon E5-2680 v4 CPUIntelhttps://www.intel.com/products/xeon-e5-2680-v4Hochleistungsprozessor für das Modelltraining
MatplotlibOpen Sourcehttps://matplotlib.orgWird zum Plotten von Leistungsmetriken verwendet
NVIDIA Tesla V100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100Wird für Training und Inferenz verwendet; unterstützt Echtzeit-Verhaltenserkennung
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeExtrahiert 2D-Skelett-Schlüsselpunkte aus Videobildern
PyTorch 1.8 FrameworkOpen Sourcehttps://www.pytorch.orgDeep-Learning-Bibliothek wird verwendet für Modellentwicklung
SBU Kinect Interaction DatasetStony Brook Universityhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectInteraktionsbasierter Skelettdatensatz
TensorBoardOpen Source (Google)https://www.tensorflow.org/tensorboardWird für die Trainingsvisualisierung
verwendet Ubuntu 20.04 LTS BetriebssystemKanonischehttps://www.ubuntu.com/downloadLinux OS als Entwicklungsumgebung
Vision Transformer (ViT)Google / Hugging Facehttps://huggingface.co/google/vit-base-patch16-224Wird für die globale raumzeitliche Verhaltensmodellierung verwendet
Mehrere

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Transformer Modellmultimodale Fusionraumzeitliche AufmerksamkeitStudent EngagementEchtzeit FeedbackVerhaltensmapping
Video demnächst verfügbar

Verwandte Artikel