Artículo de investigación

Reconocimiento del comportamiento en el aula a través de transformadores y mecanismos de atención: aplicación en la evaluación de la calidad de la enseñanza para la educación médica en IA

DOI:

10.3791/69052

15 de agosto de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un sistema de IA basado en Transformer para reconocer el comportamiento en el aula en la educación médica y de enfermería. Utilizando datos multimodales, el sistema evalúa la participación del alumno y los estados emocionales. Los resultados demuestran una mayor precisión en comparación con los modelos tradicionales, lo que permite la retroalimentación en tiempo real y un mayor apoyo para la calidad de la enseñanza y la salud mental de los estudiantes.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un sistema de inteligencia artificial basado en Transformer diseñado para el reconocimiento del comportamiento en el aula, destinado a mejorar la evaluación de la calidad de la enseñanza y el seguimiento de la salud mental en la educación médica y de enfermería. El modelo utiliza datos multimodales, específicamente video, audio y movimiento esquelético, para evaluar indicadores clave de participación de los estudiantes, como la capacidad de atención, la frecuencia de interacción y las fluctuaciones emocionales. Una novedosa estrategia de fusión multimodal, combinada con mecanismos de atención espaciotemporal, permite que el sistema capture comportamientos complejos en el aula con mayor precisión y robustez. Los resultados experimentales en los conjuntos de datos de Kinect de EduSense y SBU demuestran que el método propuesto supera significativamente a los modelos tradicionales tanto en precisión como en tasa de falsas alarmas. Además, los estudios de ablación confirman la contribución de los módulos de atención espacial y temporal a la capacidad de reconocimiento del sistema. El marco admite retroalimentación en tiempo real y mapeo visual del comportamiento, ofreciendo un valor práctico en entornos de aprendizaje experiencial. Este enfoque proporciona una solución escalable y adaptable para el monitoreo del comportamiento en el aula y respalda las estrategias de intervención temprana en la educación médica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Con los crecientes desafíos de salud mental entre los estudiantes de enfermería y medicina debido al estrés académico y clínico, la integración de la inteligencia artificial en los entornos del aula puede proporcionar no solo un seguimiento de la calidad de la enseñanza, sino también apoyo psicológico en tiempo real. Este estudio posiciona el reconocimiento del comportamiento dentro de la educación médica para apoyar el aprendizaje experiencial y promover el bienestar de los estudiantes1. El aula inteligente se refiere a un modelo educativo nuevo y de alta calidad que combina procesos de enseñanza inteligentes y personalizados mediante la aplicación de tecnologías de vanguardia, como las tecnologías de la información, la inteligencia artificial, el big data y el Internet de las cosas, para ayudar a la gestión de la enseñanza y la interacción en el aula 2,3,4. Actualmente, con el desarrollo de tecnologías como cámaras y sensores, los datos de comportamiento recopilados en el aula no solo incluyen videos sino también datos multimodales, como voz y audio5. Sin embargo, el manejo de esta compleja información y datos espaciotemporales y la extracción precisa de características de comportamiento valiosas de ellos son los principales desafíos que enfrenta el campo del reconocimiento inteligente del comportamiento en el aula 6,7. Los enfoques de reconocimiento de comportamiento existentes se basan principalmente en la extracción de características de fuentes de datos monomodales, como transmisiones de video en el aula o imágenes secuenciales8. Si bien estos métodos pueden detectar eventos de comportamiento groseros, a menudo no logran modelar la evolución temporal y los matices espaciales de los gestos, expresiones o factores de frecuencia de interacción de los estudiantes críticos para comprender el bienestar y el enfoque del alumno9. Además, los modelos actuales carecen de mecanismos robustos para fusionar fuentes de datos heterogéneas como señales de audio y movimiento esquelético, lo que limita su sensibilidad al comportamiento afectivo o desconectado10. Para abordar estas limitaciones, este estudio propone un sistema de reconocimiento de comportamiento en el aula basado en transformadores mejorado con mecanismos de atención espacio-temporal. Al aprovechar la capacidad del Transformer para modelar dependencias de largo alcance y combinarlo con estrategias de fusión de características multimodales, el sistema propuesto tiene como objetivo mejorar la precisión de la clasificación del comportamiento al tiempo que permite la visualización en tiempo real de los indicadores emocionales y de compromiso. El objetivo final es apoyar la evaluación dinámica de la calidad de la enseñanza y la retroalimentación de salud mental integrada dentro de la educación médica, ofreciendo una solución escalable y adaptativa para monitorear y mejorar tanto la eficacia de la instrucción como el bienestar del alumno.

La evaluación propone un novedoso sistema de reconocimiento de comportamiento basado en Transformer que combina mecanismos de atención espaciotemporal con fusión de datos multimodales (entradas de video y esqueleto) adaptados para la observación inteligente en el aula en la educación médica y de enfermería. A diferencia de los modelos existentes, el nuevo modelo facilita la atención precisa y en tiempo real de los estudiantes y la detección del estado emocional, lo cual es valioso tanto para la evaluación de la calidad de la instrucción como para el bienestar psicológico.

Trabajos relacionados
El aula inteligente es un nuevo entorno de enseñanza que utiliza la tecnología de la información moderna para mejorar la interacción docente, el aprendizaje personalizado y la gestión de la enseñanza. Puede utilizar métodos de enseñanza inteligentes para mejorar la eficiencia y la calidad de la enseñanza al tiempo que brinda a los estudiantes experiencias de aprendizaje más ricas y personalizadas. Por lo tanto, muchos académicos de todo el mundo han investigado la tecnología inteligente y la enseñanza en el aula. Radosavljevic et al. propusieron un modelo de aula inteligente basado en inteligencia ambiental, que evalúa los niveles de fatiga de los estudiantes y ajusta las estrategias de aprendizaje mediante el análisis de sus datos de actividad académica diaria para optimizar los resultados de aprendizaje11. Tai T. Y estudió el efecto de los asistentes personales inteligentes en la mejora de la capacidad para hablar en idiomas extranjeros y descubrió que el uso del Asistente de Google mejoró significativamente la capacidad de hablar de los hablantes no nativos, con efectos similares a los hablantes nativos en la comunicación12. Chen et al. descubrieron a través de su investigación que el uso de chatbots como herramientas de enseñanza podría responder rápidamente a las necesidades de los estudiantes, mejorar la interactividad y demostrar la aplicación potencial de la tecnología inteligente en el aula13. La investigación planteó un método de evaluación de la efectividad de la enseñanza en el aula basado en el modo de enseñanza inteligente, que mejoró la precisión de la evaluación mediante el uso del algoritmo de búsqueda de cuco y la máquina de aprendizaje extremo14.

El reconocimiento de comportamientos en aulas inteligentes es una tecnología clave para lograr una enseñanza personalizada y optimizar la gestión del aula. Puede monitorear el estado de comportamiento de los estudiantes en tiempo real y proporcionar retroalimentación efectiva. A través del reconocimiento del comportamiento, los maestros pueden comprender con precisión la participación y el enfoque de los estudiantes, mejorando así la efectividad de la enseñanza y ayudando a la toma de decisiones. En este contexto, académicos de todo el mundo han realizado una amplia investigación sobre el reconocimiento inteligente del comportamiento en el aula. La investigación propuso un sistema de monitoreo visual en tiempo real basado en inteligencia artificial, que utilizó el aprendizaje automático para entrenar modelos de reconocimiento del comportamiento de los estudiantes para ayudar a los maestros a monitorear mejor la participación de los estudiantes y la interacción en el aula, optimizando así la calidad de la enseñanza15. Chonggao P logró el reconocimiento del comportamiento de los estudiantes en tiempo real y mejoró la precisión del análisis del comportamiento en el aula en la enseñanza remota mediante la combinación del análisis de agrupamiento y el algoritmo de bosque aleatorio, así como el modelo de esqueleto humano16. Wu S desarrolló un modelo de reconocimiento del comportamiento de los estudiantes que combina la optimización del enjambre de partículas y el algoritmo del vecino más cercano K, promoviendo la precisión del reconocimiento de emociones para satisfacer las necesidades prácticas de la enseñanza en el aula17. El sistema ACORN propuesto por Ramakrishnan et al. utilizó el aprendizaje automático multimodal y combinó redes neuronales convolucionales para analizar audio, expresiones faciales y datos de imágenes. La integración de estas características a través de redes convolucionales temporales logró una evaluación automática de la atmósfera del aula y logró un progreso preliminar18.

En resumen, la investigación existente ha propuesto varias técnicas basadas en el aprendizaje automático y el aprendizaje profundo para el reconocimiento inteligente del comportamiento en el aula, que cubren áreas como la detección de la fatiga de los estudiantes, el análisis de sentimientos y el monitoreo de la interacción en el aula. Sin embargo, todavía hay algunas deficiencias en la investigación actual, y muchos métodos carecen de suficiente tiempo real y escalabilidad en aplicaciones prácticas, lo que dificulta la adaptación a escenarios de aula complejos y cambiantes. Por lo tanto, el estudio propone un método inteligente de reconocimiento del comportamiento en el aula con Transformer y AM. La innovación de la investigación radica en utilizar la poderosa capacidad de modelado temporal del Transformer combinada con AM espaciotemporal para capturar con precisión momentos y regiones clave de comportamiento en el aula, e integrar múltiples fuentes de información, como video y audio, a través de la fusión de datos multimodales para mejorar la amplitud y precisión del reconocimiento del comportamiento.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utiliza conjuntos de datos disponibles públicamente que no contienen ninguna información de identificación personal. Todos los datos utilizados en la investigación han sido anonimizados para garantizar la privacidad de los participantes. Se obtuvo el consentimiento informado de todos los participantes en el momento de la recolección de datos, y el estudio se adhiere a las pautas éticas. El protocolo explica el método inteligente de reconocimiento de comportamiento en el aula, que consiste en la extracción de características basada en la fusión de datos multimodales y el reconocimiento de comportamiento espaciotemporal basado en Transformer y la atención. El rendimiento de todo el método se optimiza a través del entrenamiento conjunto.

1. Recopilación de datos multimodelo

La recopilación de datos multimodales implicó la recopilación de datos sincronizados sobre el comportamiento en el aula de dos conjuntos de datos: el conjunto de datos de EduSense y el conjunto de datos de interacción de SBU Kinect. EduSense grabó grabaciones de aulas universitarias de la vida real y SBU Kinect grabó secuencias esqueléticas basadas en interacción. Los conjuntos de datos contenían transmisiones de video, señales de audio e información de la articulación esquelética en 3D para modelar las posturas y el movimiento de los estudiantes. El preprocesamiento de datos garantizó la alineación temporal y la eliminación del ruido para la limpieza. Esta convergencia proporcionó un monitoreo de comportamiento de extremo a extremo, registrando gestos visuales y movimientos corporales en muchas situaciones de aprendizaje.

2. Extracción de características basada en la fusión de datos multimodales

Con el objetivo de abordar el tema del reconocimiento del comportamiento de los estudiantes en las aulas inteligentes, se propone un método para el reconocimiento inteligente del comportamiento en el aula con Transformer y AM. Debido a la naturaleza compleja de las aulas con numerosos estudiantes, los cambios en los factores dentro de la escena pueden interferir con el reconocimiento del comportamiento de los estudiantes. Además, la extracción de características individuales tiene limitaciones como información incompleta, susceptibilidad a la interferencia ambiental y dificultad para capturar comportamientos complejos19,20. Por lo tanto, el estudio propone primero un método de extracción de características del aula de los estudiantes basado en la fusión de datos multimodales. Este método combina datos de modalidades de video y esqueléticas, utilizando su complementariedad para lograr una extracción de características más completa y precisa del comportamiento de los estudiantes. En particular, cada secuencia de video de entrada se divide por cuadros. Las tramas se introducen en una R-CNN más rápida preentrenada para localizar regiones humanas de interés. Las regiones detectadas se introducen en una red neuronal convolucional para obtener características visuales temporales. Para la modalidad esquelética, las posiciones articulares 3D se plantean como secuencias y se codifican utilizando un modelo BERT preentrenado para obtener dependencias temporales y espaciales. Estos se normalizan e integran antes de ser ingresados en la red de fusión multimodal. Entre ellos, la modalidad de video es la principal responsable de capturar características visuales como los movimientos y expresiones de los estudiantes, mientras que la modalidad esquelética describe con precisión los cambios de postura de los estudiantes a través de la información de los puntos articulares. Mientras que la modalidad de video se basa en las características globales de la percepción visual, mientras que la modalidad esquelética presenta características visuales globales para representar el comportamiento humano, la modalidad esquelética se centra en los cambios dinámicos en la posición de la articulación, lo que lleva a diferencias semánticas significativas entre los dos21. Por lo tanto, es necesario desarrollar una red de fusión multimodal especializada para modelar eficazmente la correlación entre las dos modalidades. La red de fusión multimodal se muestra en la Figura 1.

En la Figura 1, la red se divide principalmente en tres módulos. Entre ellos, la entrada del módulo de procesamiento de modalidad de video es una secuencia de video, que se extrae a través de una red neuronal convolucional basada en regiones más rápidas (Faster R-CNN) para la extracción de características. El tratamiento de la modalidad de video comienza traduciendo las tomas de video del aula en entradas cuadro por cuadro para la extracción de características. Las tramas se tratan con una red neuronal convolucional basada en regiones más rápida (R-CNN más rápida) con una base ResNet-50 entrenada en ImageNet. La red trata los fotogramas RGB redimensionados a 224 × 224 píxeles, lo que da como resultado mapas de características visuales de alto nivel con características espaciales y específicas de objetos de la actividad de los estudiantes. Estas características se introducen en un módulo de autoatención, que aprende las relaciones temporales entre fotogramas antes de codificarlos en incrustaciones espaciotemporales a través de una capa de Transformer. Esto conserva señales de comportamiento débiles, como inclinaciones de cabeza o levantamientos de manos, en representaciones de incrustación para su posterior fusión. Las características de video extraídas son capturadas por el módulo de autoatención para capturar las relaciones temporales y espaciales dentro de la modalidad de video, y luego modeladas por un transformador para generar vectores de incrustación para la información espaciotemporal de la secuencia de video. La entrada del módulo de procesamiento de modalidad esquelética es una secuencia esquelética, que se procesa mediante la representación bidireccional del codificador de transformadores (BERT) para extraer características temporales y espaciales de las articulaciones esqueléticas. Para los datos esqueléticos, la pose de cada estudiante se modela como una secuencia de coordenadas conjuntas 2D de los videos del aula utilizando un estimador de pose basado en OpenPose. Estas secuencias se convierten en tokens de incrustación en los que cada token corresponde a un fotograma con 18 puntos clave. El contexto temporal y las dependencias de estas secuencias conjuntas se modelan utilizando un modelo de representaciones de codificador bidireccional de transformadores (BERT). El modelo emplea 12 capas de transformadores, 8 cabezales de atención y un tamaño oculto de 768, que es la arquitectura estándar de la base BERT. El modelo se ajusta durante el entrenamiento para adquirir patrones articulares específicos del comportamiento. Las incrustaciones de salida representan las características estructurales y relacionadas con el movimiento del comportamiento de los estudiantes que posteriormente se combinan con las características de la modalidad de video. Posteriormente, las características esqueléticas se agregan aún más en características espaciales y temporales a través de CNN 3D y operaciones de agrupación, generando vectores incrustados del esqueleto como representaciones de características de la modalidad esquelética.

3. Módulo de fusión de atención cruzada

En el módulo de fusión de atención cruzada, el estudio utiliza el mecanismo de atención de múltiples cabezales (MHAM) para construir la relación de interacción entre la modalidad de video y la modalidad esquelética, y extrae además características de fusión más compactas a través de CNN 3D y operaciones de agrupación de las características de fusión multimodal generadas. El proceso de fusión se logra utilizando una red de atención de dos flujos, en la que las incrustaciones temporales de cada modalidad se pasan a través de CNN 3D y GRU bidireccionales. Los flujos de datos multimodales se alinean mediante módulos de atención multicabezal (MHAM), con atención de producto punto escalada para lograr dependencias de intermodalidad. Luego, las incrustaciones se agrupan para abordar la complejidad dimensional y se envían a una capa Softmax completamente conectada para su clasificación.

En las redes de fusión multimodal, el módulo de autoatención se utiliza para modelar la dependencia temporal y espacial dentro de un solo modo, mientras que el módulo de fusión de atención cruzada se utiliza para establecer la asociación y la interacción de información entre diferentes modos. Por lo tanto, ambos son muy importantes. El módulo de autoatención captura las dependencias internas de la secuencia de entrada calculando la relación entre la consulta Q, la clave K y el valor V. El cálculo de Q, la clave K y el valor V se muestra en la ecuación (1). ¿Dónde figure-protocol-1 están las matrices de consulta, clave y valor respectivamente; dk es la dimensionalidad del vector clave y dk es la dimensionalidad de los vectores de valor. El factor de dimensión dk se adopta para evitar que los productos de puntos se vuelvan grandes, lo que influiría en la estabilidad de los gradientes durante el entrenamiento.

figure-protocol-2(1)

En la ecuación (1), figure-protocol-3 representa las características de entrada, donde n es la longitud de la secuencia de entrada, dmodel es la dimensión de las características y WQ, WK y WV representan tres conjuntos de matrices de proyección aprendibles. A través de estas asignaciones de matrices, las entidades de entrada se transforman en consultas, claves y valores. El producto punto de la consulta Q y la clave K se utilizan para calcular los pesos de atención y escalarlos, como se muestra en la ecuación (2).

figure-protocol-4(2)

En la ecuación (2), dk representa la dimensión de la consulta de Q y la clave K, y softmax denota la función softmax utilizada para obtener la matriz de peso de atención. El escalado puede evitar eficazmente el problema de que el gradiente sea demasiado pequeño debido a los valores excesivos del producto de puntos causados por la dimensionalidad. La matriz de peso de atención se aplica al valor V para obtener la salida Z del módulo de autoatención, como se muestra en la ecuación (3).

figure-protocol-5(3)

En la ecuación (3), aij significa el peso de atención del i-ésimo vector de consulta en el j-ésimo vector clave. La estructura específica del módulo de fusión de atención cruzada se indica en la Figura 2.

A partir de la Figura 2, este módulo comienza principalmente a procesar características de entrada de modalidades esqueléticas y de video. En primer lugar, la secuencia del esqueleto y la secuencia de video se someten por separado a capas convolucionales 3D para extraer características espaciotemporales, y luego estas características espaciotemporales se modelan utilizando unidades recurrentes bidireccionales (Bi-GRU) para el modelado temporal. A continuación, las características de las dos modalidades se extraen aún más a través de MHAM para extraer correlaciones dentro de las modalidades. Cada modalidad logra la representación de características internamente a través de mecanismos de consultas, claves y valores. A continuación, se realiza una agrupación promediada en el tiempo en las entidades de salida para reducir la complejidad de la dimensión de tiempo. Después de la agrupación, las características multimodales se agrupan estadísticamente para calcular la media y la desviación estándar de cada modalidad, y finalmente generar el reconocimiento y clasificación de acciones del estudiante a través de una capa completamente conectada (FCL) y un clasificador Softmax. Por lo tanto, la extracción de características basada en la fusión de datos multimodales propuesta en el estudio utiliza la autoatención y los AM cruzados para capturar y modelar con precisión las características espaciotemporales del comportamiento de los estudiantes mediante la fusión de datos de modalidades de video y esqueléticas, mejorando así la precisión y la amplitud del reconocimiento del comportamiento de los estudiantes en aulas inteligentes.

4. Reconocimiento de comportamiento espaciotemporal basado en Transformer y atención

La extracción de características basada en la fusión de datos multimodales logra una mejora preliminar en la exhaustividad y precisión del comportamiento de los estudiantes al fusionar datos de las modalidades de video y esquelética. Sin embargo, en el contexto de las aulas inteligentes, el comportamiento de los estudiantes a menudo cambia con el tiempo, y el mismo comportamiento puede exhibir diferentes características en diferentes puntos de tiempo y regiones espaciales. Confiar únicamente en la información estática fusionada de características multimodales no puede capturar completamente las complejas relaciones dinámicas espaciotemporales en la secuencia de comportamiento22,23. Por lo tanto, investigaciones posteriores proponen un modelado de comportamiento espaciotemporal y AM basado en Transformer. El estudio eligió Vision Transformer (ViT) como arquitectura de red, que puede modelar la información espaciotemporal global de entrada a través de AM propia y tiene una mayor capacidad para capturar dependencias espaciotemporales. Después de la fusión multimodal, las características fusionadas se representan nuevamente utilizando un transformador de visión (ViT) para pronosticar el comportamiento espaciotemporal. Los mapas de características de la entrada se dividen en 16 × 16 parches inconexos, incrustados linealmente en vectores unidimensionales y codificados posicionalmente para preservar el orden espacial. La estructura ViT tiene 12 bloques de codificador Transformer, compuestos por capas de autoatención multicabezal (8 cabezales) y feed-forward cuya dimensión oculta es 768. Para mejorar la prominencia del comportamiento, se sugieren los módulos de Atención Espacial (SA) y Atención Temporal (AT). El módulo SA fomenta la relevancia de las características en áreas espaciales a través de la activación de Tanh, mientras que el módulo TA resalta marcos temporales importantes a través de la activación de ReLU. Estos dos flujos de atención se combinan posteriormente con la columna vertebral de ViT a través de un método de entrenamiento de dos etapas, de modo que el modelo aprende a capturar la evolución dinámica del comportamiento en el aula de manera eficiente. La estructura de ViT se muestra en la Figura 3.

En la Figura 3, en ViT, la entrada original es una imagen que se segmenta en múltiples bloques pequeños de tamaño fijo, cada uno representado como parte de la imagen, y aplanado linealmente en un vector unidimensional. Dado que el Transformer no puede percibir la información de ubicación, cada bloque pequeño se incrusta con información de ubicación antes de ingresarse en Transformer para garantizar que pueda capturar la relación de posición espacial relativa entre diferentes bloques pequeños. El módulo central de ViT es el codificador Transformer, que se compone de múltiples bloques de codificación Transformer apilados. Los bloques de codificación están compuestos por un MHAM y una red neuronal de alimentación. El MHAM captura las dependencias entre las secuencias de entrada en paralelo, mientras que la red neuronal de alimentación realiza transformaciones no lineales en los resultados para mejorar la capacidad del modelo para capturar y expresar información global. Después de que el codificador Transformer procesa todas las pequeñas piezas de información, la salida de la última capa de codificación se pasa al cabezal de perceptrón multicapa (cabezal MLP), que genera los resultados finales de reconocimiento y clasificación de acciones del estudiante.

Prácticamente, cada fotograma se divide en 16 × 16 parches no superpuestos, aplanados e incrustados posicionalmente para mantener las relaciones espaciales. Las incrustaciones de parches se procesan secuencialmente mediante codificadores de transformadores apilados en la arquitectura ViT. El módulo de atención espacial (SA) utiliza la activación tanh para variar la atención entre áreas de interés dentro de cada fotograma, y el módulo de atención temporal (TA) utiliza ReLU para resaltar fotogramas temporalmente importantes. Este mecanismo de dos atenciones permite modelar eficazmente la dinámica del comportamiento del espacio y el tiempo.

Para mejorar aún más el rendimiento de ViT en secuencias de comportamiento complejas, se introducen la atención espacial (SA) y la atención temporal (TA) para permitir que ViT no solo seleccione de forma autónoma articulaciones espaciales importantes, sino que también se centre en comportamientos en diferentes puntos de tiempo, capturando mejor los cambios dinámicos espaciotemporales del comportamiento. El módulo SA y el módulo TA se indican en la Figura 4.

En la Figura 4A, el módulo SA procesa la información de dimensión espacial de la entrada pasando las características del fotograma actual a la capa ViT para extraer los estados ocultos. Estos se combinan con las características del marco anterior y se introducen conjuntamente en la FCL. La FCL realizará una transformación lineal en las entidades para generar representaciones de entidades latentes. Posteriormente, se pasa a la función de activación de Tanh para asignar la salida al rango de [-1,1], mejorando la no linealidad y distinguiendo mejor entre características importantes y no importantes. Por último, las entidades se normalizan a través de una capa de normalización para garantizar que las entidades de salida tengan una escala relativamente estable. En la Figura 4B, el módulo TA se centra más en la información clave contenida en cada trama en la dimensión temporal. A diferencia de Tanh en SA, el módulo TA utiliza la función de activación ReLU para suprimir los valores negativos y solo retiene la salida de valores positivos, eliminando efectivamente la información de ruido negativo y mejorando la capacidad de captura temporal del modelo.

5. Método de entrenamiento conjunto

Para resolver de manera efectiva el problema de las características espaciotemporales sesgadas y redundantes causadas por la influencia mutua entre ViT, el módulo SA y el módulo TA en el reconocimiento de comportamiento espaciotemporal basado en Transformer y atención, se adopta un método de entrenamiento conjunto para optimizar los tres módulos. El proceso específico se indica en la Figura 5.

En la Figura 5, la estrategia de entrenamiento conjunto ingresa primero los parámetros de entrenamiento del modelo, establece la estructura de la red y los hiperparámetros. Posteriormente, se lleva a cabo una capacitación previa separada sobre SA y TA para aprender mejor las características locales. Vale la pena señalar que durante el preentrenamiento de un modelo, los pesos del otro modelo se mantienen fijos y no se actualizan. Después de completar el preentrenamiento individual, la capa ViT se combina para el entrenamiento. Luego, se fijarán dos modelos de atención y se entrenará la red ViT principal por separado. Finalmente, al entrenar conjuntamente los módulos principales de la red ViT, SA y TA, la red general se optimiza para generar el modelo final para el reconocimiento inteligente del comportamiento en el aula. El procedimiento de entrenamiento se lleva a cabo por etapas: (1) preentrenamiento autónomo de los módulos SA y TA con parámetros de ViT congelados, (2) entrenamiento por pasos de ViT con pesos de módulos de atención congelados y (3) ajuste fino de extremo a extremo de todos los componentes junto con el optimizador Adam (tasa de aprendizaje = 0,001, tamaño de lote = 64, épocas = 100). El enfoque estabiliza el aprendizaje de características y reduce la interferencia entre módulos durante la optimización.

En general, el método de reconocimiento inteligente del comportamiento en el aula propuesto combina modalidades de video y esqueléticas para modelar relaciones espaciotemporales a través de la autoatención y las AM cruzadas. Al utilizar la capacidad de modelado espaciotemporal global de ViT y combinar módulos espaciales y TA, el modelo se optimiza para capturar comportamientos clave y dinámicas temporales, logrando un reconocimiento más completo y preciso del comportamiento de los estudiantes. Las operaciones de fusión críticas, en las que se combinan representaciones de características multimodales, se realizan en la arquitectura considerada. Específicamente, las características espaciales aprendidas por CNN están conectadas a las características temporales del Bi-LSTM. Esta salida se fusiona con las características de atención aumentada de MHAM antes de la tarea de clasificación. Estas operaciones de fusión son cruciales para la fusión de puntos de vista complementarios de los datos de comportamiento y se enfatizan en la Figura 1 y la Figura 5.

El algoritmo 1 ilustra los datos multimodales combinados, la información esquelética, de texto y de video, utilizando modelos basados en ViT, BERT y GCN para extraer características informativas en una clase. Luego, la representación conjunta se marca para identificar el comportamiento de los estudiantes, con mayor precisión utilizando el aprendizaje intermodal.

Algoritmo 1: Proceso de reconocimiento de comportamiento multimodal utilizando ViT, BERT y GCN.

Inicializar:

Modelo BERT preentrenado

Modelo de R-CNN más rápido preentrenado

Modelo ViT preentrenado

Modelo GCN para datos de esqueleto

Clasificador (por ejemplo, MLP o transformador)

Cargar conjunto de datos:

Para cada muestra en el conjunto de datos multimodal:

Extraer fotogramas de vídeo

Extraer transcripción de audio

Extracción de datos de esqueleto (OpenPose o MediaPipe)

Paso 1: Procesamiento de la modalidad de video

Para cada fotograma del vídeo:

Aplique R-CNN más rápido para detectar objetos/participantes

Aplique Vision Transformer (ViT) para extraer características a nivel de fotograma

Agregar entidades a lo largo del tiempo para la representación temporal

Paso 2: Procesamiento de la modalidad de texto

Texto de la transcripción del preproceso:

Tokenizar usando el tokenizador BERT

Pasar tokens a través del modelo BERT

Extraer incrustaciones contextuales del token [CLS] o de la agrupación promedio

Paso 3: Procesamiento de la modalidad esquelética

Para cada secuencia de esqueleto:

Normalizar coordenadas

Pase a través de GCN o ST-GCN para extraer características de movimiento

Paso 4: Fusión de características

Concatenar o fusionar la atención:

Funciones de video

Características de texto

Características esqueléticas

Obtener una representación multimodal unificada

Paso 5: Clasificación

Pasar la representación fusionada al clasificador final

Predecir la etiqueta de comportamiento en el aula (p. ej., atento, distraído)

Paso 6: Evaluación

Comparar predicciones con la verdad sobre el terreno

Métricas de cálculo: exactitud, precisión, recuperación, puntuación F1

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para evaluar la eficacia y superioridad del método de reconocimiento inteligente del comportamiento en el aula con Transformer y AM, se realizó una verificación y análisis experimental del desempeño. En primer lugar, se configuraron el entorno experimental y los parámetros, como se indica en la Tabla 1.

Con base en la Tabla 1, el estudio seleccionó el conjunto de datos EduSense y el conjunto de datos de interacción SBU Kinect como conjuntos de datos experiment...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se propuso un método de reconocimiento de comportamiento para aulas inteligentes basado en Transformer y AM para abordar los desafíos del comportamiento complejo de los estudiantes y el reconocimiento de datos multimodales. Se construyó una red ViT con capacidad de modelado espaciotemporal global mediante la integración de datos de modalidades de video y esqueléticas, y se utilizaron AM de autoatención y cruzados para capturar características espaciotemporales del comportamiento. Al inte...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ninguno.

CONTRIBUCIÓN DEL AUTOR:
Liu Lei: Responsable de la concepción y diseño de la investigación; propuso el método de fusión de datos multimodal basado en transformadores para el reconocimiento inteligente del comportamiento en el aula. Dirigió el desarrollo del modelo y el diseño experimental, gestionó la recopilación y el procesamiento de datos y redactó el manuscrito inicial. Contribuyó al análisis y discusión de los resultados experimentales.

He Zhihua: Proporcionó orientación y supervisión general del estudio; contribuyó al marco de investigación y al apoyo metodológico. Participó en la optimización del modelo y el análisis experimental, revisó y revisó el manuscrito, aseguró el cumplimiento de los estándares éticos y dio la aprobación final para su presentación. Responsable de la correspondencia.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
128 GB de RAM DDR4Varios proveedoreshttps://www.crucial.com/memory/ddr4Memoria suficiente para el procesamiento de datos multimodales
Almacenamiento SSD de 2 TBVarios proveedoreshttps://www.samsung.com/ssdPara almacenar conjuntos de datos y modelos
BERT (Configuración base)https://huggingface.co/bert-base-uncasedHugging Facepara la incrustación de secuencias esqueléticas
Kit de herramientas CUDA 11.1NVIDIAhttps://developer.nvidia.com/cuda-toolkitpermite la aceleración de GPU para PyTorch
Biblioteca cuDNN 8.0Biblioteca acelerada por GPU NVIDIA https://developer.nvidia.com/cudnn para redes neuronales profundas
Conjunto de datos EduSenseUniversityhttps://www.cs.cmu.edu/~./edusenseConjunto de datos
de aulas universitarias de la vida realR-CNN (ResNet-50) másrápidoCódigo abierto (PyTorch)https://github.com/facebookresearch/detectron2Detector de objetos utilizado para la extracción de características de vídeo
CPU Intel Xeon E5-2680 v4Procesador Intelhttps://www.intel.com/products/xeon-e5-2680-v4de alto rendimiento para el entrenamiento de modelos
MatplotlibOpen Sourcehttps://matplotlib.orgutilizado para trazar métricas
GPU NVIDIA Tesla V100NVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100Se utiliza para el entrenamiento y la inferencia; admite el reconocimiento de comportamiento en tiempo real
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openpose Extrae puntos clave esqueléticos 2D de fotogramas de vídeo
Marco PyTorch 1.8abiertohttps://www.pytorch.orgBiblioteca de aprendizaje profundo utilizada para desarrollo de modelos
SBU Conjunto de datos de interacción de KinectUniversidad de Stony Brookhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectConjunto de datos esqueléticos basado en interacción
TensorBoardOpen Source (Google)https://www.tensorflow.org/tensorboardSe utiliza para entrenar la visualización
Sistema operativo Ubuntu 20.04 LTSCanonicalhttps://www.ubuntu.com/downloadSistema operativo Linux utilizado como entorno de desarrollo
Vision Transformer (ViT)Google / Hugging Facehttps://huggingface.co/google/vit-base-patch16-224Utilizado para el modelado de comportamiento espaciotemporal global
Modelo de lenguaje de rendimiento Código

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Modelo Transformerfusi n multimodalatenci n espaciotemporalcompromiso del estudianteretroalimentaci n en tiempo realmapeo de comportamiento
Video próximamente

Artículos relacionados