$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio utiliza conjuntos de datos disponibles públicamente que no contienen ninguna información de identificación personal. Todos los datos utilizados en la investigación han sido anonimizados para garantizar la privacidad de los participantes. Se obtuvo el consentimiento informado de todos los participantes en el momento de la recolección de datos, y el estudio se adhiere a las pautas éticas. El protocolo explica el método inteligente de reconocimiento de comportamiento en el aula, que consiste en la extracción de características basada en la fusión de datos multimodales y el reconocimiento de comportamiento espaciotemporal basado en Transformer y la atención. El rendimiento de todo el método se optimiza a través del entrenamiento conjunto.
1. Recopilación de datos multimodelo
La recopilación de datos multimodales implicó la recopilación de datos sincronizados sobre el comportamiento en el aula de dos conjuntos de datos: el conjunto de datos de EduSense y el conjunto de datos de interacción de SBU Kinect. EduSense grabó grabaciones de aulas universitarias de la vida real y SBU Kinect grabó secuencias esqueléticas basadas en interacción. Los conjuntos de datos contenían transmisiones de video, señales de audio e información de la articulación esquelética en 3D para modelar las posturas y el movimiento de los estudiantes. El preprocesamiento de datos garantizó la alineación temporal y la eliminación del ruido para la limpieza. Esta convergencia proporcionó un monitoreo de comportamiento de extremo a extremo, registrando gestos visuales y movimientos corporales en muchas situaciones de aprendizaje.
2. Extracción de características basada en la fusión de datos multimodales
Con el objetivo de abordar el tema del reconocimiento del comportamiento de los estudiantes en las aulas inteligentes, se propone un método para el reconocimiento inteligente del comportamiento en el aula con Transformer y AM. Debido a la naturaleza compleja de las aulas con numerosos estudiantes, los cambios en los factores dentro de la escena pueden interferir con el reconocimiento del comportamiento de los estudiantes. Además, la extracción de características individuales tiene limitaciones como información incompleta, susceptibilidad a la interferencia ambiental y dificultad para capturar comportamientos complejos19,20. Por lo tanto, el estudio propone primero un método de extracción de características del aula de los estudiantes basado en la fusión de datos multimodales. Este método combina datos de modalidades de video y esqueléticas, utilizando su complementariedad para lograr una extracción de características más completa y precisa del comportamiento de los estudiantes. En particular, cada secuencia de video de entrada se divide por cuadros. Las tramas se introducen en una R-CNN más rápida preentrenada para localizar regiones humanas de interés. Las regiones detectadas se introducen en una red neuronal convolucional para obtener características visuales temporales. Para la modalidad esquelética, las posiciones articulares 3D se plantean como secuencias y se codifican utilizando un modelo BERT preentrenado para obtener dependencias temporales y espaciales. Estos se normalizan e integran antes de ser ingresados en la red de fusión multimodal. Entre ellos, la modalidad de video es la principal responsable de capturar características visuales como los movimientos y expresiones de los estudiantes, mientras que la modalidad esquelética describe con precisión los cambios de postura de los estudiantes a través de la información de los puntos articulares. Mientras que la modalidad de video se basa en las características globales de la percepción visual, mientras que la modalidad esquelética presenta características visuales globales para representar el comportamiento humano, la modalidad esquelética se centra en los cambios dinámicos en la posición de la articulación, lo que lleva a diferencias semánticas significativas entre los dos21. Por lo tanto, es necesario desarrollar una red de fusión multimodal especializada para modelar eficazmente la correlación entre las dos modalidades. La red de fusión multimodal se muestra en la Figura 1.
En la Figura 1, la red se divide principalmente en tres módulos. Entre ellos, la entrada del módulo de procesamiento de modalidad de video es una secuencia de video, que se extrae a través de una red neuronal convolucional basada en regiones más rápidas (Faster R-CNN) para la extracción de características. El tratamiento de la modalidad de video comienza traduciendo las tomas de video del aula en entradas cuadro por cuadro para la extracción de características. Las tramas se tratan con una red neuronal convolucional basada en regiones más rápida (R-CNN más rápida) con una base ResNet-50 entrenada en ImageNet. La red trata los fotogramas RGB redimensionados a 224 × 224 píxeles, lo que da como resultado mapas de características visuales de alto nivel con características espaciales y específicas de objetos de la actividad de los estudiantes. Estas características se introducen en un módulo de autoatención, que aprende las relaciones temporales entre fotogramas antes de codificarlos en incrustaciones espaciotemporales a través de una capa de Transformer. Esto conserva señales de comportamiento débiles, como inclinaciones de cabeza o levantamientos de manos, en representaciones de incrustación para su posterior fusión. Las características de video extraídas son capturadas por el módulo de autoatención para capturar las relaciones temporales y espaciales dentro de la modalidad de video, y luego modeladas por un transformador para generar vectores de incrustación para la información espaciotemporal de la secuencia de video. La entrada del módulo de procesamiento de modalidad esquelética es una secuencia esquelética, que se procesa mediante la representación bidireccional del codificador de transformadores (BERT) para extraer características temporales y espaciales de las articulaciones esqueléticas. Para los datos esqueléticos, la pose de cada estudiante se modela como una secuencia de coordenadas conjuntas 2D de los videos del aula utilizando un estimador de pose basado en OpenPose. Estas secuencias se convierten en tokens de incrustación en los que cada token corresponde a un fotograma con 18 puntos clave. El contexto temporal y las dependencias de estas secuencias conjuntas se modelan utilizando un modelo de representaciones de codificador bidireccional de transformadores (BERT). El modelo emplea 12 capas de transformadores, 8 cabezales de atención y un tamaño oculto de 768, que es la arquitectura estándar de la base BERT. El modelo se ajusta durante el entrenamiento para adquirir patrones articulares específicos del comportamiento. Las incrustaciones de salida representan las características estructurales y relacionadas con el movimiento del comportamiento de los estudiantes que posteriormente se combinan con las características de la modalidad de video. Posteriormente, las características esqueléticas se agregan aún más en características espaciales y temporales a través de CNN 3D y operaciones de agrupación, generando vectores incrustados del esqueleto como representaciones de características de la modalidad esquelética.
3. Módulo de fusión de atención cruzada
En el módulo de fusión de atención cruzada, el estudio utiliza el mecanismo de atención de múltiples cabezales (MHAM) para construir la relación de interacción entre la modalidad de video y la modalidad esquelética, y extrae además características de fusión más compactas a través de CNN 3D y operaciones de agrupación de las características de fusión multimodal generadas. El proceso de fusión se logra utilizando una red de atención de dos flujos, en la que las incrustaciones temporales de cada modalidad se pasan a través de CNN 3D y GRU bidireccionales. Los flujos de datos multimodales se alinean mediante módulos de atención multicabezal (MHAM), con atención de producto punto escalada para lograr dependencias de intermodalidad. Luego, las incrustaciones se agrupan para abordar la complejidad dimensional y se envían a una capa Softmax completamente conectada para su clasificación.
En las redes de fusión multimodal, el módulo de autoatención se utiliza para modelar la dependencia temporal y espacial dentro de un solo modo, mientras que el módulo de fusión de atención cruzada se utiliza para establecer la asociación y la interacción de información entre diferentes modos. Por lo tanto, ambos son muy importantes. El módulo de autoatención captura las dependencias internas de la secuencia de entrada calculando la relación entre la consulta Q, la clave K y el valor V. El cálculo de Q, la clave K y el valor V se muestra en la ecuación (1). ¿Dónde
están las matrices de consulta, clave y valor respectivamente; dk es la dimensionalidad del vector clave y dk es la dimensionalidad de los vectores de valor. El factor de dimensión dk se adopta para evitar que los productos de puntos se vuelvan grandes, lo que influiría en la estabilidad de los gradientes durante el entrenamiento.
(1)
En la ecuación (1),
representa las características de entrada, donde n es la longitud de la secuencia de entrada, dmodel es la dimensión de las características y WQ, WK y WV representan tres conjuntos de matrices de proyección aprendibles. A través de estas asignaciones de matrices, las entidades de entrada se transforman en consultas, claves y valores. El producto punto de la consulta Q y la clave K se utilizan para calcular los pesos de atención y escalarlos, como se muestra en la ecuación (2).
(2)
En la ecuación (2), dk representa la dimensión de la consulta de Q y la clave K, y softmax denota la función softmax utilizada para obtener la matriz de peso de atención. El escalado puede evitar eficazmente el problema de que el gradiente sea demasiado pequeño debido a los valores excesivos del producto de puntos causados por la dimensionalidad. La matriz de peso de atención se aplica al valor V para obtener la salida Z del módulo de autoatención, como se muestra en la ecuación (3).
(3)
En la ecuación (3), aij significa el peso de atención del i-ésimo vector de consulta en el j-ésimo vector clave. La estructura específica del módulo de fusión de atención cruzada se indica en la Figura 2.
A partir de la Figura 2, este módulo comienza principalmente a procesar características de entrada de modalidades esqueléticas y de video. En primer lugar, la secuencia del esqueleto y la secuencia de video se someten por separado a capas convolucionales 3D para extraer características espaciotemporales, y luego estas características espaciotemporales se modelan utilizando unidades recurrentes bidireccionales (Bi-GRU) para el modelado temporal. A continuación, las características de las dos modalidades se extraen aún más a través de MHAM para extraer correlaciones dentro de las modalidades. Cada modalidad logra la representación de características internamente a través de mecanismos de consultas, claves y valores. A continuación, se realiza una agrupación promediada en el tiempo en las entidades de salida para reducir la complejidad de la dimensión de tiempo. Después de la agrupación, las características multimodales se agrupan estadísticamente para calcular la media y la desviación estándar de cada modalidad, y finalmente generar el reconocimiento y clasificación de acciones del estudiante a través de una capa completamente conectada (FCL) y un clasificador Softmax. Por lo tanto, la extracción de características basada en la fusión de datos multimodales propuesta en el estudio utiliza la autoatención y los AM cruzados para capturar y modelar con precisión las características espaciotemporales del comportamiento de los estudiantes mediante la fusión de datos de modalidades de video y esqueléticas, mejorando así la precisión y la amplitud del reconocimiento del comportamiento de los estudiantes en aulas inteligentes.
4. Reconocimiento de comportamiento espaciotemporal basado en Transformer y atención
La extracción de características basada en la fusión de datos multimodales logra una mejora preliminar en la exhaustividad y precisión del comportamiento de los estudiantes al fusionar datos de las modalidades de video y esquelética. Sin embargo, en el contexto de las aulas inteligentes, el comportamiento de los estudiantes a menudo cambia con el tiempo, y el mismo comportamiento puede exhibir diferentes características en diferentes puntos de tiempo y regiones espaciales. Confiar únicamente en la información estática fusionada de características multimodales no puede capturar completamente las complejas relaciones dinámicas espaciotemporales en la secuencia de comportamiento22,23. Por lo tanto, investigaciones posteriores proponen un modelado de comportamiento espaciotemporal y AM basado en Transformer. El estudio eligió Vision Transformer (ViT) como arquitectura de red, que puede modelar la información espaciotemporal global de entrada a través de AM propia y tiene una mayor capacidad para capturar dependencias espaciotemporales. Después de la fusión multimodal, las características fusionadas se representan nuevamente utilizando un transformador de visión (ViT) para pronosticar el comportamiento espaciotemporal. Los mapas de características de la entrada se dividen en 16 × 16 parches inconexos, incrustados linealmente en vectores unidimensionales y codificados posicionalmente para preservar el orden espacial. La estructura ViT tiene 12 bloques de codificador Transformer, compuestos por capas de autoatención multicabezal (8 cabezales) y feed-forward cuya dimensión oculta es 768. Para mejorar la prominencia del comportamiento, se sugieren los módulos de Atención Espacial (SA) y Atención Temporal (AT). El módulo SA fomenta la relevancia de las características en áreas espaciales a través de la activación de Tanh, mientras que el módulo TA resalta marcos temporales importantes a través de la activación de ReLU. Estos dos flujos de atención se combinan posteriormente con la columna vertebral de ViT a través de un método de entrenamiento de dos etapas, de modo que el modelo aprende a capturar la evolución dinámica del comportamiento en el aula de manera eficiente. La estructura de ViT se muestra en la Figura 3.
En la Figura 3, en ViT, la entrada original es una imagen que se segmenta en múltiples bloques pequeños de tamaño fijo, cada uno representado como parte de la imagen, y aplanado linealmente en un vector unidimensional. Dado que el Transformer no puede percibir la información de ubicación, cada bloque pequeño se incrusta con información de ubicación antes de ingresarse en Transformer para garantizar que pueda capturar la relación de posición espacial relativa entre diferentes bloques pequeños. El módulo central de ViT es el codificador Transformer, que se compone de múltiples bloques de codificación Transformer apilados. Los bloques de codificación están compuestos por un MHAM y una red neuronal de alimentación. El MHAM captura las dependencias entre las secuencias de entrada en paralelo, mientras que la red neuronal de alimentación realiza transformaciones no lineales en los resultados para mejorar la capacidad del modelo para capturar y expresar información global. Después de que el codificador Transformer procesa todas las pequeñas piezas de información, la salida de la última capa de codificación se pasa al cabezal de perceptrón multicapa (cabezal MLP), que genera los resultados finales de reconocimiento y clasificación de acciones del estudiante.
Prácticamente, cada fotograma se divide en 16 × 16 parches no superpuestos, aplanados e incrustados posicionalmente para mantener las relaciones espaciales. Las incrustaciones de parches se procesan secuencialmente mediante codificadores de transformadores apilados en la arquitectura ViT. El módulo de atención espacial (SA) utiliza la activación tanh para variar la atención entre áreas de interés dentro de cada fotograma, y el módulo de atención temporal (TA) utiliza ReLU para resaltar fotogramas temporalmente importantes. Este mecanismo de dos atenciones permite modelar eficazmente la dinámica del comportamiento del espacio y el tiempo.
Para mejorar aún más el rendimiento de ViT en secuencias de comportamiento complejas, se introducen la atención espacial (SA) y la atención temporal (TA) para permitir que ViT no solo seleccione de forma autónoma articulaciones espaciales importantes, sino que también se centre en comportamientos en diferentes puntos de tiempo, capturando mejor los cambios dinámicos espaciotemporales del comportamiento. El módulo SA y el módulo TA se indican en la Figura 4.
En la Figura 4A, el módulo SA procesa la información de dimensión espacial de la entrada pasando las características del fotograma actual a la capa ViT para extraer los estados ocultos. Estos se combinan con las características del marco anterior y se introducen conjuntamente en la FCL. La FCL realizará una transformación lineal en las entidades para generar representaciones de entidades latentes. Posteriormente, se pasa a la función de activación de Tanh para asignar la salida al rango de [-1,1], mejorando la no linealidad y distinguiendo mejor entre características importantes y no importantes. Por último, las entidades se normalizan a través de una capa de normalización para garantizar que las entidades de salida tengan una escala relativamente estable. En la Figura 4B, el módulo TA se centra más en la información clave contenida en cada trama en la dimensión temporal. A diferencia de Tanh en SA, el módulo TA utiliza la función de activación ReLU para suprimir los valores negativos y solo retiene la salida de valores positivos, eliminando efectivamente la información de ruido negativo y mejorando la capacidad de captura temporal del modelo.
5. Método de entrenamiento conjunto
Para resolver de manera efectiva el problema de las características espaciotemporales sesgadas y redundantes causadas por la influencia mutua entre ViT, el módulo SA y el módulo TA en el reconocimiento de comportamiento espaciotemporal basado en Transformer y atención, se adopta un método de entrenamiento conjunto para optimizar los tres módulos. El proceso específico se indica en la Figura 5.
En la Figura 5, la estrategia de entrenamiento conjunto ingresa primero los parámetros de entrenamiento del modelo, establece la estructura de la red y los hiperparámetros. Posteriormente, se lleva a cabo una capacitación previa separada sobre SA y TA para aprender mejor las características locales. Vale la pena señalar que durante el preentrenamiento de un modelo, los pesos del otro modelo se mantienen fijos y no se actualizan. Después de completar el preentrenamiento individual, la capa ViT se combina para el entrenamiento. Luego, se fijarán dos modelos de atención y se entrenará la red ViT principal por separado. Finalmente, al entrenar conjuntamente los módulos principales de la red ViT, SA y TA, la red general se optimiza para generar el modelo final para el reconocimiento inteligente del comportamiento en el aula. El procedimiento de entrenamiento se lleva a cabo por etapas: (1) preentrenamiento autónomo de los módulos SA y TA con parámetros de ViT congelados, (2) entrenamiento por pasos de ViT con pesos de módulos de atención congelados y (3) ajuste fino de extremo a extremo de todos los componentes junto con el optimizador Adam (tasa de aprendizaje = 0,001, tamaño de lote = 64, épocas = 100). El enfoque estabiliza el aprendizaje de características y reduce la interferencia entre módulos durante la optimización.
En general, el método de reconocimiento inteligente del comportamiento en el aula propuesto combina modalidades de video y esqueléticas para modelar relaciones espaciotemporales a través de la autoatención y las AM cruzadas. Al utilizar la capacidad de modelado espaciotemporal global de ViT y combinar módulos espaciales y TA, el modelo se optimiza para capturar comportamientos clave y dinámicas temporales, logrando un reconocimiento más completo y preciso del comportamiento de los estudiantes. Las operaciones de fusión críticas, en las que se combinan representaciones de características multimodales, se realizan en la arquitectura considerada. Específicamente, las características espaciales aprendidas por CNN están conectadas a las características temporales del Bi-LSTM. Esta salida se fusiona con las características de atención aumentada de MHAM antes de la tarea de clasificación. Estas operaciones de fusión son cruciales para la fusión de puntos de vista complementarios de los datos de comportamiento y se enfatizan en la Figura 1 y la Figura 5.
El algoritmo 1 ilustra los datos multimodales combinados, la información esquelética, de texto y de video, utilizando modelos basados en ViT, BERT y GCN para extraer características informativas en una clase. Luego, la representación conjunta se marca para identificar el comportamiento de los estudiantes, con mayor precisión utilizando el aprendizaje intermodal.
Algoritmo 1: Proceso de reconocimiento de comportamiento multimodal utilizando ViT, BERT y GCN.
Inicializar:
Modelo BERT preentrenado
Modelo de R-CNN más rápido preentrenado
Modelo ViT preentrenado
Modelo GCN para datos de esqueleto
Clasificador (por ejemplo, MLP o transformador)
Cargar conjunto de datos:
Para cada muestra en el conjunto de datos multimodal:
Extraer fotogramas de vídeo
Extraer transcripción de audio
Extracción de datos de esqueleto (OpenPose o MediaPipe)
Paso 1: Procesamiento de la modalidad de video
Para cada fotograma del vídeo:
Aplique R-CNN más rápido para detectar objetos/participantes
Aplique Vision Transformer (ViT) para extraer características a nivel de fotograma
Agregar entidades a lo largo del tiempo para la representación temporal
Paso 2: Procesamiento de la modalidad de texto
Texto de la transcripción del preproceso:
Tokenizar usando el tokenizador BERT
Pasar tokens a través del modelo BERT
Extraer incrustaciones contextuales del token [CLS] o de la agrupación promedio
Paso 3: Procesamiento de la modalidad esquelética
Para cada secuencia de esqueleto:
Normalizar coordenadas
Pase a través de GCN o ST-GCN para extraer características de movimiento
Paso 4: Fusión de características
Concatenar o fusionar la atención:
Funciones de video
Características de texto
Características esqueléticas
Obtener una representación multimodal unificada
Paso 5: Clasificación
Pasar la representación fusionada al clasificador final
Predecir la etiqueta de comportamiento en el aula (p. ej., atento, distraído)
Paso 6: Evaluación
Comparar predicciones con la verdad sobre el terreno
Métricas de cálculo: exactitud, precisión, recuperación, puntuación F1