본 연구는 의학 및 간호 교육에서 교실 행동을 인식하기 위한 Transformer 기반 AI 시스템을 제시합니다. 시스템은 다중 모드 데이터를 사용하여 학습자 참여와 감정 상태를 평가합니다. 결과는 기존 모델에 비해 정확도가 높아 실시간 피드백이 가능하고 교육 품질 및 학생 정신 건강에 대한 지원이 강화되었음을 보여줍니다.
연구 논문
본 연구는 의학 및 간호 교육에서 교실 행동을 인식하기 위한 Transformer 기반 AI 시스템을 제시합니다. 시스템은 다중 모드 데이터를 사용하여 학습자 참여와 감정 상태를 평가합니다. 결과는 기존 모델에 비해 정확도가 높아 실시간 피드백이 가능하고 교육 품질 및 학생 정신 건강에 대한 지원이 강화되었음을 보여줍니다.
본 연구는 의학 및 간호 교육에서 교의 질 평가와 정신 건강 모니터링을 강화하기 위해 교실 행동 인식을 위해 설계된 Transformer 기반 인공 지능 시스템을 소개합니다. 이 모델은 다중 모드 데이터, 특히 비디오, 오디오 및 골격 움직임을 활용하여 주의 집중 시간, 상호 작용 빈도 및 감정 변동과 같은 학생 참여의 주요 지표를 평가합니다. 시공간 주의 메커니즘과 결합된 새로운 다중 모드 융합 전략을 통해 시스템은 향상된 정밀도와 견고성으로 복잡한 교실 행동을 포착할 수 있습니다. EduSense 및 SBU Kinect 데이터 세트에 대한 실험 결과는 제안된 방법이 정확도와 오경보율 모두에서 기존 모델보다 훨씬 우수하다는 것을 보여줍니다. 또한 절제 연구는 시스템의 인식 기능에 대한 공간 및 시간적 주의 모듈의 기여를 확인합니다. 이 프레임워크는 실시간 피드백과 시각적 행동 매핑을 지원하여 체험 학습 환경에서 실용적인 가치를 제공합니다. 이 접근 방식은 교실 행동 모니터링을 위한 확장 가능하고 적응력이 뛰어난 솔루션을 제공하고 의학 교육의 조기 개입 전략을 지원합니다.
학업 및 임상적 스트레스로 인해 간호 및 의대생의 정신 건강 문제가 증가함에 따라 인공 지능을 교실 환경에 통합하면 교육 품질 모니터링뿐만 아니라 실시간 심리적 지원도 제공할 수 있습니다. 이 연구는 체험 학습을 지원하고 학생의 복지를 증진하기 위해 의학 교육 내에서 행동 인식을 포지셔닝합니다1. 지능형 교실은 정보 기술, 인공 지능, 빅 데이터 및 사물 인터넷과 같은 최첨단 기술의 적용을 통해 지능적이고 개인화된 교육 프로세스를 결합하여 교육 관리 및 교실 상호 작용을 지원하는 새롭고 고품질의 교육 모델을 말합니다 2,3,4. 현재 카메라, 센서 등의 기술의 발달로 교실에서 수집되는 행동 데이터에는 영상뿐만 아니라 음성, 음성, 음성과 같은 멀티모달 데이터도 포함된다5. 그러나 이러한 복잡한 시공간 정보와 데이터를 처리하고 여기에서 귀중한 행동 특징을 정확하게 추출하는 것이 지능형 교실 행동 인식 분야가 직면한 주요 과제입니다 6,7. 기존의 행동 인식 접근 방식은 주로 교실 비디오 스트림 또는 순차 이미지와 같은 단일 모달 데이터 소스에서 특징 추출에 의존합니다8. 이러한 방법은 거친 행동 사건을 감지할 수 있지만 학습자의 웰빙과 집중력을 이해하는 데 중요한 학생의 몸짓, 표정 또는 상호 작용 빈도 요소의 시간적 진화와 공간적 뉘앙스를 모델링하지 못하는 경우가 많습니다9. 더욱이 현재 모델에는 오디오 신호 및 골격 움직임과 같은 이기종 데이터 소스를 융합하는 강력한 메커니즘이 부족하여 정서적 또는 이탈 행동에 대한 민감도가 제한됩니다10. 이러한 한계를 해결하기 위해 본 연구는 시공간적 주의 메커니즘으로 강화된 트랜스포머 기반 교실 행동 인식 시스템을 제안합니다. 제안된 시스템은 장거리 종속성을 모델링하는 트랜스포머의 기능을 활용하고 이를 다중 모드 기능 융합 전략과 결합함으로써 행동 분류의 정밀도를 향상시키는 동시에 참여 및 감정 지표의 실시간 시각화를 가능하게 하는 것을 목표로 합니다. 궁극적인 목표는 의학 교육 내에서 동적 교육 품질 평가와 내장된 정신 건강 피드백을 지원하여 교육 효능과 학습자 복지를 모두 모니터링하고 향상시키기 위한 확장 가능하고 적응형 솔루션을 제공하는 것입니다.
이 평가는 의료 및 간호 교육에서 스마트 교실 관찰을 위해 맞춤화된 시공간 주의 메커니즘과 다중 모드 데이터 융합(비디오 및 골격 입력)을 결합한 새로운 Transformer 기반 행동 인식 시스템을 제안합니다. 기존 모델과 달리 새로운 모델은 정확한 실시간 학생의 주의력과 감정 상태 감지를 촉진하여 교육 품질 평가와 심리적 웰빙 모두에 유용합니다.
관련 작품
지능형 교실은 현대 정보 기술을 활용하여 교육 상호 작용, 개인화된 학습 및 교육 관리를 향상시키는 새로운 교육 환경입니다. 지능형 교수법을 사용하여 교육 효율성과 질을 향상시키는 동시에 학생들에게 더욱 풍부하고 개인화된 학습 경험을 제공할 수 있습니다. 따라서 전 세계의 많은 학자들이 지능형 기술과 교실 교육을 연구해 왔습니다. Radosavljevic et al. 학습 결과를 최적화하기 위해 일일 학업 활동 데이터를 분석하여 학생들의 피로 수준을 평가하고 학습 전략을 조정하는 환경 지능을 기반으로 한 지능형 교실 모델을 제안했습니다11. Tai T. Y는 지능형 개인 비서가 외국어 말하기 능력 향상에 미치는 영향을 연구한 결과 Google 어시스턴트를 사용하면 의사소통에서 원어민과 유사한 효과로 비원어민의 말하기 능력이 크게 향상된다는 사실을 발견했습니다12. Chen et al. 연구를 통해 챗봇을 교육 도구로 사용하면 학생의 요구에 신속하게 대응하고 상호 작용성을 향상시키며 교실에서 지능형 기술의 잠재적 적용을 입증할 수 있음을 발견했습니다13. 연구에서는 뻐꾸기 검색 알고리즘과 극한학습기를 이용하여 평가의 정확도를 높인 지능형 교수 모드를 기반으로 한 교실 교육 효과 평가 방법을 제기하였다14.
지능형 교실의 행동 인식은 개인화된 교육을 달성하고 교실 관리를 최적화하기 위한 핵심 기술입니다. 학생들의 행동 상태를 실시간으로 모니터링하고 효과적인 피드백을 제공할 수 있습니다. 행동 인식을 통해 교사는 학생들의 참여와 집중력을 정확하게 이해할 수 있어 교육 효율성을 높이고 의사 결정을 지원할 수 있습니다. 이러한 맥락에서 전 세계 학자들은 지능형 교실 행동 인식에 대한 광범위한 연구를 수행했습니다. 연구에서는 기계 학습을 사용하여 학생 행동 인식 모델을 훈련하여 교사가 학생 참여와 교실 상호 작용을 더 잘 모니터링하여 교육 품질을 최적화할 수 있도록 하는 인공 지능 기반 실시간 시각적 모니터링 시스템을 제안했습니다15. Chonggao P는 클러스터링 분석과 랜덤 포레스트 알고리즘, 인간 골격 모델16을 결합하여 실시간 학생 행동 인식을 달성하고 원격 교육에서 교실 행동 분석의 정확도를 향상시켰습니다. Wu S는 입자 군집 최적화와 K-최근접 이웃 알고리즘을 결합한 학생 행동 인식 모델을 개발하여 교실 교육의 실제 요구를 충족시키기 위해 감정 인식의 정확성을 촉진했습니다17. Ramakrishnan et al.이 제안한 ACORN 시스템은 다중 모드 기계 학습과 결합된 컨볼루션 신경망을 활용하여 오디오, 얼굴 표정 및 이미지 데이터를 분석했습니다. 시간적 컨볼루션 네트워크를 통해 이러한 기능을 통합하면 교실 분위기에 대한 자동 평가가 달성되고 예비 진전이 이루어졌습니다18.
요약하면, 기존 연구에서는 학생 피로 감지, 감정 분석, 교실 상호 작용 모니터링과 같은 영역을 다루는 지능형 교실 행동 인식을 위한 다양한 기계 학습 및 딥 러닝 기반 기술을 제안했습니다. 그러나 현재 연구에는 여전히 몇 가지 단점이 있으며, 많은 방법이 실제 적용에서 충분한 실시간 및 확장성이 부족하여 복잡하고 변화하는 교실 시나리오에 적응하기 어렵습니다. 따라서 본 연구에서는 Transformer와 AM을 활용한 지능형 교실 행동 인식 방법을 제안한다. 이 연구의 혁신은 시공간 AM과 결합된 트랜스포머의 강력한 시간 모델링 기능을 활용하여 교실의 주요 행동 순간과 영역을 정확하게 포착하고, 다중 모드 데이터 융합을 통해 비디오 및 오디오와 같은 여러 정보 소스를 통합하여 행동 인식의 포괄성과 정확성을 향상시키는 데 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 개인 식별 정보를 포함하지 않는 공개적으로 사용 가능한 데이터 세트를 사용합니다. 연구에 사용된 모든 데이터는 참가자의 개인 정보 보호를 위해 익명으로 처리되었습니다. 데이터 수집 당시 모든 참가자로부터 정보에 입각한 동의를 얻었으며 연구는 윤리적 지침을 준수합니다. 이 프로토콜은 다중 모드 데이터 융합에 기반한 특징 추출과 Transformer 및 주의에 기반한 시공간 행동 인식으로 구성된 지능형 교실 행동 인식 방법을 설명합니다. 전체 방법의 성능은 공동 훈련을 통해 최적화됩니다.
1. 다중 모델 데이터 수집
다중 모드 데이터 수집에는 EduSense 데이터 세트와 SBU Kinect 상호 작용 데이터 세트의 두 데이터 세트에서 동기화된 교실 행동 데이터를 수집하는 작업이 포함되었습니다. EduSense는 실제 대학 강의실 녹화를 녹화했고 SBU Kinect는 상호 작용 기반 골격 시퀀스를 녹화했습니다. 데이터 세트에는 학생의 자세와 동작을 모델링하기 위한 비디오 스트림, 오디오 신호 및 3D 골격 관절 정보가 포함되어 있습니다. 데이터 전처리는 청소를 위한 시간적 정렬 및 노이즈 제거를 보장합니다. 이러한 융합은 종단 간 행동 모니터링을 제공하여 다양한 학습 상황에서 시각적 제스처와 신체 움직임을 기록했습니다.
2. 멀티모달 데이터 융합을 기반으로 한 특징 추출
지능형 교실에서 학생 행동 인식 문제를 대상으로 Transformer와 AM을 사용한 지능형 교실 행동 인식 방법을 제안합니다. 학생이 많은 교실의 복잡한 특성으로 인해 장면 내 요인의 변화는 학생의 행동 인식을 방해할 수 있습니다. 또한 단일 특징 추출은 불완전한 정보, 환경 간섭에 대한 민감성, 복잡한 동작 캡처의 어려움 등의 한계가 있습니다19,20. 따라서 본 연구에서는 먼저 멀티모달 데이터 융합을 기반으로 한 학생 교실 특징 추출 방법을 제안한다. 이 방법은 비디오와 골격 양식의 데이터를 결합하여 상호 보완성을 활용하여 학생 행동에 대한 보다 포괄적이고 정확한 특징 추출을 달성합니다. 특히 모든 입력 비디오 시퀀스는 프레임별로 나뉩니다. 프레임은 사전 훈련된 Faster R-CNN에 공급되어 인간의 관심 영역을 현지화합니다. 감지된 영역은 시간적 시각적 특징을 얻기 위해 컨볼루션 신경망 백본에 공급됩니다. 골격 양식의 경우 3D 관절 위치는 시퀀스로 포즈되고 사전 훈련된 BERT 모델을 사용하여 인코딩되어 시간적 및 공간적 종속성을 얻습니다. 이는 다중 모드 융합 네트워크에 입력되기 전에 정규화되고 포함됩니다. 그 중 영상 모달리는 주로 학생들의 움직임과 표정과 같은 시각적 특징을 포착하는 역할을 하는 반면, 골격 모달리는 관절점 정보를 통해 학생들의 자세 변화를 정확하게 묘사합니다. 비디오 양식은 시각적 인식의 전반적인 특징에 의존하는 반면, 골격 양식은 인간 행동을 표현하기 위해 전반적인 시각적 특징에 의존하는 반면, 골격 양식은 관절 위치의 동적 변화에 초점을 맞추어 둘 사이에 상당한 의미론적 차이를 초래합니다21. 따라서 두 양식 간의 상관관계를 효과적으로 모델링하기 위해 특화된 다중 모드 융합 네트워크를 개발할 필요가 있습니다. 다중 모드 융합 네트워크는 그림 1에 나와 있습니다.
그림 1에서 네트워크는 주로 세 개의 모듈로 나뉩니다. 그 중 비디오 모달리티 처리 모듈의 입력은 비디오 시퀀스이며, 이는 특징 추출을 위해 Faster Region-based Convolutional Neural Network(Faster R-CNN)를 통해 추출됩니다. 비디오 양식의 처리는 특징 추출을 위해 교실 비디오 샷을 프레임별 입력으로 변환하는 것으로 시작됩니다. 프레임은 ImageNet에서 훈련된 ResNet-50 기반을 사용하여 Faster Region-Based Convolutional Neural Network(Faster R-CNN)로 처리됩니다. 네트워크는 224 × 224 픽셀로 크기가 조정된 RGB 프레임을 처리하여 학생 활동의 공간 및 객체별 특징이 포함된 높은 수준의 시각적 특징 맵을 생성합니다. 그런 다음 이러한 기능은 Transformer 레이어를 통해 시공간 임베딩으로 인코딩하기 전에 프레임 간의 시간적 관계를 학습하는 자기 주의 모듈에 입력됩니다. 이는 나중에 융합을 위해 표현을 임베딩하는 데 머리 기울기나 손 올리기와 같은 희미한 행동 신호를 보존합니다. 추출된 비디오 특징은 비디오 모달리티 내의 시간적, 공간적 관계를 캡처하기 위해 자기 주의 모듈에 의해 캡처된 다음 트랜스포머에 의해 추가로 모델링되어 비디오 시퀀스의 시공간 정보에 대한 임베딩 벡터를 생성합니다. 골격 양식 처리 모듈의 입력은 골격 시퀀스이며, 골격 관절의 시간적, 공간적 특징을 추출하기 위해 BERT(Bidirectional Encoder Representation from Transformers)로 처리됩니다. 골격 데이터의 경우 모든 학생의 포즈는 OpenPose 기반 포즈 추정기를 사용하여 교실 비디오의 2D 관절 좌표 시퀀스로 모델링됩니다. 이러한 시퀀스는 모든 토큰이 18개의 키포인트가 있는 프레임에 해당하는 임베딩 토큰으로 변환됩니다. 이러한 관절 시퀀스의 시간적 컨텍스트 및 종속성은 BERT(Bidirectional Encoder Representations from Transformers) 모델을 사용하여 모델링됩니다. 이 모델은 12 개의 트랜스포머 레이어, 8 개의 어텐션 헤드 및 표준 BERT 기반 아키텍처 인 768 의 숨겨진 크기를 사용합니다. 모델은 행동별 관절 패턴을 획득하기 위해 훈련 중에 미세 조정됩니다. 출력 임베딩은 이후에 비디오 양식 기능과 결합되는 학생 행동의 구조적 및 동작 관련 특성을 나타냅니다. 그 후, 골격 특징은 3D CNN 및 풀링 작업을 통해 공간 및 시간적 특징으로 추가로 집계되어 골격 양식의 특징 표현으로 골격의 임베디드 벡터를 생성합니다.
3. 교차 주의 융합 모듈
교차 주의 융합 모듈에서 본 연구는 다중 헤드 주의 메커니즘(MHAM)을 사용하여 비디오 양식과 골격 양식 간의 상호 작용 관계를 구성하고, 생성된 다중 모드 융합 특징에서 3D CNN 및 풀링 연산을 통해 보다 컴팩트한 융합 특징을 추가로 추출합니다. 융합 프로세스는 각 양식의 시간적 임베딩이 3D CNN 및 양방향 GRU를 통과하는 2스트림 어텐션 네트워크를 사용하여 수행됩니다. 다중 모드 데이터 스트림은 다중 모드 종속성을 달성하기 위해 확장된 내적 주의와 함께 MHAM(Multi-Head Attention Modules)을 사용하여 정렬됩니다. 그런 다음 임베딩은 차원 복잡성을 해결하기 위해 풀링되고 분류를 위해 완전히 연결된 Softmax 레이어로 전송됩니다.
다중 모드 융합 네트워크에서 자기 주의 모듈은 단일 모드 내에서 시간적, 공간적 의존성을 모델링하는 데 사용되는 반면, 교차주의 융합 모듈은 서로 다른 모드 간의 연관성 및 정보 상호 작용을 설정하는 데 사용됩니다. 따라서 둘 다 매우 중요합니다. 셀프 어텐션 모듈은 쿼리 Q, 키 K 및 값 V 간의 관계를 계산하여 입력 시퀀스의 내부 종속성을 캡처합니다. Q, 키 K 및 값 V의 계산은 방정식 (1)에 나와 있습니다. 쿼리, 키 및 값 행렬은 각각 어디에 있습니까
? dk는 키 벡터 차원이고 dk는 값 벡터의 차원입니다. 차원 계수 dk는 내적이 커지는 것을 방지하기 위해 채택되어 훈련 중 기울기의 안정성에 영향을 미칩니다.
(1)
방정식 (1)에서 는
입력 특징을 나타내며, 여기서 n은 입력 시퀀스의 길이, d모델은 특징의 차원, WQ, WK 및 WV는 학습 가능한 투영 행렬의 세 세트를 나타냅니다. 이러한 행렬 매핑을 통해 입력 기능은 쿼리, 키 및 값으로 변환됩니다. 쿼리 Q와 키 K의 내적은 방정식 (2)와 같이 주의력 가중치를 계산하고 크기를 조정하는 데 사용됩니다.
(2)
방정식 (2)에서 dk는 Q와 키 K를 쿼리하는 차원을 나타내고, softmax는 주의 가중치 행렬을 얻는 데 사용되는 softmax 함수를 나타냅니다. 스케일링은 차원으로 인한 과도한 내적 값으로 인해 기울기가 너무 작아지는 문제를 효과적으로 방지할 수 있습니다. 주의 가중치 행렬은 방정식 (3)과 같이 자기 주의 모듈의 출력 Z를 얻기 위해 값 V에 적용됩니다.
(3)
방정식 (3)에서 ij는 j번째 키 벡터에 대한 i 번째 쿼리 벡터의 주의 가중치를 의미합니다. 교차 주의 융합 모듈의 구체적인 구조는 그림 2에 나와 있습니다.
그림 2에서 이 모듈은 주로 골격 및 비디오 양식의 입력 기능 처리를 시작합니다. 먼저, 골격 시퀀스와 비디오 시퀀스를 3D 컨볼루션 레이어에 별도로 적용하여 시공간 특징을 추출한 다음 이러한 시공간 특징을 시간 모델링을 위해 Bi-DIRECTIONAL GRU(Gated Recurrent Units)를 사용하여 모델링합니다. 다음으로, MHAM을 통해 두 양식의 특징을 추가로 추출하여 양식 내의 상관관계를 추출합니다. 각 양식은 쿼리, 키 및 값의 메커니즘을 통해 내부적으로 기능 표현을 달성합니다. 그런 다음 시간 차원의 복잡성을 줄이기 위해 출력 기능에 대해 시간 평균 풀링이 수행됩니다. 풀링 후 다중 모드 기능을 통계적으로 풀링하여 각 양식의 평균과 표준 편차를 계산하고 최종적으로 FCL(Fully Connected Layer)과 Softmax 분류기를 통해 학생의 행동 인식 및 분류를 출력합니다. 따라서 연구에서 제안된 다중 모드 데이터 융합 기반 특징 추출은 자기 주의와 교차 AM을 활용하여 비디오와 골격 양식의 데이터를 융합하여 학생 행동의 시공간적 특징을 정확하게 포착하고 모델링함으로써 지능형 교실에서 학생 행동 인식의 정확성과 포괄성을 향상시킵니다.
4. Transformer와 주의에 기반한 시공간 행동 인식
다중 모드 데이터 융합을 기반으로 한 특징 추출은 비디오와 골격 양식의 데이터를 융합하여 학생 행동의 포괄성과 정확성을 예비적으로 개선합니다. 그러나 지능형 교실의 맥락에서 학생들의 행동은 시간이 지남에 따라 변하는 경우가 많으며, 동일한 행동이 다른 시점과 공간 영역에서 다른 특성을 나타낼 수 있습니다. 다중 모드 기능에서 융합된 정적 정보에만 의존하는 것은 행동 시퀀스(22,23)에서 복잡한 시공간 동적 관계를 완전히 포착할 수 없습니다. 따라서 추가 연구에서는 Transformer를 기반으로 한 시공간 행동 모델링과 AM을 제안합니다. 이 연구는 자체 AM을 통해 입력의 글로벌 시공간 정보를 모델링할 수 있고 시공간 종속성을 포착하는 더 강력한 능력을 가진 네트워크 아키텍처로 ViT(Vision Transformer)를 선택했습니다. 다중 모드 융합 후, 융합된 특징은 시공간 동작을 예측하기 위해 ViT(Vision Transformer)를 사용하여 다시 표현됩니다. 입력의 특징 맵은 분리된 16 × 16 패치로 분할되고 1차원 벡터에 선형으로 포함되며 공간 질서를 유지하기 위해 위치적으로 인코딩됩니다. ViT 구조에는 다중 헤드 셀프 어텐션(8 헤드)과 숨겨진 차원이 768인 피드 포워드 레이어로 구성된 12개의 트랜스포머 인코더 블록이 있습니다. 행동 현저성을 향상시키기 위해 공간 주의(SA) 및 시간적 주의(TA) 모듈이 제안됩니다. SA 모듈은 Tanh 활성화를 통해 공간 영역에서 기능 관련성을 장려하는 반면, TA 모듈은 ReLU 활성화를 통해 중요한 시간 프레임을 강조합니다. 이 두 가지 주의 흐름은 이후 2단계 훈련 방법을 통해 ViT 백본과 결합되어 모델이 교실 행동의 동적 진화를 효율적으로 포착하는 방법을 학습합니다. ViT의 구조는 그림 3에 나와 있습니다.
그림 3에서 ViT에서 원래 입력은 각각 이미지의 일부로 표현되고 1차원 벡터로 선형적으로 평평화된 여러 개의 고정 크기의 작은 블록으로 분할된 이미지입니다. 트랜스포머는 위치 정보를 인식할 수 없기 때문에 각 작은 블록에는 트랜스포머에 입력되기 전에 위치 정보가 내장되어 서로 다른 작은 블록 간의 상대적인 공간 위치 관계를 캡처할 수 있습니다. ViT의 핵심 모듈은 여러 개의 스택 트랜스포머 인코딩 블록으로 구성된 트랜스포머 인코더입니다. 인코딩 블록은 MHAM과 피드포워드 신경망으로 구성됩니다. MHAM은 입력 시퀀스 간의 종속성을 병렬로 캡처하는 반면, 피드 포워드 신경망은 결과에 대해 비선형 변환을 수행하여 글로벌 정보를 캡처하고 표현하는 모델의 능력을 향상시킵니다. 트랜스포머 인코더가 모든 작은 정보를 처리한 후 마지막 인코딩 계층의 출력은 최종 학생 행동 인식 및 분류 결과를 출력하는 MLP 헤드(Multi-Layer Perceptron Head)로 전달됩니다.
실제로 각 프레임은 중첩되지 않는 16 × 16 패치로 분할되고 평평해지며 공간 관계를 유지하기 위해 위치적으로 내장됩니다. 패치 임베딩은 ViT 아키텍처의 스택형 트랜스포머 인코더에 의해 순차적으로 처리됩니다. SA(Spatial Attention) 모듈은 tanh 활성화를 활용하여 각 프레임 내에서 관심 영역에 걸쳐 주의를 변화시키고, TA(Temporal Attention) 모듈은 ReLU를 활용하여 시간적으로 중요한 프레임을 강조 표시합니다. 이 두 가지 주의 메커니즘은 공간 및 시간 행동 역학의 효과적인 모델링을 가능하게 합니다.
복잡한 행동 시퀀스에서 ViT의 성능을 더욱 향상시키기 위해 공간 주의(SA)와 시간적 주의(TA)를 도입하여 ViT가 중요한 공간 관절을 자율적으로 선택할 수 있을 뿐만 아니라 다양한 시점의 행동에 집중하여 행동의 시공간 동적 변화를 더 잘 포착할 수 있습니다. SA 모듈과 TA 모듈은 그림 4에 표시되어 있습니다.
그림 4A에서 SA 모듈은 현재 프레임의 특징을 ViT 레이어로 전달하여 숨겨진 상태를 추출함으로써 입력의 공간 차원 정보를 처리합니다. 이들은 이전 프레임의 기능과 결합되어 FCL에 공동으로 공급됩니다. FCL은 잠재 특징 표현을 생성하기 위해 기능에 대한 선형 변환을 수행합니다. 그 후, Tanh 활성화 함수로 전달되어 출력을 [-1,1] 범위에 매핑하여 비선형성을 강화하고 중요한 특징과 중요하지 않은 특징을 더 잘 구별합니다. 마지막으로, 기능은 정규화 계층을 통해 정규화되어 출력 기능이 상대적으로 안정적인 스케일을 갖도록 합니다. 그림 4B에서 TA 모듈은 시간적 차원의 각 프레임에 포함된 주요 정보에 더 중점을 둡니다. SA의 Tanh과 달리 TA 모듈은 ReLU 활성화 기능을 사용하여 음수 값을 억제하고 양수 값의 출력만 유지하여 음의 노이즈 정보를 효과적으로 제거하고 모델의 시간적 캡처 능력을 향상시킵니다.
5. 합동 훈련 방법
Transformer와 주의력을 기반으로 한 시공간 행동 인식에서 ViT, SA 모듈 및 TA 모듈 간의 상호 영향으로 인해 발생하는 편향되고 중복된 시공간 특징 문제를 효과적으로 해결하기 위해 세 모듈을 최적화하는 공동 훈련 방법이 채택되었습니다. 구체적인 프로세스는 그림 5에 나와 있습니다.
그림 5에서 공동 훈련 전략은 먼저 모델 훈련 매개변수를 입력하고 네트워크 구조와 하이퍼매개변수를 설정합니다. 그 후, 로컬 기능을 더 잘 학습하기 위해 SA와 TA에 대해 별도의 사전 교육이 수행됩니다. 한 모델을 사전 훈련하는 동안 다른 모델의 가중치는 고정된 상태로 유지되고 업데이트되지 않는다는 점은 주목할 가치가 있습니다. 개별 사전 훈련을 완료한 후 ViT 계층이 결합되어 훈련됩니다. 그런 다음 두 개의 어텐션 모델이 고정되고 기본 ViT 네트워크가 별도로 훈련됩니다. 마지막으로, 메인 ViT 네트워크, SA 및 TA 모듈을 공동으로 훈련함으로써 전체 네트워크를 최적화하여 지능형 교실 행동 인식을 위한 최종 모델을 생성합니다. 훈련 절차는 단계적으로 수행됩니다: (1) 고정된 ViT 매개변수를 사용하여 SA 및 TA 모듈의 자율 사전 훈련, (2) 고정된 주의 모듈 가중치를 사용하여 ViT의 단계적 훈련, (3) Adam 옵티마이저와 함께 모든 구성 요소의 종단 간 미세 조정(학습률 = 0.001, 배치 크기 = 64, 에포크 = 100). 이 접근 방식은 기능 학습을 안정화하고 최적화 중에 모듈 간의 간섭을 줄입니다.
전반적으로 제안된 지능형 교실 행동 인식 방법은 비디오와 골격 양식을 결합하여 자기 주의와 교차 AM을 통해 시공간 관계를 모델링합니다. ViT의 글로벌 시공간 모델링 기능을 활용하고 공간 및 TA 모듈을 결합하여 주요 행동과 시간적 역학을 포착하도록 모델을 최적화하여 보다 포괄적이고 정확한 학생 행동 인식을 달성합니다. 다중 모드 기능 표현이 결합되는 중요한 융합 작업은 고려 중인 아키텍처에서 수행됩니다. 구체적으로, CNN이 학습한 공간적 특징은 Bi-LSTM의 시간적 특징과 연결된다. 그런 다음 이 출력은 분류 작업 전에 MHAM의 주의 증강 기능과 융합됩니다. 이러한 융합 작업은 행동 데이터의 보완적인 관점을 융합하는 데 중요하며 그림 1 과 그림 5에서 강조됩니다.
알고리즘 1은 ViT, BERT 및 GCN 기반 모델을 사용하여 클래스에서 유익한 기능을 추출하는 결합된 다중 모드 데이터, 골격, 텍스트 및 비디오 정보를 보여줍니다. 그런 다음 교차 모드 학습을 사용하여 더 높은 정확도로 학생 행동을 식별하기 위해 공동 표현을 표시합니다.
알고리즘 1: ViT, BERT 및 GCN을 사용한 다중 모드 행동 인식 프로세스.
초기화:
사전 학습된 BERT 모델
사전 학습된 Faster R-CNN 모델
사전 훈련된 ViT 모델
스켈레톤 데이터에 대한 GCN 모델
분류자(예: MLP 또는 변압기)
데이터 세트 로드:
다중 모드 데이터 세트의 각 샘플에 대해:
비디오 프레임 추출
오디오 대본 추출
스켈레톤 데이터 추출(OpenPose 또는 MediaPipe)
1단계: 비디오 양식 처리
비디오의 각 프레임에 대해:
Faster R-CNN을 적용하여 객체/참가자 감지
ViT(Vision Transformer)를 적용하여 프레임 수준 기능 추출
시간 표현을 위해 시간 경과에 따른 집계 기능
2단계: 텍스트 양식 처리
대본 텍스트 전처리:
BERT 토크나이저를 사용하여 토큰화
BERT 모델을 통해 토큰 전달
[CLS] 토큰 또는 평균 풀링에서 컨텍스트 임베딩 추출
3단계: 골격 양식 처리
각 스켈레톤 시퀀스에 대해:
좌표 정규화
GCN 또는 ST-GCN을 통과하여 모션 피처 추출
4단계: 기능 융합
연결 또는 주의 융합:
비디오 기능
텍스트 기능
골격 특징
통합된 다중 모드 표현 얻기
5단계: 분류
융합된 표현을 최종 분류자에 전달합니다.
교실 행동 라벨 예측(예: 주의력, 산만함)
6단계: 평가
예측을 실측 정보와 비교
메트릭 계산: 정확도, 정밀도, 재현율, F1 점수
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
Transformer와 AM을 이용한 지능형 교실 행동인식 방식의 효능과 우월성을 평가하기 위해 실험적 성능 검증 및 분석을 수행하였다. 먼저, 표 1과 같이 실험 환경과 매개변수를 구성했습니다.
표 1을 기반으로 이 연구는 각각 D1 및 D2라는 실험 데이터 세트로 EduSense 데이터 세트와 SBU Kinect 상호 작용 데이터 세트를 선택했습니다. D1은 대학 강의실에서 학생과 교사의 행동을 수집했고, D2는 행동 상호 작용 인식에 사용되었습니다. 그러나 데이터 유형과 시나리오는 교실 행동 인식을 위한 보충 데이터로 사용될 수 있습니다. 데이터 세트는 7:3 비율로 훈련 세트와 테스트 세트로 나뉘었습니다. 먼저 그림 6과 같이 다중 모드 데이터 융합의 효과를 검증했습니다.
...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
복잡한 학생 행동과 다중 모드 데이터 인식의 문제를 해결하기 위해 Transformer 및 AM 기반의 지능형 교실을 위한 행동 인식 방법이 제안되었습니다. 영상과 골격 양식의 데이터를 통합하여 글로벌 시공간 모델링 기능을 갖춘 ViT 네트워크를 구축하고, 자기 주의와 교차 AM을 활용하여 행동의 시공간적 특징을 포착하였다. MFT(Multimodal Framework Transformer)를 사용하여 비디오 및 오디오 데이터를 새로운 ISF(Intelligent Sensing Framework) 프레임워크에 통합함으로써 평가는 교실 행동 감지를 개선하고자 합니다24. 학생 참여에 관한 실시간 통찰력은 정적인 단일 양식 접근 방식의 단점을 극복하는 능력으로 인해 가능합니다. 완전한 교실 역학에는 아직 통합 강사 행동 분석이 포함되어 있지 않습니다. 중복 채널 억제와 객체 공간 주의(RCSOSA), 공간-깊이 컨볼루션(SPDCo...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자는 공개할 것이 없습니다.
없음.
저자 기여:
Liu Lei: 연구의 구상 및 설계를 담당합니다. 지능형 교실 행동 인식을 위한 Transformer 기반 다중 모드 데이터 융합 방법을 제안했습니다. 모델 및 실험 설계 개발을 주도하고 데이터 수집 및 처리를 관리하며 초기 원고 초안을 작성했습니다. 실험 결과의 분석 및 토론에 기여했습니다.
He Zhihua: 연구에 대한 전반적인 지침과 감독을 제공했습니다. 연구 프레임워크 및 방법론적 지원에 기여했습니다. 모델 최적화 및 실험 분석에 참여하고, 원고를 검토 및 수정하고, 윤리적 기준을 준수하는지 확인하고, 최종 제출 승인을 내렸습니다. 서신을 담당합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 128GB DDR4 RAM | 여러 공급업체 | https://www.crucial.com/memory/ddr4 | 멀티모달 데이터 처리를 위한 충분한 메모리 |
| 2TB SSD 스토리지 | 여러 공급업체 | https://www.samsung.com/ssd | 데이터 세트 및 모델 저장을 위한 |
| BERT(기본 구성) | Hugging Face | https://huggingface.co/bert-base-uncased | 골격 시퀀스 임베딩을 위한 언어 모델 |
| CUDA 11.1 툴킷 | NVIDIA | https://developer.nvidia.com/cuda-toolkit | PyTorch에 대한 GPU 가속 활성화 |
| cuDNN 8.0 라이브러리 | 심층 신경망을 위한 NVIDIA https://developer.nvidia.com/cudnn GPU 가속 라이브러리 | ||
| EduSense 데이터 세트 | Carnegie Mellon University | https://www.cs.cmu.edu/~./edusense | 실제 대학 강의실 데이터 세트 |
| 더 빠른 R-CNN(ResNet-50) | 오픈 소스(PyTorch) | https://github.com/facebookresearch/detectron2 | 비디오 특징 추출에 사용되는 객체 감지 |
| 인텔 제온 E5-2680 v4 CPU | 모델 훈련을 위한 | 인텔 | https://www.intel.com/products/xeon-e5-2680-v4 |
| Matplotlib | 오픈 소스 | https://matplotlib.org | 성능 메트릭 |
| NVIDIA Tesla V100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/tesla-v100 | 훈련 및 추론에 사용되며 실시간 동작 인식 |
| OpenPose | CMU | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 비디오 프레임에서 2D 골격 키포인트 추출 |
| PyTorch 1.8 프레임워크 | 오픈 소스 | https://www.pytorch.org | 딥 러닝 라이브러리 사용 모델 개발 |
| SBU Kinect 상호 작용 데이터 세트 | Stony Brook University | https://www3.cs.stonybrook.edu/~kyunghan/sbu_kinect | 상호 작용 기반 골격 데이터 세트 |
| TensorBoard | 오픈 소스(Google) | https://www.tensorflow.org/tensorboard | 학습 시각화에 사용 Ubuntu |
| 20.04 LTS 운영 체제 | 정식 | https://www.ubuntu.com/download | 개발 환경으로 사용되는 Linux OS |
| Vision Transformer(ViT)Google | / Hugging Face | https://huggingface.co/google/vit-base-patch16-224 | 글로벌 시공간 행동 모델링에 사용 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청