이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

연구 논문

딥러닝 기반 비디오 객체 탐지를 통한 대학 강의실에서의 행동 참여 평가

244 조회수

DOI:

10.3791/69299

2026년 3월 17일

이 논문에서

요약

이 연구는 딥러닝 알고리즘을 사용해 대학 강의실 영상에서 학생들의 행동을 감지하여 학생들의 행동 참여도를 평가합니다. 학습 참여와 양의 상관관계가 있는 7가지 행동을 식별하고, 점수 모델을 사용하여 개별 학생과 학급의 전반적인 참여도를 평가합니다.

초록

이 연구는 딥러닝 기반 비디오 객체 감지를 사용하여 대학 강의실에서 학생들의 학습 참여도를 평가하는 것을 목표로 합니다. 이를 위해 상관 분석을 통해 본 연구는 먼저 학생들의 학습 참여도를 측정하는 지표로서 학습 참여와 매우 양의 상관관계를 보이는 7가지 교실 내 행동을 확인했다; 그 후 산둥과학기술대학교(SDUST) 6개 반의 실제 교실 수업 영상 30편을 수집하여 훈련 세트와 시험 세트로 나누었습니다. 7가지 행동이 수동 주석을 기록된 후, 이 집합에 대해 기계 학습 알고리즘이 감독 방식으로 훈련되었습니다. 학습이 완료되면 모델은 라벨이 붙지 않은 나머지 데이터에 대한 초기 주석을 생성했습니다. 보다 정확하고 효율적인 교실 행동 인식을 달성하기 위해, 본 연구는 행동 탐지 실험을 위해 Faster R-CNN과 YOLOv5s라는 두 가지 대표적인 알고리즘을 선정했습니다. 정확도와 시간 비용 측면에서 이들의 탐지 성능을 비교한 결과, YOLOv5s는 이 연구에서 교실 행동 탐지에 선정되었습니다. 마지막으로, 본 연구는 포커스 그룹 방법을 사용하여 각 행동에 점수를 부여하고 3단계 학습 참여 점수 모델을 개발했습니다. 자동 측정된 행동 데이터를 기반으로 이 모델은 개인 및 학급 수준 모두에서 학습 참여도를 실시간으로 자동으로 평가할 수 있게 합니다.

서론

학습 참여는 학생의 참여, 집중, 학습 노력을 의미하며, 행동적 참여, 감정적 참여, 인지적 참여로구성됩니다. 학생들의 학습 참여는 그들의 학습 상황을 드러내고 교사가 교수 전략을 조정하는 데 도움을 줍니다. 그러나 교실 학습 참여는 주로 학생들의 자기 보고와 교사의 관찰에 의해 평가됩니다.3. 중국 대학의 높은 교사-학생 비율로 인해 교사들은 전통적인 수동 학습 참여 평가 방식을 사용하는 데 많은 시간과 노력이 필요합니다.

최근 몇 년간 중국에서 지능형 녹화 및 방송 교실의 인기가 높아지면서, 교실 영상을 기반으로 한 학습 참여도를 자동으로 측정하는 것이 가능해졌습니다. 지능형 기술이 강화된 교실 수업의 관점에서, 본 연구는 딥러닝 기법을 적용해 대학 교실 영상에서 학생들의 행동을 감지하고, 학생들의 행동 참여도를 자동으로 측정하는 점수 모델을 제안했습니다.

행동 참여 연구에 대한 간략한 검토
행동 참여에는 세 가지 주요 수준이 있습니다: (1) 학교 차원에서는 학생들이 과외 활동에 참여하려는 열정을 의미합니다.5. (2) 교실 수준에서는 수업 시간에 학생들이 수업 명령을 따르는 긍정적 행동과6학년에서 수업을 빼먹거나 말하는 등 파괴적인 행동을 포함합니다. (3) 학습 과정 수준에서는 학생들이 질문을하거나 숙제를 완료하는 등 학습 과제에 참여하고 행동하는 것을 의미합니다. 현재 행동 참여 평가 방법은 대략 수동, 반자동, 자동 세 가지 범주로 분류할 수 있습니다.

자기보고, 인터뷰, 교사 관찰, 기타 전통적인 평가 방법 등 수작업 방법은 노동 집약적이며 객관성과 정확성을 보장하기 어렵습니다. 로그 분석은 주로 학습 플랫폼에서 수집된 학생들의 학습 로그 데이터를 분석하는 대표적인 반자동 평가 방법으로, 로그인 빈도, 온라인 시간 지속 시간, 답변 정확성과 같은 지표를 포함합니다. 이 방법은 학생들의 학습 참여도를 보다 객관적으로 평가할 수 있습니다; 그러나 데이터의 방대하고 복잡성은이후 처리에 어려움을 초래합니다. 자동 방법은 컴퓨터 비전에 기반하며, 녹화 및 방송 플랫폼과 같은 지능형 장치를 사용하여 학생들의 표정, 몸짓, 행동 및 기타 시각적 신호를 교실 내 학습 중 주로 평가하기 위해 포착합니다. 앞선 두 방법과 비교할 때, 이 접근법은 컴퓨터와 알고리즘을 통한 행동 참여를 빠르게 측정할 수 있게 하며, 주관적 간섭에 덜 취약합니다.

객체 탐지를 기반으로 한 행동 참여 평가에 대한 간략한 검토
딥러닝의 발전과 함께, 객체 탐지 기법이 학습 참여 분석에 점점 더 많이 적용되고 있습니다. 객체 탐지 알고리즘은 합성곱 신경망을 기반으로 이미지에서 객체 분류 및 위치 지정을 수행합니다. 비디오 녹화 시스템이 갖춰진 스마트 교실에서는 이러한 알고리즘이 교실 영상에서 학생의 자세, 제스처, 표정과 관련된 시각 정보를 인식하여 학생들의 행동을 자동으로 식별하고 행동 참여도를 평가할 수 있습니다. 따라서 학생들의 비언어적 행동으로 반영된 교실 학습 상태는 효과적으로 해석될 수 있습니다.

다양한 장비와 알고리즘이 학생들의 다양한 비언어적 행동을 영상에서 수집하고 식별하기 위해 사용되었습니다. Rahman 등10 과 Zaletelj와 Košir11 은 Kinect 센서를 사용해 학생들의 시야, 얼굴 정보, 신체 자세 특징 등을 수집하고, 머신러닝 알고리즘을 이용해 학생들의 주의력 수준을 분석했습니다. Whitehill 등은 iPad 웹캠을 사용해 학생들의 표정을 기록하고 인식 모델을 훈련시켰으며, 기계 학습 기법이 학습 참여 평가의 정확성에서 인간 관찰과 동등함을 입증했습니다. 수쿠마란과 마노하란12 는 EGG 신호를 사용해 학생의 교전 신호를 감지했다. Ashwin과 Guddeti13 은 합성곱 신경망을 사용해 실험실 환경에서 교실 영상을 분석하고, 표정, 손 자세, 신체 태도 등 비언어적 행동을 감지하여 학습 참여도를 평가했습니다. Bai 등은 다중화 특징 융합을 결합한 Faster R-CNN을 사용 해 학습, 수면, 고개 숙임 등 교실 내 행동을 전이 학습으로 감지했습니다. Deng 등은 Faster R-CNN 딥러닝 기법을 결합하여 원격 교실 영상을 분석하고 , 학생의 머리, 손, 몸 자세를 기반으로 행동 인식과 교실 참여 측정을 달성하는 방법을 제안했습니다.

초기 연구들은 주로 실험실 환경에서 수행되었으며, 많은 연구들이 단일 개인과 단일 시나리오(10, 11, 12, 13)에 초점을 맞췄으나, 최근 연구들은 점점 더 실제 교실 환경(9, 14, 15, 16, 17, 18, 19)을 조사하고 있다. 또한, 조사되는 행동의 범위도 점점 다양해졌습니다. 예를 들어, Bai 등14와 Ouyang 등은 교실 영상에서 두 가지 행동—머리 위로 향하는 행동—만 확인된 교실 영상을 분석했다. Deng 등은 초등학교 교실 영상을 조사하여 감지된 행동 범주를 머리 움직임에서 손과 몸 움직임까지 확장했습니다. 장과동료 16은 학생들의 행동 유형 중 위를 보기, 아래를 보기, 잠, 주위를 둘러보기, 하품 등 다섯 가지 유형을 수집했습니다.

하지만 데이터가 초등학교 교실에서 수집되었기 때문에, 학생들은 보통 고정된 자세로 앉아 있어 관찰 가능한 행동 범위는 상대적으로 제한적이었습니다. 따라서 이후 연구들은 점점 더 대학 강의실에 초점을 맞추고 있습니다. 많은 대학 강의실은 넓어 약 100명의 학생들이 무작위로 앉아 있어 학생들의 행동을 감지하기 더 어렵습니다. 더욱이 실제 대학 교실 환경에서는 학생들이 교사, 동급생, 칠판, 교과서와의 상호작용 등 행동 다양성과 상호작용이 더 커집니다. Yan 등은 혼잡한 교실 장면에서 자세 인식 정확도를 향상시키기 위해 설계된 딥러닝 기반 자세 인식 방법인 BetaPose를 제안했습니다. Tan 등은 YOLOv9 네트워크에 조준 주의(CA) 모듈을 통합하였고, 그 결과 CA-YOLOv9 모델은 대규모 학생 인구가 있는 복잡한 대학 강의실 환경에서 7가지 교실 행동 인식에 적용되었습니다. Wang 등은 지능형 교실에서 학생들의 행동을 식별하기 위해 양방향 특징 증강 네트워크(BATNet)를 제안했으며, 특히 작고 가려진 대상에 대해 그렇습니다.

알고리즘이 개발되면서 행동 감지의 속도와 정확도가 크게 향상되었으며; 그러나 현재 연구들은 교실 내 행동이 감지된 것과 학생 참여 사이에 상관관계가 있는지에 대한 설명을 무시하고 있어, 특정 행동이 행동 참여를 측정하는 매개변수로 사용될 수 있는지, 그리고 어떤 행동이 학습 참여를 효과적으로 반영할 수 있는지에 대한 질문은 답을 내지 못하고 있습니다. 또한, 학생들의 행동 참여를 명확히 보여주는 방법도 마련되어야 합니다. 따라서 본 연구는 상관관계 분석을 통해 학생들의 학습 참여와 밀접한 교실 행동을 확인했으며; 한편, 행동 참여 평가 모델을 구축하기 위한 점수 체계가 개발되었습니다. 따라서 개별 학생과 전체 학급 모두에 대해 행동 참여의 자동 측정이 가능합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

모든 영상은 산둥과학기술대학교가 규정한 인간 연구 윤리 관행에 따라 수집 및 사용되었습니다. 데이터 사용 승인을 받았습니다.

첫째, 상관관계 분석을 통해 학생들의 행동이 행동 참여의 지표로 작용할 수 있음을 식별하였습니다. 프레임 추출을 통해 데이터셋을 구축하고 훈련 세트와 테스트 세트로 나눈 후, 학습 세트에서 객체 탐지에 대한 두 가지 대표적인 알고리즘을 실행하여 정확도와 효율성 측면에서 비교했습니다. 마지막으로, 더 나은 성능을 가진 알고리즘(YOLO-v5s)이 테스트 세트에서 실행되어 행동 탐지를 수행하도록 선택되었습니다. 그림 1 은 학생들의 행동을 식별하고 탐지하는 과정의 흐름도를 보여줍니다.

figure-protocol-1
그림 1. 학생 행동 식별 및 탐지 흐름도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

지표 식별
물체 탐지 실험을 수행하기 전에, 학생들의 행동 참여를 나타내는 비언어적 행동을 식별해야 했습니다. 현재까지 객체 감지를 기반으로 한 행동 참여 연구는 시야, 얼굴 정보, 신체 자세 9,10,11,12,13,14 등 다양한 비언어적 행동을 성공적으로 감지하는 데 성공했습니다. 그러나 특정 행동이 학생들의 행동 참여 지표로 정당화되는지는 아직 논의되지 않았습니다. 따라서 본 연구에서는 학생들의 행동과 행동 참여 수준 간의 상관관계 분석을 사용하여 행동 참여를 나타내는 행동을 식별하였습니다.

(1) 행동 참여 검사
이 연구는 SDUST-Jinan의 네 가지 자연스러운 비영어 전공 학부 학생 중 122명을 상관관계 연구의 표본으로 선정했습니다. 첫째, 122명의 학생들로부터 행동 참여 데이터를 수집하기 위해 자기보고 척도를 사용했으며, 내부 경험 관점에서 행동 참여 상태를 이해하고자 했습니다. 이 연구의 교실 영상 데이터가 'Academic English' 수업에서 수집되었기 때문에, Ren Qingmei20 이 개발한 대학 영어 교실 학습 참여를 위한 다차원 평가 도구가 채택되었습니다. 이 도구는 중국어 외국어 교육 환경을 위해 특별히 설계되었으며, 이 연구와 동일한 고전적 학습 참여 분류를 사용하여 행동, 정서, 인지적 참여의 세 가지 차원을 포괄합니다. 그중 행동 참여 도구는 교사-학생 상호작용(예: "영어 수업에서 교사가 제기한 질문에 적극적으로 답한다"), 개별 노력(예: "영어 수업 학습 중 겪는 어려움을 신중히 고려한다"), 또래 상호작용(예: "다른 학생들과 협력하여 영어 수업 과제를 완수한다") 등 9개의 항목으로 구성되어 있습니다. 각 문항은 리커트 5점 척도 형식으로 제시되며, "거의 없이, 드물게, 가끔, 자주 반복"이라는 답변 옵션이 1에서 5까지 채점되어 학생들이 자신의 학습 경험에 가장 잘 맞는 선택지를 선택하도록 요구합니다. 15점 이하 학생들은 저참여 학생, 16-30점 학생은 중간 참여 학생, 31-45점 학생들은 고참여 학생으로 분류되었습니다. 마지막으로, 120개의 유효한 척도가 수집되었으며, 17명은 저참여 그룹, 45명은 중간 참여 그룹, 58명은 고참여 그룹에 속했습니다.

(2) 행동 식별
한편, 이 네 수업에서 완전 참석한 '학술 영어' 수업에서 총 50분 분량의 녹화 영상 4개가 수집되었습니다. 15초마다 한 프레임씩 그려지면서 최종적으로 200장의 이미지가 추출되어 관측을 수행했다. 세 명의 학생이 비디오 샘플을 반복적으로 시청한 바탕으로, 이 연구는 처음에 교실 내 학생들의 12가지 행동 유형을 확인했는데, 즉, 주변을 둘러보기, 휴대전화 사용, 토론하기, 돌아다니기, 음식 또는 음료를 먹기, 노트 필기, 독서하기, 주의 깊게 듣기, 일어서기(질문에 답하기 위해), 하품하기, 수면하기, 컴퓨터 사용입니다. 12가지 행동의 예시는 그림 2에 나와 있습니다.

figure-protocol-2
그림 2. 12가지 행동의 예시. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

각 유형에는 시각적 특징과 시공간적 맥락에 대한 상세한 설명이 함께 제공되어, 주석 간 개념적 일관성을 보장하는 교실 행동 주석 표준 운영 절차(Standard Operating Procedure for Classroom Behavior Annotation)가 형성되었습니다. 표 1은 학생들의 행동 12가지 범주와 각 행동에 대한 설명을 보여줍니다.

주위를 둘러보는 것은 머리를 좌우, 뒤로 크게 돌리는 것을 포함했다. 학생들이 고개를 돌리고 입을 열면 토론 중인 것으로 간주되었습니다. 교실 상황에서 주의 깊게 듣는 것은 칠판이나 앞에 선 선생님을 똑바로 바라보는 것과 연관되어 있었다; 시선이 다른 곳으로 향하면, 그 학생은 아마도 방황하고 있을 가능성이 높았다. 학생이 고개를 숙인 자세를 보였을 때 책이나 노트 같은 물체가 있을 때, 이 행동은 필기하거나 책을 읽는 것으로 식별할 수 있었습니다. 행동이 서 있는 자세를 포함하고 학생이 입을 벌린 채 자리에 서 있을 때, 그는 서서 질문에 답하는 것으로 간주되었습니다; 학생이 자리에서 일어났다면 돌아다니는 것으로 간주되어, 수업에 늦었거나 교실을 나갔을 가능성이 있습니다. 학생이 책상에 머리를 누우고 있을 때는 자고 있는 것으로 확인되었습니다. 학생이 음식이나 음료를 손에 들고 있을 때, 그 행동은 '먹거나 마시는 행동'으로 분류되었습니다. 입을 크게 벌리거나 몸을 늘리는 행동 자세는 하품을 하고 있음을 나타냅니다.

행동 범주행동 설명
주위를 둘러보며머리가 오른쪽, 왼쪽, 뒤로 명확히 움직이는 것
휴대전화 사용손으로 휴대폰을 만지기
토론입을 벌리고 머리를 움직이는 모습
방황무관한 곳을 멍하니 응시하는 듯한 시선이다
돌아가기자리에서 일어나기
먹거나 마시기입을 벌리고 음식이나 물과 접촉하는 상태입니다
필기 또는 독서필기하거나 책을 내려다보는 것
주의 깊게 듣고칠판이나 선생님을 바라보며
일어서기 (질문에 답하기 위해)입을 벌린 채 자리에서 일어나 있다
하품입을 벌리거나 몸을 늘리기
잠 자기책상에 머리 대
컴퓨터 사용책상 위에 열려 있는 컴퓨터가 있었다

표 1: 학생 행동의 범주 및 설명.

(3) 상관 분석
위의 기준을 사용해 12명의 경험 많은 교사들이 120명의 학생들의 영상을 시청하고 그들의 행동 유형과 빈도를 기록하도록 초대되었습니다. 행동은 표 1에 따라 확인되었습니다. 교사들은 네 그룹으로 나뉘었고, 각 그룹에는 세 명의 교사가 있었습니다. 각 그룹은 30명의 학생을 기록하는 책임을 맡았고, 세 명의 교사 각각이 독립적으로 30명의 학생 행동을 기록했습니다. 크론바흐 알파(α라고 함)는 척도나 설문지의 내부 일관성을 측정하는 지표입니다. 크론백의 알파 값 범위는 0에서 1이며, 0.8 α ≥ 보통 내부 일관성이 좋은 것으로 해석됩니다. 세 명의 교사 모두에서 특정 행동 유형의 빈도가 높은 일관성(α > 0.8, 즉 높은 일관성)이 있을 경우, 그 행동의 빈도는 세 가지 빈도의 평균으로 기록되었습니다. 이후 각 학생의 다양한 행동 빈도와 행동 참여 수준을 나타내는 데이터를 활용하여, 두 요인 간의 상관관계 분석이 수행되었습니다. 결과는 표 2에 나와 있습니다.

행동행동적 참여
먹거나 마시기피어슨 상관.319**
시그. (두 꼬리)0.004
N120
하품피어슨 상관-.335**
시그. (두 꼬리)0
N120
토론피어슨 상관.546**
시그. (두 꼬리)0
N120
돌아가기피어슨 상관-.774**
시그. (두 꼬리)0
N120
방황피어슨 상관.293**
시그. (두 꼬리)0.008
N120
주위를 둘러보며피어슨 상관-.834**
시그. (두 꼬리)0
N120
독서 또는 필기피어슨 상관.912**
시그. (두 꼬리)0
N120
주의 깊게 듣고피어슨 상관.881**
시그. (두 꼬리)0
N120
서 있기피어슨 상관.330**
(질문에 답하기 위해)시그. (두 꼬리)0
N120
잠 자기피어슨 상관-.411**
시그. (두 꼬리)0
N120
사용피어슨 상관.591**
휴대전화시그. (두 꼬리)0
N120
컴퓨터 사용피어슨 상관.362**
시그. (두 꼬리)0.001
N120

표 2: 상관관계 분석 결과.

상관분석에서 r은 상관계수로, 두 변수 간의 선형 상관계수를 나타내며, −1에서 1까지 범위가 있습니다. 관계 정도에 따라 상관관계는 다음과 같은 유형으로 분류할 수 있습니다:
높은 상관관계 (│r│ ≥ 0.70)
중간 상관관계 (0.40 ≤ │r│ ≤ 0.70)
낮은 상관관계 (│r│ ≤ 0.40)

관계의 방향에 따라 다음과 같은 유형으로 분류할 수 있습니다:
양의 상관관계 (r > 0)
음의 상관 (r < 0)
상관관계 없음 (r = 0)

표 1에서 볼 수 있듯이, 주변을 둘러보기(r = −0.834**, p < 0.05), 휴대전화 사용(r = 0.591**, p < 0.05), 토론하기(r = 0.546, p < 0.05), 돌아다니기(r = −0.774**, p < 0.05), 필기 또는 독서(r = 0.912**, p < 0.05), 주의 깊게 듣기(r = −0.881**, p < 0.05), 수면하기(r = −0.411**, p < 0.05)는 행동 참여와 높거나 중간 정도의 상관관계를 보였으며, 식사나 음주 행동(r = 0.319**, p = 0.04), 일어서기(질문에 답하기 위해) (r = 0.330**, p = 0.00), 하품(r = −0.335**, p < 0.05), 방황(r = 0.293, p > 0.05), 컴퓨터 사용(r = 0.362, p < 0.05)과 같은 행동은 행동 몰입과 낮은 또는 상관관계가 없었습니다. 상관관계 분석을 바탕으로 이 연구는 학습 참여의 지표로 7가지 행동을 최종적으로 확인했습니다. 즉, 주위를 둘러보기, 휴대전화 사용, 토론하기, 돌아다니기, 필기하거나 읽기, 주의 깊게 듣기, 그리고 수면입니다.

데이터셋 구축
이 연구에 사용된 영상 데이터는 SDUST의 직접 녹화 플랫폼에서 수집되었으며, 이 플랫폼은 "Academic English" 강좌의 실제 교실 수업을 동기화한 영상을 제공했습니다. 비영어 전공자 4개 반에서 약 50분 길이의 10개의 영상을 수집하여 학생들의 교실 행동에 대한 훈련 가능한 데이터셋을 구축했습니다. 15초마다 한 프레임씩 그려지면, 최종적으로 1,920× 1,080의 해상도로 2,000장의 이미지를 추출했습니다.

데이터셋 분할
실험은 학생 행동 데이터셋을 완전히 독립적인 두 부분으로 나누었는데, 표 3에 나와 같이 훈련 세트와 테스트 세트로, 공유된 이미지는 없었다. 데이터셋은 7가지 학생 행동 모두를 포함했습니다. 학습 세트와 테스트 세트는 각각 모델 매개변수 학습과 정확도 평가에 사용되었습니다. 훈련 매개변수는 표 4에 표시된 대로 설정되었습니다.

데이터 세트이미지 수
2830
훈련 세트2111
테스트 세트719

표 3: 학생 행동 데이터셋 분할.

매개변수가치
학습 속도0.01
운동량0.937
무게 감소0.0005
시대100
배치 크기16

표 4: 실험 매개변수 설정

같은 학생이 서로 다른 하위 집합에 나타나 데이터 유출을 방지하고 행동의 자연스러운 시간적 연속성을 유지하기 위해 "계층화 시간 분할" 방법이 채택되었습니다.

주어 분리: 데이터셋은 고유한 학생 ID로 분할되어 훈련, 검증, 테스트 세트의 학생들이 상호 배타적임을 보장했습니다.

시간 분할: 영상들은 연대순으로 정렬되었습니다. 시간 구간의 처음 70%는 교육용으로, 다음 15%는 검증용, 마지막 15%는 테스트용으로 사용되었습니다. 이 방법은 무작위 분할보다 실제 시간적 일반화를 더 잘 시뮬레이션했습니다.

클래스 밸런스: "수면"과 "휴대전화 사용"과 같은 과대표 범주에 대해, 모든 범주에서 특징을 학습하도록 중간 정도의 과표를 적용했습니다.

학습 데이터셋 주석
오픈소스 주석 도구를 사용해 훈련 데이터를 수동으로 주석을 달았습니다. 이 도구는 경계 상자 주석 작성에 사용되었습니다. 구체적인 작업 흐름은 다음과 같았습니다: (1) 다양한 학교, 시간대, 강의 유형을 아우르는 감시 영상에서 고정된 속도(1프레임/초)로 키 프레임을 추출한 후, 얼굴 흐림과 같은 익명화 처리가 진행되었습니다; (2) 주석 SOP에 따라, 주석 작성자들은 특정 행동을 수행하는 학생을 정확히 구분하기 위해 직사각형 상자를 사용하고, 해당 범주 라벨을 부여했습니다; (3) 주석은 PASCAL VOC 형식의 XML 파일로 내보내졌습니다.

라벨 품질을 보장하기 위해, 특히 모호한 행동(예: 토론 vs 방황 행동)을 구분하는 오류를 방지하기 위해, "3단계 주석-중재" 협업 메커니즘이 구현되었습니다:

초기 주석: 각 키 프레임은 세 명의 훈련된 주석가에 의해 독립적으로 주석이 달렸습니다. 각 라벨은 카테고리 라벨과 경계 상자로 구성됩니다.

일관성 검증: 주석 간의 교차 및 합집합 및 범주 일관성을 계산했습니다. 경계 상자는 IoU > 0.8과 동일한 카테고리 라벨로 초기 주석 값을 입력한 결과로, '일관된 주석'으로 간주되었습니다. IoU ≤ 0.8이거나 동일한 범주 라벨이 없는 경계 상자는 "일관성 없는 주석"으로 간주되었습니다.

전문가 중재: 일관성 없는 주석(예: '주변을 둘러보기'와 '토론하기'와 같은 모호한 경우)의 경우, 교육 경험이 있는 전문가 패널이 영상 클립, 행동 맥락, 교육적 사전 지식을 바탕으로 최종 결정을 내렸습니다. 최종 판단은 키 프레임의 원본 영상 구간을 검사하여 라벨 정확성을 검증함으로써 이루어집니다.

주석은 학생들의 행동이 다중적이고 집중적이며 작은 목표에 의해 특징지어졌음을 밝혀냈으며, 이는 그림 3에 나타난다.

figure-protocol-3
그림 3. 교실 이미지 주석의 예시입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

수업 중 학생들은 주의 깊게 듣고, 휴대폰을 사용하며, 자주 읽거나 필기하는 행동을 보였으며, 돌아다니거나 돌아다니는 빈도는 비교적 낮았습니다. 그림 4는 훈련 데이터셋 내 교실 행동 분포 를 보여줍니다.

figure-protocol-4
그림 4. 훈련 데이터셋 내 행동 분포. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

학생 행동 탐지
딥러닝 기반 객체 탐지 프레임워크는 주로 두 가지 범주로 나뉘었는데, 2단계 방법(Faster R-CNN 시리즈로 대표)과 1단계 방법(YOLO로 대표됨)입니다. 첫 번째 범주에 대해, 2단계 검출 방법은 먼저 영역 제안 네트워크(RPN)를 사용하여 영역 제안을 생성한 후 상세한 클래스 확률 계산과 경계 상자 회귀분석을 수행했습니다. 두 번째 범주에서는 단일 단계 방법이 객체 클래스와 경계 박스를 한 단계 동시에 예측하여 검출 과정을 간소화했습니다. 2단계 방법은 이 분야 발전 초기에 등장했지만, 단순화된 아키텍처와 계산 효율성 덕분에 1단계 접근법이 인기를 얻고 있습니다. 보다 정확하고 효율적인 교실 행동 인식을 달성하기 위해, 본 연구는 두 범주에서 대표적인 알고리즘인 Faster R-CNN23,24와 YOLO-v525,26을 선정하여 교실 행동 탐지 실험을 수행하고, 두 알고리즘의 탐지 결과를 비교한 후 최종 행동 탐지 알고리즘을 결정하였습니다.

실험 결과를 효율적으로 평가하기 위해, 각 알고리즘 모델의 시간 비용보다 전체 탐지 정확도에 중점을 두었습니다. 평균 정밀도(mAP)와 훈련 시간(h)을 사용해 두 모델을 측정하였습니다.

두 방법으로 인식을 위해 7가지 행동 범주가 검출되었고, 평균 탐지 정확도 값(AP)은 표 5에 기록되었습니다. 그중 YOLO-v5는 이동, 강의 집중 청취, 휴대전화 사용 세 가지 행동 범주에서 Faster R-CNN보다 우수한 성과를 보였으며, AP 수치는 각각 100%, 62.7%, 31.8%였습니다.

네트워크 모델토론돌아다니기잘 듣기둘러보기잠 자기필기하거나 읽기모바일 폰 사용
더 빠른 R-CNN32.699.545.49.32252.626.8
YOLO-v517.810062.73.8195131.8

표 5: 단일 클래스에 대한 두 알고리즘의 평균 정밀도.

테스트 세트에서 IoU 0.5에서 두 고전 검출 네트워크의 훈련 시간과 평균 검출 정확도는 표 6에 나타났습니다. Faster R-CNN 네트워크가 더 높은 정확도를 가졌지만, 실행 시간은 상대적으로 길었습니다. 비교하자면, YOLO-v5는 30% 단축된 실행 시간을 가졌고 정확도는 0.3% 감소하여 효율성 향상이 더 크게 향상되었습니다. 이 연구에서 교실 내 학생 행동을 실시간으로 감지할 필요가 있었기 때문에, 네트워크 교육 기간은 가능한 한 짧아야 할 것으로 기대되었습니다. 훈련 세트에서 학습된 모델의 탐지 정확도와 시간 비용을 고려할 때, 이 논문은 YOLO-v5s가 교실 내 학생 행동 탐지에 더 적합하다고 결론지었습니다.

네트워크 모델hmAP@0.5 (%)
더 빠른 R-CNN2.8841.17
YOLO-v52.01640.87

표 6: 탐지 성능 비교.

따라서 YOLO-v5s가 이 연구에서 교실 행동 탐지 수행에 선정되었습니다. YOLO-v5가 생성한 검출 결과는 그림 5에 나타나 있으며, 연속적인 다중 표적 행동 검출과 해당 라벨을 보여줍니다.

figure-protocol-5
그림 5. 테스트 세트의 검출 결과 예시. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

(1) 데이터 증강 및 전처리
모델의 견고성과 일반화를 높이기 위해 훈련 중 무작위 아핀 변환, 색상 지터, 무작위 폐색 등 복합 데이터 증강 전략이 사용되었습니다. 모든 이미지는 640× 640픽셀로 균일하게 리사이즈되었습니다.

(2) 훈련 전략
교육 과정은 세 단계로 나뉘었습니다:
동결 백본 단계 (Epochs 1-100): 백본 네트워크가 동결되었고, 감지 헤드만 학습되었으며, 낮은 학습률로 워밍업을 진행했습니다.
전체 네트워크 미세 조정 단계 (101-250 에포크): 모든 네트워크 계층이 동결 해제되었습니다. 코사인 어닐링 스케줄러가 학습 속도를 조정했습니다.
정제화 단계(251-300년): 지수 이동평균을 적용하여 훈련을 안정화하고, 모델 정제를 위해 데이터 증강의 강도를 낮췄습니다.

클래스 불균형을 해결하기 위해 학습 집합 내 빈도에 반비례하는 클래스별 가중치를 손실 함수에 적용했습니다.

(3) 후처리 및 시간 최적화
교실 행동의 시간적 일관성을 유지하기 위해 모델 추론 후 시간적 일관성 필터가 적용되었습니다. 구체적으로, 비디오 시퀀스에서 감지된 대상의 행동 범주는 최소 3프레임 연속으로 식별되어야 확인되어 일시적 오탐을 효과적으로 필터링할 수 있었습니다.

행동 참여 점수 체계 확립
이 연구는 포커스 그룹 방법을 사용하여 각 행동에 점수를 부여했습니다. 20명의 1차 대학 교사들이 교실 관리 경험을 바탕으로 7가지 행동 범주의 참여도를 평가하도록 초대되었습니다. 20명의 교사 모두 10년 이상 교직하며 여러 학문 분야에서 다양한 강의를 진행했습니다. 참여도 점수는 0에서 3까지 다양했으며, 0-1은 낮은 참여도, 1-2는 중간 참여, 2-3은 높은 참여를 의미했습니다. 특정 행동 유형에 대해 여러 평가자의 평가에 높은 일관성(α > 0.8)이 있을 경우, 해당 행동의 참여도를 개별 교사의 평균으로 측정했습니다. 각 행동 유형별 최종 평가는 표 7에 나와 있습니다.

행동 유형주위를 둘러보며휴대전화 사용토론돌아다니고 있어필기 또는 독서주의 깊게 듣는다잠들어
참여 점수0.91.21.90.62.72.80.2

표 7: 행동 평가.

각 학생의 행동 참여 공식은 다음과 같습니다

figure-protocol-6

ESi = 학생의 행동 참여, Sj = 행동 점수, fj = 행동 빈도 j.

수업 중 학생이 감지한 행동 수가 100개(그중 4개는 '토론', 68개는 '집중 듣기', 25개는 '읽기/필기', 3개는 '주변을 둘러보기')라고 가정하면, 학생의 전체 개인 참여 점수는 (1.9 × 4 + 2.8 × 68 + 2.7 × 25 + 0.9 × 3) / 100 = 2.68이 되었다. 전체 강의를 기준으로 삼아, 행동 참여는 0-3 척도의 균등한 간격 나눗에 따라 네 단계로 나뉘었습니다: 0.75 미만은 '참여하지 않음', 0.76-1.5는 '약간 몰입됨', 1.6-2.25는 '참여', 2.26-3은 '매우 몰입'으로 정의되었습니다; 따라서 해당 학생은 "수업에 매우 몰입했다"고 평가받았습니다.

전체 학급의 행동 참여는 모든 학생의 평균 점수를 의미합니다. 수업의 행동 참여 공식은 다음과 같습니다:

figure-protocol-7

Ec = 학급의 행동 참여, ES = 특정 학생의 행동적 참여, n = 학생 수

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

행동을 감지하고 점수 모델을 사용함으로써 학생들의 행동 참여도를 자동으로 측정할 수 있었습니다. 영상의 한 수업을 예로 들면, 각 학생의 실시간 행동 참여도를 행동 탐지 결과와 점수 모델을 바탕으로 계산할 수 있습니다. 그림 6은 이 수업에서 두 학생의 행동 참여도를 보여주며, 다양한 시점에서의 참여 수준을 보여줍니다. 평균적으로 학생 A가 수업 내내 학생 B보다 더 높은 참여도를 보였다는 사실이 밝혀졌습니다. 두 학생은 초기 단계(처음 15분) 동안 높은 참여도를 보였으며; 하지만 후반부에는 참여율이 감소했다.

figure-results-1

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

이 연구는 행동 참여의 자동 인식과 측정을 실현했습니다. 이전 연구들과 비교했을 때, 확인된 행동들은 대학 강의실(예: 휴대전화 사용)을 더 잘 대표했으며, 행동 참여 평가는 도표로 제시되어 직관적으로 확인할 수 있었습니다. 이 자동 측정 방식은 교사가 개별 학생과 반 전체의 참여도를 효율적이고 명확하게 평가할 수 있게 하여 개인 맞춤형 수업을 지원하고 교실 수업 효율성을 향상시켰습니다. 예를 들어, 그림 7에서는 두 수업 모두 초반에 학생들의 관심을 끌기 위해 성공적인 도입 방식을 보였습니다. 클래스 A는 여러 차례 중간 및 높은 참여도의 정점을 보여주었으며, 이는 효과적인 교사-학생 상호작용과 흥미로운 교수 전략을 나타냈습니다. 반면 B반은 수업 후반부에 높은 참여도가 없었고, 점수가 1.5 이하로 떨어져 교사가 교수 활동과 전략을 재고할 필요가 있음을 시사했습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 이해 상충을 선언할 필요가 없습니다.

감사의 글

이 연구는 산둥 사회과학기금 기금(23CRWJ11)의 지원을 받았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
교실 영상이 연구에 사용된 영상 데이터는 산둥과학기술대학교(SDUST)의 직접 녹화 플랫폼에서 수집되었으며, 이는 Academic English 강좌의 실제 교실 수업을 동기화한 영상입니다. 비영어 전공자 6개 반에서 약 50분 분량의 30개 영상을 수집하여 학생들의 훈련 가능한 데이터 세트를 구축했습니다 교실 행동.
IBM SPSS 통계 26IBMSPSS for Windows는 데이터 입력, 조직, 분석 기능을 통합한 모듈식 소프트웨어 패키지입니다. 기본 기능에는 데이터 관리, 통계 분석, 차트 분석, 출력 관리 등이 포함됩니다. 이 글에서는 SPSS가 주로 일관성 분석과 상관관계 분석에 사용됩니다.
라벨링 1.8.6라벨링은 시각적 이미지 주석 도구입니다. 이 게임은 파이썬으로 작성되었으며 그래픽 인터페이스로 Qt를 사용합니다. 주석은 ImageNet에서 사용하는 PASCAL VOC 형식의 XML 파일로 저장됩니다. 또한 YOLO 포맷도 지원합니다. Faster R-CNN, YOLO, SSD(예: Faster R-CNN, YOLO, SSD)와 같은 객체 탐지 네트워크에 필요한 데이터셋에 사용되어 이미지 내 객체에 주석을 달기 위해 사용됩니다.
MMDetection 2.22.0MMDetection, 2.22.0, MMDetection은 풍부한 객체 감지, 인스턴스 세분화, 파노라마 세분화 방법과 관련된 구성 요소 및 모듈을 포함하는 객체 감지 도구 상자입니다.

참고문헌

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

Faster R CNNYOLOv5s