È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo di ricerca

Valutazione del coinvolgimento comportamentale nelle aule universitarie tramite rilevamento video di oggetti basato su deep learning

240 visualizzazioni

DOI:

10.3791/69299

17 marzo 2026

In questo articolo

Sommario

Questo studio valuta l'impegno comportamentale degli studenti rilevando i loro comportamenti nei video delle aule universitarie utilizzando un algoritmo di deep learning. Vengono identificati sette comportamenti positivamente correlati con l'impegno nell'apprendimento, e viene utilizzato un modello di punteggio per valutare il coinvolgimento complessivo dei singoli studenti e della classe.

Abstract

Questo studio mira a valutare il coinvolgimento degli studenti nell'apprendimento nelle aule universitarie utilizzando il rilevamento video degli oggetti basato su deep learning. Per farlo, tramite analisi di correlazione, questa ricerca ha identificato innanzitutto sette comportamenti in classe che presentano una correlazione altamente positiva con l'impegno nello apprendimento come indicatori per misurare l'impegno negli apprendimenti degli studenti; poi raccolse 30 video sincronizzati di insegnamento reale in aula da 6 classi della Shandong University of Science and Technology (SDUST) e li suddivise in un set di addestramento e uno di test. Dopo che i sette comportamenti sono stati annotati manualmente nei dati di addestramento, un algoritmo di apprendimento automatico è stato quindi addestrato in modo supervisionato su questo set. Una volta addestrato, il modello generava annotazioni iniziali per i dati non etichettati rimanenti. Per ottenere un riconoscimento comportamentale in classe più accurato ed efficiente, questo studio ha selezionato due algoritmi rappresentativi, ovvero Faster R-CNN e YOLOv5s, per esperimenti di rilevamento del comportamento. Sulla base di un confronto tra le loro prestazioni di rilevamento in termini di accuratezza e costo temporale, in questo studio YOLOv5 è stato selezionato per il rilevamento del comportamento in classe. Infine, questo studio ha utilizzato il metodo dei focus group per assegnare punteggi a ciascun comportamento e sviluppare un modello di valutazione del coinvolgimento apprendistico a tre livelli. Basato su dati comportamentali misurati automaticamente, il modello consente una valutazione automatica e in tempo reale del coinvolgimento dell'apprendimento sia a livello individuale che di classe.

Introduzione

L'impegno nell'apprendimento, che si riferisce alla partecipazione, concentrazione e impegno degli studenti nell'apprendimento, consiste nell'impegno comportamentale, emotivo ecognitivo. 1. L'impegno apprendistico degli studenti rivela la loro situazione di apprendimento e aiuta gli insegnanti ad adattare le strategie diinsegnamento 2. Tuttavia, il coinvolgimento dell'apprendimento in classe viene valutato principalmente dalle auto-relazioni degli studenti e dalle osservazioni degliinsegnanti 3. L'elevato rapporto insegnanti-studente nelle università cinesi fa sì che agli insegnanti ci vogliano molto tempo e impegno per utilizzare i metodi manuali tradizionali per la valutazione dell'impegno nell'apprendimento.

Negli ultimi anni, con la crescente popolarità delle aule di registrazione e trasmissione intelligenti in Cina, la misurazione automatica dell'impegno nell'apprendimento basata sui video in classe èdiventata possibile 4. Dal punto di vista dell'insegnamento in aula potenziato da tecnologie intelligenti, questo studio ha applicato metodi di deep learning per rilevare i comportamenti degli studenti nei video delle aule universitarie e ha proposto un modello di valutazione per misurare automaticamente il coinvolgimento comportamentale degli studenti.

Una breve rassegna degli studi sull'engagement comportamentale
Ci sono tre principali livelli di coinvolgimento comportamentale: (1) A livello scolastico, si riferisce all'entusiasmo degli studenti nel partecipare ad attivitàextracurriculari 5. (2) A livello di classe, include i comportamenti positivi degli studenti in classe, come il rispetto dell'ordine della classe, e comportamenti distruttivi, come saltare le lezioni o parlare inclasse 6. (3) A livello del processo di apprendimento, si riferisce alla partecipazione e ai comportamenti degli studenti nelle attività di apprendimento, come porre domande e completare icompiti 7. Attualmente, i metodi per valutare l'engagement comportamentale possono essere ampiamente classificati in tre categorie: manuale, semiautomatico eautomatico 8.

I metodi manuali, inclusi l'auto-rapporto, le interviste, l'osservazione dell'insegnante e altri metodi tradizionali di valutazione, richiedono molta fatida e sono difficili da garantire con obiettività e accuratezza. L'analisi dei log è un metodo rappresentativo di valutazione semi-automatica che analizza principalmente i dati dei log di apprendimento degli studenti raccolti dalle piattaforme di apprendimento, inclusi indicatori come la frequenza di accesso, la durata online e l'accuratezza delle risposte. Questo metodo può valutare l'impegno apprendistico degli studenti in modo più oggettivo; tuttavia, l'elevato volume e la complessità dei dati rappresentano sfide per l'elaborazionesuccessiva 4. Il metodo automatico si basa sulla visione artificiale, utilizzando dispositivi intelligenti, come piattaforme di registrazione e trasmissione, per catturare le espressioni, i gesti, i comportamenti e altri indizi visivi degli studenti in classe, principalmente per valutare il comportamento in classe. Rispetto ai due metodi precedenti, questo approccio consente una misurazione rapida dell'impegno comportamentale tramite computer e algoritmi ed è meno suscettibile all'interferenzasoggettiva 9.

Una breve revisione della valutazione dell'engagement comportamentale basata sul rilevamento di oggetti
Con l'ascesa del deep learning, le tecniche di rilevamento degli oggetti sono sempre più applicate all'analisi dell'impegno nell'apprendimento. Gli algoritmi di rilevamento degli oggetti eseguono la classificazione e la localizzazione degli oggetti nelle immagini basate su reti neurali convoluzionali. Nelle aule intelligenti dotate di sistemi di registrazione video, tali algoritmi possono riconoscere informazioni visive relative alle posture, ai gesti e alle espressioni facciali degli studenti dai video della classe, consentendo così l'identificazione automatica dei comportamenti degli studenti e la valutazione del loro coinvolgimento comportamentale. Di conseguenza, lo stato di apprendimento in classe riflesso dai comportamenti non verbali degli studenti può essere interpretatoefficacemente 9.

Sono state impiegate diverse attrezzature e algoritmi per raccogliere e identificare i molteplici comportamenti non verbali degli studenti dai video. Rahman et al.10 e Zaletelj eKošir 11 hanno utilizzato sensori Kinect per raccogliere la linea visiva, le informazioni facciali, le caratteristiche della postura corporea, ecc., e hanno analizzato il livello di attenzione degli studenti utilizzando algoritmi di machine learning. Whitehill et al.8 hanno utilizzato una webcam su iPad per registrare le espressioni facciali degli studenti e addestrare un modello di riconoscimento, dimostrando che la tecnica di machine learning è pari all'osservazione umana nella precisione della valutazione dell'impegno nell'apprendimento. Sukumaran e Manoharan12 rilevarono l'ingaggio dello studente usando i segnali EGG. Ashwin e Guddeti13 hanno utilizzato reti neurali convoluzionali per analizzare i video in classe in laboratorio e rilevare comportamenti non verbali, come espressioni facciali, posture delle mani e posture corporee, per valutare l'impegno nell'apprendimento. Bai et al.14 hanno utilizzato Faster R-CNN con fusione multiplexata di funzionalità per rilevare comportamenti in classe, come studio, sonno e testa giù, tramite apprendimento per trasferimento. Deng et al.9 hanno analizzato i video in aula remota combinando tecniche di deep learning Faster R-CNN e hanno proposto un metodo per ottenere il riconoscimento comportamentale e la misurazione dell'engagement in classe basato sulle posture della testa, delle mani e del corpo degli studenti.

I primi studi sono stati condotti principalmente in laboratorio, molti dei quali si sono concentrati su un singolo individuo in uno scenario 10,11,12,13, mentre studi più recenti hanno esaminato sempre più gli ambienti reali delle aule 9,14,15,16,17,18,19. Inoltre, la gamma di comportamenti esaminati è diventata sempre più diversificata. Ad esempio, Bai et al.14 e Ouyang et al.15 hanno analizzato video in classe in cui sono stati identificati solo due comportamenti—testa in alto e testa giù. Deng et al.9 hanno indagato i video delle classi delle scuole elementari ed ampliato le categorie di comportamento rilevati dai movimenti della testa a quelli di mani e del corpo. Zhang e icolleghi 16 hanno raccolto cinque tipi di comportamenti degli studenti, tra cui guardare in alto, guardare in basso, dormire, guardarsi intorno e sbadigliare.

Tuttavia, poiché i dati sono stati raccolti dalle classi delle scuole elementari, dove gli studenti sono tipicamente seduti in posizioni fisse, la gamma di comportamenti osservabili è rimasta relativamente limitata. Pertanto, gli studi successivi si sono sempre più concentrati sulle aule universitarie. Molte aule universitarie sono grandi, con circa cento studenti spesso seduti a caso, rendendo più difficile rilevare il comportamento degli studenti. Inoltre, nelle aule universitarie reali, gli studenti mostrano una maggiore diversità comportamentale e interattività, inclusi interagi con insegnanti, compagni di classe, lavagne e libri di testo. Yan et al.17 hanno proposto un metodo di riconoscimento della postura basato sull'apprendimento profondo, BetaPose, progettato per migliorare la precisione del riconoscimento della postura in scene di classe affollate. Tan et al.18 hanno incorporato un modulo di attenzione coordinata (CA) nella rete YOLOv9, e il modello risultante CA-YOLOv9 è stato applicato al riconoscimento di sette comportamenti in classe in complessi ambienti universitari con ampie popolazioni studentesche. Wang et al.19 hanno proposto una rete bidirezionale di aumento delle caratteristiche (BATNet) per identificare i comportamenti degli studenti nelle classi intelligenti, in particolare per bersagli piccoli e occlusi.

Con lo sviluppo degli algoritmi, la velocità e la precisione nel rilevamento del comportamento sono state notevolmente migliorate; Tuttavia, gli studi attuali hanno ignorato la spiegazione se esista una correlazione tra i comportamenti rilevati in classe e il coinvolgimento degli studenti, lasciando domande come se certi comportamenti possano essere usati come parametri per misurare l'impegno comportamentale e quali comportamenti possano riflettere efficacemente l'impegno nell'apprendimento, senza risposta. Inoltre, è necessario trovare un modo esplicito per mostrare il coinvolgimento comportamentale degli studenti. Pertanto, questo studio ha identificato comportamenti in classe fortemente correlati al coinvolgimento apprendibile degli studenti tramite analisi di correlazione; Nel frattempo, è stato sviluppato un sistema di punteggio per costruire un modello di valutazione dell'engagement comportamentale. Di conseguenza, è possibile ottenere una misurazione automatica dell'impegno comportamentale sia per singoli studenti sia per l'intera classe.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Tutti i video sono stati ottenuti e utilizzati in conformità con le attuali pratiche etiche di ricerca sull'uomo come prescritto dall'Università di Scienza e Tecnologia dello Shandong. L'approvazione per l'utilizzo dei dati è stata ricevuta.

Innanzitutto, è stata condotta un'analisi di correlazione per identificare i comportamenti degli studenti che potessero servire come indicatori di coinvolgimento comportamentale. Dopo che il dataset è stato stabilito tramite estrazione dei frame e diviso in un set di addestramento e un set di test, due algoritmi rappresentativi per il rilevamento degli oggetti sono stati eseguiti nell'insieme di addestramento e confrontati in termini di accuratezza ed efficienza. Infine, è stato selezionato l'algoritmo con migliori prestazioni (YOLO-v5s) per essere eseguito sul set di test per eseguire il rilevamento del comportamento. La Figura 1 presenta il diagramma di flusso del processo di identificazione e rilevamento dei comportamenti degli studenti.

figure-protocol-1
Figura 1. Diagramma di flusso per l'identificazione e la rilevazione dei comportamenti degli studenti. Clicca qui per visualizzare una versione più grande di questa figura.

Identificazione degli indicatori
Prima di condurre esperimenti di rilevamento oggetti, era necessario identificare comportamenti non verbali che indicano il coinvolgimento comportamentale degli studenti. Ad oggi, studi sull'engagement comportamentale basati sulla rilevazione di oggetti hanno ottenuto successo nel rilevare una varietà di comportamenti non verbali, inclusi linea di vista, informazioni facciali e posturacorporea 9,10,11,12,13,14. Tuttavia, non è ancora stato discusso se comportamenti specifici siano giustificati come indicatori dell'impegno comportamentale degli studenti. Pertanto, in questo studio, è stata utilizzata un'analisi di correlazione tra i comportamenti degli studenti e il loro livello di coinvolgimento comportamentale per identificare comportamenti indicatori di coinvolgimento comportamentale.

(1) Test di coinvolgimento comportamentale
Questo studio ha selezionato 122 studenti universitari provenienti da quattro classi naturali di studenti non laureati in inglese presso SDUST-Jinan come campione per uno studio correlazionale. Per prima cosa, sono state impiegate scale di autovalutazione per raccogliere dati sull'engagement comportamentale dai 122 studenti, con l'obiettivo di comprendere il loro stato di coinvolgimento comportamentale da una prospettiva di esperienza interna. Dato che i dati video in aula per questo studio provenivano da classi di "Academic English", è stato adottato lo strumento di valutazione multidimensionale per l'impegno nell'apprendimento nelle aule universitarie di inglese sviluppato da RenQingmei 20 . Questo strumento è specificamente progettato per l'ambiente di insegnamento delle lingue straniere cinesi e utilizza la stessa categorizzazione classica dell'impegno nell'apprendimento di questo studio, comprendendo tre dimensioni: coinvolgimento comportamentale, affettivo e cognitivo. Tra questi, lo strumento di coinvolgimento comportamentale consiste in nove elementi, corrispondenti all'interazione insegnante-studente (ad esempio, "Rispondo attivamente alle domande poste dall'insegnante in classe di inglese"), lo sforzo individuale (ad esempio, "Considero attentamente le difficoltà incontrate durante l'apprendimento in inglese"), l'interazione tra pari (ad esempio, "Collaboro con altri studenti per completare compiti di apprendimento in inglese"), ecc. Ogni voce è presentata in un formato a 5 punti di Likert, con opzioni di risposta come "quasi mai, raramente, a volte, spesso, sempre", punteggiata da 1 a 5, richiedendo agli studenti di selezionare l'opzione che meglio si allinea con la loro esperienza di apprendimento. Gli studenti che hanno ottenuto 15 punti o meno sono stati classificati come studenti a basso coinvolgimento, quelli con 16-30 punti come studenti a coinvolgimento moderato e quelli con 31-45 punti come studenti ad alto coinvolgimento. Infine, sono state raccolte 120 scale valide, con 17 studenti nella categoria a basso coinvolgimento, 45 nella categoria a coinvolgimento moderato e 58 nella categoria ad alto coinvolgimento.

(2) Identificazione del comportamento
Nel frattempo, sono stati raccolti quattro video registrati per un totale di 50 minuti provenienti da lezioni di "Academic English" frequentate in queste quattro classi. Con un fotogramma disegnato ogni 15 secondi, venivano infine estratte 200 immagini per l'osservazione. Basandosi su visioni ripetute dei campioni video da parte di tre studenti, questo studio ha inizialmente identificato 12 tipi di comportamenti degli studenti in classe, ovvero: guardarsi intorno, usare il cellulare, discutere, vagare, andare in giro, mangiare o bere, prendere appunti o leggere, ascoltare attentamente, alzarsi (per rispondere a una domanda), sbadigliare, dormire e usare il computer. Esempi dei 12 comportamenti sono mostrati nella Figura 2.

figure-protocol-2
Figura 2. Esempi di 12 comportamenti. Clicca qui per visualizzare una versione più grande di questa figura.

Ogni tipo era accompagnato da descrizioni dettagliate delle caratteristiche visive e del contesto spaziotemporale, formando la Procedura Operativa Standard per l'Annotazione del Comportamento in Aula, che garantiva coerenza concettuale tra le annotazioni. La Tabella 1 mostra le 12 categorie di comportamento degli studenti e le descrizioni di ciascun comportamento.

Guardarsi intorno includeva girare la testa a sinistra, a destra e indietro in modo significativo. Gli studenti erano considerati coinvolti in una discussione se voltavano la testa e aprivano bocca. Nello scenario della classe, ascoltare attentamente era associato allo sguardo diretto alla lavagna o all'insegnante che sta davanti a loro; Quando lo sguardo era rivolto altrove, era molto probabile che lo studente stesse vagando. Quando lo studente mostrava una postura a testa bassa e c'era un oggetto come un libro o un quaderno, questo comportamento poteva essere identificato come prendere appunti o leggere un libro. Quando il comportamento prevedeva una postura in piedi e lo studente era in piedi al proprio posto con la bocca aperta, veniva considerato che stava rispondendo a una domanda in piedi; Se lo studente era fuori posto, veniva considerato in giro, il che poteva indicare che lo studente era in ritardo o stava uscendo dall'aula, ecc. Quando uno studente appoggiava la testa sulla scrivania, veniva identificato come addormentato. Quando uno studente teneva cibo o bevande tra le mani, il comportamento veniva identificato come mangiare o bere. Una bocca spalancata o una postura comportamentale che si allungava indicavano che lo studente stava sbadigliando.

Categoria comportamentaleDescrizione del comportamento
Guardandosi intornoMovimento evidente della testa verso destra, sinistra o indietro
Uso del telefono cellulareToccare un cellulare con le mani
DiscussioneBocca aperta, accompagnata da un movimento della testa
vagandoUno sguardo vitrei su luoghi irrilevanti
GiroSpostarsi dal sedile
Mangiare o bereBocca aperta e a contatto con cibo o acqua
Prendere appunti o leggerePrendere appunti o guardare un libro
Ascoltando attentamenteFissare la lavagna o l'insegnante
Alzarsi (per rispondere alle domande)In piedi al sedile con la bocca aperta
SbadigliandoBocca aperta o corpo che si allunga
DormireTesta sulla scrivania
Uso del computerUn computer aperto sulla scrivania

Tabella 1: Categorie e descrizioni dei comportamenti degli studenti.

(3) Analisi di correlazione
Utilizzando i criteri sopra indicati, 12 insegnanti esperti sono stati invitati a guardare video dei 120 studenti e a registrarne i tipi e le frequenze comportamentali. I comportamenti sono stati identificati secondo la Tabella 1. Gli insegnanti erano divisi in quattro gruppi, con tre insegnanti per ciascun gruppo. Ogni gruppo era responsabile della registrazione di 30 studenti, con ciascuno dei tre insegnanti che registrava indipendentemente i comportamenti di 30 studenti. L'Alpha di Cronbach (chiamato α) è un indicatore per misurare la coerenza interna di una scala o di un questionario. L'intervallo di valori dell'alpha di Cronbach è da 0 a 1, e α ≥ 0,8 è solitamente interpretato come una buona coerenza interna21. Se c'era un alto grado di coerenza (α > 0,8, cioè un alto grado di coerenza) nella frequenza di un particolare tipo di comportamento tra tutti e tre gli insegnanti, la frequenza del comportamento veniva registrata come media delle tre frequenze. Successivamente, con i dati che da un lato rappresentano le frequenze dei diversi comportamenti di ogni studente e dall'altro i loro livelli di coinvolgimento comportamentale, è stata condotta un'analisi di correlazione tra i due fattori. Il risultato è mostrato nella Tabella 2.

ComportamentiCoinvolgimento comportamentale
Mangiare o bereCorrelazione di Pearson.319**
Sig. (a 2 code)0.004
N120
SbadigliandoCorrelazione di Pearson-.335**
Sig. (a 2 code)0
N120
DiscussioneCorrelazione di Pearson.546**
Sig. (a 2 code)0
N120
GiroCorrelazione di Pearson-.774**
Sig. (a 2 code)0
N120
VagareCorrelazione di Pearson.293**
Sig. (a 2 code)0.008
N120
Guardandosi intornoCorrelazione di Pearson-.834**
Sig. (a 2 code)0
N120
Lettura o presa di appuntiCorrelazione di Pearson.912**
Sig. (a 2 code)0
N120
Ascoltando attentamenteCorrelazione di Pearson.881**
Sig. (a 2 code)0
N120
In piediCorrelazione di Pearson.330**
(per rispondere a una domanda)Sig. (a 2 code)0
N120
DormireCorrelazione di Pearson-.411**
Sig. (a 2 code)0
N120
UtilizzoCorrelazione di Pearson.591**
Telefono cellulareSig. (a 2 code)0
N120
Uso del computerCorrelazione di Pearson.362**
Sig. (a 2 code)0.001
N120

Tabella 2: Risultati dell'analisi di correlazione.

Nell'analisi di correlazione, r è il coefficiente di correlazione, che si riferisce al grado di correlazione lineare tra due variabili, che varia da −1 a 1. A seconda del grado di relazione, la correlazione può essere classificata nei seguenti tipi:
Alta correlazione (│r│ ≥ 0,70)
Correlazione media (0,40 ≤ │r│ ≤ 0,70)
Bassa correlazione (│r│ ≤ 0,40)

A seconda della direzione della relazione, può essere classificata nei seguenti tipi:
Correlazione positiva (r > 0)
Correlazione negativa (r < 0)
Nessuna correlazione (r = 0)

Dalla Tabella 1 si può vedere che sette comportamenti, tra cui guardarsi intorno (r = −0,834**, p < 0,05), usare il cellulare (r = 0,591**, p < 0,05), discutere (r = 0,546, p < 0,05), girare intorno (r = −0,774**, p < 0,05), prendere appunti o leggere (r = 0,912**, p < 0,05), ascoltare attentamente (r = −0,881**, p < 0,05) e dormire (r = −0,411**, p < 0,05), presentava una correlazione alta o media con il coinvolgimento comportamentale, mentre comportamenti come mangiare o bere (r = 0,319**, p = 0,04), alzarsi (per rispondere a una domanda) (r = 0,330**, p = 0,00), sbadigliare (r = −0,335**, p < 0,05), vagare (r = 0,293, p > 0,05) e usare il computer (r = 0,362, p < 0,05) presentavano una correlazione bassa o nulla con l'impegno comportamentale. Sulla base dell'analisi di correlazione, questo studio ha identificato sette comportamenti come indicatori di coinvolgimento nello apprendimento, ovvero: guardarsi intorno, usare il cellulare, discutere, andare in giro, prendere appunti o leggere, ascoltare attentamente e dormire.

Istituzione del dataset
I dati video utilizzati in questo studio sono stati raccolti dalla piattaforma di registrazione diretta di SDUST, che ha fornito video sincronizzati dell'insegnamento reale in classe del corso "Academic English". Sono stati raccolti dieci video di quattro classi di studenti non laureati in inglese, ciascuno della durata di circa 50 minuti, per stabilire un dataset praticabile del comportamento in classe degli studenti. Con un fotogramma disegnato ogni 15 secondi, venivano infine estratte 2.000 immagini con una risoluzione di 1.920 × 1.080.

Divisione del dataset
L'esperimento ha diviso il dataset comportamentale degli studenti in due parti completamente indipendenti: un set di addestramento e un set di test, come mostrato nella Tabella 3, senza immagini condivise. Il dataset copriva tutti e sette i comportamenti degli studenti. Il set di addestramento e il set di test venivano utilizzati rispettivamente per i parametri del modello di addestramento e per la valutazione dell'accuratezza. I parametri di addestramento sono stati impostati come mostrato nella Tabella 4.

Set datiNumero di immagini
Totale2830
Set di addestramento2111
Set di prova719

Tabella 3: Divisione del dataset sul comportamento degli studenti.

ParametroValore
Tasso di apprendimento0.01
Momentum0.937
Decadimento del peso0.0005
Epoca100
Dimensione del lotto16

Tabella 4: Impostazione dei parametri sperimentali.

Per prevenire la perdita di dati causata dalla comparsa dello stesso studente in sottoinsiemi diversi e per preservare la naturale continuità temporale dei comportamenti, è stato adottato un metodo di "Stratificazione Temporale Split".

Disgiunzione del soggetto: Il dataset era suddiviso in ID studente unici, garantendo che gli studenti nei set di addestramento, validazione e test fossero mutuamente esclusivi.

Partizione temporale: I video erano ordinati in ordine cronologico. Il primo 70% dei segmenti temporali è stato utilizzato per l'addestramento, il successivo 15% per la validazione e l'ultimo 15% per i test. Questo metodo simulava meglio la generalizzazione temporale del mondo reale rispetto alla divisione casuale.

Bilanciamento di classe: Per categorie sottorappresentate come "dormiente" e "uso del cellulare", è stato applicato un oversampling moderato all'interno del set di addestramento per garantire che il modello apprese le caratteristiche di tutte le categorie.

Annotazione del dataset di addestramento
Veniva utilizzato uno strumento di annotazione open source per annotare manualmente i dati di addestramento. Lo strumento veniva impiegato per l'annotazione delle scatole delimitatorie. Il flusso di lavoro specifico era il seguente: (1) I fotogrammi chiave venivano estratti a una velocità fissa (1 fotogramma/s) dai video di sorveglianza che coprivano diverse scuole, fasce orarie e tipi di corso, seguiti da processi di anonimizzazione come la sfocatura del volto; (2) Seguendo la SOP dell'annotazione, gli annotatori hanno usato riquadre rettangolari per delineare con precisione lo studente che esegue un comportamento specifico e hanno assegnato l'etichetta di categoria corrispondente; (3) Le annotazioni venivano esportate come file XML in formato PASCAL VOC.

Per garantire la qualità dell'etichetta, soprattutto per evitare errori nella distinzione di comportamenti ambigui (ad esempio, discutere vs. vagare), è stato implementato un meccanismo collaborativo "Annotazione-Arbitrato in Tre Fasi":

Annotazione iniziale: Ogni key frame veniva annotato indipendentemente da tre annotatori addestrati. Ogni etichetta è composta da un'etichetta di categoria e da una casella delimitata.

Verifica della coerenza: Sono state calcolate l'intersezione su Unione e la coerenza delle categorie tra annotazioni. Le bounding box, che sono il risultato di annotazioni iniziali con IoU > 0.8 e etichette identiche di categoria, erano considerate "annotazioni coerenti". Le riquadre delimitanti con etichette di categoria IoU ≤ 0,8 o non identiche erano considerate "annotazioni incoerenti".

Arbitrato di esperti: Per annotazioni incoerenti (ad esempio, casi ambigui come "guardarsi intorno" vs. "discutere"), un panel di esperti con esperienza didattica prendeva la decisione finale basandosi sul video clip, sul contesto comportamentale e sulle conoscenze pedagogiche precedenti. La determinazione finale viene effettuata verificando l'accuratezza dell'etichetta tramite l'ispezione del segmento video sorgente del key frame.

L'annotazione ha rivelato che i comportamenti degli studenti erano caratterizzati da bersagli multipli, intensivi e piccoli, come mostrato nella Figura 3.

figure-protocol-3
Figura 3. Un esempio di annotazione delle immagini in classe. Clicca qui per visualizzare una versione più grande di questa figura.

Gli studenti in classe mostravano comportamenti come ascoltare attentamente, usare il cellulare e leggere o prendere appunti frequentemente, mentre la frequenza di girovagare, vagare, ecc. era relativamente bassa. La Figura 4 mostra la distribuzione dei comportamenti in classe nel dataset di addestramento.

figure-protocol-4
Figura 4. Distribuzione dei comportamenti nel dataset di addestramento. Clicca qui per visualizzare una versione più grande di questa figura.

Rilevamento dei comportamenti degli studenti
I framework di rilevamento degli oggetti basati su deep learning erano principalmente suddivisi in due categorie: 22: metodi a due stadi, rappresentati dalla serie Faster R-CNN, e metodi a uno stadio, rappresentati da YOLO. Per la prima categoria, i metodi di rilevamento a due stadi generavano inizialmente proposte di regione utilizzando una Rete di Proposta di Regione (RPN) prima di eseguire calcoli dettagliati di probabilità di classe e regressione a scatole delimitanti. Per la seconda categoria, i metodi a uno stadio semplificavano il processo di rilevamento prevedendo contemporaneamente le classi di oggetti e le scatole di delimitazione in un unico stadio. Sebbene i metodi a due stadi siano emersi prima nello sviluppo del campo, gli approcci a uno stadio hanno guadagnato popolarità grazie alla loro architettura semplificata e all'efficienza computazionale. Per ottenere un riconoscimento comportamentale in classe più accurato ed efficiente, questo studio ha selezionato algoritmi rappresentativi di entrambe le categorie, ovvero Faster R-CNN23,24 e YOLO-v525,26, per condurre esperimenti di rilevamento del comportamento in classe, e ha confrontato i risultati di rilevamento dei due algoritmi prima di decidere definitivamente quale algoritmo utilizzato per il rilevamento del comportamento in questo studio.

Per valutare in modo efficiente i risultati sperimentali, l'attenzione è stata posta sull'accuratezza complessiva della rilevazione rispetto al costo temporale di ciascun modello algoritmico. Sono stati utilizzati la Precisione Media Media (mAP) e il tempo di addestramento (h) per misurare i due modelli.

Sette categorie di comportamenti sono state rilevate per il riconoscimento con i due metodi, e i valori medi di accuratezza del rilevamento (AP) sono stati registrati nella Tabella 5. Tra queste, gli YOLO-v5 hanno superato Faster R-CNN nel rilevamento di tre categorie di azioni, ovvero andare in giro, ascoltare attentamente le lezioni e usare i cellulari, con valori AP rispettivamente del 100%, 62,7% e 31,8%.

Modello di reteDiscussioneGiroAscoltare attentamenteGuardarsi intornoDormirePrendere appunti o leggereUso del telefono cellulare
R-CNN più veloce32.699.545.49.32252.626.8
YOLO-v5s17.810062.73.8195131.8

Tabella 5: La precisione media dei due algoritmi per una singola classe.

Il tempo di addestramento e la precisione media di rilevamento delle due reti classiche di rilevamento sul set di test con un IoU di 0,5 sono mostrati nella Tabella 6. Sebbene la rete Faster R-CNN avesse una maggiore precisione, la sua durata di trasmissione era relativamente lunga. In confronto, gli YOLO-v5 avevano un tempo di esecuzione più breve del 30% con una riduzione della precisione solo dello 0,3%, dimostrando un miglioramento maggiore dell'efficienza. Data la necessità di rilevamento in tempo reale del comportamento degli studenti in classe in questo studio, si prevedeva che il tempo di addestramento per la rete fosse il più breve possibile. Considerando sia l'accuratezza della rilevazione sia il costo temporale dei modelli addestrati sul set di addestramento, questo articolo ha concluso che YOLO-v5s era più adatto per il rilevamento del comportamento degli studenti in classe.

Modello di retehmAP@0,5 (%)
R-CNN più veloce2.8841.17
YOLO-v5s2.01640.87

Tabella 6: Confronto delle prestazioni di rilevamento.

Pertanto, in questo studio è stato scelto YOLO-v5s per rilevare il comportamento in classe. I risultati di rilevamento prodotti dagli YOLO-v5 sono illustrati nella Figura 5, che mostra la rilevazione continua del comportamento multi-bersaglio insieme alle relative etichette.

figure-protocol-5
Figura 5. Esempi di risultati di rilevamento dell'insieme di test. Clicca qui per visualizzare una versione più grande di questa figura.

(1) Aumento e preelaborazione dei dati
Per aumentare la robustezza e la generalizzazione del modello, durante l'addestramento è stata adottata una strategia di aumento dei dati compositi, includendo trasformazioni affini casuali, jitter di colore e occlusione casuale. Tutte le immagini sono state ridimensionate uniformemente a 640 × 640 pixel.

(2) Strategia di addestramento
Il processo di formazione è stato suddiviso in tre fasi:
Fase della Spina Dorsale Congelata (Epoche 1-100): La rete della colonna vertebrale era bloccata e solo la testa di rilevamento era attivata, utilizzando un basso tasso di apprendimento per il riscaldamento.
Fase completa di retta fine-tuning (Epoche 101-250): Tutti i livelli di rete sono stati sbloccati. Un programmatore di ricottura coseno ha regolato il tasso di apprendimento.
Fase di Raffinamento (Epoche 251-300): È stata applicata la Media Mobile Esponenziale per stabilizzare l'addestramento e l'intensità dell'aumento dei dati è stata ridotta per il raffinamento del modello.

Per affrontare lo squilibrio di classe, sono stati applicati pesi specifici per classe inversamente proporzionali alle loro frequenze nell'insieme di addestramento alla funzione di perdita.

(3) Post-elaborazione e ottimizzazione temporale
Per mantenere la coerenza temporale nei comportamenti in classe, è stato applicato un filtro di coerenza temporale dopo l'inferenza del modello. In particolare, per un bersaglio rilevato in una sequenza video, la sua categoria comportamentale doveva essere identificata in almeno tre fotogrammi consecutivi per essere confermata, filtrando di fatto i falsi positivi transitori.

Istituzione del metodo di punteggio comportamentale dell'engagement
Questo studio ha utilizzato il metodo dei focus group per assegnare i punteggi a ciascun comportamento. Venti insegnanti universitari di prima linea sono stati invitati a valutare l'impegno delle sette categorie di comportamento in base alla loro esperienza nella gestione della classe. Tutti e 20 gli insegnanti insegnavano da più di 10 anni e avevano tenuto una vasta gamma di corsi in diverse discipline. I punteggi di ingaggio variavano da 0 a 3, con 0-1 che indicava un ingaggio basso, 1-2 un ingaggio medio e 2-3 un ingaggio alto. Se c'era un alto grado di coerenza (α > 0,8) nelle valutazioni di più valutatori per un particolare tipo di comportamento, il coinvolgimento di quel comportamento veniva misurato facendo la media delle valutazioni dei singoli insegnanti. Le valutazioni finali per ciascun tipo di comportamento sono mostrate nella Tabella 7.

Tipo di comportamentoguardandosi intornoUso del cellulareDiscussioneGirarePrendere appunti o leggereascoltando attentamenteDorme
Punteggio di ingaggio0.91.21.90.62.72.80.2

Tabella 7: Valutazioni comportamentali.

La formula per l'impegno comportamentale di ogni studente è

figure-protocol-6

ESi = coinvolgimento comportamentale dello studente, Sj = punteggio del comportamento, fj = frequenza del comportamento j.

Assumendo che il numero di comportamenti rilevati in uno studente in una classe fosse 100, inclusi 4 "discutere", 68 "ascoltare attentamente", 25 "leggere/prendere appunti" e 3 "guardarsi intorno", il punteggio complessivo di coinvolgimento personale dello studente era (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. Prendendo l'intera lezione come parametro di riferimento, il coinvolgimento comportamentale è stato suddiviso in quattro livelli secondo una divisione a intervalli uguali di una scala 0-3: un punteggio inferiore a 0,75 è stato definito come "non coinvolto", 0,76-1,5 come "leggermente coinvolto", 1,6-2,25 come "impegnato" e 2,26-3 come "molto coinvolto"; così, lo studente è stato valutato come "molto coinvolto" per la classe.

L'impegno comportamentale dell'intera classe si riferiva al punteggio medio di tutti gli studenti. La formula per l'impegno comportamentale della classe è:

figure-protocol-7

Ec = coinvolgimento comportamentale della classe, ES = coinvolgimento comportamentale di un certo studente, n = numero di studenti

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Rilevando i comportamenti e utilizzando il modello di punteggio, si è ottenuta una misurazione automatica dell'impegno comportamentale degli studenti. Prendendo come esempio una lezione nel video, l'impegno comportamentale in tempo reale di ogni studente potrebbe essere calcolato in base ai risultati del rilevamento comportamentale e al modello di punteggio. La Figura 6 illustra l'impegno comportamentale di due studenti in questa classe, mos...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio ha realizzato il riconoscimento automatico e la misurazione dell'impegno comportamentale. Rispetto a studi precedenti, i comportamenti identificati erano più rappresentativi delle aule universitarie (come l'uso del cellulare), e la valutazione dell'impegno comportamentale è stata presentata in cifre, rendendolo intuitivo da vedere. Questo approccio di misurazione automatica ha permesso agli insegnanti di valutare in modo efficiente e chiaro il coinvolgimento sia dei singoli...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori non hanno conflitti di interesse da dichiarare.

Ringraziamenti

Questa ricerca è stata finanziata dal Programma del Fondo di Pianificazione delle Scienze Sociali dello Shandong (23CRWJ11).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Video in aulaI dati video utilizzati in questo studio sono raccolti dalla piattaforma di registrazione diretta della Shandong University of Science and Technology (SDUST), che sono video sincronizzati di insegnamento reale in aula del corso di Inglese Accademico. Sono stati raccolti 30 video di 6 classi di studenti non laureati in inglese, di circa 50 minuti ciascuno, per stabilire un set di dati allenabile degli studenti Comportamento in classe.
IBM SPSS Statistiche 26IBMSPSS per Windows è un pacchetto software modulare che integra funzioni di inserimento dati, organizzazione e analisi. Le sue funzioni di base includono la gestione dei dati, l'analisi statistica, l'analisi dei grafici, la gestione degli output e così via. SPSS è principalmente utilizzato per l'analisi della coerenza e l'analisi di correlazione in questo articolo.
Etichettatura 1.8.6L'etichettatura è uno strumento di annotazione visiva delle immagini. È scritto in Python e utilizza Qt come interfaccia grafica. Le annotazioni vengono salvate come file XML nel formato PASCAL VOC, utilizzato da ImageNet. Inoltre, supporta il formato YOLO. Viene utilizzato per dataset necessari per reti di rilevamento oggetti come Faster R-CNN, YOLO e SSD per annotare oggetti nelle immagini.
MMDetection 2.22.0MMDetection, 2.22.0, MMDetection è un toolbox per il rilevamento degli oggetti che include metodi di rilevamento ricco di oggetti, segmentazione delle istanze e segmentazione panoramica, oltre a componenti e moduli correlati.

Riferimenti

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Rilevamento del comportamento in classeValutazione dell impegno nell apprendimentoFaster R CNNYOLOv5sApprendimento supervisionatoValutazione in tempo realeAnalisi di correlazione