$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, kişisel olarak tanımlanabilir herhangi bir bilgi içermeyen halka açık veri kümelerini kullanmaktadır. Araştırmada kullanılan tüm veriler, katılımcıların mahremiyetini sağlamak için anonim hale getirilmiştir. Veri toplama sırasında tüm katılımcılardan bilgilendirilmiş onam alınmıştır ve çalışma etik kurallara uygundur. Protokol, çok modlu veri füzyonuna dayalı özellik çıkarma ve Transformer ve dikkat üzerine dayalı uzay-zamansal davranış tanımadan oluşan akıllı sınıf davranış tanıma yöntemini açıklar. Tüm yöntemin performansı, ortak eğitim yoluyla optimize edilir.
1. Çok modelli veri toplama
Çok Modlu Veri Toplama, iki veri kümesinden senkronize sınıf davranışı verilerinin toplanmasını içeriyordu: EduSense Veri Kümesi ve SBU Kinect Etkileşim Veri Kümesi. EduSense, gerçek hayattaki üniversite sınıfı kayıtlarını kaydetti ve SBU Kinect etkileşime dayalı iskelet dizilerini kaydetti. Veri kümeleri, öğrenci duruşlarını ve hareketlerini modellemek için video akışları, ses ipuçları ve 3B iskelet eklemi bilgileri içeriyordu. Veri ön işleme, temizlik için garantili zamansal hizalama ve gürültü giderme. Bu yakınsama, birçok öğrenme durumunda uçtan uca davranış izleme, görsel hareketlerin ve vücut hareketlerinin kaydedilmesini sağladı.
2. Multimodal veri füzyonuna dayalı özellik çıkarma
Akıllı sınıflarda öğrenci davranışının tanınması konusunu hedef alarak, Transformer ve ile akıllı sınıf davranışı tanıma için bir yöntem önerilmiştir. Çok sayıda öğrencinin bulunduğu sınıfların karmaşık doğası nedeniyle, sahnedeki faktörlerdeki değişiklikler öğrenci davranışlarının tanınmasını engelleyebilir. Ek olarak, tek özellik çıkarımının eksik bilgi, çevresel müdahaleye yatkınlık ve karmaşık davranışları yakalamada zorluk gibi sınırlamaları vardır 19,20. Bu nedenle, çalışma ilk olarak çok modlu veri füzyonuna dayalı bir öğrenci sınıf özelliği çıkarım yöntemi önermektedir. Bu yöntem, video ve iskelet modalitelerinden elde edilen verileri birleştirerek, öğrenci davranışının daha kapsamlı ve doğru özellik çıkarımını elde etmek için tamamlayıcılıklarını kullanır. Özellikle, her giriş video dizisi kare olarak bölünür. Çerçeveler, insanların ilgilendiği bölgeleri yerelleştirmek için önceden eğitilmiş daha hızlı bir R-CNN'ye beslenir. Tespit edilen bölgeler, zamansal görsel özellikler elde etmek için evrişimli bir sinir ağı omurgasına beslenir. İskelet modalitesi için, 3B eklem pozisyonları diziler olarak pozlandırılır ve zamansal ve uzamsal bağımlılıklar elde etmek için önceden eğitilmiş bir BERT modeli kullanılarak kodlanır. Bunlar, multimodal füzyon ağına girilmeden önce normalleştirilir ve gömülür. Bunlar arasında, video modalitesi esas olarak öğrencilerin hareketleri ve ifadeleri gibi görsel özellikleri yakalamaktan sorumluyken, iskelet modalitesi eklem noktası bilgileri aracılığıyla öğrencilerin duruş değişikliklerini doğru bir şekilde tanımlar. Video modalitesi görsel algının küresel özelliklerine dayanırken, iskelet modalitesi insan davranışını temsil etmek için küresel görsel özelliklere dayanırken, iskelet modalitesi eklem pozisyonundaki dinamik değişikliklere odaklanır ve bu da ikisi arasında önemli anlamsal farklılıklara yol açar21. Bu nedenle, iki modalite arasındaki korelasyonu etkili bir şekilde modellemek için özel bir multimodal füzyon ağı geliştirmek gereklidir. Multimodal füzyon ağı Şekil 1'de gösterilmektedir.
Şekil 1'de, ağ temel olarak üç modüle ayrılmıştır. Bunlar arasında, video modalite işleme modülünün girişi, özellik çıkarma için Daha Hızlı Bölge Tabanlı Evrişimli Sinir Ağı (Daha Hızlı R-CNN) aracılığıyla çıkarılan bir video dizisidir. Video modalitesinin işlenmesi, sınıf video çekimlerinin özellik çıkarma için kare kare girişlere çevrilmesiyle başlar. Çerçeveler, ImageNet üzerinde eğitilmiş bir ResNet-50 tabanına sahip Daha Hızlı Bölge Tabanlı Evrişimli Sinir Ağı (Daha Hızlı R-CNN) ile işlenir. Ağ, 224 × 224 piksele yeniden boyutlandırılan RGB çerçevelerini işleyerek, öğrenci etkinliğinin uzamsal ve nesneye özgü özelliklerine sahip üst düzey görsel özellik haritaları sağlar. Bu özellikler daha sonra, bir Transformer katmanı aracılığıyla uzay-zamansal gömmelere kodlamadan önce çerçeveler arasındaki zamansal ilişkileri öğrenen bir kendi kendine dikkat modülüne girilir. Bu, daha sonraki füzyon için temsilleri gömerken baş eğmeleri veya el kaldırmaları gibi zayıf davranışsal sinyalleri korur. Çıkarılan video özellikleri, video modalitesi içindeki zamansal ve uzamsal ilişkileri yakalamak için kendi kendine dikkat modülü tarafından yakalanır ve daha sonra video dizisinin uzay-zamansal bilgileri için gömme vektörleri oluşturmak üzere bir transformatör tarafından daha fazla modellenir. İskelet modalitesi işleme modülünün girişi, iskelet eklemlerinin zamansal ve uzamsal özelliklerini çıkarmak için Transformatörlerden Çift Yönlü Kodlayıcı Temsili (BERT) tarafından işlenen bir iskelet dizisidir. İskelet verileri için, her öğrencinin pozu, OpenPose tabanlı bir poz tahmincisi kullanılarak sınıf videolarından 2B birleşik koordinatlar dizisi olarak modellenir. Bu diziler, her belirtecin 18 anahtar noktaya sahip bir kareye karşılık geldiği gömme belirteçlerine dönüştürülür. Bu eklem dizilerinin zamansal bağlamı ve bağımlılıkları, Transformatörlerden Çift Yönlü Kodlayıcı Temsilleri (BERT) modeli kullanılarak modellenmiştir. Model, 12 transformatör katmanı, 8 dikkat kafası ve standart BERT tabanlı mimari olan gizli bir 768 boyutu kullanır. Model, davranışa özgü eklem kalıpları elde etmek için eğitim sırasında ince ayar yapılır. Çıktı yerleştirmeleri, daha sonra video modalite özellikleriyle birleştirilen öğrenci davranışının yapısal ve hareketle ilgili özelliklerini temsil eder. Daha sonra, iskelet özellikleri, 3D CNN ve havuzlama işlemleri yoluyla uzamsal ve zamansal özellikler halinde daha da toplanır ve iskelet modalitesinin özellik temsilleri olarak iskeletin gömülü vektörleri oluşturulur.
3. Çapraz dikkat füzyon modülü
Çapraz dikkat füzyon modülünde, çalışma, video modalitesi ve iskelet modalitesi arasındaki etkileşim ilişkisini oluşturmak için çok başlı dikkat mekanizmasını (MHAM) kullanır ve oluşturulan multimodal füzyon özelliklerinden 3D CNN ve havuzlama işlemleri aracılığıyla daha kompakt füzyon özelliklerini daha da çıkarır. Füzyon işlemi, her modalitenin zamansal gömmelerinin 3D CNN'ler ve çift yönlü GRU'lar aracılığıyla geçirildiği iki akışlı bir dikkat ağı kullanılarak gerçekleştirilir. Çok modlu veri akışları, modaliteler arası bağımlılıklar elde etmek için ölçeklendirilmiş nokta ürün dikkati ile Çok Başlı Dikkat Modülleri (MHAM) kullanılarak hizalanır. Yerleştirmeler daha sonra boyutsal karmaşıklığın üstesinden gelmek için bir havuzda toplanır ve sınıflandırma için tamamen bağlı bir Softmax katmanına gönderilir.
Çok modlu füzyon ağlarında, kendi kendine dikkat modülü, tek bir mod içindeki zamansal ve mekansal bağımlılığı modellemek için kullanılırken, çapraz dikkat füzyon modülü, farklı modlar arasındaki ilişkiyi ve bilgi etkileşimini kurmak için kullanılır. Bu nedenle her ikisi de çok önemlidir. Kendi kendine dikkat modülü, Q sorgusu, K anahtarı ve V değeri arasındaki ilişkiyi hesaplayarak giriş dizisinin iç bağımlılıklarını yakalar. Q, K anahtarı ve V değerinin hesaplanması denklem (1)'de gösterilmiştir. Burada
sırasıyla sorgu, anahtar ve değer matrisleri; dk anahtar vektör boyutluluğudur ve dk değer vektörlerinin boyutluluğudur. Boyut faktörü dk, eğitim sırasında gradyanların stabilitesini etkileyecek olan nokta ürünlerinin büyümesini önlemek için benimsenmiştir.
(1)
Denklem (1)'
de, giriş özelliklerini temsil eder, burada n giriş dizisinin uzunluğudur, dmodeli özelliklerin boyutudur ve WQ, WK ve WV üç öğrenilebilir projeksiyon matrisi kümesini temsil eder. Bu matris eşlemeleri aracılığıyla giriş özellikleri sorgulara, anahtarlara ve değerlere dönüştürülür. Q sorgusunun nokta çarpımı ve K anahtarı, denklem (2)'de gösterildiği gibi dikkat ağırlıklarını hesaplamak ve ölçeklendirmek için kullanılır.
(2)
Denklem (2)'de, dk, Q ve anahtar K sorgulama boyutunu temsil eder ve softmax, dikkat ağırlığı matrisini elde etmek için kullanılan softmax fonksiyonunu gösterir. Ölçeklendirme, boyutluluğun neden olduğu aşırı nokta ürün değerleri nedeniyle gradyanın çok küçük olması sorununu etkili bir şekilde önleyebilir. Dikkat ağırlığı matrisi, denklem (3)'te gösterildiği gibi, öz dikkat modülünün Z çıktısını elde etmek için V değerine uygulanır.
(3)
Denklem (3)'te, birij, i inci sorgu vektörünün j inci anahtar vektörü üzerindeki dikkat ağırlığı anlamına gelir. Çapraz dikkat füzyon modülünün spesifik yapısı Şekil 2'de belirtilmiştir.
Şekil 2'den, bu modül esas olarak iskelet ve video modalitelerinden giriş özelliklerini işlemeye başlar. İlk olarak, iskelet dizisi ve video dizisi, uzay-zamansal özellikleri çıkarmak için ayrı ayrı 3B evrişimli katmanlara tabi tutulur ve daha sonra bu uzay-zamansal özellikler, zamansal modelleme için Çift Yönlü Kapılı Tekrarlayan Birimler (Bi-GRU'lar) kullanılarak modellenir. Daha sonra, iki modalitenin özellikleri, modaliteler içindeki korelasyonları çıkarmak için MHAM'lar aracılığıyla daha fazla çıkarılır. Her modalite, sorgular, anahtarlar ve değerler mekanizmaları aracılığıyla dahili olarak özellik temsili elde eder. Ardından, zaman boyutunun karmaşıklığını azaltmak için çıktı özellikleri üzerinde zaman ortalaması havuzlama gerçekleştirilir. Havuzlamadan sonra, multimodal özellikler, her bir modalitenin ortalama ve standart sapmasını hesaplamak için istatistiksel olarak bir havuzda toplanır ve son olarak tam bağlı bir katman (FCL) ve Softmax sınıflandırıcı aracılığıyla öğrencinin eylem tanıma ve sınıflandırmasını çıkarır. Bu nedenle, çalışmada önerilen çok modlu veri füzyonuna dayalı özellik çıkarımı, video ve iskelet modalitelerinden gelen verileri birleştirerek öğrenci davranışının uzay-zamansal özelliklerini doğru bir şekilde yakalamak ve modellemek için kendi kendine dikkat ve çapraz'leri kullanır, böylece akıllı sınıflarda öğrenci davranışı tanımanın doğruluğunu ve kapsamlılığını geliştirir.
4. Transformatör ve dikkati temel alan uzay-zamansal davranış tanıma
Çok modlu veri füzyonuna dayalı özellik çıkarımı, video ve iskelet modalitelerinden gelen verileri birleştirerek öğrenci davranışının kapsamlılığında ve doğruluğunda bir ön iyileştirme sağlar. Bununla birlikte, akıllı sınıflar bağlamında, öğrencilerin davranışları genellikle zaman içinde değişir ve aynı davranış farklı zaman noktalarında ve mekansal bölgelerde farklı özellikler gösterebilir. Yalnızca çok modlu özelliklerden kaynaşmış statik bilgilere güvenmek, davranış dizisi22,23'teki karmaşık uzay-zamansal dinamik ilişkileri tam olarak yakalayamaz. Bu nedenle, daha fazla araştırma, Transformer'a dayalı bir uzay-zamansal davranış modellemesi ve önermektedir. Çalışma, ağ mimarisi olarak, kendi kendine aracılığıyla girdinin küresel uzay-zamansal bilgilerini modelleyebilen ve uzay-zamansal bağımlılıkları yakalama konusunda daha güçlü bir yeteneğe sahip olan Vision Transformer'ı (ViT) seçti. Multimodal füzyonu takiben, kaynaşmış özellikler, uzay-zamansal davranışı tahmin etmek için bir Görüş Transformatörü (ViT) kullanılarak tekrar temsil edilir. Girişteki özellik haritaları, ayrık 16 × 16 yamaya bölünür, tek boyutlu vektörlere doğrusal olarak gömülür ve uzamsal düzeni korumak için konumsal olarak kodlanır. ViT yapısı, çok kafalı kendi kendine dikkat (8 kafa) ve gizli boyutu 768 olan ileri besleme katmanlarından oluşan 12 Trafo kodlayıcı bloğuna sahiptir. Davranışsal belirginliği artırmak için Uzamsal Dikkat (SA) ve Zamansal Dikkat (TA) modülleri önerilmektedir. SA modülü, Tanh aktivasyonu yoluyla uzamsal alanlarda özellik alaka düzeyini teşvik ederken, TA modülü ReLU aktivasyonu yoluyla önemli zamansal çerçeveleri vurgular. Bu iki dikkat akışı daha sonra iki aşamalı bir eğitim yöntemi aracılığıyla ViT omurgası ile birleştirilir, böylece model sınıf davranışının dinamik evrimini verimli bir şekilde yakalamayı öğrenir. ViT'nin yapısı Şekil 3'te gösterilmiştir.
Şekil 3'te, ViT'de orijinal girdi, her biri görüntünün bir parçası olarak temsil edilen ve tek boyutlu bir vektöre doğrusal olarak düzleştirilen birden çok sabit boyutlu küçük bloğa bölünmüş bir görüntüdür. Transformatör konum bilgisini algılayamadığından, her küçük blok, farklı küçük bloklar arasındaki göreceli uzamsal konum ilişkisini yakalayabilmesini sağlamak için Transformatöre girilmeden önce konum bilgileriyle gömülür. ViT'nin çekirdek modülü, birden fazla yığılmış Transformatör kodlama bloğundan oluşan Transformatör kodlayıcıdır. Kodlama blokları, bir MHAM ve bir ileri beslemeli sinir ağından oluşur. MHAM, giriş dizileri arasındaki bağımlılıkları paralel olarak yakalarken, ileri beslemeli sinir ağı, modelin küresel bilgileri yakalama ve ifade etme yeteneğini geliştirmek için sonuçlar üzerinde doğrusal olmayan dönüşümler gerçekleştirir. Transformatör kodlayıcı tüm küçük bilgi parçalarını işledikten sonra, son kodlama katmanının çıktısı, son öğrenci eylemi tanıma ve sınıflandırma sonuçlarını veren Çok Katmanlı Algılayıcı Kafasına (MLP Kafası) iletilir.
Pratik olarak, her çerçeve örtüşmeyen 16 × 16 yamaya bölünür, düzleştirilir ve uzamsal ilişkileri korumak için konumsal olarak gömülür. Yama yerleştirmeleri, ViT mimarisindeki yığılmış transformatör kodlayıcıları tarafından sıralı olarak işlenir. Uzamsal Dikkat (SA) modülü, dikkati her çerçevedeki ilgi alanlarına göre değiştirmek için tanh aktivasyonunu kullanır ve Zamansal Dikkat (TA) modülü, zamansal olarak önemli çerçeveleri vurgulamak için ReLU'yu kullanır. Bu iki dikkat mekanizması, uzay ve zaman davranış dinamiklerinin etkili bir şekilde modellenmesini sağlar.
Karmaşık davranış dizilerinde ViT'nin performansını daha da artırmak için, uzamsal dikkat (SA) ve zamansal dikkat (TA), ViT'nin yalnızca önemli uzamsal eklemleri özerk bir şekilde seçmesini sağlamakla kalmayıp, aynı zamanda farklı zaman noktalarındaki davranışlara odaklanarak davranışın uzay-zamansal dinamik değişikliklerini daha iyi yakalamasını sağlamak için tanıtılmıştır. SA modülü ve TA modülü Şekil 4'te gösterilmiştir.
Şekil 4A'da, SA modülü, gizli durumları çıkarmak için mevcut çerçevenin özelliklerini ViT katmanına geçirerek girdinin uzamsal boyut bilgilerini işler. Bunlar, önceki çerçevenin özellikleriyle birleştirilir ve FCL'ye birlikte beslenir. FCL, gizli özellik temsilleri oluşturmak için özellikler üzerinde doğrusal bir dönüşüm gerçekleştirecektir. Daha sonra, çıktıyı [-1,1] aralığına eşlemek, doğrusal olmayanlığı artırmak ve önemli ve önemsiz özellikler arasında daha iyi ayrım yapmak için Tanh aktivasyon fonksiyonuna geçirilir. Son olarak, çıktı özelliklerinin nispeten kararlı bir ölçeğe sahip olmasını sağlamak için özellikler bir normalleştirme katmanı aracılığıyla normalleştirilir. Şekil 4B'de, TA modülü, zamansal boyuttaki her bir çerçevede yer alan temel bilgilere daha fazla odaklanır. SA'daki Tanh'tan farklı olarak, TA modülü, negatif değerleri bastırmak için ReLU aktivasyon işlevini kullanır ve yalnızca pozitif değerlerin çıktısını korur, negatif gürültü bilgilerini etkili bir şekilde kaldırır ve modelin zamansal yakalama yeteneğini geliştirir.
5. Ortak eğitim yöntemi
Transformatör ve dikkati temel alan uzay-zamansal davranış tanımada ViT, SA modülü ve TA modülü arasındaki karşılıklı etkinin neden olduğu önyargılı ve yedekli uzay-zamansal özellikler sorununu etkin bir şekilde çözmek için, üç modülü optimize etmek için ortak bir eğitim yöntemi benimsenmiştir. Spesifik süreç Şekil 5'te belirtilmiştir.
Şekil 5'te, ortak eğitim stratejisi önce model eğitim parametrelerini girer, ağ yapısını ve hiperparametreleri ayarlar. Daha sonra, yerel özellikleri daha iyi öğrenmek için SA ve TA üzerinde ayrı bir ön eğitim yürütülür. Bir modelin ön eğitimi sırasında diğer modelin ağırlıklarının sabit tutulduğunu ve güncellenmediğini belirtmekte fayda var. Bireysel ön eğitimi tamamladıktan sonra, ViT katmanı eğitim için birleştirilir. Ardından, iki dikkat modeli sabitlenecek ve ana ViT ağı ayrı ayrı eğitilecektir. Son olarak, ana ViT ağı, SA ve TA modüllerini ortaklaşa eğiterek, genel ağ, akıllı sınıf davranışı tanıma için nihai modeli oluşturmak üzere optimize edilir. Eğitim prosedürü adım adım gerçekleştirilir: (1) donmuş ViT parametreleri ile SA ve TA modüllerinin otonom ön eğitimi, (2) donmuş dikkat modülü ağırlıkları ile ViT'nin kademeli eğitimi ve (3) Adam optimizer ile birlikte tüm bileşenlerin uçtan uca ince ayarı (öğrenme oranı = 0.001, parti büyüklüğü = 64, dönem = 100). Yaklaşım, özellik öğrenimini stabilize eder ve optimizasyon sırasında modüller arasındaki paraziti azaltır.
Genel olarak, önerilen akıllı sınıf davranışı tanıma yöntemi, öz dikkat ve çapraz'ler yoluyla uzay-zamansal ilişkileri modellemek için video ve iskelet modalitelerini birleştirir. ViT'in küresel uzay-zamansal modelleme yeteneğini kullanarak ve uzamsal ve TA modüllerini birleştirerek, model, temel davranışları ve zamansal dinamikleri yakalamak için optimize edilmiştir ve daha kapsamlı ve doğru öğrenci davranışı tanıma elde edilir. Çok modlu özellik temsillerinin birleştirildiği kritik füzyon işlemleri, söz konusu mimaride gerçekleştirilir. Spesifik olarak, CNN tarafından öğrenilen uzamsal özellikler, Bi-LSTM'nin zamansal özelliklerine bağlıdır. Bu çıktı daha sonra sınıflandırma görevinden önce MHAM'ın dikkat artırılmış özellikleriyle birleştirilir. Bu füzyon işlemleri, davranışsal verilerin tamamlayıcı görünümlerinin füzyonu için çok önemlidir ve Şekil 1 ve Şekil 5'te vurgulanmıştır.
Algoritma 1, bir sınıftaki bilgilendirici özellikleri ayıklamak için ViT, BERT ve GCN tabanlı modelleri kullanarak birleştirilmiş çok modlu verileri, iskelet, metin ve video bilgilerini gösterir. Ortak temsil daha sonra, çapraz modal öğrenme kullanılarak daha yüksek doğrulukla öğrenci davranışını tanımlamak için işaretlenir.
Algoritma 1: ViT, BERT ve GCN kullanarak çok modlu davranış tanıma süreci.
Başlatmak:
Önceden eğitilmiş BERT modeli
Önceden eğitilmiş Daha Hızlı R-CNN modeli
Önceden eğitilmiş ViT modeli
İskelet verileri için GCN modeli
Sınıflandırıcı (örneğin, MLP veya transformatör)
Veri kümesini yükle:
Çok modlu veri kümesindeki her örnek için:
Video karelerini ayıkla
Ses transkriptini ayıkla
İskelet verilerini ayıklayın (OpenPose veya MediaPipe)
1. Adım: Video modalite işleme
Videodaki her kare için:
Nesneleri/katılımcıları algılamak için Daha Hızlı R-CNN uygulayın
Çerçeve düzeyinde özellikleri çıkarmak için Vision Transformer (ViT) uygulayın
Zamansal gösterim için zaman içinde özellikleri toplama
Adım 2: Metin modalitesi işleme
Ön işlem transkript metni:
BERT tokenizer kullanarak tokenize edin
Jetonları BERT modelinden geçirin
[CLS] belirtecinden veya ortalama havuzlamadan bağlamsal eklemeleri ayıklayın
Adım 3: İskelet modalitesi işleme
Her iskelet dizisi için:
Koordinatları normalleştir
Hareket özelliklerini çıkarmak için GCN veya ST-GCN'den geçin
4. Adım: Özellik füzyonu
Birleştir veya dikkat sigortası:
Video özellikleri
Metin özellikleri
İskelet özellikleri
Birleşik bir çok modlu temsil elde edin
Adım 5: Sınıflandırma
Birleştirilmiş gösterimi son sınıflandırıcıya geçirin
Sınıf davranış etiketini tahmin edin (örneğin, dikkatli, dikkati dağılmış)
6. Adım: Değerlendirme
Tahminleri temel gerçeklerle karşılaştırın
İşlem ölçümleri: Doğruluk, Kesinlik, Geri Çağırma, F1 Puanı