Araştırma makalesi

Dönüştürücü ve Dikkat Mekanizması ile Sınıf Davranışı Tanıma: Yapay Zeka Tıp Eğitimi için Öğretim Kalite Değerlendirmesinde Uygulama

DOI:

10.3791/69052

15 Ağustos 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, tıp ve hemşirelik eğitiminde sınıf davranışını tanımak için Transformer tabanlı bir yapay zeka sistemi sunmaktadır. Sistem, çok modlu verileri kullanarak öğrenci katılımını ve duygusal durumlarını değerlendirir. Sonuçlar, geleneksel modellere kıyasla daha yüksek doğruluk göstererek gerçek zamanlı geri bildirim ve öğretim kalitesi ve öğrenci ruh sağlığı için gelişmiş destek sağlar.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, tıp ve hemşirelik eğitiminde öğretim kalitesi değerlendirmesini ve ruh sağlığı izlemesini geliştirmeyi amaçlayan, sınıf davranışının tanınması için tasarlanmış Transformer tabanlı bir yapay zeka sistemini tanıtmaktadır. Model, dikkat süresi, etkileşim sıklığı ve duygusal dalgalanmalar gibi öğrenci katılımının temel göstergelerini değerlendirmek için özellikle video, ses ve iskelet hareketi olmak üzere çok modlu verileri kullanır. Uzay-zamansal dikkat mekanizmalarıyla birleştirilen yeni bir çok modlu füzyon stratejisi, sistemin karmaşık sınıf davranışlarını gelişmiş hassasiyet ve sağlamlıkla yakalamasını sağlar. EduSense ve SBU Kinect veri kümeleri üzerinde elde edilen deneysel sonuçlar, önerilen yöntemin hem doğruluk hem de yanlış alarm oranı açısından geleneksel modellerden önemli ölçüde daha iyi performans gösterdiğini göstermektedir. Ek olarak, ablasyon çalışmaları, uzamsal ve zamansal dikkat modüllerinin sistemin tanıma yeteneğine katkısını doğrulamaktadır. Çerçeve, gerçek zamanlı geri bildirimi ve görsel davranış haritalamasını destekleyerek deneyimsel öğrenme ortamlarında pratik değer sunar. Bu yaklaşım, sınıf davranışının izlenmesi için ölçeklenebilir ve uyarlanabilir bir çözüm sunar ve tıp eğitiminde erken müdahale stratejilerini destekler.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Akademik ve klinik stres nedeniyle hemşirelik ve tıp öğrencileri arasında artan ruh sağlığı sorunlarıyla birlikte, yapay zekayı sınıf ortamlarına entegre etmek, yalnızca öğretim kalitesi izlemesi değil, aynı zamanda gerçek zamanlı psikolojik destek de sağlayabilir. Bu çalışma, deneyimsel öğrenmeyi desteklemek ve öğrenci refahını teşvik etmek için tıp eğitiminde davranış tanımayı konumlandırmaktadır1. Akıllı sınıf, öğretim yönetimine ve sınıf etkileşimine yardımcı olmak için bilgi teknolojisi, yapay zeka, büyük veri ve Nesnelerin İnterneti gibi en son teknolojilerin uygulanması yoluyla akıllı ve kişiselleştirilmiş öğretim süreçlerini birleştiren yeni ve yüksek kaliteli bir eğitim modelini ifade eder 2,3,4. Şu anda, kameralar ve sensörler gibi teknolojilerin gelişmesiyle birlikte, sınıfta toplanan davranışsal veriler sadece videoları değil, aynı zamanda ses ve ses gibi çok modlu verileri de içermektedir5. Bununla birlikte, bu karmaşık uzay-zamansal bilgi ve verileri ele almak ve bunlardan değerli davranışsal özellikleri doğru bir şekilde çıkarmak, akıllı sınıf davranışı tanıma alanının karşılaştığı temel zorluklardır 6,7. Mevcut davranış tanıma yaklaşımları, öncelikle sınıf video akışları veya sıralı görüntüler gibi tek modlu veri kaynaklarından özellik çıkarımına dayanır8. Bu yöntemler kaba davranışsal olayları tespit edebilse de, genellikle öğrencilerin jestlerinin, ifadelerinin veya etkileşimin zamansal evrimini ve uzamsal nüanslarını modellemede başarısız olurlar ve öğrencinin refahını ve odaklanmayı anlamak için kritik olan etkileşim sıklığı faktörleri9. Ayrıca, mevcut modeller, işitsel ipuçları ve iskelet hareketi gibi heterojen veri kaynaklarını kaynaştırmak için sağlam mekanizmalardan yoksundur, bu da duygusal veya ilgisiz davranışlara karşı duyarlılıklarını sınırlar10. Bu sınırlılıkları ele almak için bu çalışma, mekansal-zamansal dikkat mekanizmaları ile geliştirilmiş, dönüştürücü tabanlı bir sınıf davranışı tanıma sistemi önermektedir. Önerilen sistem, Transformer'ın uzun vadeli bağımlılıkları modelleme yeteneğinden yararlanarak ve bunu çok modlu özellik füzyon stratejileriyle birleştirerek, katılım ve duygusal göstergelerin gerçek zamanlı görselleştirilmesini sağlarken davranış sınıflandırmasının hassasiyetini artırmayı amaçlıyor. Nihai hedef, dinamik öğretim kalitesi değerlendirmesini ve tıp eğitimine gömülü ruh sağlığı geri bildirimini destekleyerek hem öğretim etkinliğini hem de öğrenci refahını izlemek ve geliştirmek için ölçeklenebilir, uyarlanabilir bir çözüm sunmaktır.

Değerlendirme, tıp ve hemşirelik eğitiminde akıllı sınıf gözlemi için uyarlanmış uzay-zamansal dikkat mekanizmalarını çok modlu veri füzyonu (video ve iskelet girdileri) ile birleştiren yeni bir Transformer tabanlı davranış tanıma sistemi önermektedir. Mevcut modellerin aksine, yeni model, hem öğretim kalitesi değerlendirmesi hem de psikolojik iyi oluş için değerli olan doğru, gerçek zamanlı öğrenci dikkatini ve duygusal durum tespitini kolaylaştırır.

İlgili işler
Akıllı sınıf, öğretim etkileşimini, kişiselleştirilmiş öğrenmeyi ve öğretim yönetimini geliştirmek için modern bilgi teknolojisini kullanan yeni bir öğretim ortamıdır. Öğrencilere daha zengin ve daha kişiselleştirilmiş öğrenme deneyimleri sağlarken öğretim verimliliğini ve kalitesini artırmak için akıllı öğretim yöntemlerini kullanabilir. Bu nedenle, dünya çapında birçok bilim adamı akıllı teknoloji ve sınıf öğretimi üzerine araştırmalar yapmıştır. Radosavljevic ve arkadaşları, öğrenme sonuçlarını optimize etmek için öğrencilerin yorgunluk düzeylerini değerlendiren ve günlük akademik aktivite verilerini analiz ederek öğrenme stratejilerini ayarlayan çevresel zekaya dayalı akıllı bir sınıf modeli önermişlerdir11. Tai T. Y, akıllı kişisel asistanların yabancı dil konuşma becerisini geliştirmedeki etkisini inceledi ve Google Asistan'ı kullanmanın, ana dili İngilizce olmayanların konuşma yeteneğini önemli ölçüde geliştirdiğini ve iletişimde anadili İngilizce olan kişilerle benzer etkilere sahip olduğunu buldu12. Chen ve arkadaşları yaptıkları araştırmalarda, sohbet robotlarını öğretim araçları olarak kullanmanın öğrenci ihtiyaçlarına hızlı bir şekilde yanıt verebileceğini, etkileşimi artırabileceğini ve akıllı teknolojinin sınıfta potansiyel uygulamasını gösterebileceğini buldular13. Araştırma, guguk kuşu arama algoritması ve aşırı öğrenme makinesini kullanarak değerlendirmenin doğruluğunu artıran akıllı öğretim moduna dayalı bir sınıf öğretimi etkinliği değerlendirme yöntemini gündeme getirdi14.

Akıllı sınıflarda davranış tanıma, kişiselleştirilmiş öğretimi başarmak ve sınıf yönetimini optimize etmek için önemli bir teknolojidir. Öğrencilerin davranış durumlarını gerçek zamanlı olarak izleyebilir ve etkili geri bildirim sağlayabilir. Davranış tanıma yoluyla, öğretmenler öğrencilerin katılımını ve odaklanmasını doğru bir şekilde anlayabilir, böylece öğretim etkinliğini artırabilir ve karar vermeye yardımcı olabilir. Bu bağlamda, dünya çapındaki bilim adamları, akıllı sınıf davranışının tanınması konusunda kapsamlı araştırmalar yaptılar. Araştırma, öğretmenlerin öğrenci katılımını ve sınıf etkileşimini daha iyi izlemelerine yardımcı olmak için öğrenci davranış tanıma modellerini eğitmek için makine öğrenimini kullanan ve böylece öğretim kalitesini optimize eden yapay zekaya dayalı gerçek zamanlı bir görsel izleme sistemi önerdi15. Chonggao P, kümeleme analizi ve rastgele orman algoritmasının yanı sıra insan iskeleti modelini16 birleştirerek gerçek zamanlı öğrenci davranışı tanıma elde etti ve uzaktan öğretimde sınıf davranış analizinin doğruluğunu geliştirdi. Wu S, parçacık sürüsü optimizasyonunu ve K-en yakın komşu algoritmasını birleştiren, sınıf öğretiminin pratik ihtiyaçlarını karşılamak için duygu tanımanın doğruluğunu destekleyen bir öğrenci davranış tanıma modeli geliştirdi17. Ramakrishnan ve arkadaşları tarafından önerilen ACORN sistemi, ses, yüz ifadeleri ve görüntü verilerini analiz etmek için çok modlu makine öğrenimi ve birleşik evrişimli sinir ağlarını kullandı. Bu özelliklerin zamansal evrişimli ağlar aracılığıyla entegre edilmesi, sınıf atmosferinin otomatik olarak değerlendirilmesini sağladı ve ön ilerleme kaydetti18.

Özetle, mevcut araştırmalar, öğrenci yorgunluğu tespiti, duygu analizi ve sınıf etkileşimi izleme gibi alanları kapsayan akıllı sınıf davranışı tanıma için çeşitli makine öğrenimi ve derin öğrenme tabanlı teknikler önermiştir. Bununla birlikte, mevcut araştırmalarda hala bazı eksiklikler vardır ve birçok yöntem pratik uygulamalarda yeterli gerçek zamanlı ve ölçeklenebilirlikten yoksundur, bu da karmaşık ve değişen sınıf senaryolarına uyum sağlamayı zorlaştırmaktadır. Bu nedenle çalışma, Transformer ve ile akıllı bir sınıf davranışı tanıma yöntemi önermektedir. Araştırmanın yeniliği, sınıftaki önemli davranışsal anları ve bölgeleri doğru bir şekilde yakalamak için uzay-zamansal ile birlikte Transformer'ın güçlü zamansal modelleme yeteneğinin kullanılmasında ve davranış tanımanın kapsamlılığını ve doğruluğunu artırmak için çok modlu veri füzyonu yoluyla video ve ses gibi birden fazla bilgi kaynağını entegre etmede yatmaktadır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, kişisel olarak tanımlanabilir herhangi bir bilgi içermeyen halka açık veri kümelerini kullanmaktadır. Araştırmada kullanılan tüm veriler, katılımcıların mahremiyetini sağlamak için anonim hale getirilmiştir. Veri toplama sırasında tüm katılımcılardan bilgilendirilmiş onam alınmıştır ve çalışma etik kurallara uygundur. Protokol, çok modlu veri füzyonuna dayalı özellik çıkarma ve Transformer ve dikkat üzerine dayalı uzay-zamansal davranış tanımadan oluşan akıllı sınıf davranış tanıma yöntemini açıklar. Tüm yöntemin performansı, ortak eğitim yoluyla optimize edilir.

1. Çok modelli veri toplama

Çok Modlu Veri Toplama, iki veri kümesinden senkronize sınıf davranışı verilerinin toplanmasını içeriyordu: EduSense Veri Kümesi ve SBU Kinect Etkileşim Veri Kümesi. EduSense, gerçek hayattaki üniversite sınıfı kayıtlarını kaydetti ve SBU Kinect etkileşime dayalı iskelet dizilerini kaydetti. Veri kümeleri, öğrenci duruşlarını ve hareketlerini modellemek için video akışları, ses ipuçları ve 3B iskelet eklemi bilgileri içeriyordu. Veri ön işleme, temizlik için garantili zamansal hizalama ve gürültü giderme. Bu yakınsama, birçok öğrenme durumunda uçtan uca davranış izleme, görsel hareketlerin ve vücut hareketlerinin kaydedilmesini sağladı.

2. Multimodal veri füzyonuna dayalı özellik çıkarma

Akıllı sınıflarda öğrenci davranışının tanınması konusunu hedef alarak, Transformer ve ile akıllı sınıf davranışı tanıma için bir yöntem önerilmiştir. Çok sayıda öğrencinin bulunduğu sınıfların karmaşık doğası nedeniyle, sahnedeki faktörlerdeki değişiklikler öğrenci davranışlarının tanınmasını engelleyebilir. Ek olarak, tek özellik çıkarımının eksik bilgi, çevresel müdahaleye yatkınlık ve karmaşık davranışları yakalamada zorluk gibi sınırlamaları vardır 19,20. Bu nedenle, çalışma ilk olarak çok modlu veri füzyonuna dayalı bir öğrenci sınıf özelliği çıkarım yöntemi önermektedir. Bu yöntem, video ve iskelet modalitelerinden elde edilen verileri birleştirerek, öğrenci davranışının daha kapsamlı ve doğru özellik çıkarımını elde etmek için tamamlayıcılıklarını kullanır. Özellikle, her giriş video dizisi kare olarak bölünür. Çerçeveler, insanların ilgilendiği bölgeleri yerelleştirmek için önceden eğitilmiş daha hızlı bir R-CNN'ye beslenir. Tespit edilen bölgeler, zamansal görsel özellikler elde etmek için evrişimli bir sinir ağı omurgasına beslenir. İskelet modalitesi için, 3B eklem pozisyonları diziler olarak pozlandırılır ve zamansal ve uzamsal bağımlılıklar elde etmek için önceden eğitilmiş bir BERT modeli kullanılarak kodlanır. Bunlar, multimodal füzyon ağına girilmeden önce normalleştirilir ve gömülür. Bunlar arasında, video modalitesi esas olarak öğrencilerin hareketleri ve ifadeleri gibi görsel özellikleri yakalamaktan sorumluyken, iskelet modalitesi eklem noktası bilgileri aracılığıyla öğrencilerin duruş değişikliklerini doğru bir şekilde tanımlar. Video modalitesi görsel algının küresel özelliklerine dayanırken, iskelet modalitesi insan davranışını temsil etmek için küresel görsel özelliklere dayanırken, iskelet modalitesi eklem pozisyonundaki dinamik değişikliklere odaklanır ve bu da ikisi arasında önemli anlamsal farklılıklara yol açar21. Bu nedenle, iki modalite arasındaki korelasyonu etkili bir şekilde modellemek için özel bir multimodal füzyon ağı geliştirmek gereklidir. Multimodal füzyon ağı Şekil 1'de gösterilmektedir.

Şekil 1'de, ağ temel olarak üç modüle ayrılmıştır. Bunlar arasında, video modalite işleme modülünün girişi, özellik çıkarma için Daha Hızlı Bölge Tabanlı Evrişimli Sinir Ağı (Daha Hızlı R-CNN) aracılığıyla çıkarılan bir video dizisidir. Video modalitesinin işlenmesi, sınıf video çekimlerinin özellik çıkarma için kare kare girişlere çevrilmesiyle başlar. Çerçeveler, ImageNet üzerinde eğitilmiş bir ResNet-50 tabanına sahip Daha Hızlı Bölge Tabanlı Evrişimli Sinir Ağı (Daha Hızlı R-CNN) ile işlenir. Ağ, 224 × 224 piksele yeniden boyutlandırılan RGB çerçevelerini işleyerek, öğrenci etkinliğinin uzamsal ve nesneye özgü özelliklerine sahip üst düzey görsel özellik haritaları sağlar. Bu özellikler daha sonra, bir Transformer katmanı aracılığıyla uzay-zamansal gömmelere kodlamadan önce çerçeveler arasındaki zamansal ilişkileri öğrenen bir kendi kendine dikkat modülüne girilir. Bu, daha sonraki füzyon için temsilleri gömerken baş eğmeleri veya el kaldırmaları gibi zayıf davranışsal sinyalleri korur. Çıkarılan video özellikleri, video modalitesi içindeki zamansal ve uzamsal ilişkileri yakalamak için kendi kendine dikkat modülü tarafından yakalanır ve daha sonra video dizisinin uzay-zamansal bilgileri için gömme vektörleri oluşturmak üzere bir transformatör tarafından daha fazla modellenir. İskelet modalitesi işleme modülünün girişi, iskelet eklemlerinin zamansal ve uzamsal özelliklerini çıkarmak için Transformatörlerden Çift Yönlü Kodlayıcı Temsili (BERT) tarafından işlenen bir iskelet dizisidir. İskelet verileri için, her öğrencinin pozu, OpenPose tabanlı bir poz tahmincisi kullanılarak sınıf videolarından 2B birleşik koordinatlar dizisi olarak modellenir. Bu diziler, her belirtecin 18 anahtar noktaya sahip bir kareye karşılık geldiği gömme belirteçlerine dönüştürülür. Bu eklem dizilerinin zamansal bağlamı ve bağımlılıkları, Transformatörlerden Çift Yönlü Kodlayıcı Temsilleri (BERT) modeli kullanılarak modellenmiştir. Model, 12 transformatör katmanı, 8 dikkat kafası ve standart BERT tabanlı mimari olan gizli bir 768 boyutu kullanır. Model, davranışa özgü eklem kalıpları elde etmek için eğitim sırasında ince ayar yapılır. Çıktı yerleştirmeleri, daha sonra video modalite özellikleriyle birleştirilen öğrenci davranışının yapısal ve hareketle ilgili özelliklerini temsil eder. Daha sonra, iskelet özellikleri, 3D CNN ve havuzlama işlemleri yoluyla uzamsal ve zamansal özellikler halinde daha da toplanır ve iskelet modalitesinin özellik temsilleri olarak iskeletin gömülü vektörleri oluşturulur.

3. Çapraz dikkat füzyon modülü

Çapraz dikkat füzyon modülünde, çalışma, video modalitesi ve iskelet modalitesi arasındaki etkileşim ilişkisini oluşturmak için çok başlı dikkat mekanizmasını (MHAM) kullanır ve oluşturulan multimodal füzyon özelliklerinden 3D CNN ve havuzlama işlemleri aracılığıyla daha kompakt füzyon özelliklerini daha da çıkarır. Füzyon işlemi, her modalitenin zamansal gömmelerinin 3D CNN'ler ve çift yönlü GRU'lar aracılığıyla geçirildiği iki akışlı bir dikkat ağı kullanılarak gerçekleştirilir. Çok modlu veri akışları, modaliteler arası bağımlılıklar elde etmek için ölçeklendirilmiş nokta ürün dikkati ile Çok Başlı Dikkat Modülleri (MHAM) kullanılarak hizalanır. Yerleştirmeler daha sonra boyutsal karmaşıklığın üstesinden gelmek için bir havuzda toplanır ve sınıflandırma için tamamen bağlı bir Softmax katmanına gönderilir.

Çok modlu füzyon ağlarında, kendi kendine dikkat modülü, tek bir mod içindeki zamansal ve mekansal bağımlılığı modellemek için kullanılırken, çapraz dikkat füzyon modülü, farklı modlar arasındaki ilişkiyi ve bilgi etkileşimini kurmak için kullanılır. Bu nedenle her ikisi de çok önemlidir. Kendi kendine dikkat modülü, Q sorgusu, K anahtarı ve V değeri arasındaki ilişkiyi hesaplayarak giriş dizisinin iç bağımlılıklarını yakalar. Q, K anahtarı ve V değerinin hesaplanması denklem (1)'de gösterilmiştir. Burada figure-protocol-1 sırasıyla sorgu, anahtar ve değer matrisleri; dk anahtar vektör boyutluluğudur ve dk değer vektörlerinin boyutluluğudur. Boyut faktörü dk, eğitim sırasında gradyanların stabilitesini etkileyecek olan nokta ürünlerinin büyümesini önlemek için benimsenmiştir.

figure-protocol-2(1)

Denklem (1)' figure-protocol-3 de, giriş özelliklerini temsil eder, burada n giriş dizisinin uzunluğudur, dmodeli özelliklerin boyutudur ve WQ, WK ve WV üç öğrenilebilir projeksiyon matrisi kümesini temsil eder. Bu matris eşlemeleri aracılığıyla giriş özellikleri sorgulara, anahtarlara ve değerlere dönüştürülür. Q sorgusunun nokta çarpımı ve K anahtarı, denklem (2)'de gösterildiği gibi dikkat ağırlıklarını hesaplamak ve ölçeklendirmek için kullanılır.

figure-protocol-4(2)

Denklem (2)'de, dk, Q ve anahtar K sorgulama boyutunu temsil eder ve softmax, dikkat ağırlığı matrisini elde etmek için kullanılan softmax fonksiyonunu gösterir. Ölçeklendirme, boyutluluğun neden olduğu aşırı nokta ürün değerleri nedeniyle gradyanın çok küçük olması sorununu etkili bir şekilde önleyebilir. Dikkat ağırlığı matrisi, denklem (3)'te gösterildiği gibi, öz dikkat modülünün Z çıktısını elde etmek için V değerine uygulanır.

figure-protocol-5(3)

Denklem (3)'te, birij, i inci sorgu vektörünün j inci anahtar vektörü üzerindeki dikkat ağırlığı anlamına gelir. Çapraz dikkat füzyon modülünün spesifik yapısı Şekil 2'de belirtilmiştir.

Şekil 2'den, bu modül esas olarak iskelet ve video modalitelerinden giriş özelliklerini işlemeye başlar. İlk olarak, iskelet dizisi ve video dizisi, uzay-zamansal özellikleri çıkarmak için ayrı ayrı 3B evrişimli katmanlara tabi tutulur ve daha sonra bu uzay-zamansal özellikler, zamansal modelleme için Çift Yönlü Kapılı Tekrarlayan Birimler (Bi-GRU'lar) kullanılarak modellenir. Daha sonra, iki modalitenin özellikleri, modaliteler içindeki korelasyonları çıkarmak için MHAM'lar aracılığıyla daha fazla çıkarılır. Her modalite, sorgular, anahtarlar ve değerler mekanizmaları aracılığıyla dahili olarak özellik temsili elde eder. Ardından, zaman boyutunun karmaşıklığını azaltmak için çıktı özellikleri üzerinde zaman ortalaması havuzlama gerçekleştirilir. Havuzlamadan sonra, multimodal özellikler, her bir modalitenin ortalama ve standart sapmasını hesaplamak için istatistiksel olarak bir havuzda toplanır ve son olarak tam bağlı bir katman (FCL) ve Softmax sınıflandırıcı aracılığıyla öğrencinin eylem tanıma ve sınıflandırmasını çıkarır. Bu nedenle, çalışmada önerilen çok modlu veri füzyonuna dayalı özellik çıkarımı, video ve iskelet modalitelerinden gelen verileri birleştirerek öğrenci davranışının uzay-zamansal özelliklerini doğru bir şekilde yakalamak ve modellemek için kendi kendine dikkat ve çapraz'leri kullanır, böylece akıllı sınıflarda öğrenci davranışı tanımanın doğruluğunu ve kapsamlılığını geliştirir.

4. Transformatör ve dikkati temel alan uzay-zamansal davranış tanıma

Çok modlu veri füzyonuna dayalı özellik çıkarımı, video ve iskelet modalitelerinden gelen verileri birleştirerek öğrenci davranışının kapsamlılığında ve doğruluğunda bir ön iyileştirme sağlar. Bununla birlikte, akıllı sınıflar bağlamında, öğrencilerin davranışları genellikle zaman içinde değişir ve aynı davranış farklı zaman noktalarında ve mekansal bölgelerde farklı özellikler gösterebilir. Yalnızca çok modlu özelliklerden kaynaşmış statik bilgilere güvenmek, davranış dizisi22,23'teki karmaşık uzay-zamansal dinamik ilişkileri tam olarak yakalayamaz. Bu nedenle, daha fazla araştırma, Transformer'a dayalı bir uzay-zamansal davranış modellemesi ve önermektedir. Çalışma, ağ mimarisi olarak, kendi kendine aracılığıyla girdinin küresel uzay-zamansal bilgilerini modelleyebilen ve uzay-zamansal bağımlılıkları yakalama konusunda daha güçlü bir yeteneğe sahip olan Vision Transformer'ı (ViT) seçti. Multimodal füzyonu takiben, kaynaşmış özellikler, uzay-zamansal davranışı tahmin etmek için bir Görüş Transformatörü (ViT) kullanılarak tekrar temsil edilir. Girişteki özellik haritaları, ayrık 16 × 16 yamaya bölünür, tek boyutlu vektörlere doğrusal olarak gömülür ve uzamsal düzeni korumak için konumsal olarak kodlanır. ViT yapısı, çok kafalı kendi kendine dikkat (8 kafa) ve gizli boyutu 768 olan ileri besleme katmanlarından oluşan 12 Trafo kodlayıcı bloğuna sahiptir. Davranışsal belirginliği artırmak için Uzamsal Dikkat (SA) ve Zamansal Dikkat (TA) modülleri önerilmektedir. SA modülü, Tanh aktivasyonu yoluyla uzamsal alanlarda özellik alaka düzeyini teşvik ederken, TA modülü ReLU aktivasyonu yoluyla önemli zamansal çerçeveleri vurgular. Bu iki dikkat akışı daha sonra iki aşamalı bir eğitim yöntemi aracılığıyla ViT omurgası ile birleştirilir, böylece model sınıf davranışının dinamik evrimini verimli bir şekilde yakalamayı öğrenir. ViT'nin yapısı Şekil 3'te gösterilmiştir.

Şekil 3'te, ViT'de orijinal girdi, her biri görüntünün bir parçası olarak temsil edilen ve tek boyutlu bir vektöre doğrusal olarak düzleştirilen birden çok sabit boyutlu küçük bloğa bölünmüş bir görüntüdür. Transformatör konum bilgisini algılayamadığından, her küçük blok, farklı küçük bloklar arasındaki göreceli uzamsal konum ilişkisini yakalayabilmesini sağlamak için Transformatöre girilmeden önce konum bilgileriyle gömülür. ViT'nin çekirdek modülü, birden fazla yığılmış Transformatör kodlama bloğundan oluşan Transformatör kodlayıcıdır. Kodlama blokları, bir MHAM ve bir ileri beslemeli sinir ağından oluşur. MHAM, giriş dizileri arasındaki bağımlılıkları paralel olarak yakalarken, ileri beslemeli sinir ağı, modelin küresel bilgileri yakalama ve ifade etme yeteneğini geliştirmek için sonuçlar üzerinde doğrusal olmayan dönüşümler gerçekleştirir. Transformatör kodlayıcı tüm küçük bilgi parçalarını işledikten sonra, son kodlama katmanının çıktısı, son öğrenci eylemi tanıma ve sınıflandırma sonuçlarını veren Çok Katmanlı Algılayıcı Kafasına (MLP Kafası) iletilir.

Pratik olarak, her çerçeve örtüşmeyen 16 × 16 yamaya bölünür, düzleştirilir ve uzamsal ilişkileri korumak için konumsal olarak gömülür. Yama yerleştirmeleri, ViT mimarisindeki yığılmış transformatör kodlayıcıları tarafından sıralı olarak işlenir. Uzamsal Dikkat (SA) modülü, dikkati her çerçevedeki ilgi alanlarına göre değiştirmek için tanh aktivasyonunu kullanır ve Zamansal Dikkat (TA) modülü, zamansal olarak önemli çerçeveleri vurgulamak için ReLU'yu kullanır. Bu iki dikkat mekanizması, uzay ve zaman davranış dinamiklerinin etkili bir şekilde modellenmesini sağlar.

Karmaşık davranış dizilerinde ViT'nin performansını daha da artırmak için, uzamsal dikkat (SA) ve zamansal dikkat (TA), ViT'nin yalnızca önemli uzamsal eklemleri özerk bir şekilde seçmesini sağlamakla kalmayıp, aynı zamanda farklı zaman noktalarındaki davranışlara odaklanarak davranışın uzay-zamansal dinamik değişikliklerini daha iyi yakalamasını sağlamak için tanıtılmıştır. SA modülü ve TA modülü Şekil 4'te gösterilmiştir.

Şekil 4A'da, SA modülü, gizli durumları çıkarmak için mevcut çerçevenin özelliklerini ViT katmanına geçirerek girdinin uzamsal boyut bilgilerini işler. Bunlar, önceki çerçevenin özellikleriyle birleştirilir ve FCL'ye birlikte beslenir. FCL, gizli özellik temsilleri oluşturmak için özellikler üzerinde doğrusal bir dönüşüm gerçekleştirecektir. Daha sonra, çıktıyı [-1,1] aralığına eşlemek, doğrusal olmayanlığı artırmak ve önemli ve önemsiz özellikler arasında daha iyi ayrım yapmak için Tanh aktivasyon fonksiyonuna geçirilir. Son olarak, çıktı özelliklerinin nispeten kararlı bir ölçeğe sahip olmasını sağlamak için özellikler bir normalleştirme katmanı aracılığıyla normalleştirilir. Şekil 4B'de, TA modülü, zamansal boyuttaki her bir çerçevede yer alan temel bilgilere daha fazla odaklanır. SA'daki Tanh'tan farklı olarak, TA modülü, negatif değerleri bastırmak için ReLU aktivasyon işlevini kullanır ve yalnızca pozitif değerlerin çıktısını korur, negatif gürültü bilgilerini etkili bir şekilde kaldırır ve modelin zamansal yakalama yeteneğini geliştirir.

5. Ortak eğitim yöntemi

Transformatör ve dikkati temel alan uzay-zamansal davranış tanımada ViT, SA modülü ve TA modülü arasındaki karşılıklı etkinin neden olduğu önyargılı ve yedekli uzay-zamansal özellikler sorununu etkin bir şekilde çözmek için, üç modülü optimize etmek için ortak bir eğitim yöntemi benimsenmiştir. Spesifik süreç Şekil 5'te belirtilmiştir.

Şekil 5'te, ortak eğitim stratejisi önce model eğitim parametrelerini girer, ağ yapısını ve hiperparametreleri ayarlar. Daha sonra, yerel özellikleri daha iyi öğrenmek için SA ve TA üzerinde ayrı bir ön eğitim yürütülür. Bir modelin ön eğitimi sırasında diğer modelin ağırlıklarının sabit tutulduğunu ve güncellenmediğini belirtmekte fayda var. Bireysel ön eğitimi tamamladıktan sonra, ViT katmanı eğitim için birleştirilir. Ardından, iki dikkat modeli sabitlenecek ve ana ViT ağı ayrı ayrı eğitilecektir. Son olarak, ana ViT ağı, SA ve TA modüllerini ortaklaşa eğiterek, genel ağ, akıllı sınıf davranışı tanıma için nihai modeli oluşturmak üzere optimize edilir. Eğitim prosedürü adım adım gerçekleştirilir: (1) donmuş ViT parametreleri ile SA ve TA modüllerinin otonom ön eğitimi, (2) donmuş dikkat modülü ağırlıkları ile ViT'nin kademeli eğitimi ve (3) Adam optimizer ile birlikte tüm bileşenlerin uçtan uca ince ayarı (öğrenme oranı = 0.001, parti büyüklüğü = 64, dönem = 100). Yaklaşım, özellik öğrenimini stabilize eder ve optimizasyon sırasında modüller arasındaki paraziti azaltır.

Genel olarak, önerilen akıllı sınıf davranışı tanıma yöntemi, öz dikkat ve çapraz'ler yoluyla uzay-zamansal ilişkileri modellemek için video ve iskelet modalitelerini birleştirir. ViT'in küresel uzay-zamansal modelleme yeteneğini kullanarak ve uzamsal ve TA modüllerini birleştirerek, model, temel davranışları ve zamansal dinamikleri yakalamak için optimize edilmiştir ve daha kapsamlı ve doğru öğrenci davranışı tanıma elde edilir. Çok modlu özellik temsillerinin birleştirildiği kritik füzyon işlemleri, söz konusu mimaride gerçekleştirilir. Spesifik olarak, CNN tarafından öğrenilen uzamsal özellikler, Bi-LSTM'nin zamansal özelliklerine bağlıdır. Bu çıktı daha sonra sınıflandırma görevinden önce MHAM'ın dikkat artırılmış özellikleriyle birleştirilir. Bu füzyon işlemleri, davranışsal verilerin tamamlayıcı görünümlerinin füzyonu için çok önemlidir ve Şekil 1 ve Şekil 5'te vurgulanmıştır.

Algoritma 1, bir sınıftaki bilgilendirici özellikleri ayıklamak için ViT, BERT ve GCN tabanlı modelleri kullanarak birleştirilmiş çok modlu verileri, iskelet, metin ve video bilgilerini gösterir. Ortak temsil daha sonra, çapraz modal öğrenme kullanılarak daha yüksek doğrulukla öğrenci davranışını tanımlamak için işaretlenir.

Algoritma 1: ViT, BERT ve GCN kullanarak çok modlu davranış tanıma süreci.

Başlatmak:

Önceden eğitilmiş BERT modeli

Önceden eğitilmiş Daha Hızlı R-CNN modeli

Önceden eğitilmiş ViT modeli

İskelet verileri için GCN modeli

Sınıflandırıcı (örneğin, MLP veya transformatör)

Veri kümesini yükle:

Çok modlu veri kümesindeki her örnek için:

Video karelerini ayıkla

Ses transkriptini ayıkla

İskelet verilerini ayıklayın (OpenPose veya MediaPipe)

1. Adım: Video modalite işleme

Videodaki her kare için:

Nesneleri/katılımcıları algılamak için Daha Hızlı R-CNN uygulayın

Çerçeve düzeyinde özellikleri çıkarmak için Vision Transformer (ViT) uygulayın

Zamansal gösterim için zaman içinde özellikleri toplama

Adım 2: Metin modalitesi işleme

Ön işlem transkript metni:

BERT tokenizer kullanarak tokenize edin

Jetonları BERT modelinden geçirin

[CLS] belirtecinden veya ortalama havuzlamadan bağlamsal eklemeleri ayıklayın

Adım 3: İskelet modalitesi işleme

Her iskelet dizisi için:

Koordinatları normalleştir

Hareket özelliklerini çıkarmak için GCN veya ST-GCN'den geçin

4. Adım: Özellik füzyonu

Birleştir veya dikkat sigortası:

Video özellikleri

Metin özellikleri

İskelet özellikleri

Birleşik bir çok modlu temsil elde edin

Adım 5: Sınıflandırma

Birleştirilmiş gösterimi son sınıflandırıcıya geçirin

Sınıf davranış etiketini tahmin edin (örneğin, dikkatli, dikkati dağılmış)

6. Adım: Değerlendirme

Tahminleri temel gerçeklerle karşılaştırın

İşlem ölçümleri: Doğruluk, Kesinlik, Geri Çağırma, F1 Puanı

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Transformer ve ile yükseltilmiş akıllı sınıf davranış tanıma yönteminin etkililiğini ve üstünlüğünü değerlendirmek için deneysel performans doğrulaması ve analizi yapılmıştır. İlk olarak, deney ortamı ve parametreler Tablo 1'de gösterildiği gibi yapılandırılmıştır.

Tablo 1'e dayanarak, çalışma EduSense Veri Kümesi ve SBU Kinect Etkileşim Veri Kümesi'ni sırasıyla D1 ve D2 olarak adlandırılan deneysel veri kümeleri olarak seçti. D1 üniversite sınıflarında öğrenc...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Karmaşık öğrenci davranışı ve çok modlu veri tanımanın zorluklarını ele almak için Transformer ve'ye dayalı akıllı sınıflar için bir davranış tanıma yöntemi önerildi. Video ve iskelet modalitelerinden gelen veriler entegre edilerek küresel uzay-zamansal modelleme yeteneğine sahip bir ViT ağı oluşturuldu ve davranışın uzay-zamansal özelliklerini yakalamak için kendi kendine dikkat ve çapraz'ler kullanıldı. Değerlendirme, video ve ses verilerini bir Multimodal Çerçeve Transformatörü (MFT) ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların ifşa edecek hiçbir şeyi yok.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hiç kimse.

YAZAR KATKISI:
Liu Lei: Araştırmanın tasarlanması ve tasarımından sorumlu; akıllı sınıf davranışının tanınması için Transformer tabanlı çok modlu veri füzyon yöntemini önerdi. Modelin ve deneysel tasarımın geliştirilmesine öncülük etti, veri toplama ve işlemeyi yönetti ve ilk el yazmasını hazırladı. Deneysel sonuçların analizine ve tartışılmasına katkıda bulundu.

He Zhihua: Çalışmanın genel rehberliğini ve denetimini sağladı; araştırma çerçevesine ve metodolojik desteğe katkıda bulundu. Model optimizasyonu ve deneysel analize katıldı, makaleyi gözden geçirdi ve revize etti, etik standartlara uygunluğu sağladı ve gönderim için nihai onayı verdi. Yazışmalardan sorumlu.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
128 GB DDR4 Veri deposuBirden çok satıcıhttps://www.crucial.com/memory/ddr4Çok modlu veri işleme için yeterli bellek
2 TB SSD DepolamaBirden çok satıcıhttps://www.samsung.com/ssdVeri kümelerini ve modelleri depolamak için
BERT (Temel yapılandırma)Sarılan Yüzhttps://huggingface.co/bert-base-uncasedİskelet dizisi gömme için dil modeli
CUDA 11.1 Araç KitiNVIDIAhttps://developer.nvidia.com/cuda-toolkitPyTorch için GPU hızlandırmayı etkinleştirir
cuDNN 8.0 KitaplığıNVIDIAhttps://developer.nvidia.com/cudnnDerin sinir ağları için GPU hızlandırmalı kitaplık
EduSense Veri KümesiCarnegie Mellon Universityhttps://www.cs.cmu.edu/~./edusenseGerçek hayattan üniversite sınıfı veri kümesi
Daha hızlı R-CNN (ResNet-50)Açık Kaynak (PyTorch)https://github.com/facebookresearch/detectron2Video özelliği ayıklamak için kullanılan nesne dedektörü
Intel Xeon E5-2680 v4 CPUIntelhttps://www.intel.com/products/xeon-e5-2680-v4Model eğitimi için yüksek performanslı işlemci
MatplotlibAçık Kaynakhttps://matplotlib.org Performans metriklerini
NVIDIA Tesla V100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100Eğitim ve çıkarım için kullanılır; Gerçek zamanlı davranış tanımayı destekler
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeVideo karelerinden 2B iskelet anahtar noktalarını çıkarır
PyTorch 1.8 ÇerçevesiAçık Kaynakhttps://www.pytorch.orgDerin öğrenme kitaplığı için kullanılır model geliştirme
SBU Kinect Etkileşim Veri KümesiStony Brook Üniversitesihttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectEtkileşim tabanlı iskelet veri kümesi
TensorBoardAçık Kaynak (Google)https://www.tensorflow.org/tensorboardEğitim görselleştirmesi için kullanılır
Ubuntu 20.04 LTS İşletim SistemiKanonikhttps://www.ubuntu.com/downloadGeliştirme ortamı olarak kullanılan Linux işletim sistemi
Vision Transformer (ViT)Google / Hugging Facehttps://huggingface.co/google/vit-base-patch16-224Küresel uzay-zamansal davranış modellemesi için kullanılır
, çizmek için kullanılır

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Transformer Modeliok Modlu F zyonUzay Zamansal Dikkatrenci Kat l mGer ek Zamanl Geri BildirimDavran Haritalama
Video yakında

İlgili makaleler