מאמר מחקר

זיהוי התנהגות בכיתה באמצעות שנאי ומנגנון קשב: יישום בהערכת איכות הוראה לחינוך רפואי בינה מלאכותית

DOI:

10.3791/69052

15 באוגוסט 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג מערכת בינה מלאכותית מבוססת רובוטריקים לזיהוי התנהגות בכיתה בחינוך רפואי וסיעודי. באמצעות נתונים רב-מודאליים, המערכת מעריכה את מעורבות הלומד ומצבים רגשיים. התוצאות מדגימות דיוק גבוה יותר בהשוואה למודלים מסורתיים, מה שמאפשר משוב בזמן אמת ותמיכה משופרת באיכות ההוראה ובבריאות הנפשית של התלמידים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג מערכת בינה מלאכותית מבוססת רובוטריקים המיועדת לזיהוי התנהגות בכיתה, שמטרתה לשפר את הערכת איכות ההוראה וניטור בריאות הנפש בחינוך לרפואה וסיעוד. המודל משתמש בנתונים רב-מודאליים, במיוחד וידאו, אודיו ותנועת שלד, כדי להעריך אינדיקטורים מרכזיים למעורבות התלמידים, כגון טווח קשב, תדירות אינטראקציה ותנודות רגשיות. אסטרטגיית היתוך רב-מודאלית חדשה, בשילוב עם מנגנוני קשב מרחביים-זמניים, מאפשרת למערכת ללכוד התנהגויות מורכבות בכיתה עם דיוק וחוסן משופרים. תוצאות ניסוי על מערכי הנתונים של EduSense ו-SBU Kinect מדגימות כי השיטה המוצעת עולה משמעותית על המודלים המסורתיים הן ברמת הדיוק והן בשיעור אזעקות השווא. בנוסף, מחקרי אבלציה מאשרים את תרומתם של מודולי קשב מרחבי וזמני ליכולת הזיהוי של המערכת. המסגרת תומכת במשוב בזמן אמת ומיפוי התנהגות חזותי, ומציעה ערך מעשי בסביבות למידה חווייתיות. גישה זו מספקת פתרון מדרגי ואדפטיבי לניטור התנהגות בכיתה ותומכת באסטרטגיות התערבות מוקדמת בחינוך רפואי.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עם אתגרי בריאות הנפש ההולכים וגדלים בקרב סטודנטים לסיעוד ורפואה עקב לחץ אקדמי וקליני, שילוב בינה מלאכותית בסביבות הכיתה יכול לספק לא רק ניטור איכות ההוראה אלא גם תמיכה פסיכולוגית בזמן אמת. מחקר זה מציב זיהוי התנהגותי בחינוך הרפואי כדי לתמוך בלמידה חווייתית ולקדם את רווחת התלמידים1. כיתה חכמה מתייחסת למודל חינוכי חדש ואיכותי המשלב תהליכי הוראה חכמים ומותאמים אישית באמצעות יישום טכנולוגיות מתקדמות, כגון טכנולוגיית מידע, בינה מלאכותית, ביג דאטה והאינטרנט של הדברים, כדי לסייע בניהול הוראה ואינטראקציה בכיתה 2,3,4. נכון לעכשיו, עם התפתחות טכנולוגיות כמו מצלמות וחיישנים, הנתונים ההתנהגותיים שנאספו בכיתה כוללים לא רק סרטונים אלא גם נתונים רב-מודאליים, כגון קול ואודיו5. עם זאת, טיפול במידע ונתונים מרחביים-זמניים מורכבים אלה וחילוץ מדויק של מאפיינים התנהגותיים יקרי ערך מהם הם האתגרים העיקריים העומדים בפני תחום זיהוי התנהגות חכם בכיתה 6,7. גישות זיהוי התנהגות קיימות מסתמכות בעיקר על חילוץ תכונות ממקורות נתונים מודאליים יחידים, כגון זרמי וידאו בכיתה או תמונות עוקבות8. בעוד ששיטות אלה יכולות לזהות אירועים התנהגותיים גסים, לעתים קרובות הן אינן מצליחות למדל את האבולוציה הזמנית והניואנסים המרחביים של המחוות, ההבעות או גורמי תדירות האינטראקציה של התלמידים החיוניים להבנת רווחת הלומד ומיקוד9. יתר על כן, למודלים הנוכחיים חסרים מנגנונים חזקים למיזוג מקורות נתונים הטרוגניים כמו רמזי שמע ותנועת שלד, מה שמגביל את רגישותם להתנהגות רגשית או מנותקת10. כדי להתמודד עם מגבלות אלה, מחקר זה מציע מערכת זיהוי התנהגות בכיתה מבוססת שנאי המשופרת במנגנוני קשב מרחביים-זמניים. על ידי מינוף היכולת של ה-Transformer למדל תלות ארוכת טווח ושילובה עם אסטרטגיות היתוך תכונות רב-מודאליות, המערכת המוצעת שואפת לשפר את הדיוק של סיווג ההתנהגות תוך מתן אפשרות להדמיה בזמן אמת של מעורבות ואינדיקטורים רגשיים. המטרה הסופית היא לתמוך בהערכת איכות הוראה דינמית ומשוב מוטמע על בריאות הנפש בחינוך הרפואי, ולהציע פתרון מדרגי ואדפטיבי לניטור ושיפור יעילות ההוראה ורווחת הלומד.

ההערכה מציעה מערכת זיהוי התנהגות חדשה מבוססת שנאי המשלבת מנגנוני קשב מרחביים-זמניים עם היתוך נתונים רב-מודאלי (כניסות וידאו ושלד) המותאם לתצפית חכמה בכיתה בחינוך רפואי וסיעודי. בניגוד למודלים הקיימים, המודל החדש מאפשר קשב מדויק בזמן אמת של התלמידים וזיהוי מצב רגשי, שהוא בעל ערך הן להערכת איכות ההוראה והן לרווחה פסיכולוגית.

עבודות קשורות
הכיתה החכמה היא סביבת הוראה חדשה המשתמשת בטכנולוגיית מידע מודרנית כדי לשפר את אינטראקציית ההוראה, הלמידה המותאמת אישית וניהול ההוראה. זה יכול להשתמש בשיטות הוראה חכמות כדי לשפר את יעילות ואיכות ההוראה תוך מתן חוויות למידה עשירות ומותאמות אישית יותר לתלמידים. לכן, חוקרים רבים ברחבי העולם חקרו טכנולוגיה חכמה והוראה בכיתה. Radosavljevic ואחרים הציעו מודל כיתה אינטליגנטי המבוסס על אינטליגנציה סביבתית, המעריך את רמות העייפות של התלמידים ומתאים אסטרטגיות למידה על ידי ניתוח נתוני הפעילות האקדמית היומית שלהם כדי לייעל את תוצאות הלמידה11. Tai T. Y חקר את ההשפעה של עוזרים אישיים אינטליגנטיים על שיפור יכולת הדיבור בשפה זרה ומצא ששימוש ב-Google Assistant שיפר משמעותית את יכולת הדיבור של אנשים שאינם דוברי שפת אם, עם השפעות דומות לדוברי שפת אם בתקשורת12. צ'ן ועמיתיו מצאו באמצעות המחקר שלהם ששימוש בצ'אטבוטים ככלי הוראה יכול להגיב במהירות לצרכי התלמידים, לשפר את האינטראקטיביות ולהדגים את היישום הפוטנציאלי של טכנולוגיה חכמה בכיתה13. המחקר העלה שיטת הערכת יעילות הוראה בכיתה המבוססת על מצב הוראה חכם, ששיפר את דיוק ההערכה על ידי שימוש באלגוריתם חיפוש קוקיה ומכונת למידה קיצונית14.

זיהוי התנהגות בכיתות חכמות הוא טכנולוגיית מפתח להשגת הוראה מותאמת אישית ואופטימיזציה של ניהול הכיתה. זה יכול לעקוב אחר מצב ההתנהגות של התלמידים בזמן אמת ולספק משוב יעיל. באמצעות זיהוי התנהגות, מורים יכולים להבין במדויק את ההשתתפות והמיקוד של התלמידים, ובכך לשפר את יעילות ההוראה ולסייע בקבלת החלטות. בהקשר זה, חוקרים ברחבי העולם ערכו מחקר מקיף על זיהוי התנהגות אינטליגנטי בכיתה. המחקר הציע מערכת ניטור חזותי בזמן אמת המבוססת על בינה מלאכותית, שהשתמשה בלמידת מכונה כדי לאמן מודלים לזיהוי התנהגות תלמידים כדי לעזור למורים לנטר טוב יותר את השתתפות התלמידים ואת האינטראקציה בכיתה, ובכך לייעל את איכות ההוראה15. Chonggao P השיג זיהוי התנהגות תלמידים בזמן אמת ושיפר את הדיוק של ניתוח התנהגות בכיתה בהוראה מרחוק על ידי שילוב של ניתוח אשכולות ואלגוריתם יער אקראי, כמו גם מודל השלד האנושי16. Wu S פיתח מודל זיהוי התנהגות תלמידים המשלב אופטימיזציה של נחיל חלקיקים ואלגוריתם השכן הקרוב ביותר, המקדם את הדיוק של זיהוי רגשות כדי לענות על הצרכים המעשיים של הוראה בכיתה17. מערכת ACORN שהוצעה על ידי Ramakrishnan et al. השתמשה בלמידת מכונה רב-מודאלית ושילבה רשתות עצביות קונבולוציוניות כדי לנתח נתוני אודיו, הבעות פנים ותמונה. שילוב תכונות אלה באמצעות רשתות קונבולוציה זמניות השיג הערכה אוטומטית של האווירה בכיתה והתקדם ראשונית18.

לסיכום, מחקר קיים הציע טכניקות שונות מבוססות למידת מכונה ולמידה עמוקה לזיהוי התנהגות חכם בכיתה, המכסות תחומים כגון זיהוי עייפות תלמידים, ניתוח סנטימנטים וניטור אינטראקציה בכיתה. עם זאת, עדיין ישנם כמה חסרונות במחקר הנוכחי, ושיטות רבות חסרות מספיק זמן אמת ויכולת הרחבה ביישומים מעשיים, מה שמקשה על הסתגלות לתרחישים מורכבים ומשתנים בכיתה. לכן, המחקר מציע שיטה חכמה לזיהוי התנהגות בכיתה עם שנאי ו-AM. החידוש של המחקר טמון בניצול יכולת המידול הזמני העוצמתית של השנאי בשילוב עם AM מרחבי-זמני כדי ללכוד במדויק רגעים ואזורים התנהגותיים מרכזיים בכיתה, ושילוב מקורות מידע מרובים, כגון וידאו ואודיו, באמצעות היתוך נתונים רב-מודאלי כדי לשפר את המקיפות והדיוק של זיהוי התנהגות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה משתמש במערכי נתונים זמינים לציבור שאינם מכילים מידע המאפשר זיהוי אישי. כל הנתונים ששימשו במחקר עברו אנונימיזציה כדי להבטיח את פרטיות המשתתפים. הסכמה מדעת הושגה מכל המשתתפים בזמן איסוף הנתונים, והמחקר מקפיד על הנחיות אתיות. הפרוטוקול מסביר את שיטת זיהוי ההתנהגות החכמה בכיתה, המורכבת מחילוץ תכונות המבוסס על היתוך נתונים רב-מודאלי וזיהוי התנהגות מרחבית-זמנית המבוססת על שנאי ותשומת לב. הביצועים של השיטה כולה מותאמים באמצעות אימונים משותפים.

1. איסוף נתונים מרובי מודלים

איסוף נתונים רב-מודאלי כלל איסוף נתוני התנהגות מסונכרנים בכיתה משני מערכי נתונים: מערך הנתונים של EduSense ומערך הנתונים של אינטראקציה SBU Kinect. EduSense הקליט הקלטות מהחיים האמיתיים באוניברסיטה-כיתה, ו-SBU Kinect הקליט רצפי שלד מבוססי אינטראקציה. מערכי הנתונים הכילו זרמי וידאו, רמזי שמע ומידע תלת מימדי על מפרקי השלד למידול תנוחות ותנועה של תלמידים. עיבוד מקדים של נתונים הבטיח יישור זמני והסרת רעשים לניקוי. התכנסות זו סיפקה ניטור התנהגות מקצה לקצה, הקלטת מחוות חזותיות ותנועות גוף במצבי למידה רבים.

2. חילוץ תכונות המבוסס על היתוך נתונים רב-מודאלי

תוך התמקדות בנושא זיהוי התנהגות תלמידים בכיתות חכמות, מוצעת שיטה לזיהוי התנהגות חכם בכיתה עם שנאי ו-AM. בשל האופי המורכב של כיתות עם תלמידים רבים, שינויים בגורמים בתוך הסצנה יכולים להפריע לזיהוי התנהגות התלמידים. בנוסף, לחילוץ תכונה בודדת יש מגבלות כגון מידע לא שלם, רגישות להפרעות סביבתיות וקושי בלכידת התנהגויות מורכבות19,20. לכן, המחקר מציע תחילה שיטת חילוץ תכונות בכיתת התלמידים המבוססת על היתוך נתונים רב-מודאלי. שיטה זו משלבת נתונים משיטות וידאו ושלד, תוך ניצול המשלימות שלהם כדי להשיג חילוץ תכונות מקיף ומדויק יותר של התנהגות התלמידים. בפרט, כל רצף וידאו קלט מחולק לפי פריימים. מסגרות מוזנות ל-R-CNN מהיר יותר שהוכשר מראש כדי למקם אזורי עניין אנושיים. האזורים שזוהו מוזנים לעמוד השדרה של רשת עצבית קונבולוציונית כדי להשיג תכונות חזותיות זמניות. עבור אופן השלד, מיקומי מפרקים תלת מימדיים מוצבים כרצפים ומקודדים באמצעות מודל BERT מאומן מראש כדי להשיג תלות זמנית ומרחבית. אלה מנורמלים ומוטמעים לפני שהם מוזנים לרשת ההיתוך הרב-מודאלית. ביניהם, אופן הווידאו אחראי בעיקר על לכידת מאפיינים חזותיים כמו תנועות והבעות של תלמידים, בעוד שאופן השלד מתאר במדויק את שינויי היציבה של התלמידים באמצעות מידע נקודתי משותף. בעוד שאופן הווידיאו מסתמך על המאפיינים הגלובליים של תפיסה חזותית, בעוד שאופן השלד מאפיינים חזותיים גלובליים לייצוג התנהגות אנושית, אופן השלד מתמקד בשינויים הדינמיים במיקום המפרקים, מה שמוביל להבדלים סמנטיים משמעותיים בין השניים21. לכן, יש צורך לפתח רשת היתוך רב-מודאלית מיוחדת כדי למדל ביעילות את המתאם בין שתי האופנים. רשת ההיתוך הרב-מודאלית מוצגת באיור 1.

באיור 1, הרשת מחולקת בעיקר לשלושה מודולים. ביניהם, הקלט של מודול עיבוד אופן הווידאו הוא רצף וידאו, המופק באמצעות רשת עצבית קונבולוציונית מבוססת אזור מהיר יותר (Faster R-CNN) לחילוץ תכונות. הטיפול בשיטת הווידאו מתחיל בתרגום צילומי וידאו בכיתה לכניסות פריים אחר פריים לחילוץ תכונות. מסגרות מטופלות ברשת עצבית קונבולוציונית מבוססת אזור מהירה יותר (Faster R-CNN) עם בסיס ResNet-50 שהוכשר ב-ImageNet. הרשת מטפלת במסגרות RGB שגודלן שונה ל-224 ×-224 פיקסלים, וכתוצאה מכך מפות תכונות חזותיות ברמה גבוהה עם תכונות מרחביות וספציפיות לאובייקטים של פעילות התלמידים. תכונות אלו מוזנות לאחר מכן למודול תשומת לב עצמית, שלומד קשרים זמניים בין מסגרות לפני קידודן להטמעות מרחביות-זמניות באמצעות שכבת שנאי. זה משמר אותות התנהגותיים חלשים, כגון הטיית ראש או הרמת ידיים, בהטמעת ייצוגים לאיחוי מאוחר יותר. תכונות הווידאו שחולצו נלכדות על ידי מודול תשומת הלב העצמית כדי ללכוד את היחסים הזמניים והמרחביים בתוך אופן הווידאו, ולאחר מכן מעוצבות עוד יותר על ידי שנאי כדי ליצור וקטורים מוטמעים למידע המרחבי-זמני של רצף הווידאו. הקלט של מודול עיבוד אופן השלד הוא רצף שלד, המעובד על ידי ייצוג מקודד דו-כיווני מרובוטריקים (BERT) כדי לחלץ תכונות זמניות ומרחביות של מפרקי השלד. עבור נתוני שלד, התנוחה של כל תלמיד מעוצבת כרצף של קואורדינטות משותפות דו-ממדיות מסרטוני הכיתה באמצעות אומדן תנוחות מבוסס OpenPose. רצפים אלה מומרים לאסימוני הטמעה שבהם כל אסימון מתאים למסגרת עם 18 נקודות מפתח. ההקשר הזמני והתלות של רצפים משותפים אלה מודלים באמצעות מודל ייצוגי מקודד דו-כיווני מרובוטריקים (BERT). הדגם משתמש ב-12 שכבות שנאים, 8 ראשי קשב וגודל נסתר של 768, שהוא הארכיטקטורה הסטנדרטית של בסיס BERT. המודל מכוונן במהלך האימון כדי לרכוש דפוסי מפרקים ספציפיים להתנהגות. הטמעות הפלט מייצגות את המאפיינים המבניים והקשורים לתנועה של התנהגות התלמידים המשולבים לאחר מכן עם תכונות אופן וידאו. לאחר מכן, תכונות השלד מצטברות עוד יותר לתכונות מרחביות וזמניות באמצעות CNN תלת מימדי ופעולות איגום, ומייצרות וקטורים משובצים של השלד כייצוגים של תכונות של אופן השלד.

3. מודול היתוך צולב

במודול היתוך קשב צולב, המחקר משתמש במנגנון הקשב הרב-ראשי (MHAM) כדי לבנות את יחסי האינטראקציה בין מודאליות וידאו לאופן השלד, ומחלץ עוד יותר תכונות היתוך קומפקטיות יותר באמצעות CNN תלת מימדי ופעולות איגום מתכונות ההיתוך הרב-מודאליות שנוצרו. תהליך ההיתוך מתבצע באמצעות רשת קשב דו-זרמית, שבה ההטמעות הטמפורליות של כל שיטה מועברות דרך CNNs תלת מימדיים ו-GRU דו-כיווניים. זרמי הנתונים הרב-מודאליים מיושרים באמצעות מודולי תשומת לב מרובי ראשים (MHAM), עם תשומת לב מורחבת של מוצר נקודה כדי להשיג תלות בין-מודאלית. לאחר מכן ההטמעות מאוגדות כדי להתמודד עם מורכבות ממדית ונשלחות לשכבת Softmax מחוברת במלואה לסיווג.

ברשתות היתוך רב-מודאליות, מודול הקשב העצמי משמש למודל התלות הזמנית והמרחבית במצב יחיד, בעוד שמודול ההיתוך הצולב משמש לביסוס הקשר ואינטראקציית המידע בין מצבים שונים. לכן, שניהם חשובים מאוד. מודול תשומת הלב העצמית לוכד את התלות הפנימית של רצף הקלט על ידי חישוב הקשר בין השאילתה Q, מפתח K וערך V. החישוב של Q, מפתח K וערך V מוצג במשוואה (1). היכן figure-protocol-1 נמצאות מטריצות השאילתה, המפתח והערך בהתאמה; DK הוא הממד הווקטורי המרכזי, ו - DK הוא הממד של וקטורי הערך. גורם הממד dk מאומץ על מנת למנוע מתוצרי הנקודות להיות גדולים, מה שישפיע על יציבות השיפועים במהלך האימון.

figure-protocol-2(1)

במשוואה (1), figure-protocol-3 מייצג את תכונות הקלט, כאשר n הוא אורך רצף הקלט, מודל d הוא הממד של התכונות, ו-W Q, WK ו-WV מייצגים שלוש קבוצות של מטריצות הקרנה הניתנות ללמידה. באמצעות מיפויי מטריצה אלה, תכונות הקלט הופכות לשאילתות, מפתחות וערכים. מכפלת הנקודה של השאילתה Q והמפתח K משמשים לחישוב משקלי קשב וקנה מידה שלהם, כפי שמוצג במשוואה (2).

figure-protocol-4(2)

במשוואה (2), dk מייצג את הממד של שאילתה Q ומפתח K, ו-softmax מציין את פונקציית softmax המשמשת להשגת מטריצת משקל הקשב. קנה מידה יכול למנוע ביעילות את הבעיה של שיפוע קטן מדי עקב ערכי מכפלת נקודות מוגזמים הנגרמים על ידי מימדיות. מטריצת משקל הקשב מוחלת על הערך V כדי להשיג את הפלט Z של מודול הקשב העצמי, כפי שמוצג במשוואה (3).

figure-protocol-5(3)

במשוואה (3), ij פירושו משקל הקשב של וקטור השאילתה i על וקטור המפתח j. המבנה הספציפי של מודול היתוך קשב צולב מסומן באיור 2.

מאיור 2, מודול זה מתחיל בעיקר לעבד מאפייני קלט מאופני שלד ווידאו. ראשית, רצף השלד ורצף הווידיאו נתונים בנפרד לשכבות קונבולוציוניות תלת מימדיות כדי לחלץ תכונות מרחביות-זמניות, ולאחר מכן מאפיינים מרחביים-זמניים אלה מודלים באמצעות יחידות חוזרות מגודרות דו-כיווניות (Bi-GRUs) למידול זמני. לאחר מכן, התכונות של שתי השיטות מופקות עוד יותר באמצעות MHAMs כדי לחלץ מתאמים בתוך האופנים. כל שיטה משיגה ייצוג תכונות באופן פנימי באמצעות מנגנונים של שאילתות, מפתחות וערכים. לאחר מכן, איגום ממוצע בזמן מתבצע על תכונות הפלט כדי להפחית את המורכבות של ממד הזמן. לאחר האיגום, התכונות הרב-מודאליות מאוגדות סטטיסטית כדי לחשב את הממוצע וסטיית התקן של כל שיטה, ולבסוף להפיק את זיהוי וסיווג הפעולה של התלמיד באמצעות שכבה מחוברת במלואה (FCL) ומסווג Softmax. לכן, חילוץ התכונות המבוסס על היתוך נתונים רב-מודאלי שהוצע במחקר משתמש בתשומת לב עצמית ובהצלבה AMs כדי ללכוד ולדגמן במדויק את המאפיינים המרחביים-זמניים של התנהגות התלמידים על ידי מיזוג נתונים משיטות וידאו ושלד, ובכך לשפר את הדיוק והמקיפות של זיהוי התנהגות התלמידים בכיתות חכמות.

4. זיהוי התנהגות מרחבית-זמנית המבוסס על שנאי וקשב

חילוץ התכונות המבוסס על היתוך נתונים רב-מודאלי משיג שיפור ראשוני במקיפות ודיוק של התנהגות התלמידים על ידי מיזוג נתונים משיטות וידאו ושלד. עם זאת, בהקשר של כיתות אינטליגנטיות, התנהגות התלמידים משתנה לעתים קרובות עם הזמן, ואותה התנהגות עשויה להפגין מאפיינים שונים בנקודות זמן ואזורים מרחביים שונים. הסתמכות אך ורק על מידע סטטי שהתמזג מתכונות רב-מודאליות אינה יכולה ללכוד באופן מלא את היחסים הדינמיים המרחביים-זמניים המורכבים ברצף ההתנהגות22,23. לכן, מחקר נוסף מציע מודל התנהגות מרחבי-זמני ו-AM המבוסס על Transformer. המחקר בחר ב-Vision Transformer (ViT) כארכיטקטורת הרשת, שיכולה לדגמן את המידע המרחבי-זמני הגלובלי של קלט באמצעות AM עצמי ויש לה יכולת חזקה יותר ללכוד תלות מרחבית-זמנית. לאחר היתוך רב-מודאלי, התכונות המאוחות מיוצגות שוב באמצעות שנאי ראייה (ViT) כדי לחזות את ההתנהגות המרחבית-זמנית. מפות התכונות בקלט מפוצלות ל-16 × 16 טלאים נפרדים, משובצים באופן ליניארי בווקטורים חד-ממדיים, ומקודדים מיקום כדי לשמור על הסדר המרחבי. למבנה ViT יש 12 בלוקים של מקודד שנאי, המורכבים מתשומת לב עצמית מרובת ראשים (8 ראשים) ושכבות הזנה קדימה שהממד הנסתר שלהן הוא 768. כדי לשפר את הבולטות ההתנהגותית, מוצעים מודולים של תשומת לב מרחבית (SA) ותשומת לב זמנית (TA). מודול SA מעודד רלוונטיות של תכונות באזורים מרחביים באמצעות הפעלת Tanh, בעוד שמודול TA מדגיש מסגרות זמניות חשובות באמצעות הפעלת ReLU. שני זרמי הקשב הללו משולבים לאחר מכן עם עמוד השדרה של ה-ViT באמצעות שיטת אימון דו-שלבית כך שהמודל לומד ללכוד את ההתפתחות הדינמית של התנהגות הכיתה ביעילות. המבנה של ViT מוצג באיור 3.

באיור 3, ב-ViT, הקלט המקורי הוא תמונה המפולחת למספר בלוקים קטנים בגודל קבוע, שכל אחד מהם מיוצג כחלק מהתמונה, ומשוטח באופן ליניארי לווקטור חד-ממדי. מכיוון שהשנאי אינו יכול לתפוס מידע מיקום, כל בלוק קטן מוטבע במידע מיקום לפני שהוא מוזן לשנאי כדי להבטיח שהוא יכול ללכוד את יחסי המיקום המרחבי היחסי בין בלוקים קטנים שונים. מודול הליבה של ViT הוא מקודד השנאי, המורכב ממספר בלוקים של קידוד שנאי מוערם. בלוקי הקידוד מורכבים מ-MHAM ורשת עצבית הזנה קדימה. ה-MHAM לוכד את התלות בין רצפי קלט במקביל, בעוד שהרשת העצבית המוזנת קדימה מבצעת טרנספורמציות לא ליניאריות על התוצאות כדי לשפר את יכולת המודל ללכוד ולבטא מידע גלובלי. לאחר שמקודד השנאי מעבד את כל פיסות המידע הקטנות, הפלט של שכבת הקידוד האחרונה מועבר לראש הפרספטרון הרב-שכבתי (MLP Head), אשר מוציא את תוצאות זיהוי וסיווג הפעולה הסופיות של התלמידים.

מבחינה מעשית, כל מסגרת מפוצלת ל-16 ×-16 טלאים שאינם חופפים, שטוחים ומשובצים במיקום על מנת לשמור על יחסים מרחביים. הטמעות תיקון מעובדות ברצף על ידי מקודדי שנאים מוערמים בארכיטקטורת ViT. מודול תשומת לב מרחבית (SA) משתמש בהפעלת tanh כדי לשנות את תשומת הלב על פני תחומי עניין בתוך כל מסגרת, ומודול תשומת לב זמנית (TA) משתמש ב-ReLU כדי להדגיש מסגרות חשובות מבחינה זמנית. מנגנון דו-קשב זה מאפשר מידול יעיל של דינמיקת התנהגות מרחב וזמן.

כדי לשפר עוד יותר את הביצועים של ViT ברצפים התנהגותיים מורכבים, תשומת לב מרחבית (SA) ותשומת לב זמנית (TA) מוצגות כדי לאפשר ל-ViT לא רק לבחור באופן אוטונומי מפרקים מרחביים חשובים, אלא גם להתמקד בהתנהגויות בנקודות זמן שונות, וללכוד טוב יותר את השינויים הדינמיים המרחביים-זמניים של ההתנהגות. מודול SA ומודול TA מסומנים באיור 4.

באיור 4A, מודול ה-SA מעבד את מידע הממד המרחבי של הקלט על ידי העברת תכונות המסגרת הנוכחית לשכבת ה-ViT כדי לחלץ את המצבים הנסתרים. אלה משולבים עם התכונות של המסגרת הקודמת ומוזנים במשותף ל-FCL. ה-FCL יבצע טרנספורמציה ליניארית על התכונות כדי ליצור ייצוגי תכונות סמויות. לאחר מכן, הוא מועבר לפונקציית ההפעלה Tanh כדי למפות את הפלט לטווח של [-1,1], משפר את האי-ליניאריות ומבחין טוב יותר בין תכונות חשובות ולא חשובות. לבסוף, התכונות מנורמלות באמצעות שכבת נורמליזציה כדי להבטיח שלתכונות הפלט יש קנה מידה יציב יחסית. באיור 4B, מודול TA מתמקד יותר במידע העיקרי הכלול בכל מסגרת בממד הזמן. בניגוד ל-Tanh ב-SA, מודול TA משתמש בפונקציית ההפעלה ReLU כדי לדכא ערכים שליליים ושומר רק על הפלט של ערכים חיוביים, מסיר ביעילות מידע רעש שלילי ומשפר את יכולת הלכידה הזמנית של המודל.

5. שיטת אימון משותפת

כדי לפתור ביעילות את בעיית המאפיינים המרחביים-זמניים המוטים והמיותרים הנגרמת על ידי ההשפעה ההדדית בין מודול ViT, SA ומודול TA בזיהוי התנהגות מרחבית-זמנית המבוססת על שנאי ותשומת לב, מאומצת שיטת אימון משותפת כדי לייעל את שלושת המודולים. התהליך הספציפי מסומן באיור 5.

באיור 5, אסטרטגיית האימון המשותפת מזינה תחילה את פרמטרי האימון של המודל, קובעת את מבנה הרשת ואת ההיפרפרמטרים. לאחר מכן, נערכת הכשרה נפרדת על SA ו-TA כדי ללמוד טוב יותר תכונות מקומיות. ראוי לציין כי במהלך האימון המקדים של דגם אחד, המשקולות של הדגם השני נשמרות קבועות ואינן מתעדכנות. לאחר השלמת אימון מקדים אישי, שכבת ה-ViT משולבת לאימון. לאחר מכן, יתוקנו שני מודלים של תשומת לב, ורשת ה-ViT הראשית תוכשר בנפרד. לבסוף, על ידי הכשרה משותפת של מודולי רשת ה-ViT העיקרית, SA ו-TA, הרשת הכוללת מותאמת ליצירת המודל הסופי לזיהוי התנהגות חכם בכיתה. הליך ההדרכה מתבצע בשלבים: (1) אימון מקדים אוטונומי של מודולי SA ו-TA עם פרמטרי ViT קפואים, (2) אימון צעד של ViT עם משקולות מודול קשב קפואות, ו-(3) כוונון עדין מקצה לקצה של כל הרכיבים יחד עם אופטימיזציה של אדם (קצב למידה = 0.001, גודל אצווה = 64, תקופות = 100). הגישה מייצבת את למידת התכונות ומפחיתה הפרעות בין מודולים במהלך האופטימיזציה.

בסך הכל, שיטת זיהוי ההתנהגות החכמה בכיתה המוצעת משלבת אופני וידאו ושלד כדי להדגים יחסים מרחביים-זמניים באמצעות תשומת לב עצמית וחוצה AMs. על ידי שימוש ביכולת המידול המרחבי-זמני הגלובלית של ViT ושילוב מודולים מרחביים ות"א, המודל מותאם ללכידת התנהגויות מפתח ודינמיקה זמנית, ומשיג זיהוי התנהגות מקיף ומדויק יותר של התלמידים. פעולות היתוך קריטיות, שבהן משולבים ייצוגי תכונות רב-מודאליות, מבוצעות בארכיטקטורה הנדונה. באופן ספציפי, התכונות המרחביות שנלמדו על ידי CNN קשורות לתכונות הטמפורליות של Bi-LSTM. פלט זה מתמזג לאחר מכן עם תכונות מוגברות קשב של MHAM לפני משימת הסיווג. פעולות היתוך אלה חיוניות לאיחוי תצוגות משלימות של נתונים התנהגותיים ומודגשות באיור 1 ובאיור 5.

אלגוריתם 1 ממחיש את הנתונים הרב-מודאליים המשולבים, מידע שלד, טקסט ווידאו, תוך שימוש במודלים מבוססי ViT, BERT ו-GCN כדי לחלץ תכונות אינפורמטיביות בכיתה. לאחר מכן מסומן הייצוג המשותף כדי לזהות את התנהגות התלמידים, עם דיוק גבוה יותר באמצעות למידה חוצה מודלים.

אלגוריתם 1: תהליך של זיהוי התנהגות רב-מודאלית באמצעות ViT, BERT ו-GCN.

אתחל:

מודל BERT מאומן מראש

דגם R-CNN מהיר יותר מאומן מראש

מודל ViT מאומן מראש

מודל GCN לנתוני שלד

מסווג (למשל, MLP או שנאי)

מערך נתונים של טעינה:

עבור כל מדגם במערך נתונים רב-מודאלי:

חלץ מסגרות וידאו

חלץ תמלול אודיו

חילוץ נתוני שלד (OpenPose או MediaPipe)

שלב 1: עיבוד אופן וידאו

עבור כל פריים בווידאו:

החל R-CNN מהיר יותר לזיהוי אובייקטים/משתתפים

החל שנאי ראייה (ViT) כדי לחלץ תכונות ברמת המסגרת

תכונות מצטברות לאורך זמן לייצוג זמני

שלב 2: עיבוד מודאליות טקסט

טקסט תמלול עיבוד מקדים:

טוקניזציה באמצעות BERT tokenizer

העברת אסימונים דרך מודל BERT

חלץ הטבעות הקשריות מאסימון [CLS] או מאגר ממוצע

שלב 3: עיבוד שיטת השלד

עבור כל רצף שלד:

נורמליזציה של קואורדינטות

לעבור דרך GCN או ST-GCN כדי לחלץ תכונות תנועה

שלב 4: מיזוג תכונות

שרשור או נתיך קשב:

תכונות וידאו

תכונות טקסט

תכונות השלד

השג ייצוג רב-מודאלי מאוחד

שלב 5: סיווג

העבר את הייצוג המותך למסווג הסופי

חיזוי תווית התנהגות בכיתה (למשל, קשוב, מוסח)

שלב 6: הערכה

השווה תחזיות עם אמת בסיסית

מדדי חישוב: דיוק, דיוק, אחזור, ציון F1

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי להעריך את היעילות והעליונות של שיטת זיהוי ההתנהגות החכמה בכיתה עם Transformer ו-AM, נערכו אימות וניתוח ביצועים ניסיוניים. ראשית, סביבת הניסוי והפרמטרים הוגדרו, כפי שמצוין בטבלה 1.

בהתבסס על טבלה 1, המחקר בחר את מערך הנתונים של EduSense ו-SBU Kinect Interaction Dataset כמערכי נתונים ניסיוניים, בשם D1 ו-D2, בהתאמה. D1 אסף התנהגויות של תלמידים ומורים בכיתות באוניברסיטה, בעוד D2 שימש לזיהוי אינטראקציה התנהגותית. עם זאת, סוג הנתונים והתרחיש שלו יכולים לשמש כנתו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

שיטת זיהוי התנהגות לכיתות אינטליגנטיות המבוססת על Transformer ו-AM הוצעה כדי להתמודד עם האתגרים של התנהגות תלמידים מורכבת וזיהוי נתונים רב-מודאלי. רשת ViT עם יכולת מידול מרחבית-זמנית גלובלית נבנתה על ידי שילוב נתונים משיטות וידאו ושלד, ותשומת לב עצמית ו-AMs צולבים נוצלו כדי ללכוד מאפיינים מרחביים-זמניים של התנהגות. על ידי שילוב נתוני וידאו ואודיו במסגרת חדשה של מסגרת חישה חכמה (ISF) באמצעות שנאי מסגרת רב-מודאלי (MFT), ההערכה מבקשת לשפר את זיהוי ההתנהגות בכיתה24. ת...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ללא.

תרומת המחבר:
ליו ליי: אחראי על הרעיון והעיצוב של המחקר; הציע את שיטת היתוך הנתונים הרב-מודאלית מבוססת רובוטריקים לזיהוי התנהגות חכם בכיתה. הוביל את פיתוח המודל ועיצוב הניסוי, ניהל איסוף ועיבוד נתונים וניסח את כתב היד הראשוני. תרם לניתוח ודיון בתוצאות הניסוי.

הא ג'יהואה: סיפק הדרכה ופיקוח כלליים על המחקר; תרם למסגרת המחקר ולתמיכה המתודולוגית. השתתף באופטימיזציה של מודלים וניתוח ניסיוני, סקר ותיקן את כתב היד, הבטיח עמידה בסטנדרטים אתיים ונתן אישור סופי להגשה. אחראי על התכתבות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
זיכרון RAM DDR4 בנפח 128 GBhttps://www.crucial.com/memory/ddr4ספקיםזיכרון מספיק לעיבוד נתונים רב-מודאלי
אחסון SSD בנפח 2 TB https://www.samsung.com/ssdספקים מרוביםלאחסון מערכי נתונים ומודלים
BERT (תצורת בסיס)שפה https://huggingface.co/bert-base-uncasedלחיבוק פניםלהטמעת רצף שלד
ערכת כלים CUDA 11.1NVIDIAhttps://developer.nvidia.com/cuda-toolkitמאפשרת האצת GPU עבור ספריית PyTorch
cuDNN 8.0מואצת NVIDIAhttps://developer.nvidia.com/cudnnGPU עבור רשתות עצביות עמוקות
מערך נתוניםאוניברסיטת קרנגי מלוןhttps://www.cs.cmu.edu/~./edusenseמערך נתונים בכיתה אוניברסיטאית מהחיים
האמיתייםR-CNN מהיר יותר (ResNet-50)קוד פתוח (PyTorch)https://github.com/facebookresearch/detectron2גלאי אובייקטים המשמש לחילוץ תכונות וידאו
מעבד Intel Xeon E5-2680 v4 מעבדIntelhttps://www.intel.com/products/xeon-e5-2680-v4בעל ביצועים גבוהים לאימון מודלים
Matplotlibקוד פתוחhttps://matplotlib.orgמשמש להתוויית מדדי ביצועים
NVIDIA Tesla V100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100משמש לאימון והסקת מסקנות; תומך בזיהוי התנהגות בזמן אמת
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeמחלץ נקודות מפתח שלד דו-ממדיות ממסגרות וידאו
PyTorch 1.8 Frameworkפתוחhttps://www.pytorch.orgספריית למידה עמוקה המשמשת עבור פיתוח מודלים
SBU Kinect Interaction DatasetStony Brook Universityhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectמערך נתונים שלד מבוסס אינטראקציה
TensorBoardקוד פתוח (Google)https://www.tensorflow.org/tensorboardמשמש להדמיית אימון
מערכת הפעלה אובונטו 20.04 LTShttps://www.ubuntu.com/downloadקנוניקלמערכת ההפעלה לינוקס משמשת כסביבת הפיתוח
Vision Transformer (ViT)Google / Hugging Face https://huggingface.co/google/vit-base-patch16-224משמש למידול התנהגות מרחבית-זמנית גלובלית
מספר מודל ספרייה של קוד

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

Transformer
הסרטון יגיע בקרוב

מאמרים קשורים