מחקר זה השתמש במסגרת למידה עמוקה דו-שלבית לזיהוי פעולות בסרטוני ספורט, המשלבת רשת נוירונים קונבולוציונית רב-קנה-מידה (MSCNN) עם רשת זיכרון לטווח קצר ארוך (LSTM). לצורך פיתוח והערכה של המודל נעשה שימוש במאגרי נתונים סטנדרטיים הזמינים לציבור, דהיינו UCF11, UCF Sports ו-JHMDB. לא נאספו נתונים חדשים ממשתתפים אנושיים, ולא נעשה שימוש או עיבוד במידע המאפשר זיהוי אישי. מכיוון שהמחקר כלל ניתוח משני של מאגרי נתונים אנונימיים הזמינים לציבור ולא כלל השתתפות אנושית ישירה, לא נדרשו אישור אתי ממוסד או הסכמה מדעת.
תהליך העבודה כלל דגימת פריימים ונורמליזציה זמנית, ולאחריהן חילוץ מאפיינים באמצעות מודול ה-MSCNN. המאפיינים שחולצו עובדו לאחר מכן באמצעות רשת LSTM למידול זמני, ולאחר מכן הועברו לשכבת סיווג רב-מחלקית. לבסוף, המודל אומן והוערך באמצעות מערכי נתוני הייחוס שנבחרו. איור 1 ממחיש את הארכיטקטורה הכוללת של המסגרת המוצעת.

איור 1מסגרת MSCNN-LSTM מוצעת לזיהוי פעולות בסרטוני ספורט. זרימת עבודה כללית המדגימה עיבוד מקדים של וידאו, הפקת מאפיינים מרחביים רב-קנה-מידה, למידה של רצפים זמניים וסיווג פעולות. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
איור 1 ממחיש את זרימת העבודה של מסגרת מוצעת לזיהוי פעולות בסרטוני ספורט, המבוססת על ארכיטקטורת MSCNN-LSTM היברידית. התהליך מתחיל בסרטוני ספורט המכילים פעולות אתלטיות שונות, כולל בעיט, רכיבה על סוסים ותנופת גולף. הסרטונים הגולמיים פווקו לפריימים בודדים במהלך שלב עיבוד המקדם, שבו הפריימים נגזרו, סטנדרטיזו והוכנו כקלט למודל. הפריימים שעברו עיבוד מקדם הוכנסו לאחר מכן למודול ה-MSCNN לצורך חילוץ מאפיינים. הארכיטקטורה הקונבולוציונית רב-קנימית לוכדת מאפיינים מרחביים בשדות קליטה שונים, מה שמאפשר חילוץ של מידע מקומי והקשרי מתוך פריימי סרטוני הספורט. וקטורי המאפיינים שחולצו עובדו לאחר מכן על ידי רשת LSTM כדי למדל תלויות זמניות ואת התפתחות התנועה לאורך פריימים עוקבים. לבסוף, מודול הסיווג והאימון השתמש בייצוגים הספטיו-טמפורליים שנלמדו כדי לחזות את קטגוריית הפעולה עבור כל סרטון. המסגרת המוצעת כללה ארבעה שלבים רצופים, המתחילים באיסוף נתונים ועיבוד מקדם באמצעות מאגרי הנתונים המקובלים UCF1 (YouTube Actions), UCF Sports ו-JHMDB. כל סרטון ספורט הומר לרצף של פריימים, אשר שונו לגודל אחיד, נורמלו ועברו הרחבה (augmentation) באמצעות סיבוב, היפוך וגזירה כדי לשפר את העמידות לשינויים סביבתיים. הפריימים שעברו עיבוד מקדם עובדו לאחר מכן על ידי הרשת הנוירונית הקונבולוציונית רב-קנימית (MSCNN) המוצעת, שבה ענפים קונבולוציוניים מקבילים עם גרעינים (kernels) של 3 × 3, 5 × 5 ו-7 × 7 חילצו מאפיינים מרחביים מקומיים והקשריים משלימים. מאפיינים רב-קנימיים אלו שורשרו ועובדו באמצעות נורמליזציית אצוות (batch normalization) ו-max pooling כדי לייצר ייצוגי מאפיינים תמציתיים. המאפיינים שהתקבלו ברמת הפריימים סופקו לאחר מכן לרשת Long Short-Term Memory (LSTM) כדי למדל תלויות זמניות בין פריימים עוקבים. פלטי ה-LSTM הסופיים עברו השטחה (flattening) והועברו דרך שכבות מחוברות באופן מלא עם הפעלת ReLU, ולאחריהן מסווג Softmax לחיזוי קטגוריית הפעולה. הרשת אומנה באמצעות אופטימיזטור Adam עם פונקציית הפסד cross-entropy ורגולריזציית dropout להפחתת התאמת-יתר (overfitting). ביצועי המודל הוערכו לבסוף על מאגרי הנתונים UCF1, UCF Sports ו-JHMDB באמצעות מדדי דיוק (accuracy), precision, recall ו-F1-score.
1. איסוף נתונים ועיבוד מקדמי
במחקר זה נעשה שימוש בשלושה מאגרי נתונים השוואתיים (benchmark datasets) הזמינים לציבור עבור ספורט ופעולות אנושיות. מאגרי נתונים אלו מכילים צילומי סרטון של ספורט מהעולם האמיתי עם תנועות מצלמה, נקודות מבט ומורכבות רקע משתנות. באופן ספציפי, המחקר השתמש ב-UCF1 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), המכיל 1 קטגוריות פעולה שנאספו מ-1,168 סרטוני YouTube שהוקלטו מכ-25 אנשים, עם מספר דגימות לכל פעולה. מאגר הנתונים Joint-Annotated Human Motion Database (JHMDB)34,35 מכיל 21 מחלקות פעולה ו-928 סרטונים מתויגים. מאגר הנתונים UCF Sports כולל 10 מחלקות פעולה ו-150 רצפי וידאו שנתפסו ממקורות שידור ברזולוציה של 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
במצטבר, מערכי נתונים אלו מכסים הן ספורט אישי והן ספורט קבוצתי ומספקים שונות במשך הזמן ובקנה המידה הוויזואלי לצורך הערכת מסגרת ה-MSCNN-LSTM המוצעת לזיהוי פעולות. כחלק מתהליך סינון איכות הנתונים, מערכי הנתונים UCF1, UCF Sports ו-JHMDB נבחנו לאיתור סרטונים פגומים, קבצים כפולים וקטעים עם הערות (annotations) חסרות. לא זוהו דגימות העומדות בקריטריונים של פסילה אלו; לפיכך, כל הסרטונים הזמינים נשמרו לניתוח המשכי. לאחר מכן, מערכי הנתונים חולקו לתתי-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) באמצעות אסטרטגיית פיצול אקראית עקבית. איור 2 מציג תמונות מייצגות ששימשו לאימון ולהערכה.

איור 2מסגרות מייצגות מתוך מאגרי נתונים סטנדרטיים לזיהוי פעולות ספורט. פאנלים (א–ד) מציגים דוגמאות מתוך מערך הנתונים UCF1 (YouTube Actions), פאנלים (ה–ח) מתוך מערך הנתונים UCF Sports, ולוחות (א–למתוך מאגר הנתונים JHMDB. הפריימים ממחישים וריאציות במחלקי פעולות, זוויות ראייה, רקעים, תנאי תאורה ומורכבות תנועה. נא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.
מודל זיהוי הפעולות המוצע הוערך על מאגרי הנתונים המקובלים (benchmark) UCF1, UCF Sports ו-JHMDB, כפי שסוכם ב-Table 3. מאגרי נתונים אלו מייצגים דפוסי תנועה מגוונים ותנאי סביבה מאתגרים. מאגר הנתונים UCF1 (YouTube Actions) מכיל פעולות ספורט מ-1 מחלקות שנרכשו תחת תנאי תאורה, נקודות מבט ותנאי רקע משתנים. מאגר הנתונים UCF Sports כולל 150 סרטוני ספורט מהשטח משידורים מקצועיים, המציגים רצפי תנועה ריאליסטיים. מאגר הנתונים JHMDB מספק הערות (annotations) מפורטות של תנועת אדם עבור 21 קטגוריות פעולה בעלות רזולוציה גבוהה (fine-grained), ומש כמאגר נתונים מקובל לזיהוי פעולות מרחביות-זמניות (spatiotemporal). יחד, מאגרי נתונים אלו שימשו להערכת ביצועי המודל בתרחישים של ספורט ופעולות אנושיות. הרשת אומנה באמצעות אופטימייזר Adam למשך 10 epochs עם גודל batch של 32, קצב למידה ראשוני של 0.01, ופונקציית הפסד מסוג cross-entropy. המודל עם הפסד הוולידציה הנמוך ביותר נבחר להערכה הסופית. בכל הניסויים נעשה שימוש ב-seed אקראי קבוע של 42. כדי לשפר את ההתכנסות, יושמו מנגנוני עצירה מוקדמת (Early stopping) והפחתת קצב למידה בעת מישוריים (learning-rate reduction on plateau), ובמהלך אימון ה-LSTM נעשה שימוש בקיטוע גרדיאנטים (gradient clipping) עם סף של 5.0 כדי למנוע גרדיאנטים מתפוצצים. מודל ה-MSCNN-LSTM המוצע הכיל כ-15 מיליון פרמטרים הניתנים לאימון. תצורת החומרה והתוכנה ששימשה למימוש מסוכמת ב-Table 4. מכיוון שהתפלגויות המחלקות היו מאוזנות מספיק, לא יושמו הליכי שקלול מחלקות או דגימה מחדש (resampling) נוספים. מודלי השוואה יושמו תוך שימוש בהיפר-פרמטרים שדווחו במחקריהם המקוריים, כאשר הגדרות האימון תואמו במידת האפשר. ערכי הביצועים דווחו כממוצע ± סטיית תקן מחמש הרצות עצמאיות עם אתחולים אקראיים שונים. הבדלים בין המודל המוצע למודלי ההשוואה הוערכו באמצעות מבחני t-paired בסף מובהקות של p < 0.05.
| מערך נתונים | מספר המחלקות | מספר סרטונים | רזולוציה (px) | נא לספק את טקסט המקור לתרגום. | תיאור |
| UCF1 (פעולות YouTube) | 11 | 1168 | משתנה (≈ 320×240) | אוניברסיטת מרכז פלורידה | כולל 11 פעולות אנושיות מענפי ספורט (לדוגמה, קליעה לסל בכדורסל, צלילה, תנועת חבטה בגולף, הלהטוט בכדורגל). הסרטונים נאספו מ-YouTube וכוללים שונות גבוהה בתאורה, בזווית הצפייה וברקע. |
| ספורט UCF | 10 | 150 | 720×480 | מאגר נתוני פעולות ספורט של UCF | מכיל פעילויות ספורט כגון צלילה, רכיבה על סוסים, תנועת חבטה בגולף, ריצה והנפת משקולות, שהוקלטו מצילומי שידורי טלוויזיה אמיתיים (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | מכון מקס פלאנק למערכות חכמות | כולל פעילויות יומיומיות וספורטיביות כגון תפיסה, קפיצה, הברשת שיער, קליעה וריצה, עם אנוטציות של מפרקים לצורך ניתוח תנועה ותנוחה. |
טבלה 3: מאפיינים של מערכי הנתונים הייחוסים ששימשו לאימון ולהערכה. סקירה כללית של מערכי הנתונים UCF1, UCF Sports ו-JHMDB, כולל מספר מחלקות הפעולה, דגימות הווידאו, מאפייני מערכי הנתונים ותפקידם באימון, תיקוף ובחינה של המודל.
| פרמטרים שנעשה בהם שימוש | תיאור |
| שפת תכנות | Python 3.8.18 [4] |
| מסגרת למידה עמוקה | TensorFlow 2.15.0 [1] |
| מאיץ GPU | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| מעבד (CPU) | Intel Core i9 @ 3.5 GHz × 16 Cores |
| מערכת הפעלה | Windows 1 |
| זיכרון (RAM) | 64 GB DDR4 |
| אופטימייזר | Adam (learning rate = 0.01) |
| גודל אצווה (Batch Size) | 32 |
| מספר תקופות (Epochs) | 100 |
| פונקציות אקטיבציה | ReLU (שכבות CNN), Softmax (שכבת פלט) |
| שיעור Dropout | 0.5 |
טבלה 4: סביבת הסימולציה ותצורת ההיפר-פרמטרים של מודל ה-MSCNN-LSTM המוצע. מפרטי חומרה, סביבת תוכנה, הגדרות אופטימייזר, קצב למידה, גודל אצווה (batch size), מספר תקופות (epochs), ממדי קלט והיפר-פרמטרים אחרים ששימשו במהלך אימון והערכת המודל.
2. עיבוד מקדים
לפני האימון, כל סרטון גלם הומר לרצף של פריימים מסודרים לפי זמן ולאחר מכן עבר נורמליזציה, דגימה זמנית והעשרה. כל סרטון קלט V הומר תחילה לרצף של פריימים ויוצג כטנזור 4D V ∈ RT×H×W×C, כאשר T הוא מספר הפריימים, H × W i מציין את אינדקס הפריים, ו-C מציין את מספר ערוצי הצבע (3 עבור RGB). צינור העיבוד המקדים כלל חילוץ פריימים, שינוי גודל מרחבי ואחריו חיתוך מרכזי או אקראי לרזולוציה קבועה (H′, W′), נורמליזציה של עוצמה לכל פיקסל, והעשרת נתונים אופציונלית, כולל היפוך אקראי, קנה מידה ושינויים אקראיים בצבע (color jittering), לפני חילוץ המאפיינים. באופן קונקרטי, נורמליזציית העוצמה יושמה כנורמליזציית ציון סטנדרטית כבמשוואה (1).
(1)
כאשר μ, σ הם ממוצעי הערוצים וסטיות התקן שחושבו על פני קבוצת האימון, או כסקאלינג min–max כפי שמופיע במשוואה (2).
(2)
לאחר נורמליזציה, כל פריים יוצג כ-F̃t ∈ RH′×W′×C′ וטנזור הווידאו שהתקבל יוצג כ-V′ ∈ RT×H′×W′×C. ב-frontend קונבולוציוני רב-קנה-מידה (multi-scale), מפות מאפיינים מרחביות של שדות קליטה מרובים מתקבלות על ידי החלת מספר קונבולוציות דו-מדיות (או תלת-ממדיות עבור קונבולוציות מרחביות-זמניות מוקדמות) עם גדלי גרעין (kernel) שונים; לאחר מכן נוצר ייצוג מאפיינים זמני עבור כל פריים או קליפ וידאו קצר והועבר למודול ה-LSTM. המאמר המקורי מיישם MobileNetV2 ולאחר מכן Deep BiLSTM לצורך מידול זמני; צינור העיבוד המקדים (preprocessing pipeline) שלעיל תואם באופן מלא להחלפה של multi-scale conv + LSTM.
3. דגימה ונורמליזציה זמנית
מכיוון שאורכי הסרטונים T משתנים בין מערכי נתונים ובתוכם, אנו דוגמים באופן אחיד או מדגמים מחדש פריימים במישור הזמן כדי לספק לרשת הקונבולוציה רב-קנימית + LSTM אורך קלט קבוע N במונחים של פריימים או קטעים קצרים. ניתן לחשב אינדקסים אחידים של פריימים כפי שמוצג במשוואה (3),
(3)
לפיכך, רצף הפריימים שנדגמו הוא Vs = {F̃t0, …, F̃tN−1}. כאשר נדרשת רמת דיוק זמנית גבוהה יותר, אנו מבצעים אינטרפולציה זמנית ליניארית: עבור כל זמן שברי כך שנדגם מחדש τ ∈ [0, T−1] שחושב כפי שמופיע במשוואה (4).
(4)
כך שהרצף שדוגם מחדש Vs יכיל בדיוק N פריימים וישמור על תנועה חלקה. לחלופין, דגימה באמצעות קטעים קצרים רציפים (אורך חלון זמני w עם פסיעה s) מניבה קבוצה של טנזורי קטעים שבהם כל קטע Cj ∈ RT×H′×W′×C ו-j = 0, …, ⌊(T − w)/s⌋. לצורך נורמליזציה זמנית בתוך הרשת, איגור (pooling) זמני פשוט במספר קני מידה הוא יעיל: בהינתן רצף מאפיינים זמני X = {x1, …, xN} שנוצר על ידי שכבות קונבולוציה רב-קנייות, יש להחיל מאפיינים מאוגרים כפי שמוצג במשוואה (5).
(5)
כאשר Sk הוא התמיכה הזמנית עבור קנה מידה k (למשל, Sk עשוי להיות בלוקים שאינם חופפים או אינדקסים מורחבים) ו- mk = |Sk|.
לפני חילוץ המאפיינים, כל הסרטונים הותאמו לגודל של 24 × 24 פיקסלים ונדגמו בקצב של 25 פריימים לשנייה. בכל ניסוי נעשה שימוש באורך רצף קבוע של 32 פריימים. טכניקות להעשרת הנתונים (data augmentation) שנעשה בהן שימוש כללו חיתוך אקראי (scale = 0.8–1.0), סיבוב אקראי (±15°), היפוך אופקי אקראי (probability = 0.5) ושינוי בהירות (±20%). ערכי הממוצע [0.485, 0.456, 0.406] וסטיות התקן [0.29, 0.24, 0.25] של ImageNet שימשו לסטנדרטיזציה של ערכי הפיקסלים. עבור כל רצף סרטונים, בוצע דגימה זמנית באמצעות בחירת פריימים אחידה. סרטונים ארוכים יותר קוצצו או נדגמו באופן אחיד כדי לשמור על אורך רצף עקבי, בעוד שסרטונים עם פחות מ-32 פריימים עברו ריפוד באפסים (zero-padded). הגדרות אלו יושמו באופן עקבי לאורך שלבי האימון וההערכה.
4. מיצוי מאפיינים באמצעות MSCNN
רשת עצבית קונבולוציונית רב-קנימית (MSCNN) הופעלה כדי לשפר את הייצוג המרחבי של פעולות בסרטוני ספורט. רשתות עצביות קונבולוציוניות קונבנציונליות המסתמכות על גודל גרעין (kernel) יחיד עשויות להיות בעלות יכולת מוגבלת ללכידת מאפיינים במספר קניינים מרחביים. מכיוון שחלק מפעולות הספורט מציגות מאפיינים חזותיים דומים, ייתכן כי ארכיטקטורה קונבולוציונית חד-קנימית תתקשה ללכוד בו-זמנית הן מאפיינים מקומיים והן מאפיינים גלובליים. כדי לטפל במגבלה זו, המסגרת המוצעת משתמשת בגרעיני קונבולוציה בגדלים שונים לביצוע חילוץ מאפיינים רב-קנימי ומיזוג מאפיינים.
בארכיטקטורת הרשת המוצעת, נעשה שימוש בגרעיני קונבולוציה של 1 × 1 כדי לארגן מידע בין הערוצים ולהפחית את הממדיות של מפות המאפיינים של הקלט. בנוסף, שכבות אלה מגבירות את יכולת הביטוי של הרשת על ידי הכנסת טרנספורמציות מאפיינים נוספות וייצוגים לא-ליניאריים. גרעיני קונבולוציה בגדלים שונים מאפשרים חילוץ של מידע מרחבי במספר קני מידה. נורמליזציה סדרתית מבוצעת בעקבות מיזוג מאפיינים רב-קני מידה משוקלל כדי לשפר את יציבות האימון. על מנת לצמצם בעיות של דעיכת גרדיאנט (gradient vanishing) ופיצוץ גרדיאנט (gradient explosion) במהלך אימון רשת עמוקה, הארכיטקטורה המוצעת משתמשת בחיבורים שאריתיים (residual connections) ובמידול זמני מבוס LSTM.
התכנון רב-הקנה (multi-scale) משפר את יכולתו של הרשת ללכוד מאפיינים ברזולוציות מרחביות שונות ומשפר את יכולת ייצוג המאפיינים. יתרה מכך, גרעין קונבולוציה קונבנציונלי של N × N מפורק לפעולות קונבולוציה של N × 1 ו-1 × N. קונבולוציות ה-N × 1 וה-1 × N המיושמות במודול ה-MSCNN תוכננו ללכוד מאפיינים מרחביים רב-קנה וכיווניים משלימים מתוך פריימים בודדים של הווידאו. פעולות קונבולוציה אלו משפרות את ייצוג המאפיינים המרחביים על ידי חילוץ תבניות בקני מידה שונים של שדה קליטה (receptive-field). קשרים זמניים בין פריימים עוקבים ממודלים לאחר מכן על ידי מודול ה-LSTM, המעבד את רצף המאפיינים שחולצו על ידי ה-MSCNN כדי ללמוד תלותיות זמניות ארוכות טווח לצורך זיהוי פעולות.
כל סרטון ספורט V = {F1, F2, …, FT} מפורק ל-T פריימים. כדי לקודד וריאציות מרחביות, למשל, תנוחת שחקן, טשטוש תנועה ומסלול הכדור, ענפים קונבולוציוניים בשלושה קנה מידה שונים פועלים ב- s ∈ {1, 2, 3}, המתאימים לגדלי קרנל של 3 × 3, 5 × 5 ו-7 × 7. כל ענף מחלץ מפות מאפיינים כבמשוואה (6):
(6)
כאשר Ws ו-bs הם משקולות והטיות קונבולוציה (convolutional weights and biases) בקנה מידה s, ו-σ היא פונקציית ההפעלה ReLU. שכבת מיזוג רב-קנימית (multi-scale fusion layer) מאגדת תכונות כפי שמוצג במשוואה (7):
(7)
טנזור מאפיינים ממוזג זה משלב הן רמזי תנועה בעלי רזולוציה גבוהה והן מידע הקשרי של שטחים רחבים, כגון פעילויות קבוצתיות. איור 3 ממחיש רק את מודול חילוץ המאפיינים של ה-MSCNN. שכבת ה-LSTM (256 יחידות נסתרות), השכבה הצפופה (128 נוירונים) ושכבת ה-dropout (0.5) המשמשות למידול זמני ולסיווג מוצגות בנפרד ב-איור 4.

איור 3מודול חילוץ מאפיינים מוצע מבוס רשת עצבית קונבולוציונית רב-קנימית (MSCNN). שלושה ענפי קונבולוציה מקבילים עם גדלי גרעין של 3 × 3, 5 × 5 ו-7 × 7 מחלצים מאפיינים מרחביים משלימים ברב-קנה מידה, אשר ממוזגים לפני מידול זמני על ידי רשת LSTM. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4ארכיטקטורת LSTM מוצעת לזיהוי פעולות בסרטוני ספורט. מודול ה-LSTM ממדל תלויות זמניות באמצעות פעולות של שער קלט, שער שכחה ושער פלט לאורך פריימים רצופים של וידאו. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
איור 3 ממחיש את מודול חילוץ המאפיינים המוצע של רשת נוירונים קונבולוציונית רב-קנימית (MSCNN) לזיהוי פעולות בסרטוני ספורט. פריימי וידאו של הקלט עובדו במקביל דרך שלושה ענפים קונבולוציוניים עם גדלי גרעין (kernel) של 3 × 3, 5 × 5 ו-7 × 7, כאשר כל אחד מכיל 64 מסננים כדי ללכוד מאפיינים מרחביים משלימים ברזולוציות עדינות וגסות. הפלטים עובדו באמצעות נורמליזציית אצוות (Batch Normalization), הפעלת ReLU ו-max pooling של 2 × 2, ולאחר מכן שורשרו ואוחדו על ידי קונבולוציה של 1 × 1 עם 128 מסננים. חיבור דילוג שאריתי (residual skip connection) שימר מידע מרחבי ברמה נמוכה ושיפר את זרימת הגרדיאנט. מפות המאפיינים המאוחדות הופשטו (flattened) והועברו לשכבת LSTM עם 256 יחידות נסתרות לצורך מידול זמני, ולאחריה שכבה מחוברת במלואה (fully connected layer) עם 128 נוירונים, הפעלת ReLU ושיעור dropout של 0.5 לפני סיווג סופי באמצעות שכבת Softmax. מפות המאפיינים הרב-קנימיות (f1נראה שהטקסט שהזנת ריק או מכיל רק תו בודד. אנא ספק את הטקסט המדעי באנגלית שברצונך לתרגם לעברית, ואשמח לבצע את התרגום המקצועי עבורך., f2למרחבו- פ3לשורשרו כדי ליצור את הייצוג המאוחד (Fל׳), אשר עובד תגליד (convolution) של 3 × 3 נוסף כדי להפיק את מפת המאפיינים (feature map) של הפלט עבור השכבה הבאה. ארכיטקטורה היררכית זו אפשרה למידה של מאפיינים מרחביים משלימים במספר שדות קליטה (receptive fields), ובכך שיפרה את הביצועים בזיהוי פעולות ספורט.
5. מידול זמני באמצעות LSTM
על מנת למדל את האבולוציה מבוססת הזמן לאורך קצוות הווידאו, רצף המאפיינים המצטבר הועבר למערכת ה-LSTM כדי ללכוד תלויות דינמיות והמשכיות של תנועה. עבור כל סרטון קלט, חילצנו תחילה מאפייני CNN רב-קנימיים לכל פריים. נסמן את פריימי הווידאו כ-I1, …, IT. עבור כל פריים t וכל קנייִם s, המקודד הקונבולוציוני הרב-קנימי מייצר וקטור מאפיינים ft(s) ∈ Rd. לאחר מכן, נמזג את הקנייִים למתאר פריים יחיד באמצעות השלכה + שרשור (projection + concat) או סכום משוקל, כפי שמופיע במשוואה (8):
(8)
לאחר מכן, העבירו את הרצף {xt}tT=1 לתוך LSTM כדי למדל את הדינמיקה הזמנית. בסימון LSTM סטנדרטי, בזמן t השערים והמצבים מופיעים במשוואות (9) עד (13):
(9)
(10)
(11)
(12)
(13)
כאן σ היא הפעלת הסיגמואיד, ו-⊙ היא כפל איבר-איבר.) למרות שניתן להשתמש בארכיטקטורות LSTM דו-כיווניות כדי ללכוד הקשר זמני הן מהעבר והן מהעתיד, המסגרת המוצעת משתמשת ב-LSTM סטנדרטי כדי למדל תלויות זמניות לאורך פריימים רצופים של וידאו. בחירה עיצובית זו עקבית עם ארכיטקטורת ה-MSCNN-LSTM המוצגת במחקר זה. לאחר עיבוד הקליפ, התקבל ייצוג של הקליפ (למשל, המצב החבוי האחרון או איחוד זמני): z = Poolt(vt).
איור 4 ממחיש את זרימת העבודה של ארכיטקטורת ה-LSTM המוצעת לזיהוי פעולות ספורט. הרשת קיבלה רצף של פריימים מווידאו או מאפיינים שהופקו באמצעות CNN ועיבדה אותם לאורך צעדי זמן עוקבים (t−2, t−1, ו-t). כל תא LSTM כלל שער כניסה (input gate), שער שכחה (forget gate) ושער יציאה (output gate), שויסתו את זרימת המידע ברשת. שער הכניסה שילב מידע חדש במצב התא (cell state), שער השכחה השליך מידע זמני לא רלוונטי, ושער היציאה יצר את המצב החבוי (hidden state) שהועבר לצעד הזמן הבא. מצב התא שמר על תלויות זמניות ארוכות טווח, בעוד שהמצב החבוי לכד מידע זמני קצר טווח. לאחר עיבוד רצפי, פלטי ה-LSTM עברו איחוד (pooling) כדי ליצור ייצוג מאפיינים זמני, שהועבר לשכבה במחוברת באופן מלא (fully connected layer) ולמסווג Softmax כדי לחזות את פעולת הספורט המתאימה. הרשת אומנה באמצעות אופטימייזר Adam למשך 10 epochs עם גודל batch של 32, קצב למידה ראשוני של 0.01, ופונקציית הפסד cross-entropy. המודל עם הפסד האימות הנמוך ביותר נבחר להערכה סופית. כדי להבטיח שחזור, כל הניסויים בוצעו באמצעות seed אקראי קבוע של 42. נעשה שימוש בעצירה מוקדמת (early stopping) והפחתת קצב הלמידה בעת מישורה (plateau) כדי לשפר את ההתכנסות, ובוצע קיטוע גרדיאנטים (gradient clipping) עם סף של 5.0 במהלך אימון ה-LSTM כדי למנוע התפוצצות גרדיאנטים. מודל ה-MSCNN-LSTM המוצע הכיל כ-15 מיליון פרמטרים הניתנים לאימון.
ציוני המחלקה הסופיים וההסתברות משתמשים בשכבה ליניארית + softmax כבמשוואה (14):
(14)
אמן על ידי מזעור הפסד האנטרופיה הצולבת (cross-entropy loss) על קטעי הווידאו המסומנים, כפי שמוצג במשוואה (15):
(15)
כאשר Nb הוא גודל האצווה (batch), C הוא מספר המחלקות, ו-y(n) הוא ה-one-hot ground truth. רגולריזציה (dropout על פלטי xt/LSTM, דעיכת משקולות) וקיטום גרדיאנטים (Gradient clipping) מיושמים כדי לסייע ביציבות עבור רצפי ספורט ארוכים.