$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מחקר זה מציע שיטת סיכום וידאו בפיקוח רב-מודאלי הנכללת בקטגוריית סיכום וידאו גנרי, המכונה בדרך כלל רפרוף וידאו. זה כולל טכניקות שמתרכזות במציאת קטעי מפתח של סרטון גדול יותר כדי ליצור גרסה דחוסה זמנית שלו. מחקר זה מציע טכניקה מפוקחת לניתוח זרם הווידאו בקטעים של 1 שניות הכוללים ייצוגים קוליים וויזואליים, כפי שמוצג באיור 1. קטעים אלה מסווגים לאחר מכן כ"לא מעניינים" או "אינפורמטיביים". בניגוד לנתונים סינתטיים או מדומים, "נתונים אמיתיים" מתייחסים כעת למערכי הווידאו בפועל המשמשים לניסויים. קטעי וידאו המספקים אותות אודיו-ויזואליים חשובים הנחוצים לסיכום - כגון תנועה גבוהה, קול או מעברי סצנה - מכונים "קטעים אינפורמטיביים". חלקים "לא מעניינים" מוגדרים כמסגרות שחוזרות על עצמן או מיותרות שאינן מוסיפות שום דבר חדש לתקציר.
סרטוני הקלט מפולחים למסגרות, והתכונות הרב-מודאליות מופקות מכל פריים באמצעות מודל GARNN המוצע. התכונות האודיו והוויזואליות מתמזגות ומוזנות כקלט לשלב הפחתת הממדים, שבו המסגרות המיותרות מוסרות להמשך עיבוד. לבסוף, ה-AELSTM המוצע מוחל על הנתונים המופחתים לסיכום וידאו. מסווג בינארי מפוקח המאומן עם ייצוגי תכונות מהאופנים החזותיים, האודיו או המעורבים, הנקראים רב-מודאליות, משמש להשגת מטרה זו.

איור 1: סקירה כללית של מודל סיכום הווידאו המוצע. הצינור כולל חילוץ תכונות רב-מודאליות, הפחתת מימדים ויצירת סיכום באמצעות AELSTM. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
מערך נתונים
האפקטיביות של הפתרונות המוצעים נקבעת באמצעות מערכי נתונים VSUMM17 ו-SumMe18 , זוג מערכי נתונים בנצ'מרק בסיכום וידאו סטטי. תכונות CNN שנוצרו באמצעות AlexNet עם LSTM ונתונים אמיתיים הן בין מערכי הנתונים. הנתונים האמיתיים ומערכי הנתונים נגישים לציבור הרחב19. 50 הסרטים במערך הנתונים של VSUMM הם מאתרים כמו YouTube ומשתרעים על פני 110 דקות ב-30 פריימים לשנייה. הם מגיעים במגוון ז'אנרים, כולל סרטים מצוירים, חדשות, ספורט, פרסום, סדרות טלוויזיה וסרטונים ביתיים. בין אלה, 25 סרטונים מורכבים מחגים, פסטיבלים וספורט שהתקבלו מאתר היוטיוב הידוע ותויגו עם לפחות 15 סיכומים שנוצרו על ידי בני אדם (390 בסך הכל) מרכיבים את מערך הנתונים של סיכום הווידאו "SumMe"20 . טווח משך הסרטונים הוא 1-6 דקות.
הסרטון המקורי מומר לתמונות RGB, המוזנות כקלט למודל ה-GARNN המוצע מראש לחילוץ תכונות. דגם זה מורכב מ- AlexNet ו- RNN מגודר. מספר התכונות המקורי הוא 64, ולתכונות של AlexNet יש 4100 תכונות.
הצעה לחילוץ תכונות מבוססות מגודרות-AlexNet-RNN
הן מצבי המידע החזותיים והן האודיו שימשו לסיכום הסרטונים. כדי להשיג ייצוג תכונה בשתי האופנים, זיהינו תכונות בעבודת יד המשמשות לעתים קרובות במשימות אשכולות וסיווג אודיו וויזואלי, כגון אחזור תמונות, סיווג וידאו, ניתוח סצנות שמיעה ואחזור מידע מוזיקלי. המטרה הייתה לכלול כמה שיותר רכיבים חזותיים וקוליים הדרכתיים. איור 2 מציג המחשה מושגית של התהליך המשמש לחילוץ תכונות עבור האופנים האודיו והוויזואליים.

איור 2: חילוץ מאפיינים רב-מודאלי מבוסס GARNN מוצע. תכונות משיטות חזותיות ואודיו כאחד מחולצות באמצעות רכיבי AlexNet ו-GARNN. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
מגודר- AlexNetRNN: (GARNN)
לניתוח תמונות וירטואליות, CNN הוא דגם DL21 פופולרי. באופן כללי, CNN משתמשת בתמונה כקלט ומחלקת אותה למספר קבוצות. נוירוני קלט, רצף של שכבות עם איגום קונבולוציוני, שכבות מקושרות לחלוטין ושכבות מנרמלות מרכיבות את המבנה שלו22. הנוירונים של שכבת הקונבולוציה מחוברים לשכבה הקודמת באמצעות אזור צר. השכבות שמתחתיהם, מחוברות במלואן לתאי העצב המפעילים של השכבות המקושרות במלואן. Eqn (1) מייצג את ההתפשטות קדימה ואחורה של פונקציה מחוברת במלואה.
(1)
(2)
היכן
נמצאת ההפעלהשל הנוירון i בשכבה l,
הוא השיפועשל הנוירון i בשכבה l,
הוא המשקלשל הנוירון iבשכבה l + 1. עיצובים רבים של CNN צצו כתוצאה מהתקדמות המחקר האחרונה. נעשה שימוש ב-AlexNet בעבודה זו.
הארכיטקטורה של AlexNet, המוצגת באיור 3, משקפת עיצוב מוקפד ומובנה היטב. שלוש שכבות מחוברות לחלוטין וחמש שכבות קונבולוציה מרכיבות את שמונה שכבות הלמידה שלו. תוויות המחלקה מיוצרות על ידי הזנת התוצאה של השכבה האחרונה לפונקציה שמפעילה את softmax. גרעיני השכבה השנייה, הרביעית או החמישית מחוברים לרמות הקודמות שלהם באמצעות שיתוף GPU. גרעיני השכבה השנייה והשלישית מחוברים זה לזה במלואם. שכבת הנורמליזציה מחוברת לשכבות האיגום המקסימליות לאחר הרמה הראשונה והשנייה. ReLU מקושר לכל שכבות הלמידה.

איור 3: ארכיטקטורה של AlexNet. חמש שכבות קונבולוציוניות ושלוש שכבות מחוברות במלואן משמשות לעיבוד נתונים חזותיים במודל הסיכום. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
רשת עמוד השדרה העיקרית לעבודה הייתה GARNN בשכבה צפופה. ישנן שלוש שכבות ב-RNN העבה. עם 80 נוירונים בשכבה השנייה ו-170 בראשונה, הוא מורכב משתי שכבות מחוברות לחלוטין (fc). השכבות הבאות הן נורמליזציה ונשירה של אצווה. ה-fc, השכבה האחרונה, מורכבת משלושה תאי עצב ומשמשת לחלוקת התמונה. השכבה הצפופה, שמגיעה אחרי ה-LSTM, מחלקת את האזור סביב הגידול במוח. AlexNet נותן לשכבת LSTM מאפיינים. למערך הנתונים יש מקסימום 20 פרוסות, השווה למספר הכולל של הרצפים שהוכרזו. השכבה הראשונה של ה-GARNN מכילה 100 יחידות נסתרות, ואילו השכבה השלישית מכילה 125 יחידות נסתרות.
מנגנון השער שולב בשכבה הצפופה (המקושרת לחלוטין) של AlexNet במסגרת GARNN-AE-LSTM המוצעת שלנו. מפות תכונות קונבולוציוניות מעובדות לעתים קרובות על ידי AlexNet ונשלחות ישירות לשכבות מחוברות לחלוטין לסיווג. כל המאפיינים המרחביים שאוחזרו, כולל דפוסים מיותרים או פחות משמעותיים, מטופלים באופן שווה בשיטה זו. טיפלנו בכך על ידי הצגת פונקציית שער המתפקדת כמסנן תכונות ומבוססת על סיגמואיד. במונחים מתמטיים, וקטור שער g = σ(wX) + b, מווסת את הפלט של השכבה הצפופה, כאשר σ מייצג את פונקציית הסיגמואיד. במהלך האימון, שער זה לומד לתת משקלי הפעלת תכונות שונים הנעים בין 0 ל-1. הם: (i) ערכי שער נמוכים מדכאים תכונות לא רלוונטיות (למשל, רעשי רקע או מרקמים מיותרים). (ii) ערכי שער גבוהים יותר מדגישים תכונות מבחינים (כגון אזורי אובייקט חשובים או דפוסים רגישים לתנועה). (iii) ערכת תכונות משופרת זו משמשת לאחר מכן את רכיב ה-RNN, מה שמאפשר לו ללכוד טוב יותר תלות זמנית מבלי להסיט את המסלול על ידי מידע מרחבי לא רלוונטי. (iv) התפשטות לאחור משמשת לשינוי פרמטרי השער במהלך האימון בד בבד עם AlexNet וה-RNN. זה מרמז שעם הזמן, המודל לומד אילו היבטים הם החשובים ביותר לסיכום בנוסף לאילו תכונות לחלץ.
באיור 4, המשתנה X מציין את נתוני הקלט, C מציין את התא ו-H מציין את המצב הנסתר.

איור 4: מודל ארכיטקטורת רשת עצבית חוזרת מגודרת (GARNN). ה-GARNN משלב נורמליזציה של אצווה, נשירה ושכבות צפופות מרובות למידול רצף יעיל. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
בכל בלוק, המשקולות המתאימות, כגון Iw, Rw והטיה הנקראות קלט, משקל חוזר והטיה, בהתאמה, שימשו כמו ב-Eqn (3) עד Eqn (5)
(3)
(4)
(5)
בחותמת זמן מסוימת t, מצב התא מסומן כמו ב-Eqn (6)
(6)
כאשר
המכפלה של Hadamard ומצב היחידה הנסתרת מסומנת כמו ב-Eqn (7)
(7)
לפיכך, הוא משתמש במודול py Audio Analysis כדי לחשב מאפייני שמע ברמת הקטע עבור כל קליפ שמע שחולץ מקובץ הווידאו המתאים, תוך שימוש ב-ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. התכונות שחולצו מפורטות בטבלה 1. בהתאם לתהליך זה, חילוץ תכונות השמע נעשה בתחילה על בסיס זמני. החלק האחרון של הייצוג מורכב מסטטיסטיקות תכונות ברמת המגזר המחושבות ברמה שנייה. באופן ספציפי, מבוצע עיבוד לטווח קצר עבור כל קטע של אות השמע, וכתוצאה מכך חישוב של 68 תכונות לטווח קצר (34 תכונות ו-34 דלתות) עבור כל חלון ברמת הקטע, שעשוי להיות חופף או לא חופף. השתמשנו במגוון מאפיינים חזותיים כדי להעביר את תוכן המידע החזותי בנוסף לחילוץ אלמנטים שמיעתיים מאות הקול של כל סרטון. שיטה זו צפויה להיות מכרעת לתהליך הסיכום. ספריית multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) שימשה לחילוץ תכונות המשקפות היבטים חזותיים של סרטון על מנת לחלץ אלמנטים חזותיים אלה. באופן ספציפי, 88 האלמנטים החזותיים המפורטים להלן נלקחים מהמסגרת התואמת כל 0.2 שניות. בכך, התכונות הרב-מודאליות מתמזגות, ובסך הכל 59 תכונות משמשות לניתוח נוסף של סיווג הסרטון כאינפורמטיבי ולא מעניין על ידי ביצוע סיכום הווידאו.
הפחתת תכונות באמצעות PCA
ממד המאפיינים במחקר זה צומצם על ידי יישום ניתוח רכיבים עיקריים (PCA). המאפיינים הבסיסיים הופכים לתכונות מפתח על מנת להגביר את הבולטות והחשיבות שלהם. PCA נמצא בשימוש נרחב על ידי חוקרים רבים במגוון תחומים24. הערכים העצמיים משמשים לקביעת המאפיינים. תכונות הערך העצמי הגבוה ביותר נבחרות, ואילו תכונות הערך העצמי הנמוך ביותר מוסרות.
לאחר הסרת מסגרות מיותרות, PCA משמש במחקר זה כשלב אופציונלי להפחתת תכונות. PCA מדכא רעש ומידע מיותר על ידי דחיסת וקטורי התכונה הגבוהים המיוצרים על ידי GARNN לתוך תת-מרחב קטן. זה מגביר את היעילות החישובית של ה-AE-LSTM תוך הבטחה שזיהוי מסגרות מפתח נשלט על ידי הרמזים החזותיים והשמיעתיים המפלים ביותר. על מנת לאזן בין מדרגיות ודיוק בסיכום וידאו, PCA משמש ככלי שימושי. האלגוריתם (אלגוריתם 1) מסופק כקובץ משלים 1.
כל מסגרת זהה לחלוטין למסגרת הקודמת או דומה לה להפליא נחשבת למיותרת. ברור ששינוי קצב הפריימים יכול להשפיע על שיעור מסגרות הווידאו שהוסרו. ליתר דיוק, ככל שקצב הפריימים גדל, הדמיון בין מסגרות עוקבות גדל גם הוא, מה שמוביל לאחוז גבוה יותר של מסגרות שהוסרו. כעת, התכונות מופחתות הממדים משמשות לאימון מודל ה-ML, הנקרא מודל AE-LSTM היריב.
אימון באמצעות AELSTM
רשת עצבית הנקראת GAN25 מורכבת משתי תת-רשתות יריבות: 1) רשת "מחולל" (G) שיוצרת נתונים הדומים להתפלגות לא ידועה, ו-2) רשת "מפלה" (D) המבחינה בין הדגימות שנוצרו לבין אלה מתצפיות בפועל. המטרה היא למצוא מחולל שממקסם את הסבירות שהמפלה יבצע טעות תוך התאמה להתפלגות הנתונים בפועל.
נניח ש-X הוא הקלט ו-E הוא רעש הקלט הקודם, X'= g(E) הוא הדגימה שנוצרה. באמצעות אופטימיזציה של מינימקס, הלמידה מנוסחת:
(8)
כאשר D מוסמך להשיג את ההסתברות הנכונה לסיווג. מרכיבי מודל האימון שפיתחנו מוצגים באיור 5. הבורר LSTM בוחר את קבוצת המשנה של המסגרות מרצף הווידאו הקלט X. המסגרות שנבחרו מומרים לתכונה באורך קבוע E באמצעות המקודד-LSTM, ואחריו שחזור הווידאו X באמצעות המפענח-LSTM. הסיווג של X' למחלקת וידאו או סיכום אמיתי מבוצע על ידי המפלה-LSTM. במחקר זה, AE-LSTM משמש לסיכום וידאו עם מבנה GAN לסיכומי וידאו יעילים, מגוונים ומובנים. ה-AE יכול לבטל את שינויי הרקע המיותרים, וה-LSTM יכול לזהות את מעברי הסצנה במקום להתייחס למסגרות כתמונות, וה-GAN, הגנרטור יכול לסכם את הסרטון, והמפלה מבטיח שהסיכום מגוון

איור 5: ארכיטקטורה של מודל הסיכום AELSTM. כולל Selector-LSTM, Encoder-LSTM, Decoder-LSTM ו-Discriminator-LSTM כדי לייעל סיכומי וידאו באמצעות אימון יריב. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
על ידי מתן תכונות GARNN עבור כל מסגרת בסרטון הקלט X שנקרא
, המסכם משתמש בבורר LSTM כדי לבחור את תת-קבוצת המסגרות, והמקודד מקודד את המסגרות כ-E ואחריו המפענח משחזר את הסרטון כ-X' בכל מסגרת xt. הבורר מנצל את ניקוד החשיבות בעת בחירת המסגרת. התכונות ניתנות על ידי ערך המשקל באמצעות הציונים, ולאחר מכן עוברות למקודד. עבור כל מסגרת עם ציון st = 1, תת-הקבוצה מתקבלת רק על ידי המקודד. המפלה בוחר את המחלקות כמקוריות או כסיכום על ידי הערכת המרחק בין X ל-X' והקצאת התוויות. במקרה זה, המפלה מחשב את השגיאה בין הסרטון המקורי לסרטון התקציר. אלגוריתם 2 (קובץ משלים 2) מציין את סיכום ההכשרה של AELSTM לסיכום וידאו.
לאחר עיבוד - סיכום וידאו
סיכומי וידאו יכולים להיות מופקים על ידי מסווגים ברמת הסגמנט לאחר הכשרתם. שלושה שלבים מעורבים בהשגת מטרה זו: (i) קבע את המאפיינים האודיו, הוויזואליים או המשולבים של כל קטע וידאו. (ii) לסווג כל קטע וידאו באמצעות מסווג האודיו, החזותי או ההיתוך המתאים. (iii) כדי למנוע טעויות בולטות, עבד לאחר מכן את תחזיות המסווג המסודר.
כדי לענות על דרישה זו, פותח צינור המורכב משני פילטרים נפרדים לשלב שלאחר העיבוד. מערך הקלט נתון תחילה למסנן חציוני באורך N1 תוך שימוש בחלונות מקומיים על מנת להחליק את תחזיות המסווג הרציף. התחזיות הסופיות נקבעות לאחר מכן על ידי סינון קשיח בשיטה פשוטה השומרת על סדרה של תחזיות חיוביות ברצף (מקטעים אינפורמטיביים) אם לפחות מקטעי N2 נכללים ברצף זה. במילים אחרות, קריטריון זה דורש מקטע מאלף שיימשך לפחות N2 שניות.