מאמר מחקר

GARNN-AE-LSTM: גישת למידה עמוקה רב-מודאלית לסיכום וידאו ברמת דיוק גבוהה

DOI:

10.3791/69097

10 באוקטובר 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציע מסגרת למידה עמוקה רב-מודאלית לסיכום וידאו על ידי שילוב תכונות אודיו-ויזואליות באמצעות מודלים של GARNN שהוכשרו מראש. המערכת ממנפת GRUs, AlexNet ומסווג LSTM יריב, משפרת את זיהוי ה-keyframe, מפחיתה יתירות ומשיגה דיוק סיכום גבוה עם ציון F ממוצע של 0.985.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סיכום וידאו מתמקד ביצירת גרסאות תמציתיות של סרטונים ארוכים על ידי שימור תוכן חיוני. מחקר זה חושף אסטרטגיית למידת מכונה רב-מודאלית המשלבת מידע חזותי ושמיעתי על ידי שימוש בארכיטקטורות רשת עצבית חוזרות מגודרות שהוכשרו מראש המכונות GARNN, המשלבות יחידות חוזרות מגודרות (GRUs) ו-AlexNet, כדי לחלץ תכונות אודיו, תמונה וחזותיות. זיהוי המסגרת הראשית משופר על ידי הסרת מסגרות מיותרות והחלת הפחתת תכונות מקוזזת תנועה, ולאחר מכן הפחתת מימדים אופציונלית מבוססת PCA. מסווג זיכרון לטווח קצר (AE-LSTM) מבוסס מקודד יריב משמש למידול זמני על ידי השגת דיוק גבוה בסיכום. התוצאות הוערכו על ידי שימוש ברגישות, ציוני F וערכי ניבוי חיוביים, והשיטה השיגה ציון F ממוצע של 0.985. AlexNet מגודר מוצג במסגרת GARNN-AE-LSTM רב-מודאלית, שבה הפחתה מבוססת PCA עם פיצוי תנועה מבטלת יתירות, GRUs מתעדים התקדמות זמנית, ושער מכוונן את בחירת התכונות המרחביות, כל אלה תורמים למערכת סיכום וידאו מדויקת ויעילה יותר. ציון F1 המשופר מדגים את יעילות המודל ביצירת דיוק בתקצירי וידאו על ידי יצירת סרטון משמעותי. גישה זו מדגישה את הפוטנציאל של חילוץ תכונות רב-מודאליות וטכניקות למידה עמוקה מתקדמות לניתוח ודחיסת וידאו חזקים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מערכות ניתוח רב-מודאלי (MMA) צצו, המשלבות מספר שיטות כמו אודיו, וידאו, טקסט ונתוני חיישנים כדי לספק תובנות לגבי האופן שבו תלמידים לומדים1. טכנולוגיות אלו יכולות לסייע בהשגת הבנה מעמיקה של התנהגות התלמידים ורמות המעורבות על ידי הערכת נתונים רב-מודאליים2. עם זאת, ישנם מספר מכשולים ומגבלות בכל הנוגע ליצירת מערכות MMA יעילות3. יש המון סרטונים דיגיטליים עקב צמיחת האינטרנט ומצלמות האבטחה. הכרחי שהסרטונים הללו ייאספו למאגרי מידע. סיכום וידאו יכול להיות מועיל במצב זה. יצירת תקציר שימושי של הסרטון האמיתי ידועה בשם סיכום וידאו, והיא עוזרת במעקב אחר פעילות, זיהוי חריגות ואחזור וידאו4. ניתן לבצע סיכום וידאו באמצעות מגוון אסטרטגיות. שיטות אלו מתחלקות לאחת משתי קטגוריות5, כגון סיכום וידאו חילוץ ומופשט.

מכיוון שסיכום וידאו דורש מחשוב רב, יש צורך בשיטות יעילות. אם כל פריים בסרט נבדק לבחירה, תהליך הסיכום יכול להיות איטי וארוך, ומשאבי עיבוד יכולים להיות מושקעים במסגרות זהות או דומות. יתר על כן, כדי לזרז את התהליך ולהבטיח שרק תכונות חשובות יילקחו בחשבון, יש לבצע צמצום מקום לכל קבוצה של תכונות6. ניתן לסווג טכניקות לסיכום וידאו לארבעה תחומים עיקריים על סמך סוג האותות האודיו-ויזואליים המופקים ומוצגים למשתמש הקצה7, או הפלט שלהם. ליתר דיוק, התוצאות של חישובי סיכום וידאו יכולות לכלול: (i) פריימים ראשוניים8, המוצגים ברצף מסגרות וידאו שחולצו הידועות בדרך כלל כסיכומים סטטיים; (ii) מסגרות וידאו9, הנקראות סיכומים דינמיים; (iii) אותות חזותיים10, המשפרים סיכומים עבור משתמש הקצה על ידי הוספת תחביר מבוסס גרפיקה לרמזים אחרים; ו-(iv) שנוצרו על ידי מחשבים, ביאורים טקסטואליים11, שנועדו להציע סיכומים יעילים של מידע וידאו.

סיכומים המבוססים על מסגרות ראשיות הם בדרך כלל קטנים יותר מאלה המבוססים על צילומי מפתח. מסגרת ראשית מתייחסת למסגרת מייצגת בודדת שנבחרה מהווידאו. Keyshot מציין קטע רציף קצר של מסגרות וידאו המקובצות סביב מסגרות ראשיות. מחלקת סיכום מתייחסת למסגרות או לקטעים של תיוג הפלט של המסווג כאינפורמטיביים (שייכללו בסיכום) או לא אינפורמטיביים (לא ייכללו). עם זאת, יתרון זה בא על חשבון השמטת פרטים חשובים בתהליך הסיכום. לדוגמה, זה יכול להיות קשה לקבל את ההקשר של מסגרת הקודמת בסיכום מבוסס מסגרת מפתח. הוא גם נטול הצליל המקורי. כדי לטפל בבעיות אלו, לכן נבחרות לעתים קרובות טכניקות סיכום וידאו מבוססות צילום מקשים. טכניקות סיכום וידאו מבוססות Keyshot משמשות ליצירת קבוצות משנה לסרטונים ארוכים או קצרים. לסרטונים קצרים וארוכים יש בדרך כלל משכים של פחות מ-10 דקות ויותר מ-10 דקות, בהתאמה:12. יצירת תת-קבוצות בסיוע צילומי מפתח לסרטונים קצרים אינה מעשית וייתכן שלא תצליח בשל אורך ההשמעה החוזרת הקצר ממילא. יתר על כן, זמן ההפעלה של סרטונים ארוכים, במיוחד סרטים או סרטוני ספורט, עשוי לעלות על 90 דקות. עבור קטגוריות וידאו כאלה, טכניקות סיכום מבוססות צילום מקשים שימושיות ויעילות יותר במתן סקירה קצרה למשתמשים.

האופי הסובייקטיבי של תקציר וידאו הופך אותו למשימה מרתיעה. זאת בשל העובדה שלכל משתמש יש טעמים שונים, גם כשמדובר בתוכן וידאו דומה. ניתן לפתור בעיה זו במדויק בעזרת גישת סיכום הווידאו המותאמתאישית 13. מטרת האלגוריתם היא לספק לכל משתמש תוכן המותאם לתחומי העניין שלו. עם זאת, סיכומי וידאו מותאמים עם משכי זמן אידיאליים לסרטונים ארוכים חדשים (כמו אירועי ספורט) אינם זמינים. השיטות הנוכחיותדורשות משאבי מחשב עצומים כדי להעריך נתוני העדפות לקוחות וצילומי וידאו על מנת לספק סיכומים אישיים בזמן אמת. ניתן לקבל סיכומי וידאו מותאמים אישית בזמן אמת משרתים ייעודיים מרכזיים. באבו ויסאם וסאטיש16 דנו בניתוח טקסונומי יסודי של כל אסטרטגיות סיכום הווידאו העיקריות המדגימות גישות בשימוש נרחב הדחוסות ביעילות כמויות עצומות של נתוני וידאו. הסקירה מסווגת ומעריכה מתודולוגיות ביחס לגישות הבסיסיות שלהן, הכוללות אסטרטגיות אינטגרציה רב-מודאליות, מסגרות למידה עמוקה ושיטות מבוססות אשכולות. בין השיטות הראויות לציון ניתן למנות את מסגרת KDAN, המשתמשת בזיקוק ידע לסיכום מפוקח, ושיטת SVS_MCO, המשתמשת באשכולות DBSCAN המותאם על ידי אלגוריתם האצות המלאכותיות. בנוסף, הסקירה מספקת מודלים מתוחכמים כגון הרשת האודיו-ויזואלית החוזרת ולמידת נשר אפריקאית עמוקה מבוססת שאילתות, שנמצאו יעילים ביותר בניהול בעיות סיכום וידאו דינמיות ורב-מודאליות.

הכללת מסגרת רב-מודאלית מגודרת של רשת עצבית חוזרת של AlexNet (GARNN-AE-LSTM) לסיכום וידאו היא מה שהופך את המחקר הזה לחדשני. גישה זו משפרת את הדיוק והיעילות של תהליך סיכום הווידאו על ידי הפחתת יתירות עם PCA מקוזז תנועה, לכידת דינמיקה זמנית עם GRUs ואופטימיזציה של בחירת מאפיינים מרחביים באמצעות שיטות שער. על מנת לספק את סיכום הווידאו ביעילות עם מורכבות מופחתת, מאמר זה תורם את הדברים הבאים: (i) סיכום וידאו רב-מודאלי: הציע מסגרת ליצירת סיכומי וידאו תמציתיים על ידי שילוב מידע חזותי ושמיעתי באמצעות מודל GARNN מאומן מראש המשלב RNNs מגודרים ו-AlexNet. (ii) AlexNet מגודר לליטוש תכונות: הכנס מנגנון מגודר חדשני (שער סיגמואידי) לשכבה הצפופה של AlexNet כדי לסנן תכונות מרחביות לא רלוונטיות, ובכך לשפר את חילוץ התכונות החזותיות ברמה גבוהה. האינטגרציה עם RNN מאפשרת מידול זמני יעיל של תלות ממסגרת למסגרת. (iii) חיסול פריימים מיותרים: פיתח גישה מבוססת שונות מקוזזת תנועה להסרת מסגרות זהות או דומות לפני זיהוי מסגרות מפתח, ואחריה הפחתת מימדים אופציונלית מבוססת PCA לייצוג יעיל של תכונות. (iv) זיהוי Keyframe מדויק: השתמש במסווג LSTM מבוסס מקודד יריב למידול זמני, והשיג ציון F ממוצע של 0.985, ובכך הפגין דיוק סיכום מעולה בהשוואה לגישות בסיסיות. (v) יעילות על פני מודלים של שנאים: הוכח כי מודל ה-GARNN המוצע יעיל מבחינה חישובית, כאשר AlexNet לוכד ביעילות תכונות מרחביות, RNN מדגמן תלות עוקבת, ומנגנון השער מסנן מסגרות לא חשובות, ועולה על חלופות מבוססות שנאי בבחירת תכונות וסיכום.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציע שיטת סיכום וידאו בפיקוח רב-מודאלי הנכללת בקטגוריית סיכום וידאו גנרי, המכונה בדרך כלל רפרוף וידאו. זה כולל טכניקות שמתרכזות במציאת קטעי מפתח של סרטון גדול יותר כדי ליצור גרסה דחוסה זמנית שלו. מחקר זה מציע טכניקה מפוקחת לניתוח זרם הווידאו בקטעים של 1 שניות הכוללים ייצוגים קוליים וויזואליים, כפי שמוצג באיור 1. קטעים אלה מסווגים לאחר מכן כ"לא מעניינים" או "אינפורמטיביים". בניגוד לנתונים סינתטיים או מדומים, "נתונים אמיתיים" מתייחסים כעת למערכי הווידאו בפועל המשמשים לניסויים. קטעי וידאו המספקים אותות אודיו-ויזואליים חשובים הנחוצים לסיכום - כגון תנועה גבוהה, קול או מעברי סצנה - מכונים "קטעים אינפורמטיביים". חלקים "לא מעניינים" מוגדרים כמסגרות שחוזרות על עצמן או מיותרות שאינן מוסיפות שום דבר חדש לתקציר.

סרטוני הקלט מפולחים למסגרות, והתכונות הרב-מודאליות מופקות מכל פריים באמצעות מודל GARNN המוצע. התכונות האודיו והוויזואליות מתמזגות ומוזנות כקלט לשלב הפחתת הממדים, שבו המסגרות המיותרות מוסרות להמשך עיבוד. לבסוף, ה-AELSTM המוצע מוחל על הנתונים המופחתים לסיכום וידאו. מסווג בינארי מפוקח המאומן עם ייצוגי תכונות מהאופנים החזותיים, האודיו או המעורבים, הנקראים רב-מודאליות, משמש להשגת מטרה זו.

figure-protocol-1
איור 1: סקירה כללית של מודל סיכום הווידאו המוצע. הצינור כולל חילוץ תכונות רב-מודאליות, הפחתת מימדים ויצירת סיכום באמצעות AELSTM. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

מערך נתונים
האפקטיביות של הפתרונות המוצעים נקבעת באמצעות מערכי נתונים VSUMM17 ו-SumMe18 , זוג מערכי נתונים בנצ'מרק בסיכום וידאו סטטי. תכונות CNN שנוצרו באמצעות AlexNet עם LSTM ונתונים אמיתיים הן בין מערכי הנתונים. הנתונים האמיתיים ומערכי הנתונים נגישים לציבור הרחב19. 50 הסרטים במערך הנתונים של VSUMM הם מאתרים כמו YouTube ומשתרעים על פני 110 דקות ב-30 פריימים לשנייה. הם מגיעים במגוון ז'אנרים, כולל סרטים מצוירים, חדשות, ספורט, פרסום, סדרות טלוויזיה וסרטונים ביתיים. בין אלה, 25 סרטונים מורכבים מחגים, פסטיבלים וספורט שהתקבלו מאתר היוטיוב הידוע ותויגו עם לפחות 15 סיכומים שנוצרו על ידי בני אדם (390 בסך הכל) מרכיבים את מערך הנתונים של סיכום הווידאו "SumMe"20 . טווח משך הסרטונים הוא 1-6 דקות.

הסרטון המקורי מומר לתמונות RGB, המוזנות כקלט למודל ה-GARNN המוצע מראש לחילוץ תכונות. דגם זה מורכב מ- AlexNet ו- RNN מגודר. מספר התכונות המקורי הוא 64, ולתכונות של AlexNet יש 4100 תכונות.

הצעה לחילוץ תכונות מבוססות מגודרות-AlexNet-RNN
הן מצבי המידע החזותיים והן האודיו שימשו לסיכום הסרטונים. כדי להשיג ייצוג תכונה בשתי האופנים, זיהינו תכונות בעבודת יד המשמשות לעתים קרובות במשימות אשכולות וסיווג אודיו וויזואלי, כגון אחזור תמונות, סיווג וידאו, ניתוח סצנות שמיעה ואחזור מידע מוזיקלי. המטרה הייתה לכלול כמה שיותר רכיבים חזותיים וקוליים הדרכתיים. איור 2 מציג המחשה מושגית של התהליך המשמש לחילוץ תכונות עבור האופנים האודיו והוויזואליים.

figure-protocol-2
איור 2: חילוץ מאפיינים רב-מודאלי מבוסס GARNN מוצע. תכונות משיטות חזותיות ואודיו כאחד מחולצות באמצעות רכיבי AlexNet ו-GARNN. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

מגודר- AlexNetRNN: (GARNN)
לניתוח תמונות וירטואליות, CNN הוא דגם DL21 פופולרי. באופן כללי, CNN משתמשת בתמונה כקלט ומחלקת אותה למספר קבוצות. נוירוני קלט, רצף של שכבות עם איגום קונבולוציוני, שכבות מקושרות לחלוטין ושכבות מנרמלות מרכיבות את המבנה שלו22. הנוירונים של שכבת הקונבולוציה מחוברים לשכבה הקודמת באמצעות אזור צר. השכבות שמתחתיהם, מחוברות במלואן לתאי העצב המפעילים של השכבות המקושרות במלואן. Eqn (1) מייצג את ההתפשטות קדימה ואחורה של פונקציה מחוברת במלואה.

figure-protocol-3(1)

figure-protocol-4(2)

היכן figure-protocol-5 נמצאת ההפעלהשל הנוירון i בשכבה l, figure-protocol-6 הוא השיפועשל הנוירון i בשכבה l, figure-protocol-7 הוא המשקלשל הנוירון iבשכבה l + 1. עיצובים רבים של CNN צצו כתוצאה מהתקדמות המחקר האחרונה. נעשה שימוש ב-AlexNet בעבודה זו.

הארכיטקטורה של AlexNet, המוצגת באיור 3, משקפת עיצוב מוקפד ומובנה היטב. שלוש שכבות מחוברות לחלוטין וחמש שכבות קונבולוציה מרכיבות את שמונה שכבות הלמידה שלו. תוויות המחלקה מיוצרות על ידי הזנת התוצאה של השכבה האחרונה לפונקציה שמפעילה את softmax. גרעיני השכבה השנייה, הרביעית או החמישית מחוברים לרמות הקודמות שלהם באמצעות שיתוף GPU. גרעיני השכבה השנייה והשלישית מחוברים זה לזה במלואם. שכבת הנורמליזציה מחוברת לשכבות האיגום המקסימליות לאחר הרמה הראשונה והשנייה. ReLU מקושר לכל שכבות הלמידה.

figure-protocol-8
איור 3: ארכיטקטורה של AlexNet. חמש שכבות קונבולוציוניות ושלוש שכבות מחוברות במלואן משמשות לעיבוד נתונים חזותיים במודל הסיכום. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

רשת עמוד השדרה העיקרית לעבודה הייתה GARNN בשכבה צפופה. ישנן שלוש שכבות ב-RNN העבה. עם 80 נוירונים בשכבה השנייה ו-170 בראשונה, הוא מורכב משתי שכבות מחוברות לחלוטין (fc). השכבות הבאות הן נורמליזציה ונשירה של אצווה. ה-fc, השכבה האחרונה, מורכבת משלושה תאי עצב ומשמשת לחלוקת התמונה. השכבה הצפופה, שמגיעה אחרי ה-LSTM, מחלקת את האזור סביב הגידול במוח. AlexNet נותן לשכבת LSTM מאפיינים. למערך הנתונים יש מקסימום 20 פרוסות, השווה למספר הכולל של הרצפים שהוכרזו. השכבה הראשונה של ה-GARNN מכילה 100 יחידות נסתרות, ואילו השכבה השלישית מכילה 125 יחידות נסתרות.

מנגנון השער שולב בשכבה הצפופה (המקושרת לחלוטין) של AlexNet במסגרת GARNN-AE-LSTM המוצעת שלנו. מפות תכונות קונבולוציוניות מעובדות לעתים קרובות על ידי AlexNet ונשלחות ישירות לשכבות מחוברות לחלוטין לסיווג. כל המאפיינים המרחביים שאוחזרו, כולל דפוסים מיותרים או פחות משמעותיים, מטופלים באופן שווה בשיטה זו. טיפלנו בכך על ידי הצגת פונקציית שער המתפקדת כמסנן תכונות ומבוססת על סיגמואיד. במונחים מתמטיים, וקטור שער g = σ(wX) + b, מווסת את הפלט של השכבה הצפופה, כאשר σ מייצג את פונקציית הסיגמואיד. במהלך האימון, שער זה לומד לתת משקלי הפעלת תכונות שונים הנעים בין 0 ל-1. הם: (i) ערכי שער נמוכים מדכאים תכונות לא רלוונטיות (למשל, רעשי רקע או מרקמים מיותרים). (ii) ערכי שער גבוהים יותר מדגישים תכונות מבחינים (כגון אזורי אובייקט חשובים או דפוסים רגישים לתנועה). (iii) ערכת תכונות משופרת זו משמשת לאחר מכן את רכיב ה-RNN, מה שמאפשר לו ללכוד טוב יותר תלות זמנית מבלי להסיט את המסלול על ידי מידע מרחבי לא רלוונטי. (iv) התפשטות לאחור משמשת לשינוי פרמטרי השער במהלך האימון בד בבד עם AlexNet וה-RNN. זה מרמז שעם הזמן, המודל לומד אילו היבטים הם החשובים ביותר לסיכום בנוסף לאילו תכונות לחלץ.

באיור 4, המשתנה X מציין את נתוני הקלט, C מציין את התא ו-H מציין את המצב הנסתר.

figure-protocol-9
איור 4: מודל ארכיטקטורת רשת עצבית חוזרת מגודרת (GARNN). ה-GARNN משלב נורמליזציה של אצווה, נשירה ושכבות צפופות מרובות למידול רצף יעיל. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

בכל בלוק, המשקולות המתאימות, כגון Iw, Rw והטיה הנקראות קלט, משקל חוזר והטיה, בהתאמה, שימשו כמו ב-Eqn (3) עד Eqn (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

בחותמת זמן מסוימת t, מצב התא מסומן כמו ב-Eqn (6)

figure-protocol-13(6)

כאשר figure-protocol-14 המכפלה של Hadamard ומצב היחידה הנסתרת מסומנת כמו ב-Eqn (7)

figure-protocol-15(7)

לפיכך, הוא משתמש במודול py Audio Analysis כדי לחשב מאפייני שמע ברמת הקטע עבור כל קליפ שמע שחולץ מקובץ הווידאו המתאים, תוך שימוש ב-ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. התכונות שחולצו מפורטות בטבלה 1.  בהתאם לתהליך זה, חילוץ תכונות השמע נעשה בתחילה על בסיס זמני. החלק האחרון של הייצוג מורכב מסטטיסטיקות תכונות ברמת המגזר המחושבות ברמה שנייה. באופן ספציפי, מבוצע עיבוד לטווח קצר עבור כל קטע של אות השמע, וכתוצאה מכך חישוב של 68 תכונות לטווח קצר (34 תכונות ו-34 דלתות) עבור כל חלון ברמת הקטע, שעשוי להיות חופף או לא חופף. השתמשנו במגוון מאפיינים חזותיים כדי להעביר את תוכן המידע החזותי בנוסף לחילוץ אלמנטים שמיעתיים מאות הקול של כל סרטון. שיטה זו צפויה להיות מכרעת לתהליך הסיכום. ספריית multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) שימשה לחילוץ תכונות המשקפות היבטים חזותיים של סרטון על מנת לחלץ אלמנטים חזותיים אלה. באופן ספציפי, 88 האלמנטים החזותיים המפורטים להלן נלקחים מהמסגרת התואמת כל 0.2 שניות. בכך, התכונות הרב-מודאליות מתמזגות, ובסך הכל 59 תכונות משמשות לניתוח נוסף של סיווג הסרטון כאינפורמטיבי ולא מעניין על ידי ביצוע סיכום הווידאו.

הפחתת תכונות באמצעות PCA
ממד המאפיינים במחקר זה צומצם על ידי יישום ניתוח רכיבים עיקריים (PCA). המאפיינים הבסיסיים הופכים לתכונות מפתח על מנת להגביר את הבולטות והחשיבות שלהם. PCA נמצא בשימוש נרחב על ידי חוקרים רבים במגוון תחומים24. הערכים העצמיים משמשים לקביעת המאפיינים. תכונות הערך העצמי הגבוה ביותר נבחרות, ואילו תכונות הערך העצמי הנמוך ביותר מוסרות.

לאחר הסרת מסגרות מיותרות, PCA משמש במחקר זה כשלב אופציונלי להפחתת תכונות. PCA מדכא רעש ומידע מיותר על ידי דחיסת וקטורי התכונה הגבוהים המיוצרים על ידי GARNN לתוך תת-מרחב קטן. זה מגביר את היעילות החישובית של ה-AE-LSTM תוך הבטחה שזיהוי מסגרות מפתח נשלט על ידי הרמזים החזותיים והשמיעתיים המפלים ביותר. על מנת לאזן בין מדרגיות ודיוק בסיכום וידאו, PCA משמש ככלי שימושי. האלגוריתם (אלגוריתם 1) מסופק כקובץ משלים 1.

כל מסגרת זהה לחלוטין למסגרת הקודמת או דומה לה להפליא נחשבת למיותרת. ברור ששינוי קצב הפריימים יכול להשפיע על שיעור מסגרות הווידאו שהוסרו. ליתר דיוק, ככל שקצב הפריימים גדל, הדמיון בין מסגרות עוקבות גדל גם הוא, מה שמוביל לאחוז גבוה יותר של מסגרות שהוסרו. כעת, התכונות מופחתות הממדים משמשות לאימון מודל ה-ML, הנקרא מודל AE-LSTM היריב.

אימון באמצעות AELSTM
רשת עצבית הנקראת GAN25 מורכבת משתי תת-רשתות יריבות: 1) רשת "מחולל" (G) שיוצרת נתונים הדומים להתפלגות לא ידועה, ו-2) רשת "מפלה" (D) המבחינה בין הדגימות שנוצרו לבין אלה מתצפיות בפועל. המטרה היא למצוא מחולל שממקסם את הסבירות שהמפלה יבצע טעות תוך התאמה להתפלגות הנתונים בפועל.

נניח ש-X הוא הקלט ו-E הוא רעש הקלט הקודם, X'= g(E) הוא הדגימה שנוצרה. באמצעות אופטימיזציה של מינימקס, הלמידה מנוסחת:

figure-protocol-16(8)

כאשר D מוסמך להשיג את ההסתברות הנכונה לסיווג. מרכיבי מודל האימון שפיתחנו מוצגים באיור 5. הבורר LSTM בוחר את קבוצת המשנה של המסגרות מרצף הווידאו הקלט X. המסגרות שנבחרו מומרים לתכונה באורך קבוע E באמצעות המקודד-LSTM, ואחריו שחזור הווידאו X באמצעות המפענח-LSTM. הסיווג של X' למחלקת וידאו או סיכום אמיתי מבוצע על ידי המפלה-LSTM. במחקר זה, AE-LSTM משמש לסיכום וידאו עם מבנה GAN לסיכומי וידאו יעילים, מגוונים ומובנים. ה-AE יכול לבטל את שינויי הרקע המיותרים, וה-LSTM יכול לזהות את מעברי הסצנה במקום להתייחס למסגרות כתמונות, וה-GAN, הגנרטור יכול לסכם את הסרטון, והמפלה מבטיח שהסיכום מגוון

figure-protocol-17
איור 5: ארכיטקטורה של מודל הסיכום AELSTM. כולל Selector-LSTM, Encoder-LSTM, Decoder-LSTM ו-Discriminator-LSTM כדי לייעל סיכומי וידאו באמצעות אימון יריב. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

על ידי מתן תכונות GARNN עבור כל מסגרת בסרטון הקלט X שנקרא figure-protocol-18 , המסכם משתמש בבורר LSTM כדי לבחור את תת-קבוצת המסגרות, והמקודד מקודד את המסגרות כ-E ואחריו המפענח משחזר את הסרטון כ-X' בכל מסגרת xt. הבורר מנצל את ניקוד החשיבות בעת בחירת המסגרת. התכונות ניתנות על ידי ערך המשקל באמצעות הציונים, ולאחר מכן עוברות למקודד. עבור כל מסגרת עם ציון st = 1, תת-הקבוצה מתקבלת רק על ידי המקודד. המפלה בוחר את המחלקות כמקוריות או כסיכום על ידי הערכת המרחק בין X ל-X' והקצאת התוויות. במקרה זה, המפלה מחשב את השגיאה בין הסרטון המקורי לסרטון התקציר. אלגוריתם 2 (קובץ משלים 2) מציין את סיכום ההכשרה של AELSTM לסיכום וידאו.

לאחר עיבוד - סיכום וידאו
סיכומי וידאו יכולים להיות מופקים על ידי מסווגים ברמת הסגמנט לאחר הכשרתם. שלושה שלבים מעורבים בהשגת מטרה זו: (i) קבע את המאפיינים האודיו, הוויזואליים או המשולבים של כל קטע וידאו. (ii) לסווג כל קטע וידאו באמצעות מסווג האודיו, החזותי או ההיתוך המתאים. (iii) כדי למנוע טעויות בולטות, עבד לאחר מכן את תחזיות המסווג המסודר.

כדי לענות על דרישה זו, פותח צינור המורכב משני פילטרים נפרדים לשלב שלאחר העיבוד. מערך הקלט נתון תחילה למסנן חציוני באורך N1 תוך שימוש בחלונות מקומיים על מנת להחליק את תחזיות המסווג הרציף. התחזיות הסופיות נקבעות לאחר מכן על ידי סינון קשיח בשיטה פשוטה השומרת על סדרה של תחזיות חיוביות ברצף (מקטעים אינפורמטיביים) אם לפחות מקטעי N2 נכללים ברצף זה. במילים אחרות, קריטריון זה דורש מקטע מאלף שיימשך לפחות N2 שניות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

חילוץ התכונות המוצע מבוסס GARNN וסיכום וידאו מבוסס AGLSTM של סרטונים ארוכים נוסו על שני מערכי נתונים, כלומר VSUMM ו-SumMe. חלק זה דן בתוצאות הניסוי והשוואה לגישות קונבנציונליות. עבור ה-LSTM המפלה, אנו משתמשים ב-LSTM דו-שכבתי עם 1024 יחידות נסתרות בכל שכבה. עבור encoder_LSTM ו-decoder_LSTM, בהתאמה, אנו משתמשים בשני LSTMs דו-שכבתיים עם 2048 יחידות נסתרות בכל שכבה. מפענח LSTM המבקש לאחסן ולסנתז את הרצף ההפוך הוכח כפשוט יותר לאימון26. רצף התכונות משוחזר גם בסדר הפוך על ידי המפענח שלנו LSTM. ההגדרות של...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

במחקר זה, סיכום הווידאו של סרטונים ארוכים מוצג באמצעות מודלים יעילים של ML ו-DL רב-מודאליים, המשתמשים באופני אודיו, תמונה וויזואליים של נתונים שנוצרו מנתוני הקלט. המסווג הבינארי מאומן ללמוד את ההבחנה בין המקטעים החשובים שהם חלק הסיכום המיוצר לבין המקטעים ה"לא חשובים" שנזרקים. המודל מאומן באמצעות מערכי נתונים כגון SumMe ו-VSUMM, ויכולת ההרחבה של המודל מודגמת מבחינת המדדים. בתחילה, התכונות מופקות מהסרטונים באמצעות מודל GARNN, והיא מעובדת עוד יותר באמצעות PCA כדי להפחית את הממדיות. באמצעות ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי אינטרסים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים אסירי תודה לבית הספר לטלוויזיה של ד"ר, אוניברסיטת סצ'ואן לקולנוע וטלוויזיה, על שסיפקו את מתקני המעבדה לביצוע המחקר.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
AlexNet (מודל מאומן מראש)MATLAB / PyTorchרכזת PyTorch — מודל AlexNet טרום אימון: https://pytorch.org/hub/pytorch_vision_alexnet/משמש לחילוץ תכונות חזותיות
FFmpegFFmpeg.orghttps://ffmpeg.org/חילוץ אודיו מווידאו
מודל מבוסס GRNNיישום מותאם אישיתספרייה " נויפי" מיישם GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlמשמש עבור היתוך תכונות רב-מודאליות
LSTM (זיכרון לטווח קצר ארוך)פייטורץ'https://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlמשמש בבורר, מקודד, מפענח
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisלחילוץ תכונות חזותיות
NumPyקרן התוכנה של פייתוןhttps://pypi.org/project/numpy/חישוב נומרי ופעולות מטריצה
PCA (ניתוח רכיבים עיקריים)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlהפחתת מימדים
PyAudioAnalysisGitHubhttps://github.com/tyiannak/pyaudioanalysisחילוץ תכונות שמע
פייטורץ'קרן PyTorchhttps://pytorch.org/מסגרת למידה עמוקה
מערך נתונים של SumMeמערך נתונים ציבוריhttps://gyglim.github.io/me/vsum/index.htmlמערך נתונים של סיכום וידאו בנצ'מרק
מערך נתונים של VSUMMמערך נתונים ציבוריhttp://www.vision.ime.usp.br/~creativision/vsumm/מערך נתונים של סיכום וידאו בנצ'מרק

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

PCAF1

מאמרים קשורים