$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تقترح هذه الدراسة طريقة تلخيص فيديو خاضعة للإشراف متعددة الوسائط تندرج ضمن فئة تلخيص الفيديو العامة ، والتي يشار إليها عادة باسم قشط الفيديو. يتضمن ذلك التقنيات التي تركز على العثور على الأجزاء الرئيسية من مقطع فيديو أكبر لإنشاء نسخة مكثفة مؤقتا منه. تقترح هذه الدراسة تقنية خاضعة للإشراف لتحليل دفق الفيديو في أقسام 1 ثانية تتضمن تمثيلات سمعية ومرئية ، كما هو موضح في الشكل 1. ثم يتم تصنيف هذه المقاطع على أنها إما "غير مثيرة للاهتمام" أو "غنية بالمعلومات". على عكس البيانات التركيبية أو المحاكاة ، تشير "البيانات الحقيقية" الآن إلى مجموعات بيانات الفيديو الفعلية المستخدمة في التجارب. يشار إلى مقاطع الفيديو التي توفر إشارات سمعية بصرية مهمة ضرورية للتلخيص - مثل الحركة العالية أو الصوت أو انتقالات المشهد - باسم "المقاطع الإعلامية". يتم تعريف الأجزاء "غير المثيرة للاهتمام" على أنها إطارات متكررة أو زائدة عن الحاجة لا تضيف أي شيء جديد إلى الملخص.
يتم تقسيم مقاطع الفيديو المدخلة إلى إطارات ، ويتم استخراج الميزات متعددة الوسائط من كل إطار باستخدام نموذج GARNN المقترح. يتم دمج الميزات السمعية والمرئية وتغذيتها كمدخلات في مرحلة تقليل الأبعاد ، حيث تتم إزالة الإطارات الزائدة عن الحاجة لمزيد من المعالجة. وأخيرا، يطبق المعيار AELSTM المقترح على البيانات المخفضة من أجل تلخيص الفيديو. يتم استخدام مصنف ثنائي خاضع للإشراف مدرب على تمثيلات الميزات من الطرائق المرئية أو الصوتية أو المختلطة ، والتي تسمى الطرائق المتعددة ، لتحقيق ذلك.

الشكل 1: نظرة عامة على نموذج تلخيص الفيديو المقترح. يتضمن خط الأنابيب استخراج الميزات متعددة الوسائط وتقليل الأبعاد وإنشاء الملخص باستخدام AELSTM. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
مجموعة البيانات
يتم تحديد فعالية الحلول المقترحة باستخدام مجموعات بيانات VSUMM17 و SumMe18 ، وهي زوج من مجموعات البيانات المعيارية في تلخيص الفيديو الثابت. تعد ميزات CNN التي تم إنشاؤها باستخدام AlexNet مع LSTM والبيانات الحقيقية من بين مجموعات البيانات. البيانات ومجموعات البيانات الحقيقية متاحة لعامة الناس19. الأفلام ال 50 في مجموعة بيانات VSUMM مأخوذة من مواقع ويب مثل YouTube وتمتد لمدة 110 دقيقة بمعدل 30 إطارا في الثانية. تأتي في مجموعة متنوعة من الأنواع ، بما في ذلك الرسوم المتحركة والأخبار والرياضة والإعلانات والمسلسلات التلفزيونية ومقاطع الفيديو المنزلية. من بين هؤلاء ، يتكون 25 مقطع فيديو من العطلات والمهرجانات والرياضات التي تم الحصول عليها من موقع YouTube الشهير وتم وضع علامة عليها بما لا يقل عن 15 ملخصا من إنشاء الإنسان (390 في المجموع) تشكل مجموعة بيانات ملخص الفيديو "SumMe"20 . نطاق مدة مقاطع الفيديو هو 1-6 دقائق.
يتم تحويل الفيديو الأصلي إلى صور RGB ، والتي يتم تغذيتها كمدخلات في نموذج GARNN المقترح المدرب مسبقا لاستخراج الميزات. يتكون هذا النموذج من AlexNet و RNN مسور. العدد الأصلي للميزات هو 64 ، وتحتوي ميزات AlexNet على 4100 ميزة.
مقترح استخراج ميزة مقترح قائم على Gated-AlexNet-RNN
تم استخدام كل من الوضعين المرئي والصوتي للمعلومات لتلخيص مقاطع الفيديو. لتحقيق تمثيل ميزة في كلتا الطريقتين ، حددنا الميزات المصنوعة يدويا والتي غالبا ما تستخدم في مهام التجميع والتصنيف الصوتية والمرئية ، مثل استرجاع الصور وتصنيف الفيديو وتحليل المشهد السمعي واسترجاع معلومات الموسيقى. كان الهدف هو تضمين أكبر عدد ممكن من المكونات التعليمية والمرئية والسمعية. ويبين الشكل 2 توضيحا مفاهيميا للعملية المستخدمة لاستخراج معالم الطرائق السمعية والمرئية.

الشكل 2: استخراج الميزة المقترح متعدد الوسائط المستند إلى GANNN. يتم استخراج الميزات من كل من الطرائق المرئية والصوتية باستخدام مكونات AlexNet و GARNN. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
مسور- AlexNetRNN: (GARNN)
لتحليل الصور الافتراضية ، تعد CNN نموذجاشائعا ل DL 21. بشكل عام ، تستخدم CNN الصورة كمدخل وتقسمها إلى عدة مجموعات. تشكل الخلايا العصبية المدخلة ، وهي سلسلة من الطبقات ذات التجميع التلافيفي ، والطبقات المرتبطة تماما ، والطبقات الطبيعية هيكلها22. ترتبط الخلايا العصبية لطبقة الالتفاف بالطبقة السابقة عبر منطقة ضيقة. الطبقات الموجودة تحتها متصلة تماما بالخلايا العصبية المنشطة للطبقات المرتبطة بالكامل. يمثل المعادل (1) الانتشار الأمامي والخافي لوظيفة متصلة بالكامل.
(1)
(2)
أين
هوتنشيط الخلايا العصبيةفي الطبقة l ،
هو تدرجالخلايا العصبيةفي الطبقة l th ،
هووزن الخلايا العصبيةفي الطبقة l + 1. ظهرت العديد من تصميمات CNN نتيجة للتطورات البحثية الحديثة. تم استخدام AlexNet في هذا العمل.
تعكس بنية AlexNet ، الموضحة في الشكل 3 ، تصميما دقيقا ومنظما جيدا. تشكل ثلاث طبقات متصلة تماما وخمس طبقات الالتفاف طبقات التعلم الثمانية. يتم إنتاج ملصقات الفئة عن طريق تغذية نتيجة الطبقة الأخيرة في الوظيفة التي تنشط softmax. ترتبط نواة الطبقة الثانية أو الرابعة أو الخامسة بمستوياتها السابقة عبر مشاركة وحدة معالجة الرسومات. حبات الطبقة الثانية والثالثة متصلة بالكامل ببعضها البعض. يتم توصيل طبقة التسوية بطبقات التجميع القصوى بعد المستويين الأول والثاني. يرتبط ReLU بجميع طبقات التعلم.

الشكل 3: هندسة AlexNet. يتم استخدام خمس طبقات تلافيفية وثلاث طبقات متصلة بالكامل لمعالجة البيانات المرئية في نموذج التلخيص. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
كانت شبكة العمود الفقري الأساسية للعمل عبارة عن طبقة كثيفة من GARNN. هناك ثلاث طبقات في RNN السميك. مع 80 خلية عصبية في الطبقة الثانية و 170 في الطبقة الأولى ، فهي تتكون من طبقتين متصلتين بالكامل (fc). الطبقات التالية هي تطبيع الدفعات والانقطاع عن الطلب. تتكون الطبقة الأخيرة من ثلاث خلايا عصبية وتستخدم لتقسيم الصورة. تقسم الطبقة الكثيفة ، التي تأتي بعد LSTM ، المنطقة المحيطة بورم الدماغ. يعطي AlexNet ميزات طبقة LSTM. تحتوي مجموعة البيانات على 20 شريحة كحد أقصى ، وهو ما يساوي العدد الإجمالي للتسلسلات التي تم الإعلان عنها. تحتوي الطبقة الأولى من GARNN على 100 وحدة مخفية ، بينما تحتوي الطبقة الثالثة على 125 وحدة مخفية.
تم دمج آلية البوابات في الطبقة الكثيفة (المرتبطة تماما) من AlexNet في إطار عمل GARNN-AE-LSTM المقترح. غالبا ما تتم معالجة خرائط الميزات التلافيفية بواسطة AlexNet وإرسالها مباشرة إلى طبقات متصلة بالكامل للتصنيف. يتم التعامل مع جميع الخصائص المكانية المستردة ، بما في ذلك الأنماط الزائدة عن الحاجة أو الأقل أهمية ، بالتساوي بهذه الطريقة. لقد عالجنا هذا من خلال تقديم وظيفة بوابات تعمل كمرشح ميزات وتستند إلى سيني. من الناحية الرياضية ، يقوم متجه البوابة g = σ(wX) + b ، بتعديل ناتج الطبقة الكثيفة ، مع تمثيل σ الدالة السني. أثناء التدريب ، تتعلم هذه البوابة إعطاء أوزان تنشيط ميزات مختلفة تتراوح من 0 إلى 1. وهي: (ط) تمنع قيم البوابة المنخفضة ميزات غير ذات صلة (على سبيل المثال ، ضوضاء الخلفية أو القوام الزائد). (2) تسلط قيم البوابة الأعلى الضوء على السمات التمييزية (مثل مناطق الكائنات المهمة أو الأنماط الحساسة للحركة). (iii) يتم بعد ذلك استخدام مجموعة الميزات المحسنة هذه بواسطة مكون RNN ، مما يمكنه من التقاط التبعيات الزمنية بشكل أفضل دون الانحرف عن طريق المعلومات المكانية غير ذات الصلة. (iv) يستخدم الانتشار الخلفي لتغيير معلمات البوابات أثناء التدريب جنبا إلى جنب مع AlexNet و RNN. هذا يعني أنه بمرور الوقت ، يتعلم النموذج الجوانب الأكثر أهمية للتلخيص بالإضافة إلى الميزات التي يجب استخراجها.
في الشكل 4 ، يشير المتغير X إلى بيانات الإدخال ، ويشير C إلى الخلية ، ويشير H إلى الحالة المخفية.

الشكل 4: نموذج بنية الشبكة العصبية المتكررة المسورة (GARNN). يدمج GARNN تطبيع الدفعات والتسرب والطبقات الكثيفة المتعددة لنمذجة التسلسل الفعالة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
في كل كتلة ، تم استخدام الأوزان المعنية ، مثل Iw و Rw والتحيز المسمى المدخلات والوزن المتكرر والتحيز ، على التوالي ، كما هو الحال في المعادل (3) إلى المعادل (5)
(3)
(4)
(5)
في طابع زمني معين t ، يشار إلى حالة الخلية كما في Eqn (6)
(6)
حيث
يشار إلى حاصل الضرب من هادامرد وحالة الوحدة المخفية كما في المعادل (7)
(7)
وبالتالي، فإنه يستخدم وحدة تحليل الصوت py لحساب الخصائص الصوتية على مستوى المقطع لكل مقطع صوتي تم استخراجه من ملف الفيديو المقابل، باستخدام ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. وترد السمات المستخرجة في الجدول 1. وفقا لهذه العملية ، يتم استخراج ميزة الصوت في البداية على أساس مؤقت. يتكون الجزء الأخير من التمثيل من إحصائيات المعالم على مستوى المقطع التي يتم حسابها على مستوى ثان. وعلى وجه التحديد، تجرى معالجة قصيرة الأجل لكل جزء من الإشارة السمعية، مما يؤدي إلى حساب 68 معلما قصير المدى (34 سمة و34 دلتا) لكل نافذة على مستوى المقطع، والتي قد تكون متداخلة أو غير متداخلة. لقد استخدمنا مجموعة متنوعة من الخصائص المرئية لنقل محتوى المعلومات المرئية بالإضافة إلى استخراج العناصر السمعية من الإشارة الصوتية لكل فيديو. ومن المتوقع أن تكون هذه الطريقة حاسمة في عملية التلخيص. تم استخدام مكتبة multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) لاستخراج الميزات التي تعكس الجوانب المرئية للفيديو من أجل استخراج هذه العناصر المرئية. على وجه التحديد ، يتم أخذ العناصر المرئية ال 88 المدرجة أدناه من الإطار المطابق كل 0.2 ثانية. في هذا ، يتم دمج الميزات متعددة الوسائط ، ويتم استخدام ما مجموعه 59 ميزة لمزيد من التحليل لتصنيف الفيديو على أنه غني بالمعلومات وغير مثير للاهتمام من خلال إجراء تلخيص الفيديو.
تقليل الميزات باستخدام PCA
تم تقليل بعد الميزات في هذه الدراسة من خلال تطبيق تحليل المكونات الرئيسية (PCA). يتم تحويل الخصائص الأساسية إلى ميزات رئيسية من أجل تعزيز أهميتها وأهميتها. تم استخدام PCA على نطاق واسع من قبل العديد من الباحثين في مجموعة متنوعة من المجالات24. تستخدم القيم الذاتية لتحديد الخصائص. يتم تحديد أعلى ميزات القيمة الذاتية، بينما تتم إزالة ميزات القيمة الذاتية الأدنى.
بعد إزالة الإطارات الزائدة عن الحاجة ، يتم استخدام PCA في هذه الدراسة كخطوة اختيارية لتقليل الميزات. يقوم PCA بقمع الضوضاء والمعلومات الزائدة عن الحاجة عن طريق ضغط متجهات الميزات عالية الأبعاد التي تنتجها GARNN في مساحة فرعية صغيرة. هذا يزيد من الكفاءة الحسابية ل AE-LSTM مع ضمان سيطرة القرائن المرئية والسمعية الأكثر تمييزا على اكتشاف الإطار الرئيسي. من أجل تحقيق التوازن بين قابلية التوسع والدقة في تلخيص الفيديو ، يتم استخدام PCA كأداة مفيدة. يتم توفير الخوارزمية (الخوارزمية 1) كملف تكميلي 1.
يعتبر أي إطار مشابه تماما للإطار السابق أو يمكن مقارنته بشكل لافت للنظر عنه زائدا عن الحاجة. من الواضح أن تغيير معدل الإطارات يمكن أن يكون له تأثير على نسبة إطارات الفيديو التي تمت إزالتها. وبشكل أكثر تحديدا ، مع زيادة معدلات الإطارات ، يزداد التشابه بين الإطارات المتتالية أيضا ، مما يؤدي إلى إزالة نسبة أعلى من الإطارات. الآن ، يتم استخدام ميزات تقليل الأبعاد لتدريب نموذج ML ، والذي يسمى نموذج AE-LSTM الخصوم.
التدريب باستخدام AELSTM
تتكون الشبكة العصبية المسماة GAN25 من شبكتين فرعيتين متنافستين: 1) شبكة "مولد" (G) تنشئ بيانات تشبه توزيعا غير معروف، و 2) شبكة "تمييزية" (D) تميز بين العينات التي تم إنشاؤها وتلك من الملاحظات الفعلية. الهدف هو العثور على مولد يزيد من احتمالية ارتكاب المميز خطأ مع ملاءمة التوزيع الفعلي للبيانات.
افترض أن X هو الإدخال و E هو ضوضاء الإدخال السابقة ، X'= g (E) هي العينة التي تم إنشاؤها. باستخدام تحسين الحد الأدنى ، يتم صياغة التعلم:
(8)
حيث يكون D مؤهلا للحصول على الاحتمال الصحيح للتصنيف. يتم عرض مكونات نموذج التدريب المطور لدينا في الشكل 5. يختار محدد LSTM المجموعة الفرعية للإطارات من تسلسل فيديو الإدخال X. وتحول الأرتال المختارة إلى ميزة E ثابتة الطول باستخدام المشفر-LSTM، متبوعة بإعادة بناء الفيديو X' باستخدام مفكك التشفير-LSTM. يتم تصنيف X إلى فيديو حقيقي أو فئة ملخص بواسطة المميز-LSTM. في هذه الدراسة ، يتم استخدام AE-LSTM لتلخيص الفيديو باستخدام بنية GAN للحصول على ملخصات فيديو فعالة ومتنوعة ومنظمة. يمكن ل AE التخلص من تغييرات الخلفية غير الضرورية ، ويمكن ل LSTM اكتشاف انتقالات المشهد بدلا من التعامل مع الإطارات كصور ، ويمكن ل GAN ، يمكن للمولد تلخيص الفيديو ، ويضمن المميز أن الملخص متنوع

الشكل 5: بنية نموذج تلخيص AELSTM. يتضمن Selector-LSTM و Encoder-LSTM و Decoder-LSTM و Discriminator-LSTM لتحسين ملخصات الفيديو عبر التدريب الخصومي. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
من خلال إعطاء ميزات GARNN لكل إطار في فيديو الإدخال المسمى
X ، يستخدم الملخص محدد LSTM لاختيار المجموعة الفرعية للإطارات ، ويقوم المشفر بتشفير الإطارات ك E متبوعا بوحدة فك التشفير التي تعيد بناء الفيديو ك X' في كل إطار xt. يستخدم المحدد درجة الأهمية عند تحديد الإطار. يتم إعطاء الميزات من خلال قيمة الوزن باستخدام الدرجات ، ثم الانتقال إلى برنامج التشفير. لكل إطار بدرجة st = 1 ، يتم استلام المجموعة الفرعية فقط بواسطة المشفر. يختار المميز الفئات على أنها أصلية أو ملخصة عن طريق تقدير المسافة بين X و X' وتعيين التسميات. في هذه الحالة ، يحسب المميز الخطأ بين مقاطع الفيديو الأصلية ومقاطع الفيديو الموجزة. تشير الخوارزمية 2 (الملف التكميلي 2) إلى تلخيص تدريب AELSTM لتلخيص الفيديو.
المعالجة اللاحقة - تلخيص الفيديو
يمكن إنتاج ملخصات الفيديو بواسطة مصنفات على مستوى الشريحة بمجرد تدريبها. يتم تضمين ثلاث خطوات لتحقيق ذلك: (i) تحديد الخصائص الصوتية أو المرئية أو المختلطة لكل مقطع فيديو. (ii) تصنيف كل مقطع فيديو باستخدام مصنف الصوت أو المرئي أو الاندماج المناسب. (ثالثا) لمنع الأخطاء الصارخة ، قم بمعالجة تنبؤات المصنف المنظمة.
لتلبية هذا الطلب ، تم تطوير خط أنابيب يتكون من مرشحين متميزين لخطوة ما بعد المعالجة. تخضع مصفوفة الإدخال أولا لمرشح متوسط الطول N1 باستخدام النوافذ المحلية من أجل تنديس تنبؤات المصنف المتسلسلة. ثم يتم تحديد التنبؤات النهائية عن طريق التصفية الصعبة باستخدام طريقة مباشرة تحافظ على سلسلة من التنبؤات الإيجابية المتتالية (المقاطع الإعلامية) إذا تم تضمين مقاطع N2 على الأقل في هذا التسلسل. بعبارة أخرى ، يتطلب هذا المعيار مقطعا إرشاديا يستمر على الأقل N2 ثانية.