مقالة بحثية

GARNN-AE-LSTM: نهج التعلم العميق متعدد الوسائط لتلخيص الفيديو عالي الدقة

DOI:

10.3791/69097

أكتوبر 10, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة إطارا للتعلم العميق متعدد الوسائط لتلخيص الفيديو من خلال دمج الميزات السمعية والبصرية باستخدام نماذج GARNN المدربة مسبقا. من خلال الاستفادة من GRUs و AlexNet ومصنف LSTM العدائي ، يعزز النظام اكتشاف الإطار الرئيسي ، ويقلل من التكرار ، ويحقق دقة تلخيص عالية بمتوسط درجة F تبلغ 0.985.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يركز تلخيص الفيديو على إنشاء إصدارات موجزة من مقاطع الفيديو الطويلة من خلال الحفاظ على المحتوى الأساسي. تكشف هذه الدراسة عن استراتيجية التعلم الآلي متعددة الوسائط التي تدمج المعلومات المرئية والسمعية باستخدام معماريات الشبكة العصبية المتكررة المسورة المدربة مسبقا والتي يشار إليها باسم GARNN ، والتي تجمع بين الوحدات المتكررة المسورة (GRUs) و AlexNet ، لاستخراج الميزات الصوتية والصورة والمرئية. تم تحسين اكتشاف الإطار الرئيسي عن طريق إزالة الإطارات الزائدة عن الحاجة وتطبيق تقليل الميزات المعوض بالحركة، متبوعا بتقليل الأبعاد الاختياري المستند إلى PCA. يتم استخدام مصنف الذاكرة الطويلة قصيرة المدى المستند إلى المشفر الخصومي (AE-LSTM) للنمذجة الزمنية من خلال تحقيق دقة عالية في التلخيص. تم تقييم النتائج باستخدام الحساسية ودرجات F والقيم التنبؤية الإيجابية ، وحققت الطريقة متوسط درجة F قدره 0.985. يتم تقديم AlexNet المسور في إطار عمل GARNN-AE-LSTM متعدد الوسائط ، حيث يلغي التقليل المستند إلى PCA التعويضي عن الحركة التكرار ، وتسجل GRUs التقدم الزمني ، وتقوم البوابات بضبط اختيار الميزات المكانية ، وكلها تساهم في نظام تلخيص فيديو أكثر دقة وكفاءة. توضح نتيجة F1 المحسنة فعالية النموذج في توليد الدقة في ملخصات الفيديو من خلال إنشاء فيديو ذي معنى. يسلط هذا النهج الضوء على إمكانات استخراج الميزات متعددة الوسائط وتقنيات التعلم العميق المتقدمة لتحليل الفيديو وضغطه القوي.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ظهرت أنظمة التحليل متعدد الوسائط (MMA) ، حيث تجمع بين العديد من الطرائق مثل الصوت والفيديو والنصوص وبيانات المستشعر لتوفير رؤى حول كيفية تعلم الطلاب1. يمكن أن تساعد هذه التقنيات في اكتساب فهم شامل لسلوك الطلاب ومستويات المشاركة من خلال تقييم البيانات متعددة الوسائط2. ومع ذلك ، هناك عدد من العقبات والقيود عندما يتعلق الأمر بإنشاء أنظمة MMA فعالة3. هناك الكثير من مقاطع الفيديو الرقمية بسبب نمو الإنترنت والكاميرات الأمنية. من الضروري تجميع مقاطع الفيديو هذه في قواعد بيانات. يمكن أن يكون ملخص الفيديو مفيدا في هذه الحالة. يعرف إنشاء ملخص مفيد للفيديو الحقيقي باسم تلخيص الفيديو ، ويساعد في تتبع النشاط واكتشاف الحالات الشاذة واسترجاع الفيديو4. يمكن إنجاز ملخص الفيديو باستخدام مجموعة متنوعة من الاستراتيجيات. تندرج هذه الطرق في واحدة من فئتين5 ، مثل تلخيص الفيديو الاستخراجي والتجريدي.

نظرا لأن تلخيص الفيديو يتطلب الكثير من الحوسبة ، فهناك حاجة إلى طرق فعالة. إذا تم فحص كل إطار في الفيلم للاختيار ، فقد تكون عملية الملخص بطيئة وطويلة ، ويمكن إنفاق موارد المعالجة على إطارات متطابقة أو متشابهة. علاوة على ذلك ، لتسريع العملية والتأكد من مراعاة الميزات المهمة فقط ، يجب تقليل المساحة لأي مجموعة من الميزات6. يمكن تصنيف تقنيات تلخيص الفيديو إلى أربعة مجالات رئيسية بناء على نوع الإشارات السمعية والبصرية التي يتم إنتاجها وعرضها على المستخدم النهائي7 ، أو مخرجاتها. ولكي نكون أكثر تحديدا، يمكن أن تشمل نتائج حسابات تلخيص الفيديو: (1) الإطارات الأولية 8، وهي إطارات فيديو مستخرجة معروضة بالتتابع تعرف باسم الملخصات الثابتة؛ (1) الإطارات الأساسية 8، وهي إطارات فيديو مستخرجة معروضة بالتتابع تعرف باسم الملخصات الثابتة؛ (1) الإطارات الأساسية 8، وهي إطارات فيديو مستخرجة معروضة بالتتابع تعرف باسم الملخصات الثابتة؛ (1) الإطارات الأولية8، وهي إطارات فيديو مستخرجة معروضة بالتتابع تعرف باسم الملخصات الثابتة؛ (2) إطارات الفيديو9 ، والتي تسمى الملخصات الديناميكية ؛ (3) الإشارات المرئية10 ، والتي تعزز الملخصات للمستخدم النهائي عن طريق إضافة بناء الجملة المستند إلى الرسومات إلى إشارات أخرى ؛ و (4) تم إنشاؤها بواسطة أجهزة الكمبيوتر ، التعليقات التوضيحيةالنصية 11 ، المصممة لتقديم ملخصات فعالة لمعلومات الفيديو.

عادة ما تكون الملخصات المستندة إلى الإطارات الرئيسية أصغر من تلك التي تستند إلى لقطات المفاتيح. يشير الإطار الرئيسي إلى إطار تمثيلي فردي محدد من الفيديو. تشير Keyshot إلى مقطع قصير مستمر من إطارات الفيديو مجمعة حول الإطارات الرئيسية. تشير فئة الملخص إلى إطارات أو مقاطع تسمية إخراج المصنف على أنها إعلامية (يتم تضمينها في الملخص) أو غير إعلامية (يتم استبعادها). ومع ذلك ، فإن هذه الميزة تأتي على حساب حذف التفاصيل المهمة في عملية التلخيص. على سبيل المثال ، قد يكون من الصعب الحصول على سياق الإطار السابق في ملخص قائم على الإطار الرئيسي. كما أنه يخلو من الصوت الأصلي. لمعالجة هذه المشكلات ، يتم اختيار تقنيات تلخيص الفيديو المستندة إلى لقطات المفاتيح بشكل متكرر. تستخدم تقنيات تلخيص الفيديو المستندة إلى لقطات المفاتيح لإنشاء مجموعات فرعية لمقاطع الفيديو الطويلة أو القصيرة. عادة ما تكون مدة مقاطع الفيديو القصيرة والطويلة أقل من 10 دقائق وتزيد عن12 دقائق على التوالي. يعد إنشاء مجموعات فرعية بمساعدة لقطة المفاتيح لمقاطع الفيديو القصيرة أمرا غير عملي وقد لا يكون ناجحا نظرا لطول إعادة التشغيل القصير بالفعل. علاوة على ذلك ، قد يتجاوز وقت تشغيل مقاطع الفيديو الطويلة ، وخاصة الأفلام أو مقاطع الفيديو الرياضية ، 90 دقيقة. بالنسبة لفئات الفيديو هذه ، تعد تقنيات الملخص المستندة إلى لقطة المفاتيح أكثر فائدة وكفاءة في منح المستخدمين نظرة عامة موجزة.

الطبيعة الذاتية لملخص الفيديو تجعله مهمة شاقة. هذا يرجع إلى حقيقة أن كل مستخدم لديه أذواق مميزة ، حتى عندما يتعلق الأمر بمحتوى الفيديو المماثل. يمكن حل هذه المشكلة بدقة بمساعدة نهج تلخيص الفيديو المخصص13. الهدف من الخوارزمية هو تزويد كل مستخدم بمحتوى مصمم خصيصا لاهتماماته. ومع ذلك ، لا تتوفر ملخصات الفيديو المعدلة ذات المدد المثالية لمقاطع الفيديو الطويلة الجديدة (مثل الأحداث الرياضية) بسهولة. تتطلب الطرق الحالية14،15 موارد حاسوبية ضخمة لتقييم بيانات تفضيلات العملاء ولقطات الفيديو من أجل تقديم ملخصات فردية في الوقت الفعلي. يمكن الحصول على ملخصات فيديو مخصصة في الوقت الفعلي من خوادم مخصصة مركزية. ناقش بابو فيسام وساتيش16 تحليلا تصنيفيا شاملا لجميع استراتيجيات تلخيص الفيديو الرئيسية التي توضح الأساليب المستخدمة على نطاق واسع لضغط كميات هائلة من بيانات الفيديو بشكل فعال. تصنف المراجعة وتقيم المنهجيات فيما يتعلق بمناهجها الأساسية ، والتي تشمل استراتيجيات التكامل متعدد الوسائط ، وأطر التعلم العميق ، والأساليب القائمة على التجميع. من بين الطرق الجديرة بالملاحظة إطار عمل KDAN ، الذي يستخدم تقطير المعرفة للتلخيص الخاضع للإشراف ، وطريقة SVS_MCO ، التي تستخدم تجميع DBSCAN المحسن بواسطة خوارزمية الطحالب الاصطناعية. بالإضافة إلى ذلك ، توفر المراجعة نماذج معقدة مثل الشبكة المتكررة السمعية والبصرية والتعلم العميق للنسور الأفريقية القائم على الاستعلام ، والتي وجد أنها فعالة للغاية في إدارة مشاكل تلخيص الفيديو الديناميكي ومتعدد الوسائط.

إن إدراج إطار عمل متعدد الوسائط من الشبكة العصبية المتكررة AlexNet (GARNN-AE-LSTM) لتلخيص الفيديو هو ما يجعل هذه الدراسة جديدة. يعمل هذا النهج على تحسين دقة وكفاءة عملية تلخيص الفيديو عن طريق تقليل التكرار باستخدام PCA المعوض عن الحركة ، والتقاط الديناميكيات الزمنية باستخدام GRUs ، وتحسين اختيار الميزات المكانية باستخدام طرق البوابات. من أجل توفير تلخيص الفيديو بكفاءة مع تقليل التعقيد ، تساهم هذه الورقة بما يلي: (ط) تلخيص الفيديو متعدد الوسائط: اقترح إطار عمل لإنشاء ملخصات فيديو موجزة من خلال دمج كل من المعلومات المرئية والسمعية باستخدام نموذج GARNN المدرب مسبقا الذي يجمع بين RNNs المسورة و AlexNet. (ii) AlexNet المسور لتحسين الميزات: تم إدخال آلية مسورة جديدة (بوابة سيني) في طبقة AlexNet الكثيفة لتصفية الميزات المكانية غير ذات الصلة ، وبالتالي تعزيز استخراج الميزات المرئية عالية المستوى. يتيح التكامل مع RNN النمذجة الزمنية الفعالة للتبعيات من إطار إلى إطار. (iii) إزالة الإطار الزائد: تم تطوير نهج قائم على التباين التعويضي عن الحركة لإزالة الإطارات المتطابقة أو المتشابهة قبل اكتشاف الإطار الرئيسي ، متبوعا بتقليل الأبعاد الاختياري المستند إلى PCA لتمثيل الميزات بكفاءة. (رابعا) الكشف الدقيق عن الإطار الرئيسي: استخدم مصنف LSTM قائم على المشفر الخصومي للنمذجة الزمنية ، مما يحقق متوسط درجة F يبلغ 0.985 ، مما يدل على دقة تلخيص فائقة مقارنة بمناهج خط الأساس. (v) الكفاءة على نماذج المحولات: أظهر أن نموذج GARNN المقترح فعال من الناحية الحسابية ، حيث تلتقط AlexNet بشكل فعال الميزات المكانية ، ونماذج RNN التبعيات المتسلسلة ، وتقوم آلية البوابات بتصفية الإطارات غير المهمة ، متفوقة على البدائل القائمة على المحولات في اختيار الميزات والتلخيص.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة طريقة تلخيص فيديو خاضعة للإشراف متعددة الوسائط تندرج ضمن فئة تلخيص الفيديو العامة ، والتي يشار إليها عادة باسم قشط الفيديو. يتضمن ذلك التقنيات التي تركز على العثور على الأجزاء الرئيسية من مقطع فيديو أكبر لإنشاء نسخة مكثفة مؤقتا منه. تقترح هذه الدراسة تقنية خاضعة للإشراف لتحليل دفق الفيديو في أقسام 1 ثانية تتضمن تمثيلات سمعية ومرئية ، كما هو موضح في الشكل 1. ثم يتم تصنيف هذه المقاطع على أنها إما "غير مثيرة للاهتمام" أو "غنية بالمعلومات". على عكس البيانات التركيبية أو المحاكاة ، تشير "البيانات الحقيقية" الآن إلى مجموعات بيانات الفيديو الفعلية المستخدمة في التجارب. يشار إلى مقاطع الفيديو التي توفر إشارات سمعية بصرية مهمة ضرورية للتلخيص - مثل الحركة العالية أو الصوت أو انتقالات المشهد - باسم "المقاطع الإعلامية". يتم تعريف الأجزاء "غير المثيرة للاهتمام" على أنها إطارات متكررة أو زائدة عن الحاجة لا تضيف أي شيء جديد إلى الملخص.

يتم تقسيم مقاطع الفيديو المدخلة إلى إطارات ، ويتم استخراج الميزات متعددة الوسائط من كل إطار باستخدام نموذج GARNN المقترح. يتم دمج الميزات السمعية والمرئية وتغذيتها كمدخلات في مرحلة تقليل الأبعاد ، حيث تتم إزالة الإطارات الزائدة عن الحاجة لمزيد من المعالجة. وأخيرا، يطبق المعيار AELSTM المقترح على البيانات المخفضة من أجل تلخيص الفيديو. يتم استخدام مصنف ثنائي خاضع للإشراف مدرب على تمثيلات الميزات من الطرائق المرئية أو الصوتية أو المختلطة ، والتي تسمى الطرائق المتعددة ، لتحقيق ذلك.

figure-protocol-1
الشكل 1: نظرة عامة على نموذج تلخيص الفيديو المقترح. يتضمن خط الأنابيب استخراج الميزات متعددة الوسائط وتقليل الأبعاد وإنشاء الملخص باستخدام AELSTM. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

مجموعة البيانات
يتم تحديد فعالية الحلول المقترحة باستخدام مجموعات بيانات VSUMM17 و SumMe18 ، وهي زوج من مجموعات البيانات المعيارية في تلخيص الفيديو الثابت. تعد ميزات CNN التي تم إنشاؤها باستخدام AlexNet مع LSTM والبيانات الحقيقية من بين مجموعات البيانات. البيانات ومجموعات البيانات الحقيقية متاحة لعامة الناس19. الأفلام ال 50 في مجموعة بيانات VSUMM مأخوذة من مواقع ويب مثل YouTube وتمتد لمدة 110 دقيقة بمعدل 30 إطارا في الثانية. تأتي في مجموعة متنوعة من الأنواع ، بما في ذلك الرسوم المتحركة والأخبار والرياضة والإعلانات والمسلسلات التلفزيونية ومقاطع الفيديو المنزلية. من بين هؤلاء ، يتكون 25 مقطع فيديو من العطلات والمهرجانات والرياضات التي تم الحصول عليها من موقع YouTube الشهير وتم وضع علامة عليها بما لا يقل عن 15 ملخصا من إنشاء الإنسان (390 في المجموع) تشكل مجموعة بيانات ملخص الفيديو "SumMe"20 . نطاق مدة مقاطع الفيديو هو 1-6 دقائق.

يتم تحويل الفيديو الأصلي إلى صور RGB ، والتي يتم تغذيتها كمدخلات في نموذج GARNN المقترح المدرب مسبقا لاستخراج الميزات. يتكون هذا النموذج من AlexNet و RNN مسور. العدد الأصلي للميزات هو 64 ، وتحتوي ميزات AlexNet على 4100 ميزة.

مقترح استخراج ميزة مقترح قائم على Gated-AlexNet-RNN
تم استخدام كل من الوضعين المرئي والصوتي للمعلومات لتلخيص مقاطع الفيديو. لتحقيق تمثيل ميزة في كلتا الطريقتين ، حددنا الميزات المصنوعة يدويا والتي غالبا ما تستخدم في مهام التجميع والتصنيف الصوتية والمرئية ، مثل استرجاع الصور وتصنيف الفيديو وتحليل المشهد السمعي واسترجاع معلومات الموسيقى. كان الهدف هو تضمين أكبر عدد ممكن من المكونات التعليمية والمرئية والسمعية. ويبين الشكل 2 توضيحا مفاهيميا للعملية المستخدمة لاستخراج معالم الطرائق السمعية والمرئية.

figure-protocol-2
الشكل 2: استخراج الميزة المقترح متعدد الوسائط المستند إلى GANNN. يتم استخراج الميزات من كل من الطرائق المرئية والصوتية باستخدام مكونات AlexNet و GARNN. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

مسور- AlexNetRNN: (GARNN)
لتحليل الصور الافتراضية ، تعد CNN نموذجاشائعا ل DL 21. بشكل عام ، تستخدم CNN الصورة كمدخل وتقسمها إلى عدة مجموعات. تشكل الخلايا العصبية المدخلة ، وهي سلسلة من الطبقات ذات التجميع التلافيفي ، والطبقات المرتبطة تماما ، والطبقات الطبيعية هيكلها22. ترتبط الخلايا العصبية لطبقة الالتفاف بالطبقة السابقة عبر منطقة ضيقة. الطبقات الموجودة تحتها متصلة تماما بالخلايا العصبية المنشطة للطبقات المرتبطة بالكامل. يمثل المعادل (1) الانتشار الأمامي والخافي لوظيفة متصلة بالكامل.

figure-protocol-3(1)

figure-protocol-4(2)

أين figure-protocol-5 هوتنشيط الخلايا العصبيةفي الطبقة l ، figure-protocol-6 هو تدرجالخلايا العصبيةفي الطبقة l th ، figure-protocol-7 هووزن الخلايا العصبيةفي الطبقة l + 1. ظهرت العديد من تصميمات CNN نتيجة للتطورات البحثية الحديثة. تم استخدام AlexNet في هذا العمل.

تعكس بنية AlexNet ، الموضحة في الشكل 3 ، تصميما دقيقا ومنظما جيدا. تشكل ثلاث طبقات متصلة تماما وخمس طبقات الالتفاف طبقات التعلم الثمانية. يتم إنتاج ملصقات الفئة عن طريق تغذية نتيجة الطبقة الأخيرة في الوظيفة التي تنشط softmax. ترتبط نواة الطبقة الثانية أو الرابعة أو الخامسة بمستوياتها السابقة عبر مشاركة وحدة معالجة الرسومات. حبات الطبقة الثانية والثالثة متصلة بالكامل ببعضها البعض. يتم توصيل طبقة التسوية بطبقات التجميع القصوى بعد المستويين الأول والثاني. يرتبط ReLU بجميع طبقات التعلم.

figure-protocol-8
الشكل 3: هندسة AlexNet. يتم استخدام خمس طبقات تلافيفية وثلاث طبقات متصلة بالكامل لمعالجة البيانات المرئية في نموذج التلخيص. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

كانت شبكة العمود الفقري الأساسية للعمل عبارة عن طبقة كثيفة من GARNN. هناك ثلاث طبقات في RNN السميك. مع 80 خلية عصبية في الطبقة الثانية و 170 في الطبقة الأولى ، فهي تتكون من طبقتين متصلتين بالكامل (fc). الطبقات التالية هي تطبيع الدفعات والانقطاع عن الطلب. تتكون الطبقة الأخيرة من ثلاث خلايا عصبية وتستخدم لتقسيم الصورة. تقسم الطبقة الكثيفة ، التي تأتي بعد LSTM ، المنطقة المحيطة بورم الدماغ. يعطي AlexNet ميزات طبقة LSTM. تحتوي مجموعة البيانات على 20 شريحة كحد أقصى ، وهو ما يساوي العدد الإجمالي للتسلسلات التي تم الإعلان عنها. تحتوي الطبقة الأولى من GARNN على 100 وحدة مخفية ، بينما تحتوي الطبقة الثالثة على 125 وحدة مخفية.

تم دمج آلية البوابات في الطبقة الكثيفة (المرتبطة تماما) من AlexNet في إطار عمل GARNN-AE-LSTM المقترح. غالبا ما تتم معالجة خرائط الميزات التلافيفية بواسطة AlexNet وإرسالها مباشرة إلى طبقات متصلة بالكامل للتصنيف. يتم التعامل مع جميع الخصائص المكانية المستردة ، بما في ذلك الأنماط الزائدة عن الحاجة أو الأقل أهمية ، بالتساوي بهذه الطريقة. لقد عالجنا هذا من خلال تقديم وظيفة بوابات تعمل كمرشح ميزات وتستند إلى سيني. من الناحية الرياضية ، يقوم متجه البوابة g = σ(wX) + b ، بتعديل ناتج الطبقة الكثيفة ، مع تمثيل σ الدالة السني. أثناء التدريب ، تتعلم هذه البوابة إعطاء أوزان تنشيط ميزات مختلفة تتراوح من 0 إلى 1. وهي: (ط) تمنع قيم البوابة المنخفضة ميزات غير ذات صلة (على سبيل المثال ، ضوضاء الخلفية أو القوام الزائد). (2) تسلط قيم البوابة الأعلى الضوء على السمات التمييزية (مثل مناطق الكائنات المهمة أو الأنماط الحساسة للحركة). (iii) يتم بعد ذلك استخدام مجموعة الميزات المحسنة هذه بواسطة مكون RNN ، مما يمكنه من التقاط التبعيات الزمنية بشكل أفضل دون الانحرف عن طريق المعلومات المكانية غير ذات الصلة. (iv) يستخدم الانتشار الخلفي لتغيير معلمات البوابات أثناء التدريب جنبا إلى جنب مع AlexNet و RNN. هذا يعني أنه بمرور الوقت ، يتعلم النموذج الجوانب الأكثر أهمية للتلخيص بالإضافة إلى الميزات التي يجب استخراجها.

في الشكل 4 ، يشير المتغير X إلى بيانات الإدخال ، ويشير C إلى الخلية ، ويشير H إلى الحالة المخفية.

figure-protocol-9
الشكل 4: نموذج بنية الشبكة العصبية المتكررة المسورة (GARNN). يدمج GARNN تطبيع الدفعات والتسرب والطبقات الكثيفة المتعددة لنمذجة التسلسل الفعالة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

في كل كتلة ، تم استخدام الأوزان المعنية ، مثل Iw و Rw والتحيز المسمى المدخلات والوزن المتكرر والتحيز ، على التوالي ، كما هو الحال في المعادل (3) إلى المعادل (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

في طابع زمني معين t ، يشار إلى حالة الخلية كما في Eqn (6)

figure-protocol-13(6)

حيث figure-protocol-14 يشار إلى حاصل الضرب من هادامرد وحالة الوحدة المخفية كما في المعادل (7)

figure-protocol-15(7)

وبالتالي، فإنه يستخدم وحدة تحليل الصوت py لحساب الخصائص الصوتية على مستوى المقطع لكل مقطع صوتي تم استخراجه من ملف الفيديو المقابل، باستخدام ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. وترد السمات المستخرجة في الجدول 1.  وفقا لهذه العملية ، يتم استخراج ميزة الصوت في البداية على أساس مؤقت. يتكون الجزء الأخير من التمثيل من إحصائيات المعالم على مستوى المقطع التي يتم حسابها على مستوى ثان. وعلى وجه التحديد، تجرى معالجة قصيرة الأجل لكل جزء من الإشارة السمعية، مما يؤدي إلى حساب 68 معلما قصير المدى (34 سمة و34 دلتا) لكل نافذة على مستوى المقطع، والتي قد تكون متداخلة أو غير متداخلة. لقد استخدمنا مجموعة متنوعة من الخصائص المرئية لنقل محتوى المعلومات المرئية بالإضافة إلى استخراج العناصر السمعية من الإشارة الصوتية لكل فيديو. ومن المتوقع أن تكون هذه الطريقة حاسمة في عملية التلخيص. تم استخدام مكتبة multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) لاستخراج الميزات التي تعكس الجوانب المرئية للفيديو من أجل استخراج هذه العناصر المرئية. على وجه التحديد ، يتم أخذ العناصر المرئية ال 88 المدرجة أدناه من الإطار المطابق كل 0.2 ثانية. في هذا ، يتم دمج الميزات متعددة الوسائط ، ويتم استخدام ما مجموعه 59 ميزة لمزيد من التحليل لتصنيف الفيديو على أنه غني بالمعلومات وغير مثير للاهتمام من خلال إجراء تلخيص الفيديو.

تقليل الميزات باستخدام PCA
تم تقليل بعد الميزات في هذه الدراسة من خلال تطبيق تحليل المكونات الرئيسية (PCA). يتم تحويل الخصائص الأساسية إلى ميزات رئيسية من أجل تعزيز أهميتها وأهميتها. تم استخدام PCA على نطاق واسع من قبل العديد من الباحثين في مجموعة متنوعة من المجالات24. تستخدم القيم الذاتية لتحديد الخصائص. يتم تحديد أعلى ميزات القيمة الذاتية، بينما تتم إزالة ميزات القيمة الذاتية الأدنى.

بعد إزالة الإطارات الزائدة عن الحاجة ، يتم استخدام PCA في هذه الدراسة كخطوة اختيارية لتقليل الميزات. يقوم PCA بقمع الضوضاء والمعلومات الزائدة عن الحاجة عن طريق ضغط متجهات الميزات عالية الأبعاد التي تنتجها GARNN في مساحة فرعية صغيرة. هذا يزيد من الكفاءة الحسابية ل AE-LSTM مع ضمان سيطرة القرائن المرئية والسمعية الأكثر تمييزا على اكتشاف الإطار الرئيسي. من أجل تحقيق التوازن بين قابلية التوسع والدقة في تلخيص الفيديو ، يتم استخدام PCA كأداة مفيدة. يتم توفير الخوارزمية (الخوارزمية 1) كملف تكميلي 1.

يعتبر أي إطار مشابه تماما للإطار السابق أو يمكن مقارنته بشكل لافت للنظر عنه زائدا عن الحاجة. من الواضح أن تغيير معدل الإطارات يمكن أن يكون له تأثير على نسبة إطارات الفيديو التي تمت إزالتها. وبشكل أكثر تحديدا ، مع زيادة معدلات الإطارات ، يزداد التشابه بين الإطارات المتتالية أيضا ، مما يؤدي إلى إزالة نسبة أعلى من الإطارات. الآن ، يتم استخدام ميزات تقليل الأبعاد لتدريب نموذج ML ، والذي يسمى نموذج AE-LSTM الخصوم.

التدريب باستخدام AELSTM
تتكون الشبكة العصبية المسماة GAN25 من شبكتين فرعيتين متنافستين: 1) شبكة "مولد" (G) تنشئ بيانات تشبه توزيعا غير معروف، و 2) شبكة "تمييزية" (D) تميز بين العينات التي تم إنشاؤها وتلك من الملاحظات الفعلية. الهدف هو العثور على مولد يزيد من احتمالية ارتكاب المميز خطأ مع ملاءمة التوزيع الفعلي للبيانات.

افترض أن X هو الإدخال و E هو ضوضاء الإدخال السابقة ، X'= g (E) هي العينة التي تم إنشاؤها. باستخدام تحسين الحد الأدنى ، يتم صياغة التعلم:

figure-protocol-16(8)

حيث يكون D مؤهلا للحصول على الاحتمال الصحيح للتصنيف. يتم عرض مكونات نموذج التدريب المطور لدينا في الشكل 5. يختار محدد LSTM المجموعة الفرعية للإطارات من تسلسل فيديو الإدخال X. وتحول الأرتال المختارة إلى ميزة E ثابتة الطول باستخدام المشفر-LSTM، متبوعة بإعادة بناء الفيديو X' باستخدام مفكك التشفير-LSTM. يتم تصنيف X إلى فيديو حقيقي أو فئة ملخص بواسطة المميز-LSTM. في هذه الدراسة ، يتم استخدام AE-LSTM لتلخيص الفيديو باستخدام بنية GAN للحصول على ملخصات فيديو فعالة ومتنوعة ومنظمة. يمكن ل AE التخلص من تغييرات الخلفية غير الضرورية ، ويمكن ل LSTM اكتشاف انتقالات المشهد بدلا من التعامل مع الإطارات كصور ، ويمكن ل GAN ، يمكن للمولد تلخيص الفيديو ، ويضمن المميز أن الملخص متنوع

figure-protocol-17
الشكل 5: بنية نموذج تلخيص AELSTM. يتضمن Selector-LSTM و Encoder-LSTM و Decoder-LSTM و Discriminator-LSTM لتحسين ملخصات الفيديو عبر التدريب الخصومي. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

من خلال إعطاء ميزات GARNN لكل إطار في فيديو الإدخال المسمى figure-protocol-18 X ، يستخدم الملخص محدد LSTM لاختيار المجموعة الفرعية للإطارات ، ويقوم المشفر بتشفير الإطارات ك E متبوعا بوحدة فك التشفير التي تعيد بناء الفيديو ك X' في كل إطار xt. يستخدم المحدد درجة الأهمية عند تحديد الإطار. يتم إعطاء الميزات من خلال قيمة الوزن باستخدام الدرجات ، ثم الانتقال إلى برنامج التشفير. لكل إطار بدرجة st = 1 ، يتم استلام المجموعة الفرعية فقط بواسطة المشفر. يختار المميز الفئات على أنها أصلية أو ملخصة عن طريق تقدير المسافة بين X و X' وتعيين التسميات. في هذه الحالة ، يحسب المميز الخطأ بين مقاطع الفيديو الأصلية ومقاطع الفيديو الموجزة. تشير الخوارزمية 2 (الملف التكميلي 2) إلى تلخيص تدريب AELSTM لتلخيص الفيديو.

المعالجة اللاحقة - تلخيص الفيديو
يمكن إنتاج ملخصات الفيديو بواسطة مصنفات على مستوى الشريحة بمجرد تدريبها. يتم تضمين ثلاث خطوات لتحقيق ذلك: (i) تحديد الخصائص الصوتية أو المرئية أو المختلطة لكل مقطع فيديو. (ii) تصنيف كل مقطع فيديو باستخدام مصنف الصوت أو المرئي أو الاندماج المناسب. (ثالثا) لمنع الأخطاء الصارخة ، قم بمعالجة تنبؤات المصنف المنظمة.

لتلبية هذا الطلب ، تم تطوير خط أنابيب يتكون من مرشحين متميزين لخطوة ما بعد المعالجة. تخضع مصفوفة الإدخال أولا لمرشح متوسط الطول N1 باستخدام النوافذ المحلية من أجل تنديس تنبؤات المصنف المتسلسلة. ثم يتم تحديد التنبؤات النهائية عن طريق التصفية الصعبة باستخدام طريقة مباشرة تحافظ على سلسلة من التنبؤات الإيجابية المتتالية (المقاطع الإعلامية) إذا تم تضمين مقاطع N2 على الأقل في هذا التسلسل. بعبارة أخرى ، يتطلب هذا المعيار مقطعا إرشاديا يستمر على الأقل N2 ثانية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تجربة استخراج الميزات المقترح المستند إلى GARRNN وتلخيص الفيديو المستند إلى AGLSTM لمقاطع الفيديو الطويلة على مجموعتي بيانات ، وهما VSUMM و SumMe. يناقش هذا القسم النتائج التجريبية ومقارنتها بالمناهج التقليدية. بالنسبة إلى LSTM المميز ، نستخدم LSTM من طبقتين يحتوي على 1024 وحدة مخفية في كل طبقة. بالنسبة encoder_LSTM و decoder_LSTM ، على التوالي ، نستخدم اثنين من LSTMs من طبقتين لهما 2048 وحدة مخفية في كل طبقة. ثبت أن وحدة فك التشفير LSTM التي تسعى إلى تخزين وتوليف التسلسل العكسي أسهل لتدريب26. ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في هذه الدراسة ، يتم تقديم تلخيص الفيديو لمقاطع الفيديو الطويلة باستخدام نماذج ML و DL متعددة الوسائط فعالة ، والتي تستخدم طرائق الصوت والصورة والمرئية للبيانات المتولدة من بيانات الإدخال. يتم تدريب المصنف الثنائي على تعلم التمييز بين المقاطع المهمة التي هي جزء الملخص المنتج والمقاطع "غير المهمة" التي يتم تجاهلها. يتم تدريب النموذج باستخدام مجموعات بيانات مثل SumMe و VSUMM ، ويتم توضيح قابلية التوسع للنموذج من حيث المقاييس. في البداية ، يتم استخراج الميزات من مقاطع الفيديو باستخدام نموذج...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى المؤلفين تضارب في المصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعرب المؤلفون عن امتنانهم لمدرسة الدكتور التلفزيون ، جامعة سيتشوان للسينما والتلفزيون ، لتوفير مرافق المختبر لإجراء الدراسة البحثية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
AlexNet (نموذج مدرب مسبقا)MATLAB / PyTorchPyTorch Hub و [مدش] ؛ نموذج AlexNet المدرب مسبقا: https://pytorch.org/hub/pytorch_vision_alexnet/تستخدم لاستخراج المعالم المرئية
FFmpegFFmpeg.orghttps://ffmpeg.org/استخراج الصوت من الفيديو
نموذج قائم على GRNNالتنفيذ المخصصمكتبة " نيوبي" ينفذ GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlتستخدم لدمج الميزات متعددة الوسائط
LSTM (الذاكرة طويلة المدى القصيرة)باي تورشhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlتستخدم في محدد ، جهاز تشفير ، وحدة فك ترميز
Multimodal_movie_analysis libجيت هبhttps://github.com/tyiannak/multimodal_movie_analysisلاستخراج المعالم المرئية
رقممؤسسة برامج بايثونhttps://pypi.org/project/numpy/الحساب العددي وعمليات المصفوفة
PCA (تحليل المكون الرئيسي)تعلم العلومhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlتقليل الأبعاد
تحليل الصوت الصوتيجيت هبhttps://github.com/tyiannak/pyaudioanalysisاستخراج ميزة الصوت
باي تورشمؤسسة PyTorchhttps://pytorch.org/إطار عمل التعلم العميق
مجموعة بيانات SumMeمجموعة البيانات العامةhttps://gyglim.github.io/me/vsum/index.htmlمجموعة بيانات تلخيص الفيديو المعيارية
مجموعة بيانات VSUMMمجموعة البيانات العامةhttp://www.vision.ime.usp.br/~creativision/vsumm/مجموعة بيانات تلخيص الفيديو المعيارية

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

F1

مقالات ذات صلة