Исследовательская статья

GARNN-AE-LSTM: МУЛЬТИМОДАЛЬНЫЙ ПОДХОД К ГЛУБОКОМУ ОБУЧЕНИЮ ДЛЯ высокоточного суммирования видео

DOI:

10.3791/69097

10 октября 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании предлагается мультимодальная среда глубокого обучения для суммирования видео путем интеграции аудиовизуальных функций с использованием предварительно обученных моделей GARNN. Используя GRU, AlexNet и состязательный классификатор LSTM, система улучшает обнаружение ключевых кадров, снижает избыточность и достигает высокой точности суммирования со средним F-баллом 0,985.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Суммаризация видео направлена на создание кратких версий длинных видеороликов с сохранением основного контента. В этом исследовании раскрывается мультимодальная стратегия машинного обучения, которая интегрирует визуальную и слуховую информацию с использованием предварительно обученных архитектур рекуррентных нейронных сетей, называемых GARNN, объединяющих рекуррентные единицы (GRU) и AlexNet, для извлечения аудио, изображений и визуальных признаков. Обнаружение ключевых кадров улучшено за счет удаления избыточных кадров и применения функции уменьшения функции с компенсацией движения, за которым следует дополнительное уменьшение размерности на основе PCA. Классификатор Long Short-Term Memory (AE-LSTM) на основе состязательного кодировщика используется для временного моделирования за счет достижения высокой точности суммирования. Результаты оценивались с использованием чувствительности, F-баллов и положительных прогностических значений, и метод достиг среднего F-балла 0,985. Стробируемый AlexNet представлен в мультимодальной среде GARNN-AE-LSTM, где редукция на основе PCA с компенсацией движения устраняет избыточность, GRU записывают временную прогрессию, а стробирование тонко настраивает выбор пространственных признаков, что способствует более точной и эффективной системе суммирования видео. Улучшенный балл F1 демонстрирует эффективность модели в обеспечении точности в кратких видеозаписях путем создания осмысленного видео. Этот подход подчеркивает потенциал мультимодального извлечения признаков и передовых методов глубокого обучения для надежного анализа и сжатия видео.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Появились системы мультимодального анализа (MMA), сочетающие в себе несколько модальностей, таких как аудио, видео, текст и данные датчиков, чтобы дать представление о том, как учащиеся учатся1. Эти технологии могут помочь получить полное представление о поведении учащихся и уровнях вовлеченности путем оценки мультимодальных данных2. Тем не менее, существует ряд препятствий и ограничений, когда дело доходит до создания эффективных систем ММА3. Существует масса цифровых видео из-за роста Интернета и камер видеонаблюдения. Крайне важно, чтобы эти видео были собраны в базы данных. В этой ситуации может быть полезно краткое содержание видео. Создание полезного синопсиса реального видео известно как подведение итогов видео, и оно помогает в отслеживании активности, обнаружении аномалий и извлечении видео4. Резюме видео может быть выполнено с помощью различных стратегий. Эти методы относятся к одной из двух категорий5, таких как извлечение и абстрактное суммирование видео.

Поскольку суммирование видео требует большого количества вычислений, необходимы эффективные методы. Если каждый кадр в фильме проверяется на предмет выбора, процесс обобщения может быть медленным и длительным, а ресурсы обработки могут быть потрачены на идентичные или похожие кадры. Более того, чтобы ускорить процесс и гарантировать, что будут учтены только важные характеристики, следует сократить пространство до любогонабора характеристик. Методы суммирования видео можно разделить на четыре основные области в зависимости от типа аудиовизуальных сигналов, которые производятся и демонстрируются конечному пользователю7, или их вывода. Если быть более точным, то результаты расчетов суммаризации видео могут включать: (i) первичные кадры8, которые представляют собой последовательно отображаемые извлеченные видеокадры, обычно известные как статические сводки; (ii) видеокадры9, которые называются динамическими резюме; (iii) визуальные сигналы10, которые улучшают резюме для конечного пользователя за счет добавления графического синтаксиса к другим сигналам; и (iv) сгенерированные компьютерами, текстовые аннотации11, которые предназначены для предоставления эффективных резюме видеоинформации.

Сводки, основанные на ключевых кадрах, обычно меньше, чем сводки, основанные на снимках клавиш. Ключевой кадр — это отдельный репрезентативный кадр, выбранный из видео. Keyshot обозначает короткий непрерывный сегмент видеокадров, сгруппированных вокруг ключевых кадров. Класс summary относится к выходным классификаторам, маркирующим фреймы или сегменты как информативные (для включения в сводку) или неинформативные (для исключения). Тем не менее, эта выгода достигается за счет пропуска важных деталей в процессе подведения итогов. Например, может быть сложно получить контекст предшествующего кадра в сводке на основе ключевых кадров. Он также лишен оригинального звучания. Поэтому для решения этих проблем часто выбирают методы суммирования видео на основе ключевых снимков. Методы суммирования видео на основе ключевых снимков используются для создания подмножеств для длинных или коротких видео. Короткие и длинные видеоролики обычно имеют продолжительность менее и более 10 минут соответственно12 минут. Создание подмножеств с помощью ключевых снимков для коротких видеороликов непрактично и может оказаться неуспешным из-за их и без того короткой длины воспроизведения. Кроме того, время воспроизведения длинных видео, особенно фильмов или спортивных видео, может превышать 90 минут. Для таких категорий видео методы суммирования на основе ключевых снимков более полезны и эффективны для предоставления пользователям краткого обзора.

Субъективный характер краткого изложения видео делает его сложной задачей. Это связано с тем, что у каждого пользователя свои вкусы, даже если речь идет о сопоставимом видеоконтенте. Этот вопрос может быть точно решен с помощью индивидуального подхода к суммированию видео13. Цель алгоритма — предоставить каждому пользователю контент, адаптированный к его интересам. Однако адаптированные краткие видеоописания с идеальной продолжительностью для новых длинных видеороликов (например, спортивных мероприятий) не всегда доступны. Современные методы14,15 требуют огромных компьютерных ресурсов для оценки данных о предпочтениях клиентов и видеоматериалов с целью предоставления индивидуализированных резюме в режиме реального времени. Персонализированные видеосводки в режиме реального времени можно получить с централизованных выделенных серверов. Бабу Висам и Сатиш16 обсудили тщательный таксономический анализ всех основных стратегий обобщения видео, которые демонстрируют широко используемые подходы к эффективному сжатию огромных объемов видеоданных. В обзоре классифицируются и оцениваются методологии в связи с их фундаментальными подходами, которые включают стратегии мультимодальной интеграции, фреймворки глубокого обучения и методы, основанные на кластеризации. Среди заслуживающих внимания методов можно выделить фреймворк KDAN, который использует дистилляцию знаний для контролируемого обобщения, и метод SVS_MCO, который использует кластеризацию DBSCAN, оптимизированную алгоритмом искусственных водорослей. Кроме того, в обзоре представлены сложные модели, такие как аудиовизуальная рекуррентная сеть и основанное на запросах глубокое обучение африканских стервятников, которые были признаны высокоэффективными в решении динамических и мультимодальных задач суммирования видео.

Включение мультимодальной структуры рекуррентной нейронной сети AlexNet (GARNN-AE-LSTM) для суммирования видео делает это исследование новым. Такой подход повышает точность и эффективность процесса суммирования видео за счет снижения избыточности с помощью PCA с компенсацией движения, захвата временной динамики с помощью GRU и оптимизации выбора пространственных объектов с помощью методов стробирования. Для того, чтобы обеспечить эффективное суммирование видео с уменьшенной сложностью, в этом документе реализовано следующее: (i) Мультимодальная суммаризация видео: Предложена структура для создания кратких видеорезюме путем интеграции как визуальной, так и слуховой информации с использованием предварительно обученной модели GARNN, которая сочетает в себе Gated RNNs и AlexNet. (ii) Закрытый AlexNet для уточнения признаков: Введен новый механизм стробирования (сигмоидный вентиль) в плотный слой AlexNet для фильтрации нерелевантных пространственных признаков, тем самым улучшая извлечение высокоуровневых визуальных признаков. Интеграция с RNN обеспечивает эффективное временное моделирование покадровых зависимостей. (iii) Устранение избыточных кадров: Разработан подход, основанный на дисперсии с компенсацией движения, для удаления идентичных или похожих кадров до обнаружения ключевого кадра с последующим необязательным уменьшением размерности на основе PCA для эффективного представления признаков. (iv) Точное обнаружение ключевых кадров: Для временного моделирования был использован классификатор LSTM на основе состязательного кодировщика, средний F-балл составил 0,985, что продемонстрировало превосходную точность суммирования по сравнению с базовыми подходами. (v) Эффективность по сравнению с моделями трансформаторов: продемонстрировано, что предложенная модель GARNN является вычислительно эффективной, где AlexNet эффективно захватывает пространственные объекты, модели RNN — последовательные зависимости, а механизм стробирования отфильтровывает неважные кадры, превосходя альтернативы на основе трансформаторов в выборе характеристик и суммировании.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании предлагается мультимодальный метод суммирования видео с учителем, который попадает в общую категорию суммирования видео, обычно называемую беглым просмотром видео. Это включает в себя методы, которые концентрируются на поиске ключевых сегментов большого видео для создания его временной сокращенной версии. В этом исследовании предлагается контролируемый метод анализа видеопотока в 1 с секциями, которые включают аудио и визуальные представления, как показано на рисунке 1. Затем эти сегменты классифицируются как «неинтересные» или «информативные». В отличие от синтетических или смоделированных данных, «реальные данные» теперь относятся к реальным наборам видеоданных, используемым для экспериментов. Видеосегменты, которые предоставляют важные аудиовизуальные сигналы, необходимые для суммирования, такие как высокое движение, голос или переходы между сценами, называются «информативными сегментами». «Неинтересные» части определяются как повторяющиеся или избыточные кадры, которые не добавляют ничего нового в синопсис.

Входные видео сегментируются на кадры, а мультимодальные признаки извлекаются из каждого кадра с помощью предложенной модели GARNN. Аудиовизуальные функции объединяются и подаются в качестве входных данных на этапе уменьшения размерности, где избыточные кадры удаляются для дальнейшей обработки. Наконец, предложенный AELSTM применяется к сокращенным данным для суммирования видео. Для этого используется контролируемый двоичный классификатор, обученный с помощью представлений признаков из визуальной, звуковой или смешанной модальностей, называемый мультимодальностями.

figure-protocol-1
Рисунок 1: Обзор предложенной модели суммирования видео. Конвейер включает в себя мультимодальное извлечение признаков, уменьшение размерности и создание сводки с помощью AELSTM. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Набор данных
Эффективность предложенных решений определена с помощью наборов данных VSUMM17 и SumMe18 , пары эталонных наборов данных в статическом суммировании видео. Среди наборов данных есть функции CNN, созданные с помощью AlexNet с LSTM и реальными данными. Реальные данные и наборы данных доступны для широкой общественности19. 50 фильмов в наборе данных VSUMM взяты с таких веб-сайтов, как YouTube, и имеют продолжительность 110 минут при частоте 30 кадров в секунду. Они бывают разных жанров, включая мультфильмы, новости, спорт, рекламу, сериалы и домашнее видео. Среди них 25 видеороликов о праздниках, фестивалях и спортивных состязаниях, которые были получены с известного сайта YouTube и помечены не менее чем 15 резюме, созданными человеком (всего 390), составляют набор данных «SumMe»20 . Диапазон продолжительности видеороликов составляет 1-6 минут.

Исходное видео преобразуется в изображения RGB, которые подаются в качестве входных данных в предварительно обученную предложенную модель GARNN для извлечения признаков. Эта модель состоит из AlexNet и стробируемой RNN. Первоначальное количество функций — 64, а функций от AlexNet — 4100.

Предлагаемое извлечение признаков на основе Gated-AlexNet-RNN
Для обобщения видео были использованы как визуальный, так и звуковой режимы информации. Чтобы получить представление признаков в обеих модальностях, мы определили созданные вручную функции, которые часто используются в задачах аудиовизуальной кластеризации и классификации, таких как извлечение изображений, классификация видео, анализ слуховых сцен и поиск музыкальной информации. Цель состояла в том, чтобы включить как можно больше обучающих визуальных и звуковых компонентов. На рисунке 2 показана концептуальная иллюстрация процесса, используемого для извлечения признаков для аудио- и визуальных модальностей.

figure-protocol-2
Рисунок 2: Предлагаемое мультимодальное извлечение признаков на основе GARNN. Функции как визуальной, так и звуковой модальностей извлекаются с помощью компонентов AlexNet и GARNN. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Закрытый - AlexNetRNN: (GARNN)
Для виртуального анализа изображений CNN является популярным DL model21. Как правило, CNN использует изображение в качестве входных данных и делит его на несколько групп. Входные нейроны, последовательность слоев со сверточным объединением, слои, которые полностью связаны, и нормализующие слои составляют его структуру22. Нейроны слоя свертки соединены с предыдущим слоем через узкую область. Слои под ними полностью соединены с активирующими нейронами полностью связанных слоев. Eqn (1) представляет прямое и обратное распространение полностью связной функции.

figure-protocol-3(1)

figure-protocol-4(2)

Где figure-protocol-5 активацияi-го нейрона вl-м слое равна, figure-protocol-6 градиентi-го нейрона вl-м слое, figure-protocol-7 весi-го нейрона в l+1-м слое. Многочисленные проекты CNN появились в результате последних достижений в области исследований. В этой работе был использован AlexNet.

Архитектура AlexNet, показанная на рисунке 3, отражает тщательный и хорошо структурированный дизайн. Три полностью связанных слоя и пять слоев свертки составляют восемь слоев обучения. Метки классов создаются путем подачи результата последнего слоя в функцию, которая активирует softmax. Ядра второго, четвертого или пятого уровня подключаются к своим предыдущим уровням через совместное использование GPU. Ядра второго и третьего слоев полностью соединены друг с другом. Слой нормализации соединяется со слоями максимального пула после первого и второго уровней. ReLU связан со всеми уровнями обучения.

figure-protocol-8
Рисунок 3: Архитектура AlexNet. Пять сверточных слоев и три полносвязных слоя используются для обработки визуальных данных в модели суммирования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Основной магистральной сетью для проведения работ была плотнослойная GARNN. В густом РНН есть три слоя. Имея 80 нейронов во втором слое и 170 в первом, он состоит из двух полностью связанных (fc) слоев. Следующие слои — это пакетная нормализация и отсеивание. fc, последний слой, состоит из трех нейронов и используется для деления изображения. Плотный слой, который идет после LSTM, разделяет область вокруг опухоли головного мозга. AlexNet наделяет слой LSTM функциями. Набор данных содержит не более 20 срезов, что равно общему количеству объявленных последовательностей. Первый слой GARNN содержит 100 скрытых единиц, в то время как третий слой содержит 125 скрытых единиц.

Механизм стробирования был встроен в плотный (полностью связанный) слой AlexNet в предложенной нами структуре GARNN-AE-LSTM. Сверточные карты признаков часто обрабатываются AlexNet и отправляются прямо в полносвязные слои для классификации. Все полученные пространственные характеристики, включая избыточные или менее значимые паттерны, обрабатываются этим методом в равной степени. Мы решили эту проблему, представив функцию стробирования, которая функционирует как фильтр признаков и основана на сигмоиде. С математической точки зрения, вектор затвора g = σ(wX) + b модулирует выход плотного слоя, где σ представляет собой сигмоидную функцию. Во время обучения этот вентиль учится присваивать различные веса активации функций в диапазоне от 0 до 1. К ним относятся: (i) низкие значения стробов подавляют несущественные особенности (например, фоновый шум или избыточные текстуры). (ii) Более высокие значения стробов выделяют различительные особенности (такие как важные области объектов или чувствительные к движению паттерны). (iii) Этот улучшенный набор функций затем используется компонентом RNN, что позволяет ему лучше улавливать временные зависимости, не отвлекаясь на нерелевантную пространственную информацию. (iv) Обратное распространение ошибки используется для изменения параметров стробирования во время обучения в тандеме с AlexNet и RNN. Это означает, что со временем модель изучает, какие аспекты наиболее важны для обобщения, а также какие признаки следует извлечь.

На рисунке 4 переменная X обозначает входные данные, C обозначает ячейку, а H обозначает скрытое состояние.

figure-protocol-9
Рисунок 4: Модель архитектуры рекуррентной нейронной сети (GARNN). GARNN объединяет пакетную нормализацию, отпадение и множественные плотные слои для эффективного моделирования последовательностей. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

В каждом блоке соответствующие веса, такие как Iw, Rw и смещение, называемые входом, рекуррентным весом и смещением, соответственно, использовались как в уравнениях (3) - уравнениях (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

На некотором временном штампе t состояние ячейки обозначается как в уравнении (6)

figure-protocol-13(6)

Где figure-protocol-14 произведение Адамара и состояние скрытой единицы обозначается как в уравнении (7)

figure-protocol-15(7)

Таким образом, он использует модуль py Audio Analysis для вычисления характеристик звука на уровне сегментов для каждого аудиоклипа, который был извлечен из соответствующего видеофайла, используя ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Извлеченные признаки перечислены в таблице 1.  В соответствии с этим процессом извлечение аудиоэлементов первоначально выполняется на временной основе. Заключительная часть представления состоит из статистики объектов на уровне сегментов, которая вычисляется на втором уровне. В частности, краткосрочная обработка выполняется для каждого сегмента звукового сигнала, в результате чего вычисляются 68 краткосрочных признаков (34 признака и 34 дельты) для каждого окна уровня сегмента, которые могут быть перекрывающимися или неперекрывающимися. Мы использовали различные визуальные характеристики для передачи содержания визуальной информации в дополнение к извлечению слуховых элементов из звукового сигнала каждого видео. Ожидается, что этот метод будет иметь решающее значение для процесса подготовки резюме. Библиотека multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) используется для извлечения функций, отражающих визуальные аспекты видео, с целью извлечения этих визуальных элементов. В частности, 88 визуальных элементов, перечисленных ниже, берутся из соответствующего кадра каждые 0,2 с. При этом мультимодальные признаки объединяются, и в общей сложности 59 признаков используются для дальнейшего анализа классификации видео как информативного и неинтересного путем обобщения видео.

Уменьшение характеристик с помощью PCA
Размерность особенностей в данном исследовании была уменьшена за счет применения анализа главных компонент (PCA). Основные характеристики преобразуются в ключевые черты с целью повышения их значимости и важности. PCA широко используется многочисленными исследователями в различных областях24. Для определения свойств используются собственные значения. Выбираются объекты с наибольшими собственными значениями, в то время как объекты с наименьшими собственными значениями удаляются.

После удаления лишних кадров PCA используется в данном исследовании в качестве дополнительного шага по уменьшению признаков. PCA подавляет шум и избыточную информацию, сжимая векторы признаков высокой размерности, созданные GARNN, в небольшое подпространство. Это повышает вычислительную эффективность AE-LSTM, гарантируя, что при обнаружении ключевых кадров доминируют наиболее различительные визуальные и слуховые подсказки. Для того, чтобы сбалансировать масштабируемость и точность при суммировании видео, PCA используется в качестве полезного инструмента. Алгоритм (Алгоритм 1) представлен в виде Дополнительного файла 1.

Любой кадр, который точно такой же или поразительно сопоставим с предыдущим, считается избыточным. Очевидно, что изменение частоты кадров может повлиять на долю удаляемых видеокадров. В частности, по мере увеличения частоты кадров сходство между последовательными кадрами также увеличивается, что приводит к увеличению процента удаляемых кадров. Теперь функции с уменьшенной размерностью используются для обучения модели машинного обучения, которая называется состязательной моделью AE-LSTM.

Обучение с использованием AELSTM
Нейронная сеть, называемая GAN25 , состоит из двух конкурирующих подсетей: 1) «генераторной» сети (G), которая создает данные, напоминающие неизвестное распределение, и 2) «дискриминаторной» сети (D), которая различает созданные образцы и те, которые получены в результате реальных наблюдений. Цель состоит в том, чтобы найти генератор, который максимизирует вероятность того, что дискриминатор допустит ошибку при подгонке фактического распределения данных.

Предположим, что X — вход, E — априорный входной шум, X'= g(E) — сгенерированный образец. С помощью минимаксной оптимизации обучение формулируется:

figure-protocol-16(8)

Где D квалифицируется для получения правильной вероятности классификации. Компоненты разработанной нами обучающей модели показаны на рисунке 5. Селектор LSTM выбирает подмножество кадров из входной видеопоследовательности X. Выбранные кадры преобразуются в элемент фиксированной длины E с помощью кодировщика-LSTM, за которым следует реконструкция видео X' с помощью декодера-LSTM. Классификация X' по реальному видео или суммарному классу выполняется дискриминатором-LSTM. В этом исследовании AE-LSTM используется для суммирования видео со структурой GAN для эффективного, разнообразного и структурированного резюме видео. AE может устранить ненужные изменения фона, LSTM может обнаруживать переходы между сценами, а не обрабатывать кадры как изображения, а GAN, генератор может суммировать видео, а дискриминатор обеспечивает разнообразие резюме

figure-protocol-17
Рисунок 5: Архитектура модели обобщения AELSTM. Включает в себя Selector-LSTM, Encoder-LSTM, Decoder-LSTM и Discriminator-LSTM для оптимизации видеорезюме с помощью состязательного обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Задавая признаки GARNN для каждого кадра во входном видео, называемом figure-protocol-18 X, сумматор использует селектор LSTM для выбора подмножества кадров, а кодировщик кодирует кадры как E, после чего декодер реконструирует видео как X' в каждом кадре xt. Селектор использует показатель важности при выборе кадра. Признаки задаются значением веса с помощью оценок, а затем переходят на энкодер. Для каждого кадра с оценкой st = 1 подмножество принимается только кодировщиком. Дискриминатор выбирает классы в качестве исходных или сводных, оценивая расстояние между X и X' и присваивая метки. В этом случае дискриминатор вычисляет ошибку между исходным и кратким видео. Алгоритм 2 (Дополнительный файл 2) обозначает суммирование обучения AELSTM для суммирования видео.

Постобработка – Обобщение видео
Видеорезюме могут быть созданы классификаторами на уровне сегментов после их обучения. Для достижения этой цели необходимо выполнить три этапа: (i) Определить звуковые, визуальные или смешанные характеристики каждого видеосегмента. (ii) Классифицировать каждый видеосегмент с использованием соответствующего аудио-, визуального или объединенного классификатора. (iii) Чтобы предотвратить вопиющие ошибки, проведите постобработку упорядоченных прогнозов классификатора.

Чтобы удовлетворить этот спрос, для этапа постобработки был разработан конвейер, состоящий из двух отдельных фильтров. Входной массив сначала подвергается медианному фильтру длины N1 с использованием локальных окон для сглаживания последовательных прогнозов классификатора. Окончательные прогнозы затем определяются путем жесткой фильтрации с использованием простого метода, который поддерживает ряд последовательно положительных прогнозов (информативных сегментов), если в эту последовательность включено по крайней мере N2 сегментов. Иными словами, этот критерий требует, чтобы обучающий сегмент длился не менее N2 секунд.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложенное извлечение признаков на основе GARNN и суммирование длинных видео на основе AGLSTM были опробованы на двух наборах данных, а именно VSUMM и SumMe. В этом разделе обсуждаются экспериментальные результаты и сравнение с традиционными подходами. Для дискриминатора LSTM мы используем двухслойный LSTM, имеющий 1024 скрытых единицы на каждом слое. Для encoder_LSTM и decoder_LSTM соответственно мы используем два двухслойных LSTM, имеющих 2048 скрытых единиц в каждом слое. Декодер LSTM, который стремится хранить и си...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании обобщение длинных видеороликов представлено с использованием эффективных мультимодальных моделей ML и DL, которые используют аудио, изображения и визуальные модальности данных, сгенерированных на основе входных данных. Двоичный классификатор обучается распознаванию между важными сегментами, которые являются созданной сводной частью, и «неважными» сегментами, которые отбрасываются. Модель обучается с помощью наборов данных, таких как SumMe и VSUMM, а масштабируемость...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность Школе доктора телевидения Сычуаньского университета кино и телевидения за предоставление лабораторных помещений для проведения исследования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
AlexNet (предварительно обученная модель)MATLAB / PyTorchКонцентратор PyTorch — Предварительно обученная модель AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Используется для визуального извлечения признаков
FFmpegFFmpeg.orghttps://ffmpeg.org/Извлечение звука из видео
Модель на основе GRNПользовательская реализацияБиблиотека « Неупы" реализует GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlИспользуется для мультимодального слияния признаков
LSTM (долгосрочная кратковременная память)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlИспользуется в селекторе, кодировщике, декодере
Multimodal_movie_analysis libСайт GitHubhttps://github.com/tyiannak/multimodal_movie_analysisДля визуального извлечения признаков
НумПиPython Software Foundationhttps://pypi.org/project/numpy/Численные вычисления и матричные операции
PCA (анализ главных компонент)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlУменьшение размерности
PyAudioAnalysis (Анализ PyAudio)Сайт GitHubhttps://github.com/tyiannak/pyaudioanalysisИзвлечение аудиофункций
PyTorchФонд PyTorchhttps://pytorch.org/Фреймворк глубокого обучения
Набор данных SumMeОбщедоступный набор данныхhttps://gyglim.github.io/me/vsum/index.htmlНабор данных для обобщения видео в тестовом режиме
Набор данных VSUMMОбщедоступный набор данныхhttp://www.vision.ime.usp.br/~creativision/vsumm/Набор данных для обобщения видео в тестовом режиме

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

PCAF1

Похожие статьи