$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании предлагается мультимодальный метод суммирования видео с учителем, который попадает в общую категорию суммирования видео, обычно называемую беглым просмотром видео. Это включает в себя методы, которые концентрируются на поиске ключевых сегментов большого видео для создания его временной сокращенной версии. В этом исследовании предлагается контролируемый метод анализа видеопотока в 1 с секциями, которые включают аудио и визуальные представления, как показано на рисунке 1. Затем эти сегменты классифицируются как «неинтересные» или «информативные». В отличие от синтетических или смоделированных данных, «реальные данные» теперь относятся к реальным наборам видеоданных, используемым для экспериментов. Видеосегменты, которые предоставляют важные аудиовизуальные сигналы, необходимые для суммирования, такие как высокое движение, голос или переходы между сценами, называются «информативными сегментами». «Неинтересные» части определяются как повторяющиеся или избыточные кадры, которые не добавляют ничего нового в синопсис.
Входные видео сегментируются на кадры, а мультимодальные признаки извлекаются из каждого кадра с помощью предложенной модели GARNN. Аудиовизуальные функции объединяются и подаются в качестве входных данных на этапе уменьшения размерности, где избыточные кадры удаляются для дальнейшей обработки. Наконец, предложенный AELSTM применяется к сокращенным данным для суммирования видео. Для этого используется контролируемый двоичный классификатор, обученный с помощью представлений признаков из визуальной, звуковой или смешанной модальностей, называемый мультимодальностями.

Рисунок 1: Обзор предложенной модели суммирования видео. Конвейер включает в себя мультимодальное извлечение признаков, уменьшение размерности и создание сводки с помощью AELSTM. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Набор данных
Эффективность предложенных решений определена с помощью наборов данных VSUMM17 и SumMe18 , пары эталонных наборов данных в статическом суммировании видео. Среди наборов данных есть функции CNN, созданные с помощью AlexNet с LSTM и реальными данными. Реальные данные и наборы данных доступны для широкой общественности19. 50 фильмов в наборе данных VSUMM взяты с таких веб-сайтов, как YouTube, и имеют продолжительность 110 минут при частоте 30 кадров в секунду. Они бывают разных жанров, включая мультфильмы, новости, спорт, рекламу, сериалы и домашнее видео. Среди них 25 видеороликов о праздниках, фестивалях и спортивных состязаниях, которые были получены с известного сайта YouTube и помечены не менее чем 15 резюме, созданными человеком (всего 390), составляют набор данных «SumMe»20 . Диапазон продолжительности видеороликов составляет 1-6 минут.
Исходное видео преобразуется в изображения RGB, которые подаются в качестве входных данных в предварительно обученную предложенную модель GARNN для извлечения признаков. Эта модель состоит из AlexNet и стробируемой RNN. Первоначальное количество функций — 64, а функций от AlexNet — 4100.
Предлагаемое извлечение признаков на основе Gated-AlexNet-RNN
Для обобщения видео были использованы как визуальный, так и звуковой режимы информации. Чтобы получить представление признаков в обеих модальностях, мы определили созданные вручную функции, которые часто используются в задачах аудиовизуальной кластеризации и классификации, таких как извлечение изображений, классификация видео, анализ слуховых сцен и поиск музыкальной информации. Цель состояла в том, чтобы включить как можно больше обучающих визуальных и звуковых компонентов. На рисунке 2 показана концептуальная иллюстрация процесса, используемого для извлечения признаков для аудио- и визуальных модальностей.

Рисунок 2: Предлагаемое мультимодальное извлечение признаков на основе GARNN. Функции как визуальной, так и звуковой модальностей извлекаются с помощью компонентов AlexNet и GARNN. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Закрытый - AlexNetRNN: (GARNN)
Для виртуального анализа изображений CNN является популярным DL model21. Как правило, CNN использует изображение в качестве входных данных и делит его на несколько групп. Входные нейроны, последовательность слоев со сверточным объединением, слои, которые полностью связаны, и нормализующие слои составляют его структуру22. Нейроны слоя свертки соединены с предыдущим слоем через узкую область. Слои под ними полностью соединены с активирующими нейронами полностью связанных слоев. Eqn (1) представляет прямое и обратное распространение полностью связной функции.
(1)
(2)
Где
активацияi-го нейрона вl-м слое равна,
градиентi-го нейрона вl-м слое,
весi-го нейрона в l+1-м слое. Многочисленные проекты CNN появились в результате последних достижений в области исследований. В этой работе был использован AlexNet.
Архитектура AlexNet, показанная на рисунке 3, отражает тщательный и хорошо структурированный дизайн. Три полностью связанных слоя и пять слоев свертки составляют восемь слоев обучения. Метки классов создаются путем подачи результата последнего слоя в функцию, которая активирует softmax. Ядра второго, четвертого или пятого уровня подключаются к своим предыдущим уровням через совместное использование GPU. Ядра второго и третьего слоев полностью соединены друг с другом. Слой нормализации соединяется со слоями максимального пула после первого и второго уровней. ReLU связан со всеми уровнями обучения.

Рисунок 3: Архитектура AlexNet. Пять сверточных слоев и три полносвязных слоя используются для обработки визуальных данных в модели суммирования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Основной магистральной сетью для проведения работ была плотнослойная GARNN. В густом РНН есть три слоя. Имея 80 нейронов во втором слое и 170 в первом, он состоит из двух полностью связанных (fc) слоев. Следующие слои — это пакетная нормализация и отсеивание. fc, последний слой, состоит из трех нейронов и используется для деления изображения. Плотный слой, который идет после LSTM, разделяет область вокруг опухоли головного мозга. AlexNet наделяет слой LSTM функциями. Набор данных содержит не более 20 срезов, что равно общему количеству объявленных последовательностей. Первый слой GARNN содержит 100 скрытых единиц, в то время как третий слой содержит 125 скрытых единиц.
Механизм стробирования был встроен в плотный (полностью связанный) слой AlexNet в предложенной нами структуре GARNN-AE-LSTM. Сверточные карты признаков часто обрабатываются AlexNet и отправляются прямо в полносвязные слои для классификации. Все полученные пространственные характеристики, включая избыточные или менее значимые паттерны, обрабатываются этим методом в равной степени. Мы решили эту проблему, представив функцию стробирования, которая функционирует как фильтр признаков и основана на сигмоиде. С математической точки зрения, вектор затвора g = σ(wX) + b модулирует выход плотного слоя, где σ представляет собой сигмоидную функцию. Во время обучения этот вентиль учится присваивать различные веса активации функций в диапазоне от 0 до 1. К ним относятся: (i) низкие значения стробов подавляют несущественные особенности (например, фоновый шум или избыточные текстуры). (ii) Более высокие значения стробов выделяют различительные особенности (такие как важные области объектов или чувствительные к движению паттерны). (iii) Этот улучшенный набор функций затем используется компонентом RNN, что позволяет ему лучше улавливать временные зависимости, не отвлекаясь на нерелевантную пространственную информацию. (iv) Обратное распространение ошибки используется для изменения параметров стробирования во время обучения в тандеме с AlexNet и RNN. Это означает, что со временем модель изучает, какие аспекты наиболее важны для обобщения, а также какие признаки следует извлечь.
На рисунке 4 переменная X обозначает входные данные, C обозначает ячейку, а H обозначает скрытое состояние.

Рисунок 4: Модель архитектуры рекуррентной нейронной сети (GARNN). GARNN объединяет пакетную нормализацию, отпадение и множественные плотные слои для эффективного моделирования последовательностей. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
В каждом блоке соответствующие веса, такие как Iw, Rw и смещение, называемые входом, рекуррентным весом и смещением, соответственно, использовались как в уравнениях (3) - уравнениях (5)
(3)
(4)
(5)
На некотором временном штампе t состояние ячейки обозначается как в уравнении (6)
(6)
Где
произведение Адамара и состояние скрытой единицы обозначается как в уравнении (7)
(7)
Таким образом, он использует модуль py Audio Analysis для вычисления характеристик звука на уровне сегментов для каждого аудиоклипа, который был извлечен из соответствующего видеофайла, используя ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Извлеченные признаки перечислены в таблице 1. В соответствии с этим процессом извлечение аудиоэлементов первоначально выполняется на временной основе. Заключительная часть представления состоит из статистики объектов на уровне сегментов, которая вычисляется на втором уровне. В частности, краткосрочная обработка выполняется для каждого сегмента звукового сигнала, в результате чего вычисляются 68 краткосрочных признаков (34 признака и 34 дельты) для каждого окна уровня сегмента, которые могут быть перекрывающимися или неперекрывающимися. Мы использовали различные визуальные характеристики для передачи содержания визуальной информации в дополнение к извлечению слуховых элементов из звукового сигнала каждого видео. Ожидается, что этот метод будет иметь решающее значение для процесса подготовки резюме. Библиотека multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) используется для извлечения функций, отражающих визуальные аспекты видео, с целью извлечения этих визуальных элементов. В частности, 88 визуальных элементов, перечисленных ниже, берутся из соответствующего кадра каждые 0,2 с. При этом мультимодальные признаки объединяются, и в общей сложности 59 признаков используются для дальнейшего анализа классификации видео как информативного и неинтересного путем обобщения видео.
Уменьшение характеристик с помощью PCA
Размерность особенностей в данном исследовании была уменьшена за счет применения анализа главных компонент (PCA). Основные характеристики преобразуются в ключевые черты с целью повышения их значимости и важности. PCA широко используется многочисленными исследователями в различных областях24. Для определения свойств используются собственные значения. Выбираются объекты с наибольшими собственными значениями, в то время как объекты с наименьшими собственными значениями удаляются.
После удаления лишних кадров PCA используется в данном исследовании в качестве дополнительного шага по уменьшению признаков. PCA подавляет шум и избыточную информацию, сжимая векторы признаков высокой размерности, созданные GARNN, в небольшое подпространство. Это повышает вычислительную эффективность AE-LSTM, гарантируя, что при обнаружении ключевых кадров доминируют наиболее различительные визуальные и слуховые подсказки. Для того, чтобы сбалансировать масштабируемость и точность при суммировании видео, PCA используется в качестве полезного инструмента. Алгоритм (Алгоритм 1) представлен в виде Дополнительного файла 1.
Любой кадр, который точно такой же или поразительно сопоставим с предыдущим, считается избыточным. Очевидно, что изменение частоты кадров может повлиять на долю удаляемых видеокадров. В частности, по мере увеличения частоты кадров сходство между последовательными кадрами также увеличивается, что приводит к увеличению процента удаляемых кадров. Теперь функции с уменьшенной размерностью используются для обучения модели машинного обучения, которая называется состязательной моделью AE-LSTM.
Обучение с использованием AELSTM
Нейронная сеть, называемая GAN25 , состоит из двух конкурирующих подсетей: 1) «генераторной» сети (G), которая создает данные, напоминающие неизвестное распределение, и 2) «дискриминаторной» сети (D), которая различает созданные образцы и те, которые получены в результате реальных наблюдений. Цель состоит в том, чтобы найти генератор, который максимизирует вероятность того, что дискриминатор допустит ошибку при подгонке фактического распределения данных.
Предположим, что X — вход, E — априорный входной шум, X'= g(E) — сгенерированный образец. С помощью минимаксной оптимизации обучение формулируется:
(8)
Где D квалифицируется для получения правильной вероятности классификации. Компоненты разработанной нами обучающей модели показаны на рисунке 5. Селектор LSTM выбирает подмножество кадров из входной видеопоследовательности X. Выбранные кадры преобразуются в элемент фиксированной длины E с помощью кодировщика-LSTM, за которым следует реконструкция видео X' с помощью декодера-LSTM. Классификация X' по реальному видео или суммарному классу выполняется дискриминатором-LSTM. В этом исследовании AE-LSTM используется для суммирования видео со структурой GAN для эффективного, разнообразного и структурированного резюме видео. AE может устранить ненужные изменения фона, LSTM может обнаруживать переходы между сценами, а не обрабатывать кадры как изображения, а GAN, генератор может суммировать видео, а дискриминатор обеспечивает разнообразие резюме

Рисунок 5: Архитектура модели обобщения AELSTM. Включает в себя Selector-LSTM, Encoder-LSTM, Decoder-LSTM и Discriminator-LSTM для оптимизации видеорезюме с помощью состязательного обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Задавая признаки GARNN для каждого кадра во входном видео, называемом
X, сумматор использует селектор LSTM для выбора подмножества кадров, а кодировщик кодирует кадры как E, после чего декодер реконструирует видео как X' в каждом кадре xt. Селектор использует показатель важности при выборе кадра. Признаки задаются значением веса с помощью оценок, а затем переходят на энкодер. Для каждого кадра с оценкой st = 1 подмножество принимается только кодировщиком. Дискриминатор выбирает классы в качестве исходных или сводных, оценивая расстояние между X и X' и присваивая метки. В этом случае дискриминатор вычисляет ошибку между исходным и кратким видео. Алгоритм 2 (Дополнительный файл 2) обозначает суммирование обучения AELSTM для суммирования видео.
Постобработка – Обобщение видео
Видеорезюме могут быть созданы классификаторами на уровне сегментов после их обучения. Для достижения этой цели необходимо выполнить три этапа: (i) Определить звуковые, визуальные или смешанные характеристики каждого видеосегмента. (ii) Классифицировать каждый видеосегмент с использованием соответствующего аудио-, визуального или объединенного классификатора. (iii) Чтобы предотвратить вопиющие ошибки, проведите постобработку упорядоченных прогнозов классификатора.
Чтобы удовлетворить этот спрос, для этапа постобработки был разработан конвейер, состоящий из двух отдельных фильтров. Входной массив сначала подвергается медианному фильтру длины N1 с использованием локальных окон для сглаживания последовательных прогнозов классификатора. Окончательные прогнозы затем определяются путем жесткой фильтрации с использованием простого метода, который поддерживает ряд последовательно положительных прогнозов (информативных сегментов), если в эту последовательность включено по крайней мере N2 сегментов. Иными словами, этот критерий требует, чтобы обучающий сегмент длился не менее N2 секунд.