$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Используемое программное обеспечение указано в Таблице материалов.
Настройка набора данных
Набор данных UCF-1013 был получен и извлечен в каталог Videos/UCF-101 . Целостность набора данных оценивалась с помощью проверки контрольной суммы или ручного воспроизведения, и любые повреждённые файлы исключались из последующей обработки.
Вычислительная среда
Все эксперименты проводились на Python 3.10 на Windows 10/11 или Ubuntu 20.04+. Программная среда включала tensorflow==2.17.0, opencv-python, scikit-image, numpy, pandas и tqdm. Использовалось минимум 8 ГБ оперативной памяти, а ускорение GPU применялось по мере доступности.
Извлечение кадров
Видеокадры читались с помощью cv2. VideoCapture() и преобразование в оттенках серого выполнялись с помощью cv2.cvtColor. Полученные кадры хранились в последовательном порядке в каталоге Frames для сохранения временной согласованности.
Базовая сеть объектов
Для обработки 224 × 224 оттенков серого была использована последовательная сверточная нейронная сеть. Использовались сверточные, пулирующие и плотные слои, а модель была обучена для пяти эпох с оптимизатором Адама и потерей бинарной перекрестной энтропии для установления базовых представлений признаков.
Распределение битрейта и сжатие
Сложность кадра на уровне пикселей оценивалась и использовалась для определения пропорционального распределения битрейта. Применялась JPEG-компрессия с адаптивными Q-значениями, а обработанные кадры сохранялись в каталоге Processed для дальнейшей оценки.
Оценка качества
Для каждого обработанного кадра выполнялись расчёты SSIM, PSNR и MSE. Полученные метрики компилировались в CSV-файлы, а графики визуализации генерировались и хранились в каталоге Output .
Окончательная казнь
Весь рабочий процесс выполнялся с помощью framework.run(). Это выполнение дало итоговый набор обработанных кадров, метрических сводок и графиков оценки.
1. Оптимизация видео с адаптивным качеством стриминга
1.1 Обзор архитектуры системы
Здесь представлен метод оптимизации потокового видео специально для сетей 5G и выше через фреймворк AQVSO. Подход сочетал в себе несколько передовых элементов, которые дополняли друг друга для улучшения качества качества и максимизации использования сетевых ресурсов. Для обработки видеопотоков использовался сложный конвейер, каждый компонент специализировался на определённой области видеооптимизации. На протяжении всего процесса стриминга система обеспечивала оптимальное качество обслуживания и сбалансированную обработку.
1.2 Предварительная обработка видео и начальный анализ
1.2.1 Извлечение кадров и базовый уровень качества
Данная структура оптимизации была построена на этапе предварительной обработки видео, который использовал передовые методы анализа для установления стандартов качества и подготовки видеоконтента к последующей обработке. При входе в систему видеопоток подвергался тщательной процедуре извлечения кадров, которая делила видео на отдельные кадры и изучала временные корреляции между последовательными кадрами. Эта предварительная обработка фиксировала временную динамику видео и устанавливала соответствующие параметры обработки для всего потока. Для входного видео V кадры извлекались и обрабатывались с помощью следующей математической формулировки:
(1)
Разрешение кадров рассчитывалось как m, а общее количество кадров — как n. Кадры извлекались при сохранении временной когерентности видео для обеспечения параллельной обработки на более поздних этапах. Базовый уровень качества был установлен путём внедрения нового подхода к термоядерному синтезу. Несколько метрик качества были объединены для создания комплексной оценки качества. Общее начальное QoE определялось с использованием указанных параметров.
(2)
Было рассмотрено значение этого подхода к слиянию, поскольку он учитывал ограничения индивидуальных показателей качества. Индекс структурного сходства (SSIM) отражал перцептивные аспекты качества, которые традиционные метрики могли бы упустить, в то время как пиковое отношение сигнал/шум (PSNR) обеспечивал объективное измерение качества, а среднеквадратическая ошибка (MSE) — прямое сравнение на уровне пикселей. Весовые коэффициенты α1,α 2,α 3 не были статичными; Вместо этого они динамически адаптировались в зависимости от характеристик содержания. i-й коэффициент веса рассчитывался с использованием следующих факторов:
(3)
Где,
Qi — i-я система, i = 1,2... n
Qj — j-й фрейм, j = 1,2... n, i не равен j
Важные факторы μi были определены посредством обширного эмпирического анализа различных типов видеоконтента, чтобы убедиться, что динамическая корректировка веса поддерживает соответствующую оценку качества при различных типах видеоконтента и условиях просмотра. Учитывались такие факторы, как сложность движения, плотность текстуры и перцептивная значимость различных областей.
1.2.2 Анализ сложности контента
Сложность контента была проанализирована как ключевой компонент фреймворка с помощью многомерного подхода, количественно оценивающего различные аспекты видеоконтента. Этот анализ был основополагающим для обоснованных решений о распределении ресурсов и параметрах сжатия на последующих этапах. Был введён комплексный метрик сложности, учитывающий пространственные, временные и перцептивные аспекты видеоконтента, который был задан:
(4)
Компонент пространственной сложности Cs(f) рассчитывался путём анализа детализации и распределения текстур в каждом кадре с помощью градиентного анализа. Это измерение использовалось для выявления областей, требующих большего распределения битов для поддержания качества.
(5)
Компонент временной сложности Ct(f) был рассчитан для количественной оценки интенсивности движения между последовательными кадрами, так как это измерение было необходимо для прогнозирования поведения сжатия и определения подходящих размеров буферов.
(6)
Компонент перцептивной сложности Cp(f) интегрировал модели человеческого зрения для приоритизирования областей, значимых для зрителей перцептивно.
(7)
1.3 Извлечение признаков с использованием сверточных сетей с разрежённым графом внимания
Новая архитектура Sparse Graph Attention Convolutional Network (SGA-ConvNet) была реализована на этапе извлечения признаков AQVSO, что стало значительным улучшением по сравнению с традиционными сверточными сетями для обработки видео. SGA-ConvNet был разработан так, чтобы быть особенно подходящим для обработки высокомерных видеоданных в условиях с ограниченными ресурсами, сочетая эффективность разрежённых свёрток с адаптивностью механизмов внимания. Эта сетевая архитектура решала основную проблему фиксации временных и пространственных зависимостей в видеоконтенте. Динамический граф был построен во время обработки видеокадров, при этом каждый узел представлял важную точку признака, а рёбра — указывали на то, как эти особенности взаимосвязаны. Вычислительные накладные расходы значительно сократились за счёт концентрации ресурсов на соответствующих областях при сохранении разреженной связности, в отличие от традиционных сверточных сетей. Работа ядра на каждом уровне определялась посредством:
(8)
H(l) представлял представления признаков на уровне l, а A ̃ — нормированную матрицу смежности внимания. W(l) содержала обучаемые матрицы веса, а σ представляла нелинейную функцию активации. Сеть получила возможность изучать иерархические представления признаков при сохранении разреженности в графе вычислений. Механизм внимания, который был ключевым для адаптивной обработки признаков, вычислялся посредством:
(9)
αij обозначал коэффициент внимания между узлами i и j, а [hi ∣∣∣ h j] обозначал конкатенацию их векторов признаков. Активация LeakyReLU использовалась для предотвращения исчезновения градиентов при сохранении способности сети учиться на негативных особенностях. Механизм внимания динамически корректировал важность различных признаковых связей в зависимости от их релевантности к текущему содержанию кадра.
1.4 Динамическое управление скоростью через адаптивные спайкинг-нейронные сети
Динамическое управление скоростью было реализовано в фреймворке AQVSO (рисунок 1) с помощью архитектуры ASNN — биологически вдохновлённого подхода к управлению скоростями потокового потока видео. ASNN был специально разработан для обработки временной динамики видеопотоковой передачи при адаптации к быстро меняющимся сетевым условиям. Этот компонент был признан ключевым для сохранения качества потокового потока при одновременной оптимизации использования пропускной способности в различных условиях сети. Информация обрабатывалась с помощью дискретных спайков в ASNN, имитирующих биологические нейронные сети, что обеспечивало ряд преимуществ с точки зрения энергоэффективности и временной обработки. Мембранный потенциал шипующих нейронов эволюционировал в соответствии с следующим:
(10)
V(t) обозначал мембранный потенциал в момент времени t,V rest устанавливался как потенциал покоя, а τm определялся как константа времени мембраны. I(t) рассчитывался исходя из состояния сети и сложности контента. Адаптивный шум был введён через σ(t)N(0,1) для повышения устойчивости. Этот шумовой термин помогал сети сохранять стабильность при резких колебаниях условий сети. Механизм управления скоростью был реализован с использованием сложной схемы адаптации:
(11)
R(t) — целевой битрейт, S(t) — скорость скачки нейронной сети, B(t) — доступная пропускная способность, а E(t) — ошибочный термин, полученный из метрик качества. Экспоненциальный термин expp(-λE(t)) использовался для обеспечения плавной адаптации к вариациям качества при предотвращении колебательного поведения в системе управления скоростью.
1.5 Оптимизация сжатия, основанная на качестве
На этапе оптимизации сжатия был реализован новый подход, сочетающий перцептивные метрики качества с стратегиями сжатия, ориентированными на контент. Этот этап стал фундаментальным для достижения оптимальных компромиссов между качеством и размером в сжатом видеопотоке. Использовалась регионально-адаптивная схема сжатия, которая распределяла биты как по важности содержания, так и по перцептивным требованиям к качеству.
(12)
C (r,t) обозначал степень сжатия для области r в момент времени t, а Cbase(r) использовался как базовое сжатие, определяемое сложностью содержания. Q(r,t) была определена для обозначения коэффициента качества. φi (r,t) был реализован для представления различных факторов корректировки, включая интенсивность движения, плотность краёв и перцептивную важность.
1.6 Распределение ресурсов через глубокие сети убеждений с оптимизацией муравьиных колоний
Механизм распределения ресурсов в AQVSO был настроен для реализации гибридного подхода, объединяющего глубокие сети убеждений (DBN) с оптимизацией муравьиных колоний (ACO), что позволило создать новое решение сложной задачи оптимального распределения ресурсов в видеопотоковых системах. Возможности обучения в сетях глубоких убеждений использовались для распознавания шаблонов при использовании ресурсов, а оптимизационные возможности алгоритмов муравьиных колоний применялись для принятия решений о распределении ресурсов в реальном времени. Система DBN-ACO была разработана для решения фундаментальной задачи баланса немедленных потребностей в ресурсах с долгосрочными целями оптимизации в динамических сетевых средах. Компонент DBN был реализован с использованием иерархической структуры обучения, состоящей из нескольких ограниченных машин Больцмана (RBM), каждый из которых фиксировал всё более абстрактные закономерности использования ресурсов. Распределение вероятностей активации скрытых единиц было смоделировано посредством:
(13)
hi — скрытые единицы, v — видимые единицы, bi — смещенные термины, а wij — веса связей. Это вероятностное моделирование использовалось для фиксации сложных зависимостей в паттернах использования ресурсов при сохранении адаптивности к изменяющимся условиям. Компонент ACO был реализован с использованием динамической стратегии оптимизации на основе феромонов.
(14)
(15)
τij обозначал уровни феромонов, при этом p служила скоростью испарения Δτij (t). определялся как обновление феромонов, а η IJ представлял эвристическое значение на основе текущих состояний сети и доступности ресурсов.
1.7 Адаптивное управление буфером и восстановление ошибок
В фреймворке AQVSO была реализована сложная система управления буфером, которая динамически адаптировалась к изменяющимся условиям сети и характеристикам контента. Эта система была разработана для поддержания непрерывности потока при минимизации задержки и предотвращении условий переполнения или переполнения буфера. Был внедрён новый адаптивный подход, учитывающий как сетевую статистику, так и сложность контента.
(16)
B(t) сохранялся как целевой размер буфера, QoE(t) измерялся как текущее качество опыта, σ(t) отслеживался как метрика стабильности сети, а φ(σ(t)) реализовывался как адаптивная функция для модуляции размера буфера на основе изменчивости сети. Механизм восстановления ошибок был реализован с использованием многоуровневого подхода, сочетающего проактивное предотвращение ошибок с реактивными стратегиями восстановления. В системе сохранялось скользящее окно с референсами.
(17)
p использовалось для обозначения вероятности успеха одной попытки восстановления, n — как количество попыток, а T(t) применялось для обозначения времени с момента обнаружения ошибки. Этот термин экспоненциального распада использовался для того, чтобы приоритеты по восстановлению были правильно распределены с точки зрения временной значимости.
1.8 Оценка качества и интеграция обратной связи
Система оценки качества реализовала комплексный подход, сочетающий несколько метрик качества с факторами пользовательского опыта. Эта интеграция была крайне важна для поддержания высокого качества качества и оптимизации использования ресурсов. Система реализовала новый метод термоядерного синтеза качества:
(18)
NB(t) рассчитывался как нормированное буферное отношение, SB(t) — как частота переключения, а M(t) — как коэффициент качества движения. Веса wi регулировались динамически в зависимости от типа контента и условий просмотра.
(19)
Θi представлялась как базовые веса, а f(C(t)) применялась как функция корректировки, зависящая от содержания. Система интеграции обратной связи была реализована как механизм управления с замкнутым контуром.
(20)
e(t) был установлен для отображения ошибки между целевой и достигнутой метрикой качества, а K1,K 2,K 3 определялись как адаптивные параметры усиления, корректирующиеся в зависимости от условий сети и характеристик контента.