본 연구는 사전 훈련된 GARNN 모델을 사용하여 시청각 기능을 통합하여 비디오 요약을 위한 다중 모드 딥러닝 프레임워크를 제안합니다. GRU, AlexNet 및 적대적 LSTM 분류기를 활용하는 이 시스템은 키프레임 감지를 향상시키고 중복성을 줄이며 평균 F-점수 0.985로 높은 요약 정확도를 달성합니다.
연구 논문
본 연구는 사전 훈련된 GARNN 모델을 사용하여 시청각 기능을 통합하여 비디오 요약을 위한 다중 모드 딥러닝 프레임워크를 제안합니다. GRU, AlexNet 및 적대적 LSTM 분류기를 활용하는 이 시스템은 키프레임 감지를 향상시키고 중복성을 줄이며 평균 F-점수 0.985로 높은 요약 정확도를 달성합니다.
비디오 요약은 필수 콘텐츠를 보존하여 긴 비디오의 간결한 버전을 만드는 데 중점을 둡니다. 이 연구는 GRU(Gated Recurrent Units)와 AlexNet을 결합한 GARNN이라고 하는 사전 훈련된 Gated Recurrent Neural Network 아키텍처를 사용하여 오디오, 이미지 및 시각적 특징을 추출함으로써 시각 및 청각 정보를 통합하는 다중 모드 기계 학습 전략을 보여줍니다. 키프레임 감지는 중복 프레임을 제거하고 모션 보정 기능 감소를 적용한 다음 선택적 PCA 기반 차원 감소를 적용하여 개선됩니다. 적대적 인코더 기반 AE-LSTM(Long Short-Term Memory) 분류기는 요약에서 높은 정확도를 달성하여 시간 모델링에 사용됩니다. 결과는 민감도, F-점수, 양성 예측값을 사용하여 평가되었으며, 평균 F-점수 0.985를 달성했습니다. 게이트 AlexNet은 다중 모드 GARNN-AE-LSTM 프레임워크에 도입되었으며, 여기서 동작 보상 PCA 기반 감소는 중복성을 제거하고, GRU는 시간적 진행을 기록하며, 게이팅은 공간 특징 선택을 미세 조정하여 보다 정확하고 효율적인 비디오 요약 시스템에 기여합니다. 향상된 F1 점수는 의미 있는 비디오를 만들어 비디오 요약의 정확성을 생성하는 모델의 효율성을 보여줍니다. 이 접근 방식은 강력한 비디오 분석 및 압축을 위한 다중 모드 특징 추출 및 고급 딥 러닝 기술의 잠재력을 강조합니다.
오디오, 비디오, 텍스트 및 센서 데이터와 같은 여러 양식을 결합하여 학생들이 학습하는 방법에 대한 통찰력을 제공하는 다중 모드 분석(MMA) 시스템이 등장했습니다1. 이러한 기술은 다중 모드 데이터를 평가하여 학생 행동과 참여 수준을 철저히 이해하는 데 도움이 될 수 있습니다2. 그러나 효율적인 MMA 시스템을 만드는 데는 여러 가지 장애물과 제한 사항이 있습니다3. 인터넷과 보안 카메라의 성장으로 인해 수많은 디지털 비디오가 있습니다. 이러한 비디오는 데이터베이스로 컴파일하는 것이 필수적입니다. 이 상황에서는 비디오 요약이 도움이 될 수 있습니다. 실제 비디오의 유용한 시놉시스를 만드는 것을 비디오 요약이라고 하며 활동 추적, 이상 징후 감지 및 비디오 검색에 도움이 됩니다4. 비디오 요약은 다양한 전략을 사용하여 수행할 수 있습니다. 이러한 방법은 추출 및 추상적 비디오 요약과 같은 두 가지 범주5 중 하나에 속한다.
비디오 요약에는 많은 컴퓨팅이 필요하기 때문에 효율적인 방법이 필요합니다. 동영상의 모든 프레임을 선택하기 위해 검사하는 경우 요약 프로세스가 느리고 길어질 수 있으며 동일하거나 유사한 프레임에 처리 리소스가 소비될 수 있습니다. 또한 프로세스를 가속화하고 중요한 기능만 고려하도록 하려면모든 기능 세트에 대한 공간 축소가 수행되어야 합니다6. 비디오 요약을 위한 기술은 최종 사용자7에게 생성되고 표시되는 시청각 신호의 유형 또는 그들의 출력에 기초하여 네 가지 주요 영역으로 분류될 수 있다. 보다 구체적으로, 비디오 요약 계산의 결과는 다음을 포함할 수 있다: (i) 일반적으로 정적 요약으로 알려진 순차적으로 표시되는 추출된 비디오 프레임인 1차 프레임(8); (ii) 동적 요약이라고 하는 비디오 프레임9; (iii) 다른 단서에 그래픽 기반 구문을 추가함으로써 최종 사용자에 대한 요약을 향상시키는 시각적 신호(10); (iv) 비디오 정보의 효율적인 요약을 제공하도록 설계된 컴퓨터에 의해 생성되는 텍스트 주석11.
키프레임을 기반으로 한 요약은 일반적으로 키샷을 기반으로 하는 요약보다 작습니다. 키프레임은 비디오에서 선택한 개별 대표 프레임을 나타냅니다. 키샷은 키프레임을 중심으로 그룹화된 비디오 프레임의 짧고 연속적인 세그먼트를 나타냅니다. 요약 클래스는 분류자의 출력 레이블 지정 프레임 또는 세그먼트를 정보 제공(요약에 포함됨) 또는 비정보 제공(제외됨)으로 참조합니다. 그럼에도 불구하고 이러한 이점은 요약 과정에서 중요한 세부 사항을 생략하는 대가를 치르는 대가로 제공됩니다. 예를 들어, 키프레임 기반 요약에서 선행 프레임의 컨텍스트를 가져오는 것이 어려울 수 있습니다. 또한 원래 사운드가 없습니다. 따라서 이러한 문제를 해결하기 위해 키샷 기반 비디오 요약 기술이 자주 선택됩니다. Keyshot 기반 동영상 요약 기술은 긴 형식 또는 짧은 형식의 동영상에 대한 하위 집합을 만드는 데 활용됩니다. 짧은 형식과 긴 형식의 비디오는 일반적으로 길이가 각각 10분 미만 및12분 이상입니다. 숏폼 비디오에 대한 키샷 지원 하위 집합을 생성하는 것은 비실용적이며 이미 짧은 재생 길이로 인해 성공하지 못할 수 있습니다. 또한 긴 형식의 비디오, 특히 영화나 스포츠 비디오의 재생 시간은 90분을 초과할 수 있습니다. 이러한 비디오 범주의 경우 키샷 기반 요약 기법이 사용자에게 간략한 개요를 제공하는 데 더 유용하고 효율적입니다.
비디오 요약의 주관적인 특성으로 인해 어려운 작업이 됩니다. 이는 비교 가능한 비디오 콘텐츠에 관해서도 각 사용자가 서로 다른 취향을 가지고 있기 때문입니다. 이 문제는 맞춤형 비디오 요약 접근법(13)의 도움으로 정확하게 해결될 수 있다. 알고리즘의 목표는 각 사용자의 관심사에 맞는 콘텐츠를 제공하는 것입니다. 그러나 새로운 긴 형식의 비디오(예: 스포츠 이벤트)에 이상적인 길이의 적응된 비디오 요약은 쉽게 사용할 수 없습니다. 현재의 방법(14,15)은 개별화된 요약을 실시간으로 제공하기 위해 고객 선호도 데이터 및 비디오 영상을 평가하기 위해 방대한 컴퓨터 자원을 필요로 한다. 실시간 개인화된 비디오 요약은 중앙 집중식 전용 서버에서 얻을 수 있습니다. Babu Veesam과 Satish16은 방대한 양의 비디오 데이터를 효과적으로 압축하는 널리 사용되는 접근 방식을 보여주는 모든 주요 비디오 요약 전략에 대한 철저한 분류학적 분석에 대해 논의했습니다. 이 검토는 다중 모드 통합 전략, 딥 러닝 프레임워크 및 클러스터링 기반 방법을 포함하는 기본 접근 방식과 관련하여 방법론을 분류하고 평가합니다. 주목할만한 방법 중에는 지도 요약을 위해 지식 증류를 사용하는 KDAN 프레임워크와 인공 조류 알고리즘으로 최적화된 DBSCAN 클러스터링을 사용하는 SVS_MCO 방법이 있습니다. 또한 이 검토는 동적 및 다중 모드 비디오 요약 문제를 관리하는 데 매우 효과적인 것으로 밝혀진 시청각 순환 네트워크 및 쿼리 기반 심층 아프리카 독수리 학습과 같은 정교한 모델을 제공합니다.
비디오 요약을 위한 게이트 AlexNet 순환 신경망(GARNN-AE-LSTM) 다중 모드 프레임워크를 포함하는 것이 이 연구를 참신하게 만드는 것입니다. 이 접근 방식은 동작 보상 PCA로 중복성을 줄이고, GRU로 시간 역학을 캡처하고, 게이팅 방법을 사용하여 공간 특징 선택을 최적화함으로써 비디오 요약 프로세스의 정확성과 효율성을 향상시킵니다. 복잡성을 줄이면서 비디오 요약을 효율적으로 제공하기 위해 이 논문은 다음과 같은 기여를 합니다. (i) 다중 모드 비디오 요약: Gated RNN과 AlexNet을 결합한 사전 훈련된 GARNN 모델을 사용하여 시각 및 청각 정보를 모두 통합하여 간결한 비디오 요약을 생성하는 프레임워크를 제안했습니다. (ii) 기능 개선을 위한 게이트 AlexNet: AlexNet의 조밀한 레이어에 새로운 게이트 메커니즘(시그모이드 게이트)을 도입하여 관련 없는 공간 특징을 필터링하여 높은 수준의 시각적 특징 추출을 향상시켰습니다. RNN과의 통합을 통해 프레임 간 종속성의 효과적인 시간적 모델링이 가능합니다. (iii) 중복 프레임 제거: 키프레임 감지 전에 동일하거나 유사한 프레임을 제거한 후 효율적인 특징 표현을 위해 선택적 PCA 기반 차원 감소를 수행하는 동작 보상 분산 기반 접근 방식을 개발했습니다. (iv) 정확한 키프레임 감지: 시간 모델링을 위해 적대적 인코더 기반 LSTM 분류기를 사용하여 평균 F-점수 0.985를 달성하여 기본 접근 방식에 비해 우수한 요약 정확도를 입증했습니다. (v) 트랜스포머 모델에 대한 효율성: 제안된 GARNN 모델은 계산적으로 효율적이며, AlexNet은 공간적 특징을 효과적으로 캡처하고, RNN 모델은 순차적 종속성을 포착하며, 게이팅 메커니즘은 중요하지 않은 프레임을 필터링하여 특징 선택 및 요약에서 트랜스포머 기반 대안을 능가합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 일반적으로 비디오 스키밍이라고 하는 일반적인 비디오 요약 범주에 속하는 다중 모드 지도 비디오 요약 방법을 제안합니다. 여기에는 더 큰 비디오의 주요 세그먼트를 찾아 시간적으로 압축된 버전을 만드는 데 집중하는 기술이 포함됩니다. 이 연구는 그림 1과 같이 오디오 및 시각적 표현을 포함하는 1초 섹션에서 비디오 스트림을 분석하는 지도 기술을 제안합니다. 그런 다음 이러한 세그먼트는 "흥미롭지 않음" 또는 "유익함"으로 분류됩니다. 합성 또는 시뮬레이션 데이터와 달리 "실제 데이터"는 이제 실험에 활용되는 실제 비디오 데이터 세트를 의미합니다. 요약에 필요한 중요한 시청각 신호(예: 높은 동작, 음성 또는 장면 전환)를 제공하는 비디오 세그먼트를 "정보 세그먼트"라고 합니다. "흥미롭지 않은" 부분은 시놉시스에 새로운 것을 추가하지 않는 반복적이거나 중복된 프레임으로 정의됩니다.
입력 비디오는 프레임으로 분할되고 제안된 GARNN 모델을 사용하여 각 프레임에서 다중 모드 기능이 추출됩니다. 오디오 및 시각적 기능은 융합되어 차원 축소 단계에 입력으로 공급되며, 여기서 중복 프레임은 추가 처리를 위해 제거됩니다. 마지막으로, 제안된 AELSTM은 비디오 요약을 위해 축소된 데이터에 적용됩니다. 이를 달성하기 위해 다중 양식이라고 하는 시각, 청각 또는 혼합 양식의 특징 표현으로 훈련된 지도 이진 분류기가 사용됩니다.

그림 1: 제안된 비디오 요약 모델의 개요. 파이프라인에는 AELSTM을 사용한 다중 모드 기능 추출, 차원 축소 및 요약 생성이 포함됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
데이터 세트
제안된 솔루션의 효과는 정적 비디오 요약의 벤치마크 데이터 세트 쌍인 VSUMM17 및 SumMe18 데이터 세트를 사용하여 결정됩니다. LSTM과 실제 데이터와 함께 AlexNet을 사용하여 생성된 CNN 기능이 데이터 세트에 포함됩니다. 실제 데이터와 데이터 세트는 일반 대중이 접근할 수 있습니다19. VSUMM 데이터 세트에 있는 50편의 영화는 YouTube와 같은 웹사이트에서 가져온 것이며 초당 30프레임으로 110분에 걸쳐 있습니다. 만화, 뉴스, 스포츠, 광고, TV 시리즈, 홈 비디오 등 다양한 장르로 제공됩니다. 이 중 25개의 동영상은 유명 YouTube 사이트에서 가져온 휴일, 축제 및 스포츠로 구성되어 있으며 최소 15개의 인간이 생성한 요약(총 390개)이 태그되어 "SumMe"20 비디오 요약 데이터 세트를 구성합니다. 비디오의 지속 시간 범위는 1-6분입니다.
원본 비디오는 RGB 이미지로 변환되며, 이는 특징 추출을 위해 사전 훈련된 제안된 GARNN 모델에 입력으로 공급됩니다. 이 모델은 AlexNet과 게이트 RNN으로 구성됩니다. 원래 기능 수는 64개이며 AlexNet의 기능에는 4100개의 기능이 있습니다.
제안된 Gated-AlexNet-RNN 기반 특징 추출
정보의 시각적 및 오디오 모드 모두 비디오를 요약하는 데 사용되었습니다. 두 양식 모두에서 특징 표현을 달성하기 위해 우리는 사진 검색, 비디오 분류, 청각 장면 분석 및 음악 정보 검색과 같은 오디오 및 시각적 클러스터링 및 분류 작업에 자주 사용되는 수공예 기능을 식별했습니다. 목표는 가능한 한 많은 교육용 시각 및 청각 구성 요소를 포함하는 것이었습니다. 그림 2 는 오디오 및 시각적 양식에 대한 특징을 추출하는 데 사용되는 프로세스의 개념적 그림을 보여줍니다.

그림 2: 제안된 다중 모드 GARNN 기반 특징 추출. 시각 및 청각 양식 모두에서 특징은 AlexNet 및 GARNN 구성 요소를 사용하여 추출됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
게이트 - AlexNetRNN: (GARNN)
가상 이미지 분석의 경우 CNN은 널리 사용되는 DL 모델입니다21. 일반적으로 CNN은 이미지를 입력으로 사용하여 여러 그룹으로 나눕니다. 입력 뉴런, 컨볼루션 풀링이 있는 일련의 계층, 완전히 연결된 계층 및 정규화 계층이 구조를 구성합니다22. 컨볼루션 계층의 뉴런은 좁은 영역을 통해 이전 계층에 연결됩니다. 그 아래의 층은 완전히 연결된 층의 활성화 뉴런에 완전히 연결되어 있습니다. 방정식 (1)은 완전히 연결된 함수의 정방향 및 역방향 전파를 나타냅니다.
(1)
(2)
여기서
l번째 층에서 i번째 뉴런의 활성화는 l
번째 층에서 i번째 뉴런의 기울기이며
l+1 번째 층에서 i번째 뉴런의 무게입니다. 최근 연구 발전의 결과로 수많은 CNN 디자인이 등장했습니다. 이 작업에는 AlexNet이 사용되었습니다.
그림 3에 표시된 AlexNet의 아키텍처는 세심하고 잘 구성된 설계를 반영합니다. 완전히 연결된 3개의 계층과 5개의 컨볼루션 계층이 8개의 학습 계층을 구성합니다. 클래스 레이블은 마지막 레이어의 결과를 softmax를 활성화하는 함수에 공급하여 생성됩니다. 두 번째, 네 번째 또는 다섯 번째 계층 커널은 GPU 공유를 통해 선행 수준에 연결됩니다. 두 번째와 세 번째 계층 커널은 서로 완전히 연결되어 있습니다. 정규화 계층은 첫 번째 및 두 번째 수준 이후에 최대 풀링 계층에 연결됩니다. ReLU는 모든 학습 계층에 연결됩니다.

그림 3: AlexNet의 아키텍처. 5개의 컨볼루션 계층과 3개의 완전 연결 계층은 요약 모델에서 시각적 데이터를 처리하는 데 사용됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
이 작업의 기본 백본 네트워크는 고밀도 계층 GARNN이었습니다. 두꺼운 RNN에는 세 개의 층이 있습니다. 두 번째 층에 80개의 뉴런이 있고 첫 번째 층에 170개의 뉴런이 있는 두 개의 완전 연결된(fc) 층으로 구성됩니다. 다음 계층은 일괄 정규화 및 드롭아웃입니다. 마지막 레이어인 fc는 3개의 뉴런으로 구성되며 이미지를 분할하는 데 사용됩니다. LSTM 뒤에 오는 조밀한 층은 뇌종양 주변 영역을 나눕니다. AlexNet은 LSTM 레이어 기능을 제공합니다. 데이터 세트에는 최대 20개의 슬라이스가 있으며, 이는 선언된 총 시퀀스 수와 같습니다. GARNN의 첫 번째 레이어에는 100개의 숨겨진 유닛이 포함되어 있는 반면, 세 번째 레이어에는 125개의 숨겨진 유닛이 포함되어 있습니다.
게이팅 메커니즘은 제안된 GARNN-AE-LSTM 프레임워크에서 AlexNet의 조밀한(완전히 연결된) 레이어에 통합되었습니다. 컨볼루션 기능 맵은 종종 AlexNet에 의해 처리되고 분류를 위해 완전히 연결된 레이어로 바로 전송됩니다. 중복되거나 덜 중요한 패턴을 포함하여 검색된 모든 공간 특성은 이 방법으로 동일하게 처리됩니다. 우리는 특징 필터로 작동하고 시그모이드를 기반으로 하는 게이팅 함수를 도입하여 이 문제를 해결했습니다. 수학적 용어로 게이트 벡터 g = σ(wX) + b는 σ 시그모이드 함수를 나타내며 밀도 층의 출력을 변조합니다. 훈련 중에 이 게이트는 0에서 1 사이의 다양한 기능 활성화 가중치를 제공하는 방법을 학습합니다. 그것들은 다음과 같습니다: (i) 낮은 게이트 값은 관련 없는 기능(예: 배경 소음 또는 중복 텍스처)을 억제합니다. (ii) 게이트 값이 높을수록 식별 기능(예: 중요한 물체 영역 또는 동작 감지 패턴)이 강조됩니다. (iii) 이 개선된 기능 세트는 RNN 구성 요소에서 사용되며, 이를 통해 관련 없는 공간 정보에 의해 옆길로 이동하지 않고 시간적 종속성을 더 잘 캡처할 수 있습니다. (iv) 역전파는 AlexNet 및 RNN과 함께 훈련 중에 게이팅 매개변수를 변경하는 데 사용됩니다. 이는 시간이 지남에 따라 모델이 추출할 기능 외에도 요약에 가장 중요한 측면을 학습한다는 것을 의미합니다.
그림 4에서 변수 X는 입력 데이터를 나타내고, C는 셀을 나타내며, H는 숨겨진 상태를 나타냅니다.

그림 4: GARNN(Gated Recurrent Neural Network 아키텍처) 모델. GARNN은 효과적인 시퀀스 모델링을 위해 배치 정규화, 드롭아웃 및 여러 고밀도 레이어를 통합합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
각 블록에서 Iw, Rw 및 각각 입력, 반복 가중치 및 바이어스라고 하는 바이어스와 같은 각각의 가중치가 식(3)에서 식(5)과 같이 활용되었습니다
(3)
(4)
(5)
특정 타임 스탬프 t에서 셀의 상태는 방정식 (6)과 같이 표시됩니다.
(6)
여기서
Hadamard의 곱과 숨겨진 단위의 상태는 Eqn (7)에서와 같이 표시됩니다.
(7)
따라서 py 오디오 분석 모듈을 활용하여 ffmpeg(https: //github.com/tyiannak/pyaudioanalysis)23을 활용하여 해당 비디오 파일에서 추출된 모든 오디오 클립에 대한 세그먼트 수준 오디오 특성을 계산합니다. 추출된 기능은 표 1에 나열되어 있습니다. 이 프로세스에 따라 오디오 기능 추출은 처음에는 임시로 수행됩니다. 표현의 마지막 부분은 두 번째 수준에서 계산되는 세그먼트 수준 피처 통계로 구성됩니다. 구체적으로, 오디오 신호의 각 세그먼트에 대해 단기 처리가 수행되어 모든 세그먼트 수준 창에 대해 68개의 단기 기능(34개 기능 및 34개의 델타)이 계산되며, 이는 겹치거나 겹치지 않을 수 있습니다. 우리는 각 비디오의 사운드 신호에서 청각 요소를 추출하는 것 외에도 시각적 정보의 내용을 전달하기 위해 다양한 시각적 특성을 사용했습니다. 이 양식은 요약 프로세스에 매우 중요할 것으로 예상됩니다. multimodal_movie_analysis 라이브러리(https://github.com/tyiannak/multimodal_movie_analysis)는 이러한 시각적 요소를 추출하기 위해 비디오의 시각적 측면을 반영하는 기능을 추출하는 데 사용되었습니다. 구체적으로, 아래 나열된 88개의 시각적 요소는 0.2초마다 일치하는 프레임에서 가져옵니다. 여기에서 다중 모드 기능이 융합되고 총 59개의 기능이 비디오 요약을 수행하여 비디오를 유익하고 흥미롭지 않은 것으로 분류하는 추가 분석에 사용됩니다.
PCA를 사용한 기능 축소
본 연구의 특징 차원은 주성분 분석(PCA)의 적용에 의해 감소되었습니다. 기본 특성은 그 중요성과 중요성을 높이기 위해 핵심 기능으로 변환됩니다. PCA는 다양한 영역에서 수많은 연구자들에 의해 널리 사용되어 왔습니다24. 고유값은 속성을 결정하는 데 사용됩니다. 가장 높은 고유값 특징이 선택되고 가장 낮은 고유값 특징이 제거됩니다.
불필요한 프레임을 제거한 후 PCA는 이 연구에서 선택적 기능 감소 단계로 사용됩니다. PCA는 GARNN에 의해 생성된 고차원 특징 벡터를 작은 하위 공간으로 압축하여 노이즈와 중복 정보를 억제합니다. 이는 AE-LSTM의 계산 효율성을 높이는 동시에 키프레임 감지가 가장 식별 가능한 시각 및 청각 단서에 의해 지배되도록 보장합니다. 비디오 요약의 확장성과 정확성의 균형을 맞추기 위해 PCA는 유용한 도구로 활용됩니다. 알고리즘(알고리즘 1)은 보충 파일 1로 제공됩니다.
이전 프레임과 정확히 동일하거나 눈에 띄게 유사한 프레임은 중복으로 간주됩니다. 프레임 속도를 변경하면 제거된 비디오 프레임의 비율에 영향을 미칠 수 있다는 것은 분명합니다. 보다 구체적으로, 프레임 속도가 증가함에 따라 연속 프레임 간의 유사성도 증가하여 제거되는 프레임의 비율이 높아집니다. 이제 차원 축소 기능은 적대적 AE-LSTM 모델이라고 하는 ML 모델을 훈련하는 데 사용됩니다.
AELSTM을 사용한 교육
GAN25 라고 하는 신경망은 두 개의 경쟁 하위 네트워크로 구성됩니다: i) 알려지지 않은 분포와 유사한 데이터를 생성하는 "생성기" 네트워크(G)와 ii) 생성된 샘플과 실제 관측치의 샘플을 구별하는 "판별자" 네트워크(D). 목표는 실제 데이터 분포에 맞추면서 판별자가 실수를 저지를 가능성을 최대화하는 생성기를 찾는 것입니다.
X가 입력이고 E가 이전 입력 노이즈라고 가정하면 X'= g(E)가 생성된 샘플입니다. 미니맥스 최적화를 사용하여 학습이 공식화됩니다.
(8)
여기서 D는 분류의 정확한 확률을 얻을 수 있습니다. 개발된 훈련 모델의 구성 요소는 그림 5에 나와 있습니다. 선택기 LSTM은 입력 비디오 시퀀스 X에서 프레임 하위 집합을 선택합니다. 선택한 프레임은 인코더-LSTM을 사용하여 고정 길이 기능 E로 변환된 다음 디코더-LSTM을 사용하여 비디오 재구성 X'로 변환됩니다. X'를 실제 비디오 또는 요약 클래스로 분류하는 것은 판별자-LSTM에 의해 수행됩니다. 본 연구에서는 효율적이고 다양하며 구조화된 영상 요약을 위해 GAN 구조의 영상 요약에 AE-LSTM을 사용하였다. AE는 불필요한 배경 변화를 제거할 수 있고, LSTM은 프레임을 이미지로 취급하는 대신 장면 전환을 감지할 수 있으며, GAN은 생성기가 비디오를 요약할 수 있으며, 판별기는 요약이 다양하도록 보장합니다

그림 5: AELSTM 요약 모델의 아키텍처. Selector-LSTM, Encoder-LSTM, Decoder-LSTM 및 Discriminator-LSTM이 포함되어 적대적 훈련을 통해 비디오 요약을 최적화합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
라고 하는
입력 비디오 X의 각 프레임에 대한 GARNN 기능을 제공함으로써 요약기는 셀렉터 LSTM을 사용하여 프레임 하위 집합을 선택하고, 인코더는 프레임을 E로 인코딩한 다음 디코더가 각 프레임 xt에서 비디오를 X'로 재구성합니다. 선택기는 프레임을 선택할 때 중요도 점수를 활용합니다. 기능은 점수를 사용하여 가중치 값으로 제공된 다음 인코더로 이동합니다. 점수 st = 1인 각 프레임에 대해 하위 집합은 인코더에서만 수신됩니다. 판별자는 X와 X' 사이의 거리를 추정하고 레이블을 할당하여 클래스를 원본 또는 요약으로 선택합니다. 이 경우 판별자는 원본 비디오와 요약 비디오 간의 오류를 계산합니다. 알고리즘 2(보충 파일 2)는 비디오 요약을 위한 AELSTM 훈련의 요약을 나타냅니다.
후처리 – 비디오 요약
비디오 요약은 학습이 완료되면 세그먼트 수준 분류자에 의해 생성될 수 있습니다. 이를 달성하려면 세 단계가 포함됩니다. (i) 각 비디오 세그먼트의 오디오, 시각적 또는 혼합 특성을 결정합니다. (ii) 적절한 오디오, 시각적 또는 융합 분류기를 사용하여 각 비디오 세그먼트를 분류합니다. (iii) 눈에 띄는 실수를 방지하기 위해 질서 정연한 분류기 예측을 후처리합니다.
이러한 요구를 충족하기 위해 후처리 단계를 위해 두 개의 개별 필터로 구성된 파이프라인이 개발되었습니다. 입력 배열은 순차적 분류기 예측을 평활화하기 위해 먼저 로컬 창을 활용하는 길이 N1의 중앙값 필터를 받습니다. 그런 다음 최종 예측은 해당 시퀀스에 최소 N2개의 세그먼트가 포함된 경우 일련의 연속적으로 긍정적인 예측(유익한 세그먼트)을 유지하는 간단한 방법을 사용하여 하드 필터링에 의해 결정됩니다. 다르게 말하면, 이 기준은 교육적인 세그먼트가 최소 N2초 동안 지속되어야 합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제안된 GARNN 기반 특징 추출 및 긴 비디오의 AGLSTM 기반 비디오 요약은 VSUMM과 SumMe라는 두 가지 데이터 세트에서 실험되었습니다. 이 섹션에서는 실험 결과와 기존 접근 방식과의 비교에 대해 설명합니다. 판별기 LSTM의 경우 모든 레이어에 1024개의 숨겨진 단위가 있는 2레이어 LSTM을 사용합니다. encoder_LSTM와 decoder_LSTM의 경우 각각 각 레이어에 2048개의 숨겨진 장치가 있는 두 개의 2레이어 LSTM을 사용합니다. 역서열을 저장하고 합성하려는 디코더 LSTM은 훈련하기가 더 간단한 것으로 입증된다26. 기능 시퀀스는 디코더 LSTM에 의해 역순으로 재구성됩니다. 원본 동영상의 기능 시퀀스에 대해 학습된 사전 학습된 반복 자동 인코더 모델의 설정은 인코더 LSTM 및 디코더 LSTM 모델을 초기화하는 데 사용됩니다. 우리는 이것이 더 빠른 수렴으로 이어지고 전반적인 정확도를 높이는 데 도움이 된다는 것을 발견했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구에서는 입력 데이터에서 생성된 데이터의 오디오, 이미지 및 시각적 양식을 사용하는 효율적인 다중 모드 ML 및 DL 모델을 사용하여 긴 비디오의 비디오 요약을 제시합니다. 이진 분류기는 생성된 요약 부분인 중요한 세그먼트와 폐기되는 "중요하지 않은" 세그먼트 간의 구별을 학습하도록 훈련됩니다. 모델은 SumMe 및 VSUMM과 같은 데이터 세트를 사용하여 훈련되며 모델의 확장성은 메트릭 측면에서 입증됩니다. 처음에는 GARNN 모델을 사용하여 비디오에서 특징을 추출하고 차원을 줄이기 위해 PCA를 사용하여 추가로 처리합니다. AELSTM 기반 분류기를 사용하여 정량적 및 정성적 평가를 기반으로 모델의 효율성을 테스트합니다. 모델의 우월성을 주장하기 위해 오디오, 이미지 및 비디오 기능을 기반으로 하는 기존의 4가지 ML 및 DL 기반 비디오 요약 접근 방식과 비교합니다. 결과는 다중 모드 기능의 중요성이 SumMe 데이터 세트에 대해 PPv 0.947, 민감도 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자에게는 이해 상충이 없습니다.
저자들은 연구를 수행할 수 있는 실험실 시설을 제공한 쓰촨 영화 텔레비전 대학교 박사 텔레비전 스쿨에 감사를 표합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| AlexNet(사전 학습된 모델) | MATLAB / 파이토치 | PyTorch 허브 — AlexNet 사전 학습된 모델: https://pytorch.org/hub/pytorch_vision_alexnet/ | 시각적 특징 추출에 사용 |
| FFmpeg | FFmpeg.org | https://ffmpeg.org/ | 비디오에서 오디오 추출 |
| GRNN 기반 모델 | 사용자 지정 구현 | 도서관 " 뉴피" GRNN 구현: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.html | 다중 모드 기능 융합에 사용 |
| LSTM(장단기 기억) | 파이토치 | https://pytorch.org/docs/stable/generated/torch.nn.LSTM.html | 선택기, 인코더, 디코더에 사용 |
| Multimodal_movie_analysis lib | 깃허브 | https://github.com/tyiannak/multimodal_movie_analysis | 시각적 특징 추출용 |
| 넘파이 | 파이썬 소프트웨어 재단 | https://pypi.org/project/numpy/ | 수치 계산 및 행렬 연산 |
| PCA(주성분 분석) | 시킷 학습 | https://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.html | 차원 축소 |
| 파이오디오분석 | 깃허브 | https://github.com/tyiannak/pyaudioanalysis | 오디오 기능 추출 |
| 파이토치 | 파이토치 재단 | https://pytorch.org/ | 딥러닝 프레임워크 |
| SumMe 데이터 세트 | 공개 데이터 세트 | https://gyglim.github.io/me/vsum/index.html | 벤치마크 비디오 요약 데이터 세트 |
| VSUMM 데이터 세트 | 공개 데이터 세트 | http://www.vision.ime.usp.br/~creativision/vsumm/ | 벤치마크 비디오 요약 데이터 세트 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청