Artykuł badawczy

Wizualne mapowanie multimodalnych cech emocji dla projektowania inteligentnych interakcji

96 wyświetleń

DOI:

10.3791/71171

21 sierpnia 2026

W tym artykule

Podsumowanie

W pracy zaproponowano kompleksowy, multimodalny system analizy emocji, który wykorzystuje koderach transformera, rozdzielone reprezentacje emocji oraz oparty na grafach mechanizm uwagi między-modalnej z mapowaniem wizualnym w celu zwiększenia dokładności rozpoznawania emocji w dwóch zbiorach danych.

Streszczenie

Wizualne mapowanie multimodalnych cech emocjonalnych ma kluczowe znaczenie dla projektowania inteligentnych interfejsów, umożliwiając maszynom rozumienie, interpretowanie i reagowanie na afektywne stany człowieka. Niemniej jednak obecne algorytmy multimodalnego wykrywania emocji koncentrują się głównie na wydajności predykcyjnej, oferując niewielki wgląd w interpretowalność, świadomość interakcji czy międzymodalne interakcje na poziomie cech. W niniejszej pracy przedstawiono ramy wizualnego mapowania aspektów emocji multimodalnych, które łączą wizualizację zorientowaną na interakcję, interpretowalną naukę reprezentacji oraz predykcję emocji. Bez użycia ręcznie tworzonych cech, do ekstrakcji wysokopoziomowych osadzeń emocjonalnych z modalności tekstowej, dźwiękowej i wizualnej wykorzystano koderów opartych na transformerach. W celu zwiększenia odporności, informacje specyficzne dla emocji oraz specyficzne dla modalności zostały rozdzielone za pomocą techniki rozplątanej nauki reprezentacji. Dodatkowo stworzono opartą na grafach sieć uwagi międzymodalnej, wykorzystującą adaptacyjne ważenie uwagi do symulowania subtelnych relacji emocjonalnych między modalnościami. W celu zwiększenia przejrzystości opracowano moduł wielowidokowego mapowania wizualnego, który obrazuje czasowe trajektorie emocji, rozkłady uwagi międzymodalnej oraz ukryte osadzenia emocjonalne. Do oceny zaproponowanych ram wykorzystano zbiór danych Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) oraz Chinese Multimodal Sentiment Analysis Dataset (CH-SIMS). Wyniki eksperymentalne wykazały, że zaproponowane ramy zapewniły lepszą interpretowalność na poziomie cech i wizualizację świadomą interakcji, konsekwentnie przewyższając reprezentatywne techniki bazowe pod względem dokładności, wskaźnika F1, korelacji oraz średniego błędu absolutnego. Ponadto moduł mapowania wizualnego umożliwił jakościową interpretację multimodalnych reprezentacji emocji, interakcji międzymodalnych i czasowej dynamiki emocji, wspierając analizę i wizualizację świadomą interakcji.

Wprowadzenie

Zdolność do prawidłowej identyfikacji i rozumienia ludzkich emocji stała się kluczowa dla usprawnienia interakcji między ludźmi a maszynami. Analiza emocji, poza tym że jest niezbędna do poprawy interakcji człowiek-komputer, ma potencjał zrewolucjonizować szereg dziedzin, w tym przeddiagnostykę medyczną1, analizę behawioralną w klasie2, monitorowanie psychologiczne pacjentów3, identyfikację zmęczenia w pojazdach4 oraz inteligentne zarządzanie w środowiskach inteligentnego domu5. Ostatnie osiągnięcia w dziedzinie informatyki afektywnej i uczenia głębokiego6 zwiększyły zainteresowanie tworzeniem systemów czasu rzeczywistego, które potrafią uchwycić złożoność ludzkich emocji.

Wiele obecnych metod opiera się głównie na danych unimodalnych, takich jak sygnały tekstowe, graficzne lub słuchowe7,8,9. Podejścia te wielokrotnie zawodzą w wykrywaniu subtelnych sygnałów, takich jak sarkazm czy niuanse zależne od kontekstu. Badania przesunęły się w stronę multimodalnej oceny emocji, która w celu przełamania tych ograniczeń łączy komplementarne dane z wielu źródeł10,11,12. Zalety łączenia wielu modalności zostały wykazane w modelach bazowych, takich jak wczesna fuzja z długo-krótkotrwałą pamięcią (EF-LSTM)13, lekkie głębokie sieci neuronowe FM (LF-DNN)14, sieci fuzji tensorowej (TFN) oraz podejścia oparte na fuzji multimodalnej o niskim rzędzie. Jednak większość tych metod opiera się na offline'owej generacji cech i nie nadaje się do dynamicznych sytuacji w świecie rzeczywistym.

W celu uwzględnienia stanów emocjonalnych, w ciągu ostatnich dziesięciu lat rozwinęły się badania i zastosowania w zakresie multimodalnej identyfikacji emocji15. Jednym z najbardziej wymagających i istotnych obszarów współczesnych badań jest ciągłe monitorowanie stanów emocjonalnych z wykorzystaniem różnorodnych źródeł danych16. Koncepcja multimodalności pojawiła się w sposób naturalny wraz z powstaniem tak zróżnicowanego systemu wiedzy, co doprowadziło do wielu postępów w wykorzystaniu emocji w dziedzinach takich jak obliczenia emocjonalne, interakcja człowiek-komputer (HCI), uczenie się, gry wideo, obsługa klienta, opieka medyczna, ocena doświadczeń użytkownika (UX) itp. Jednak zastosowanie technik rozpoznawania emocji w ewaluacji UX nie zawsze było tak proste.

Jednym z głównych powodów skupienia się na rozpoznawaniu multimodalnym, a nie na metodach unimodalnych, są immanentne wady polegania na pojedynczym źródle informacji. Systemy unimodalnego wykrywania emocji mogą cechować się niższą dokładnością z powodu brakujących lub niejasnych danych, podczas gdy schematy MER są bardziej niezawodne i oferują bardziej kompleksowe oraz wnikliwe zrozumienie stanów ekspresyjnych poprzez integrację wielu źródeł danych17. Na przykład sam język mimiki może być niewystarczający do precyzyjnej klasyfikacji uczuć, szczególnie gdy gesty są złożone lub niejasne. Jednak połączenie wyrazów twarzy z innymi formami komunikacji, takimi jak język lub sygnały fizyczne, może zwiększyć dokładność rozpoznawania uczuć.

Przeprowadzono szeroko zakrojone badania nad rozpoznawaniem emocji z wykorzystaniem kilku modalności. Wczesne studia koncentrowały się na identyfikacji cech wyróżniających w różnych modalnościach, takich jak dane graficzne, akustyczne lub tekstowe. Coraz bardziej oczywiste staje się jednak, że integracja różnych modalności może dostarczyć zrównoważonych informacji emocjonalnych, co prowadzi do bardziej wiarygodnego i precyzyjnego wykrywania sentymentu. Niniejszy segment omawia kluczowe postępy w jednowymiarowej i multimodalnej analizie emocji, koncentrując się na podejściach bazowych, ich niedociągnięciach oraz uzasadnieniu zastosowanej przez nas metody.

Wstępne badania nad rozpoznawaniem emocji koncentrowały się głównie na pojedynczej modalności. W obszarze wizualnym przełomowe badania doprowadziły do kategoryzacji prototypowych ruchów twarzy20. Kolejne postępy obejmowały techniki rejestrowania dynamiki czasowej, takie jak ruch wizualny21 oraz ukryte modele Markowa22, podczas gdy reakcje twarzy zostały podzielone na jednostki akcji przy użyciu Systemu Kodowania Ruchów Twarzy (FACS)23. Sieci LSTM oraz konwolucyjne sieci neuronowe (CNN) były z sukcesem wykorzystywane do ekstrakcji istotnych cech bezpośrednio z surowych sygnałów audio; metodologie identyfikacji emocji na podstawie dźwięku ewoluowały od konwencjonalnego przetwarzania sygnałów do głębokiego uczenia24. Ekstrakcja kontekstowych sygnałów sentymentu w tekstowej analizie emocji została znacznie usprawniona dzięki rekurencyjnym sieciom neuronowym (RNN) z wbudowanymi mechanizmami uwagi, a w ostatnim czasie przez modele oparte na transformerach. Pomimo tych osiągnięć, techniki unimodalne są z natury niezdolne do dokładnego odwzorowania złożoności doświadczeń ludzkich, ponieważ brakuje im informacji uzupełniających dostępnych w innych modalnościach.

W 2021 roku zaproponowano niektóre modele oparte na mechanizmach uwagi, takie jak model DialogXL25, w celu gromadzenia długoterminowych danych środowiskowych w obszarze identyfikacji sentymentu w konwersacjach. Kim i wsp.26 wprowadzili w 2021 roku model EmoBERTa, aby zwiększyć dokładność ERC. Model ten wykorzystuje dane o mówcach w celu ulepszenia cech uczestników rozmów oraz ich wzajemnych interakcji. W 2022 roku Li i wsp.27 zaprezentowali metodę CoG-BART. Organizacja ta wykorzystuje nadzorowane uczenie kontrastowe, aby poprawić zdolność modelu do interpretacji istotnych danych. Należy zauważyć, że uczenie nadzorowane wymaga znacznej ilości etykietowanych danych.

Typowym przykładem takich prac jest framework Multimodal Interaction-Aware Representation (MIAR)28, który wykorzystuje tokeny interakcji cech oraz wyrównanie kontrastowe w celu poprawy generalizacji między modalnościami. MIAR poprawia wyrównanie modalności i osiąga wysoką skuteczność w wielu zbiorach danych; jednak koncentruje się on przede wszystkim na dokładności predykcji, nie zajmując się odwzorowaniem wizualnym. Podobnie model Cross-Attentional Audio-Visual Fusion29 skutecznie rejestruje szczegółowe interakcje audiowizualne dla predykcji walencji i pobudzenia, ale jest ograniczony do dwóch modalności i nie posiada możliwości wizualizacji. Podejścia do modelowania czasowego oparte na sieciach LSTM i fuzji autoenkoderów pomyślnie oddają dynamikę czasową emocji, lecz zapewniają ograniczony wgląd w interakcje modalności i wyuczone reprezentacje emocjonalne. W ostatnim czasie metody oparte na transformerach, takie jak Transformer-based Multimodal Fusion Network (TMFN)30, wykazały wysoką skuteczność w zbiorach CMU-MOSI i CMU-MOSEI dzięki ulepszonej fuzji multimodalnej i uczeniu kontrastowemu. Niemniej jednak, podejścia te pozostają głównie zorientowane na wydajność i oferują ograniczone wsparcie dla wyjaśnialności, interpretacji na poziomie cech oraz wizualizacji zorientowanej na interakcje.

W celu usprawnienia integracji danych tekstowych, akustycznych i wizualnych zaproponowano szereg multimodalnych technik rozpoznawania emocji. Choć wczesne techniki fuzji, takie jak EF-LSTM i LF-DNN, nie były w stanie uchwycić złożonych interakcji międzymodalnych, wykazały one zalety wykorzystania informacji multimodalnych w analizie sentymentu i emocji. Mimo że model TFN poprawił wyniki na zbiorach referencyjnych, takich jak CMU-MOSI i CMU-MOSEI, oraz wprowadził jawne modelowanie interakcji międzymodalnych, jego użyteczność była ograniczona przez niską interpretowalność i wysoką złożoność obliczeniową. Aby poprawić dopasowanie modalności oraz dynamiczną fuzję cech, nowsze techniki, takie jak MIAR, modele fuzji z wzajemną uwagą (cross-attentional fusion), TMFN oraz adaptacyjne transformery multimodalne, wykorzystały topologie transformerów i mechanizmy uwagi. Metody te koncentrowały się przede wszystkim na wydajności predykcyjnej, oferując niewielki wgląd w reprezentacje emocjonalne na poziomie cech i zależności międzymodalne, mimo osiągnięcia konkurencyjnych wyników w powszechnych metrykach ewaluacyjnych, takich jak dokładność (accuracy), F1-score oraz średni błąd bezwzględny (mean absolute error). Ponadto niewiele badań opracowało techniki wizualizacji zdolne do ujawnienia ukrytych osadzeń emocji (latent emotion embeddings), rozkładów uwagi i czasowej dynamiki emocji, lub zintegrowało modelowanie interakcji międzymodalnych oparte na grafach. Zaproponowane podejście łączy wielowidokowe mapowanie wizualne, fuzję uwagi międzymodalnej opartą na grafach oraz uczenie reprezentacji rozplecionych (disentangled representation learning), aby wyeliminować te wady i zwiększyć wydajność multimodalnego rozpoznawania emocji.

Podobnie, Adaptive Multimodal Transformer32 proponuje fuzję opartą na wymianie, aby adaptacyjnie niwelować zakłócenia lub brakujące informacje modalne, zwiększając tym samym skuteczność klasyfikacji sentymentu. Chociaż podejście to może efektywnie rozwiązywać rozbieżności w rozkładzie informacji modalnych, jego konstrukcja jest specyficzna dla zadania analizy sentymentu i dostarcza ograniczonych informacji na temat wyuczonych reprezentacji emocjonalnych. Innym istotnym wkładem jest Multimodal Fusion Model33, który integruje sieci CNN, multiplikatywne sieci LSTM oraz mechanizm uwagi oparty na transformerach w celu rozpoznawania emocji multimodalnych w czasie rzeczywistym. Model ten przeprowadza pełną fuzję modalności wideo, audio i tekstu, wykazując wysoką skuteczność rozpoznawania. Niemniej jednak, podobnie jak inne istniejące modele, koncentruje się on głównie na dokładności predykcyjnej i brakuje mu jawnych cech umożliwiających wizualizację oraz interpretowalność zorientowaną na interakcję.

Podsumowując, choć obecne, najnowocześniejsze podejścia do multimodalnego rozpoznawania emocji odniosły znaczny sukces w przechwytywaniu interakcji międzymodalnych i zwiększaniu dokładności predykcji, większość z nich koncentruje się na zadaniach zorientowanych na samo rozpoznawanie. Mało uwagi poświęcono obszarom takim jak interpretowalność na poziomie cech, wizualizacja reprezentacji emocjonalnych w przestrzeni obrazu oraz włączanie proponowanego frameworka do projektowania inteligentnych interakcji. To właśnie z myślą o tych wyzwaniach wprowadzono proponowany framework.

Większość obecnych metod koncentruje się przede wszystkim na poprawie wydajności predykcyjnej, oferując niewielką interpretowalność wyuczonych reprezentacji emocjonalnych oraz interakcji między-modalnych, pomimo znaczących postępów w multimodalnym rozpoznawaniu emocji28,29. Złożone interakcje między modalnościami tekstową, akustyczną i wizualną są często trudne do wymodelowania dla obecnych strategii fuzji, szczególnie w przypadku wystąpienia rozbieżności między modalnościami oraz braków w informacjach 28,31. Chociaż architektury oparte na transformerach i mechanizmy uwagi usprawniły uczenie reprezentacji, ich przejrzystość i interpretowalność są często ograniczane przez brak wyraźnego oddzielenia informacji specyficznych dla emocji od informacji specyficznych dla modalności31,32,33. Ponadto tylko niewielka liczba badań analizowała modelowanie interakcji intermodalnych w oparciu o grafy lub tworzyła frameworki wizualizacyjne zdolne do ujawnienia temporalnej dynamiki emocji, rozkładów uwagi oraz embeddingów emocjonalnych. Wady te wskazują na konieczność opracowania interpretowalnego frameworka multimodalnego dla inteligentnej interakcji człowiek-maszyna, który łączyłby zorientowane na interakcję mapowanie wizualne z silnym uczeniem między-modalnym.

Niniejsza praca przedstawia interpretowalny model wizualnego mapowania multimodalnych aspektów emocji w projektowaniu inteligentnych interfejsów. Bez konieczności ręcznego tworzenia cech, system wykorzystuje głębokie uczenie end-to-end do ekstrakcji wysokopoziomowych reprezentacji emocjonalnych z modalności tekstowej, audio i wizualnej. Międzymodalne interakcje emocjonalne są modelowane za pomocą grafowego mechanizmu fuzji uwagi, który oddziela informacje specyficzne dla emocji od informacji specyficznych dla modalności, co umożliwia naukę rozplątanych reprezentacji oraz poprawia interpretowalność i odporność modelu. Dodatkowo stworzono moduł wizualizacji wielowidokowej, aby przedstawić czasową dynamikę emocji, międzymodalne wzorce uwagi oraz osadzenia emocji. Skuteczność i przydatność proponowanego modelu w inteligentnych systemach interakcji człowiek-maszyna zostały ocenione poprzez walidację na referencyjnych zbiorach danych do multimodalnego rozpoznawania emocji.

Niniejsza praca oferuje unikalne ramy dla wizualnego mapowania multimodalnych aspektów emocji, które wykraczają poza tradycyjne podejścia zorientowane na predykcję, aby przezwyciężyć słabe modelowanie interakcji międzymodalnych oraz ograniczoną interpretowalność w obecnych systemach identyfikacji emocji multimodalnych. W ramach jednej architektury zaproponowane podejście łączy multimodalne uczenie reprezentacji oparte na transformatorach, rozplecione (disentangled) modelowanie cech świadomych emocji, fuzję uwagi międzymodalnej opartą na grafach oraz wizualizację zorientowaną na interakcje. W przeciwieństwie do obecnych podejść, które koncentrują się głównie na wydajności klasyfikacji, opracowane ramy wyraźnie oddzielają reprezentacje specyficzne dla emocji od reprezentacji specyficznych dla modalności, co poprawia interpretowalność, odporność i spójność międzymodalną. Dodatkowo przedstawiono mechanizm uwagi oparty na grafach, aby umożliwić adaptacyjne modelowanie interakcji międzymodalnych poprzez przechwytywanie drobnoziarnistych współzależności emocjonalnych pomiędzy modalnościami tekstową, dźwiękową i wizualną. Stworzono moduł wizualnego mapowania wielowidokowego w celu zwiększenia przejrzystości poprzez ujawnienie czasowych trajektorii emocji, wzorców uwagi międzymodalnej i ukrytych osadzeń (embeddings) emocji, co zapewnia intuicyjny wgląd w proces podejmowania decyzji przez model. Oprócz zapewnienia lepszej wizualizacji i interpretowalności multimodalnej dynamiki emocjonalnej, ocena eksperymentalna na zbiorach danych referencyjnych CH-SIMS i CMU-MOSEI wykazała konkurencyjną wydajność pod względem dokładności, miary F1-score, średniego błędu bezwzględnego oraz korelacji.

Protokół

Zaproponowana praca ma na celu poprawę projektowania inteligentnej interakcji poprzez zaproponowanie interpretowalnego ramowego podejścia do wizualnego mapowania wielomodalnych cech emocjonalnych. W pracy wykorzystano bazy danych CH-SIMS oraz CMU-MOSEI, które są publicznie dostępne. Oba zestawy danych pozyskano z oficjalnych źródeł i wykorzystano zgodnie z wytycznymi użytkowania, standardami badawczymi oraz warunkami licencyjnymi określonymi przez ich odpowiednich twórców. Wielomodalna zawartość zestawów danych, w tym dane tekstowe, audio oraz wideo, została najpierw zebrana i opisana przez dostawców danych zgodnie z uprawnieniami uczestników oraz protokołami gromadzenia danych. W badaniu nie miało miejsca bezpośredni kontakt z ludźmi, nie prowadzono rekrutacji nowych uczestników ani gromadzenia informacji umożliwiających identyfikację osób. Wszystkie analizy przeprowadzono przy użyciu publicznie dostępnych zestawów danych badawczych. W związku z tym nasza analiza danych wtórnych nie wymagała dodatkowej zgody etycznej ani przeglądu przez Komisję ds. Etyki Badań (IRB). Badanie przeprowadzono zgodnie z odpowiednimi wewnętrznymi zasadami instytucji regulującymi wykorzystywanie publicznie dostępnych zestawów danych, etyczne procedury badawcze oraz obowiązujące polityki wykorzystania danych.

Zastosowano opartą na grafach międzymodalną mechanikę uwagi, aby nauczyć się charakterystyki emocji w różnych modalnościach, wykorzystując cechy specyficzne dla emocji lub modalności w celu poprawy zrozumienia. Składnik wielowidokowego mapowania wizualnego jest używany do wzmocnienia interaktywnego projektowania z uwzględnieniem emocji w czasie rzeczywistym, a jego skuteczność szacowana jest w zakresie rozpoznawania emocji. Wyniki pokazują, że proponowana metoda poprawia zarówno interpretowalność, jak i efektywność inteligentnych interfejsów użytkownika zorientowanych na emocje w warunkach rzeczywistych. Rysunek 1 przedstawia schemat architektury proponowanego rozwiązania. Rysunek 1 pokazuje pełen schemat pracy proponowanego ramowego podejścia do wizualnego mapowania w kontekście uczenia się cech emocji w systemach interakcji wielomodalnej. Schemat rozpoczyna się od trzech zsynchronizowanych modalności wejściowych, a mianowicie tekstu, dźwięku i wideo, które pozyskują uzupełniające informacje emocjonalne odpowiednio z modalności językowej, prosodycznej i ekspresji twarzy. Każdy rodzaj modalności jest przetwarzany przez enkoder transformatora specyficzny dla danej modalności, w celu uzyskania reprezentacji wysokopoziomowych surowych danych wejściowych. Następnie reprezentacje są przekazywane do modułu uczenia się rozłączonych reprezentacji, w którym osadzenia specyficzne dla emocji są oddzielane od cech specyficznych dla modalności, aby zapewnić spójność nauczonych emocji w różnych źródłach danych. Osadzenia specyficzne dla emocji z każdej modalności są następnie agregowane przez opartą na grafach sieć uwagi międzymodalnej, która modeluje zależności emocjonalne między modalnościami i przypisuje dynamiczne wagi istotności każdej modalności na podstawie kontekstu interakcji. Ostatecznie ramy zapewniają zarówno wyniki klasyfikacji emocji, jak i wglądy w interakcję, co ułatwia przejrzyste podejmowanie decyzji zorientowanych na emocje oraz adaptacyjne projektowanie inteligentnej interakcji.

Uzyskiwanie danych multimodalnych

Zestawy danych CH-SIMS i CMU-MOSEI to dwa istniejące publiczne zestawy danych wielomodalnych, które zawierają informacje wielomodalne, takie jak zsynchronizowane wideo, dźwięk i tekst. Zestaw danych CH-SIMS obejmuje wielomodalne badania osób chińskich, w tym 2 281 segmentów wideo, pochodzących z wielu fragmentów filmów, seriali telewizyjnych oraz programów rozrywkowych. Dodanie odpowiadającego dźwięku i tekstu do tych segmentów wideo czyni badania nad analizą emocji z wykorzystaniem danych wielomodalnych bardziej interesującymi i wykonalnymi. Jednak największym zbiorem danych wielomodalnych służącym do analizy opinii, uczuć i emocji jest zestaw danych CMU-MOSEI, zebrany z ponad 23 000 klipów wideo zawierających wypowiedzi więcej niż 1000 mówców na różnorodne tematy. Zestaw danych został podzielony losowo na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%) z zachowaniem rozkładu klas.

Transkrypcje tekstowe, sygnały dźwiękowe i klatki wideo są uzyskiwane i synchronizowane za pomocą znaczników czasu, by odpowiadały sobie na drobnoziarnistym poziomie czasowym. Integracja na poziomie klatek zapewnia, że proponowane mechanizmy uczenia reprezentacji i fuzji opartej na grafach mogą łącznie modelować i wykorzystywać emocjonalną treść pochodzącą z ekspresji wizualnych, tonu głosu oraz treści językowych. Efektywne wydobywanie międzymodalnych dynamik emocjonalnych umożliwia ten typ techniki pozyskiwania danych wielomodalnych, który jest niezbędny dla projektowania inteligentnej interakcji i zrozumiałego mapowania wizualnego.

Tabela 1 przedstawia kluczowe struktury multimodalnych zbiorów danych emocjonalnych wykorzystanych w proponowanej metodzie. Aby uzyskać szerszy zakres powiązanych uczuć, takich jak wypowiadane słowa, intonacje głosu i wyrażenia twarzy, CH-SIMS oraz CMU-MOSEI integrują modalności wideo, audio i tekstowe pochodzące z tych zbiorów danych. Ponadto, w zbiorze CH-SIMS dostępna jest ograniczona liczba próbek danych, co umożliwia dogłębne zbadanie interakcji modalności oraz zmienności emocji w kontekście chińskim. Z drugiej strony, zbiór danych CMU-MOSEI ma większe znaczenie przy ocenie odporności algorytmów uczenia reprezentacji oraz powiązanych metod wizualizacji omawianych w tej pracy, ponieważ zawiera dużą ilość danych obejmujących różne języki, osoby oraz poziomy oznaczone emocji. Dodatkowo, w porównaniu do wcześniejszych badań, zmniejsza on trudności związane z wyborem informacji podczas testowania modeli.

Przetwarzanie wielomodalne i synchronizacja

Oznaczenia czasowe z zestawów danych CH-SIMS i CMU-MOSEI wykorzystano do synchronizacji modalności tekstowych, dźwiękowych i wizualnych, zapewniając spójne uczenie się reprezentacji wielomodalnych. Każda wypowiedź stanowiła podstawową jednostkę analizy i była powiązana z odpowiadającymi segmentami audio i wideo w tym samym przedziale czasowym. Wyrównanie przeprowadzono na poziomie wypowiedzi. Transkrypcję podzielono na segmenty na podstawie znaczników czasu początku i końca każdej wypowiedzi. Odpowiedniość między transkrypcją, dźwiękiem i obrazem ustanowiono poprzez wyodrębnienie odpowiadających klatek wideo i sygnałów dźwiękowych mieszczących się w tym samym przedziale czasowym. Podczas gdy segmenty dźwiękowe przetwarzano za pomocą Wav2Vec 2.0 w celu uzyskania reprezentacji akustycznych, ramki wizualne z segmentu wideo próbkowano z ustaloną częstotliwością i kodowano przy użyciu transformatora wizyjnego (ViT). Enkoder RoBERTa wykorzystano do tworzenia osadzeń tekstowych na podstawie transkrypcji wypowiedzi. Synchronizację czasową osiągnięto poprzez wyrównanie wszystkich cech modalności do jednej granicy wypowiedzi, ponieważ trzy modalności generowały sekwencje cech o różnej długości. Do normalizacji sekwencji o różnej długości zastosowano format o ustalonej długości. Dłuższe sekwencje skrócono do maksymalnej dozwolonej długości sekwencji, a krótsze uzupełniono zerami. Podczas uczenia maski uwagi stosowano w celu oddzielenia uzupełnionych elementów od prawidłowych pozycji cech. Osadzenia specyficzne dla modalności rzutowano do wspólnej przestrzeni ukrytej przed fuzją, aby pokonać różnice w długości sekwencji pomiędzy modalnościami. Zapewniło to spójność wymiarową i umożliwiło mechanizmowi uwagi opartemu na grafach skuteczne uczenie się interakcji międzymodalnych. Aby zachować jakość danych i integralność synchronizacji, próbki z uszkodzonymi plikami, brakującymi adnotacjami lub niepełnymi informacjami modalnymi wykluczono z badań.

Ekstrakcja cech oparta na transformatorach

Metoda uczenia głębokiego jest wykorzystywana do pozyskiwania reprezentacji cech wysokiego poziomu, uwzględniających emocje, z informacji pochodzących z wielu modalności, takich jak wizja, dźwięk i tekst, w sposób kompleksowy, po wyrównaniu danych wielomodalnych oraz po wykonaniu wszelkich wymaganych wstępnych przetwarzania. Dzięki zastosowaniu enkodera typu transformer w celu pozyskiwania wewnętrznie dyskryminacyjnych reprezentacji cech z surowych danych wielomodalnych, proponowana metoda eliminuje potrzebę inżynierii cech. Aby zapewnić spójność pomiędzy zestawami danych wykorzystywanymi w proponowanym podejściu, dla każdej modalności uczy się osadzenia o ustalonej wielkości. Na przykład, osadzenia cech o wymiarze 768 są uczone dla każdej z poszczególnych modalności, w tym obrazu, dźwięku i tekstu, tworząc wspólną przestrzeń cech stosowaną w całym podejściu, w szczególności podejście do ekstrakcji cech wykorzystywane w zestawie danych CH-SIMS oraz w zestawie danych CMU-MOSEI w celu pozyskiwania cech wysokiego poziomu z danych o różnych rozmiarach.

Modalność wizualna: transformator wizji do osadzania ramek z uwzględnieniem emocji

Model typu Vision Transformer (ViT-Base) został wykorzystany do wyodrębnienia informacji wizualnych z klatek wideo w celu uzyskania przestrzennych reprezentacji związanych z emocjami. Przed ekstrakcją cech ramki każdego segmentu wideo zostały przeskalowane do rozmiaru (224 × 224) pikseli i próbkowane w regularnych odstępach czasowych. Używając rozmiaru fragmentu 16 × 16 pikseli, architektura ViT-Base generuje serię tokenów wizualnych, które są przetwarzane przez 12 warstw enkodera typu transformer. Uzyskane reprezentacje na poziomie klatek zostały odwzorowane do przestrzeni osadzania o wymiarze 768 przy użyciu wstępnego modelu ViT jako szkieletu wizualnego. Osadzenia na poziomie klatek zostały zagregowane za pomocą uśredniania (mean pooling), tworząc końcową reprezentację wizualną dla każdego segmentu. Podczas treningu stosowano normalizację obrazów oraz typowe metody augmentacji, takie jak losowe przycinanie i odbijanie w poziomie, w celu poprawy zdolności uogólniania. Następnie zastosowano proponowany framework fuzji multimodalnej, aby połączyć te osadzenia wizualne z reprezentacjami tekstowymi i dźwiękowymi.

Aby zachować dynamikę czasową emocji, próbki wideo z zestawów danych CH-SIMS i CMU-MOSEI zostaną jednostajnie próbkowane dla modalności wizualnej. Klatki każdego wideo, Reprezentacja wektorowa wzoru matematycznego, \(x_v \in \mathbb{R}^{H \times W \times C}\), równania., mogą zostać podzielone na N sekcji o stałym rozmiarze, które następnie są spłaszczone i odwrotnie przekształcone do przestrzeni osadzania ukrytej o wymiarze Równanie przedstawiające przypisanie zmiennej: \( d_v = 768 \).. Seria jest tworzona poprzez dodanie osadzeń pozycyjnych oraz edytowalnego tokenu grupującego:

Równanie przedstawiające sumę ważonych składników; analiza matematyczna; metodologia badań.   (1)

gdzie równanie E_pos, koncepcja równowagi statycznej, edukacyjny wzór do analizy badań fizycznych oznacza kodowanie pozycyjne, a Wzór matematyczny przedstawiający reprezentację przestrzeni wektorowej: \( E \in \mathbb{R}^{(P^2C) \times 768} \). to macierz osadzania fragmentów obrazu (patch embedding matrix).

Używane są warstwy enkodera transformatora ułożone w stos, składające się z sieci typu feed-forward i wielogłowym samouwagą, które przetwarzają sekwencję osadzonych fragmentów. Przekształcenie w warstwie l opisane jest jako:

Równanie iteracyjnego modelu matematycznego z wykorzystaniem funkcji MSA i LNO, reprezentacja symboliczna.   (2)

Równanie normalizacji warstwowej i sieci bezpośredniego przesyłania sygnału w obliczeniach neuronowych.   (3)

Aby uzyskać wektor cech wizualnych z uwzględnieniem emocji, wyodrębnia się dane wyjściowe odpowiadające tokenowi klasy jako wektor cech Równanie przestrzeni wektorowej \( f_v \in \mathbb{R}^{768} \), pojęcie matematyczne, notacja, algebra.. Aby zapewnić spójne reprezentacje wizualnych emocji pomimo różnic językowych i treści między zestawami danych, osadzenia na poziomie klatek z każdego segmentu wideo są łączone w celu uchwycenia ekspresji twarzy oraz ewolucji emocji.

Modalność dźwiękowa z wykorzystaniem Wav2Vec 2.0 do reprezentacji intonacji i semantycznych cech akustycznych Kontekstowe osadzenia mowy zostały wygenerowane przy użyciu wstępnego kodera Wav2Vec 2.0 jako podstawy akustycznej. Wektor cech akustycznych o ustalonej długości dla każdej frazy uzyskano poprzez agregację wyjściowych reprezentacji ukrytych za pomocą uśredniania. Model Wav2Vec 2.0 wykorzystano do ekstrakcji reprezentacji akustycznych z sygnałów dźwiękowych w celu uchwycenia kontekstowych i emocjonalnie istotnych cech mowy. Przed ekstrakcją cech nagrania dźwiękowe zostały znormalizowane i przeprobkowane do 16 kHz. Aby zapewnić synchronizację między modalnościami tekstową i wizualną, każdy segment dźwiękowy na poziomie wypowiedzi został wyizolowany przy użyciu granic czasowych podanych w adnotacjach zbioru danych. Wstępny kodera akustycznego został dostrojony podczas treningu modelu w celu poprawy adaptacji do konkretnego zadania, co umożliwiło uzyskanie reprezentacji dokładniej oddających emocjonalne aspekty sygnałów mowy. Następnie wykonano fuzję uwagi międzymodalnej opartej na grafach oraz rozłączne uczenie się reprezentacji, wykorzystując końcowe osadzenia dźwiękowe.

W modalności audio do modelowania sygnałów mowy pochodzących z pierwotnych informacji mowy w zestawach danych CH-SIMS i CMU-MOSEI wykorzystywany jest Wav2Vec-2.0, który bezpośrednio wyodrębnia cechy audio związane z emocjami. Dla każdego wejściowego sygnału mowy Wyrażenie matematyczne, symbol: \( x_a \in \mathbb{R}^T \), oznaczający element w przestrzeni wektorowej rzeczywistej. istnieje konwolucyjne kodowanie cech:

Równanie matematyczne, funkcja splotu, diagram przekształcenia liniowego, analiza badawcza.   (4)

gdzie Z oznacza niskopoziomowe cechy prosodyczne, takie jak melodia, ton i energia. Sieć kontekstowa oparta na transformatorze jest przydatna dla powyższych struktur, reprezentując długozasięgowe zależności czasowe:

C równa się transformata Fouriera Z; równanie matematyczne do analizy przetwarzania sygnału   (5)

Dane akustyczne dotyczące cech rytmiczno-melodycznych i semantyki, które są niezbędne do wyrażania emocji, zawarte są w tych kontekstowych reprezentacjach akustycznych. Osadzenie dźwięku o określonej długości tworzy się poprzez wykonanie procedury agregacji czasowej:

Wyrażenie matematyczne dla operacji łączenia w modelu obliczeniowym, równanie fa=Pool(C),fa∈ℝ⁷⁶⁸.   (6)

Projekt unika wykorzystywania cech akustycznych, takich jak MFCC, i osiąga trwałość poprzez proste wyodrębnianie reprezentacji z przebiegów czasowych, wykorzystując dane mowy angielskiej z CMU-MOSEI oraz dane mowy chińskiej z CH-SIMS.

Modalność tekstu przy użyciu RoBERTa do osadzania emocji w kontekście

W przypadku modalności tekstowej, do transkrypcji mowy z dwóch zestawów danych zastosowano głęboki dwukierunkowy transformator RoBERTa w celu wygenerowania kontekstowych znaczeń semantycznych i afektywnych. Do ekstrakcji reprezentacji tekstowych z danych transkrypcyjnych wykorzystano enkodery transformatorowe oparte na RoBERTa, aby uchwycić kontekstowe informacje semantyczne i emocjonalne. Dla zestawu danych CMU-MOSEI w języku angielskim użyto wstępnego modelu RoBERTa, podczas gdy dla chińskiego zestawu danych CH-SIMS zastosowano wariant RoBERTa dla języka chińskiego, aby lepiej uwzględnić językowe cechy specyficzne dla danego języka. Przetwarzanie wstępnego tekstu obejmowało tokenizację przy użyciu odpowiedniego tokenu RoBERTa dla każdego języka oraz normalizację tekstu. Aby zapewnić spójne przetwarzanie partii, sekwencje wejściowe zostały przekształcone w osadzenia tokenów i uzupełnione lub przycięte do ustalonej maksymalnej długości sekwencji. Zgodnie z formatem wejściowym RoBERTa, wprowadzono specjalne tokeny klasyfikacyjne i separatorowe. Uzyskano osadzenie tekstowe o ustalonej długości poprzez agregację kontekstowych reprezentacji tokenów generowanych przez enkoder transformatora przy użyciu końcowej reprezentacji zdania równoważnej [CLS]. Aby dostosować nauczone reprezentacje do zadania rozpoznawania emocji, wstępnie wytrenowane enkodery RoBERTa zostały udoskonalone poprzez wielomodalne uczenie. Następnie zastosowano proponowaną ramę fuzji wielomodalnej, aby połączyć osadzenia tekstowe z cechami audio i wizualnymi.

Osadzenia tokenów i kodowania pozycyjne mogą być połączone dla każdego tokenizowanego wejścia, Analiza systemu dynamicznego, równanie: xt={w1,w2,...,wn}, wzór matematyczny dla zmiennych stanu., aby utworzyć reprezentację wejściową w głębokiej dwukierunkowej technice transformacji znanej jako

Równanie Hamiltona, \(H_0 = E_{tok}(x_t) + E_{pos}\); reprezentacja wzoru z mechaniki kwantowej.   (7)

Ta forma jest reprezentowana przez warstwy transformera L, który wykorzystuje samouwagę do wykrywania zależności kontekstowych między słowami:

Równanie warstw transformatora w sieciach neuronowych L, wzór matematyczny.  (8)

Osadzanie emocji w kontekście uzyskuje się przy użyciu końcowego stanu ukrytego tokenu klasyfikacji:

Równanie przedstawiające transformację wektora, fₜ = Hᴸ[CLS], fₜ ∈ ℝ⁷⁶⁸, związane z analizą danych.   (9)

Polarność nastroju, emocje intensywne oraz powiązane implikacje to przykłady cech językowych związanych z emocjami, które zostaną odwzorowane w tym osadzeniu. RoBERTa ułatwia modelowanie niezależne od języka. Pozwala to systemowi na użycie tego samego rozmiaru osadzenia zarówno dla tekstów angielskich z zestawu danych CMU-MOSEI, jak i dla tekstów chińskich z zestawu danych CH-SIMS.

Trzy wektory cech specyficzne dla danej modalności o wymiarach 768, każdy z modalności wizualnej fv, dźwiękowej fa oraz tekstowej ft, są wyodrębniane w kroku uczenia reprezentacji cech głębokich. W inteligentnym projektowaniu interakcji, te wyuczone reprezentacje tworzą ujednoliconą przestrzeń cech wielomodalnych, która stanowi podstawę dla mapowania na poziomie cech, fuzji międzymodalnej opartej na grafach oraz uczenia się rozłącznych reprezentacji.

Uczenie reprezentacji rozłącznych

Po nauczeniu się głębokiej reprezentacji cech dodatkowe przetwarzanie wektorów cech wielomodalnych pochodzących z modalności wizualnej, dźwiękowej i tekstowej może dać rozłączny opis emocji. Jeśli osadzenia cech specyficznych dla modalności dźwiękowej, wizualnej i tekstowej użyte w poprzednim kroku są reprezentowane przez fv, fa i ft, odpowiednio, takie że Symbol matematyczny, wzór przestrzeni wektorowej, \(f_m \in \mathbb{R}^{768}\), dla wymiarowości danych. oraz Równania dla elementów teorii zbiorów; m ∈ {v, a, t}; notacja matematyczna, zastosowanie edukacyjne., celem tego kroku jest rozkład wszystkich cech modalności na dwa odrębne ukryte przedstawienia, w tym opisy emocji po uwzględnieniu poprzednich znaczeń każdej z różnych modalności.

Osiąga się to, podając cechę każdego rodzaju sygnału, fm, do dwóch równoległych sieci projekcyjnych: enkodera emocji Równanie statycznej równowagi, E_e(.), reprezentujące dynamikę bilansu energii na schemacie układu. oraz enkodera modalności Symbol funkcji Em; notacja matematyczna; używana w równaniach w celach edukacyjnych., w których generowane są dwa kodowania.

Równania matematyczne opisujące mechanikę statystyczną; zmienne pokazują proces równowagi.  (10)

Gdzie Równanie, \( z^e_m \in \mathbb{R}^{d_e} \), reprezentacja symbolu matematycznego. ukryta cecha związana z emocją jest reprezentowana przez Pojęcie matematyczne; zm ∈ ℝdm symbol; przestrzeń wektorowa; analiza wymiarowości; równanie., które reprezentuje ukrytą cechę charakterystyczną dla konkretnej modalności. Umożliwia to osadzaniu specyficznemu dla emocji komunikowanie się w przestrzeni poprzez wiele wejść, w tym dźwięk, obraz i tekst, zachowując jednocześnie unikalne dane strukturalne związane z każdą modalnością.

Efektywna separacja jest wymuszana poprzez rekonstrukcję z ograniczeniami niezależności. Rekonstrukcja cech oryginalnej modalności jest dana jako:

Równanie dla procesu dynamicznego; wzór: f̂ₘ = D(zₘᵉ, zₘᵐ); diagram koncepcyjny; kontekst badawczy.  (11)

gdzie Proces statystyczny; wzór \( D(.) \); równanie matematyczne do analizy danych. jest siecią dekodującą. Strata rekonstrukcji zachowuje następujące dane:

Wzór na stratę rekonstrukcji, równanie matematyczne do analizy przetwarzania sygnału, Σm||fm-f̂m||².   (12)

Dodatkowo ortogonalność, czyli dekorelacja, między emocjami a charakterystycznymi dla danej modalności przedstawieniami często ogranicza nakładanie się informacji:

Równanie równowagi statycznej Σm||(ze^T)zm||2, wzór matematyczny, zastosowanie edukacyjne.   (13)

Osiągając te cele, model może nauczyć się reprezentacji emocji, które są wiarygodne, zrozumiałe i odporne na zmienność modalności. Późniejsza oparta na grafach fuzja wielomodalna oraz cechy mapowania wizualnego, szczególnie przy projektowaniu inteligentnej interakcji, w dużej mierze zależą od interpretowalnych, ustrukturyzowanych reprezentacji emocji.

Spójność emocji między modalnościami

Dodanie spójności emocjonalnej wyraźnie zwiększa skuteczność fuzji między modalnościami. Dzieje się tak, ponieważ strategie fuzji nie muszą uwzględniać dużych różnic między dwiema reprezentacjami, ponieważ osadzenia emocji specyficzne dla danej modalności współdzielą przestrzeń ukrytą. Łączna ilustracja dwóch emocji jest opisana następująco Równania równowagi chemicznej Z<sub>v</sub><sup>e</sup>, Z<sub>a</sub><sup>e</sup>, Z<sub>t</sub><sup>e</sup>.. Fuzja ważona będzie bardziej stabilna, gdy reprezentacje specyficzne dla emocji będą spójne, ponieważ wariacje sygnałów z różnych modalności nie będą już wpływać na wynik.

Równanie dla straty kontrastowej, wzór matematyczny, przedstawiający sumowanie i indeksy zmiennych.   (14)

Wymuszając semantyczne dopasowanie informacji emocjonalnych, ten cel minimalizuje rozbieżności między różnymi modalnościami i zapewnia spójność percepcji emocji niezależnie od modalności użytej do ich wyrażenia. W konsekwencji spójna i emocjonalna przestrzeń reprezentacji jest tworzona poprzez rzutowanie sygnałów emocjonalnych uzyskanych z sygnałów mowy, ekspresji twarzy oraz treści językowej.

Wpływ na fuzję międzymodalną

Fuzja międzymodalna staje się bardziej efektywna, gdy wprowadza się spójność emocji pomiędzy modalnościami. Mechanizmy fuzji nie muszą już nadrobić znaczących różnic w reprezentacjach międzymodalnych, ponieważ osadzenia specyficzne dla emocji są wyrównane w wspólnej przestrzeni ukrytej. Połączona reprezentacja emocji jest zdefiniowana następująco:

Równanie równowagi statycznej Σm∈{v,a,t}amzem diagram dla analizy fuzji w badaniach edukacyjnych.  (15)

Gdzie αm reprezentuje wagę poświęconą modalności m. Wspólna agregacja staje się bardziej stabilna i zrozumiała, gdy reprezentacje specyficzne dla emocji są spójne, ponieważ wynik agregacji pokazuje uzupełniające się dowody emocjonalne, a nie sprzeczne sygnały modalności.

Matematycznie, obniżenie Równanie równowagi statycznej, ΣFx=0, mechanika wektorowa, wzór edukacyjny. wariancja między różnymi typami reprezentacji specyficznych dla emocji w odniesieniu do Równanie równowagi statycznej, ΣFx=0, mechanika wektorowa, wzór edukacyjny. jest równoważne:

Wzór na obliczenie wariancji, Var(z^e), wyrażenie matematyczne, równanie analizy statystycznej.   (16)

gdzie symbol Z^-e, równanie chemiczne, związane z badaniami ładunku jonu, reprezentacja wzoru. oznacza średnią ekspresję emocji. Zmniejszona wariancja powoduje, że modalności wejściowe są ważone zgodnie z ich dokładnym znaczeniem emocjonalnym, a nie zakłóceniami modalności, co zapewnia lepszą zbieżność sieci oraz bardziej dokładną ocenę uwagi.

Ostatecznym celem naukowym wizualizacji rozłączonych emocji jest połączenie fragmentacji, rekonstrukcji oraz jednolitości emocjonalnej:

Wzór matematyczny, L_total = L_rec + λ1L_dis + λ2L_con, diagram równania, optymalizacja.   (17)

które dwa hiperparametry, λ1 i λ2, kontrolują związek między niezawodnością emocji w różnych modalnościach a ich rozłączeniem. Proponowany model pozyskuje niezależne od modalności, interpretowalne i możliwe do połączenia reprezentacje emocjonalne, aby osiągnąć ten cel, z naciskiem na zapewnienie solidnej podstawy do późniejszej fuzji opartej na grafach oraz reprezentacji na poziomie cech w projektowaniu inteligentnych interfejsów.

Fuzja uwagi międzymodalnej oparta na grafach

Wykorzystano sieć uwagi międzymodalnej opartą na grafach, aby zasymulować szczegółowe relacje emocjonalne pomiędzy modalnościami. Aby ułatwić przepływ informacji między modalnościami, zbudowano w pełni połączony graf wielomodalny, w którym każde modalityczne osadzenie (tekst, dźwięk i obraz) reprezentowane było jako węzeł grafu. Związki między modalnościami wykorzystano do ustalenia macierzy sąsiedztwa grafu, która następnie została ulepszona za pomocą uczonej metody uwagi. Przestrzeń ukrytą wspólną utworzono poprzez połączenie i rzutowanie wyników z kilku głowic uwagi. Jednolitą reprezentację emocji wielomodalnych wygenerowano następnie poprzez agregację reprezentacji węzłów przy użyciu agregacji ważonej uwagą. Ten połączony wektor został następnie przekazany do modułów predykcji i wizualizacji w celu analizy zorientowanej na interakcję oraz rozpoznawania emocji. Moduł fuzji grafowej miał wymiar reprezentacji ukrytej równy 256 oraz zawierał dwie warstwy uwagi grafowej, z których każda posiadała osiem głowic uwagi. Aby określić względną ważność sąsiednich modalności, obliczono i standaryzowano współczynniki uwagi pomiędzy połączonymi węzłami przy użyciu funkcji softmax. Po każdej warstwie uwagi grafowej zastosowano normalizację warstwy, połączenia residualne oraz współczynnik dropout równy 0,2, aby zwiększyć stabilność treningu i zmniejszyć przeuczenie. Po połączeniu i rzutowaniu wyników kilku głowic uwagi na wspólną przestrzeń ukrytą, reprezentacje węzłów zostały połączone w pojedynczy wektor emocji wielomodalnych przy użyciu agregacji ważonej uwagą. Następnie połączona reprezentacja została wykorzystana do mapowania wizualnego wielowidokowego i przewidywania emocji.

Za pomocą wielogłowowej uwagi grafowej przechwycono różnorodne interakcje międzymodalne. Funkcja softmax została wykorzystana do normalizacji współczynników uwagi pomiędzy połączonymi węzłami dla każdego węzła. Aby zwiększyć stabilność treningu i uniknąć przeuczenia, warstwy ułożonej jednostki fuzji grafowej zostały uzupełnione o połączenia resztkowe, normalizację warstwy oraz regularyzację typu dropout.

Wyrazy Równania równowagi chemicznej Z<sub>v</sub><sup>e</sup>, Z<sub>a</sub><sup>e</sup>, Z<sub>t</sub><sup>e</sup> symbole. reprezentują oddzielnie reprezentacje odpowiadające emocjom uzyskanym za pomocą modalności wizualnej, dźwiękowej i tekstowej; każdy komponent znajduje się w przestrzeni ukrytej Symbol matematyczny R^d_e dla przestrzeni wektorowych; diagram równania do analizy przestrzennej.. Modele węzłów modalności wykorzystują oznaczenie grafu Równanie teorii grafów G=(V,E) reprezentujące wierzchołki i krawędzie; reprezentacja symboliczna., przy czym węzły zbioru Obliczanie prędkości za pomocą wzoru v={v,a,t}; równanie kinematyki; treść edukacyjna. odpowiadają trzem węzłom modalności, aby wyraźnie wzmocnić wspólne zależności emocjonalne między różnymi reprezentacjami modalności.

Po przypisaniu wektora cech specyficznego dla emocji do każdego węzła w grafie, otrzymujemy:

Równanie równowagi statycznej \(H=[Z_v^e, Z_a^e, Z_t^e]^T \in \mathbb{R}^{3 \times a_e}\).   (18)

W przeciwieństwie do tradycyjnych metod fuzji, wykorzystujących wstępnie ustalone lub stałe wagi fuzji, proponowana metoda uczy się adaptacyjnych wag krawędzi na podstawie ich znaczenia oraz wzajemnych zależności, zarówno pomiędzy kanałami, jak i różnymi sytuacjami emocjonalnymi.

Sieć uwagi grafowej (GAT) jest wykorzystywana do fuzji międzymodalnej. Współczynnik uwagi jest obliczany dla każdego węzła i oraz jego sąsiednich węzłów, tj. węzła j:

Równanie aktywacji sieci neuronowej: LeakyReLU; wzór; wyrażenie uczenia maszynowego.   (19)

Efekt emocjonalny przełączania z trybu j na modalność i mierzony jest za pomocą znormalizowanych wag αij.

Następnie obliczany jest połączony wygląd każdego węzła modalności jako ważona grupa jego sąsiadów:

Formuła sieci neuronowej grafowych, \( h'_i = \sigma(\sum_{{j \in N(i)}} \alpha_{ij} W z_j^e) \).   (20)

gdzie funkcja aktywacji Symbol funkcji sygmoидalnej (σ), oznaczenie matematyczne. jest nieliniowa. Ostatecznie zaktualizowane cechy każdego węzła są łączone w celu uzyskania globalnej połączonej reprezentacji emocji:

Równanie procesu fuzji danych, z_fusion = 1/|v| Σ h'_i, wzór matematyczny.   (21)

Jest to przydatna technika do interpretowalnego modelowania emocji i dalszego wizualnego mapowania, ponieważ rejestruje uzupełniające informacje z różnych modalności, zachowując przy tym skomplikowane relacje międzymodalnościowe.

Algorytm 1 (Supplementary File 1) przedstawia ogólny schemat przeprowadzenia grafowej fuzji wielomodalnej. Na początku tworzony jest graf z cechami specyficznymi dla emocji powiązanymi z każdą z modalności: wizualną, dźwiękową i tekstową. Następnie obliczane są wyniki uwagi dla każdej pary węzłów grafu, które reprezentują kombinację zależności emocjonalnych. Wyniki te są następnie normalizowane, aby wskazać względną wkład każdej modalności w określony kontekst emocjonalny, umożliwiając nauczenie się wag uwagi. Ogólny wektor osadzania emocji jest generowany w ostatnim etapie poprzez agregację cech powiązanych z węzłami grafu. W tym sensie ogólna fuzja cech wielomodalnych związanych z określonymi emocjami wykazuje potencjał pod względem adaptowalności, interpretowalności i inteligencji kontekstowej.

Rycina 2 przedstawia strukturę i zasadę działania proponowanej sieci uwagi krzyżowo-modalnej do fuzji sentymentu multimodalnego. Osadzenia specyficzne dla emocji, uzyskane niezależnie dla modalności tekstowej, dźwiękowej i wizyjnej, są najpierw przekazywane przez mechanizmy uwagi na poziomie modalności, które uczą się względnej ważności informacji językowych, głosowych i twarzowych w danym kontekście emocjonalnym. Ważone uwagą reprezentacje modalności są następnie łączone w celu utworzenia ujednoliconego osadzenia emocji, w którym macierz uwagi oddaje zależności międzymodalne oraz siłę interakcji. Macierz uwagi nauczona przez sieć dynamicznie moduluje wkłady poszczególnych modalności, umożliwiając skupienie się na modalności najbardziej informacyjnej, podczas ignorowania szumnych i mniej wartościowych. Zebrana reprezentacja emocji umożliwia dokładne rozpoznawanie emocji oraz szczegółową analizę stanów emocjonalnych, takich jak neutralność, przytulenie i niepokój.

Moduł mapowania wizualnego

Z wykorzystaniem sekcji mapowania wizualnego, stworzonej specjalnie w tym celu, inteligentny projektant interakcji może przekształcić ujednoliconą reprezentację stanu emocjonalnego w formę wizualną, która po procesie fuzji międzymodalnej, opartej na grafie, staje się zrozumiała i łatwa do odbioru.

Aby ułatwić zrozumienie ukrytych reprezentacji emocjonalnych, zastosowano techniki redukcji wymiarowości w celu wizualizacji nauczonych wielomodalnych osadzeń emocji. Po zredukowaniu wymiarowości cech przy zachowaniu większości wariancji za pomocą analizy głównych składowych (PCA), osadzenia zostały odwzorowane na przestrzeń dwuwymiarową przy użyciu rozproszonego osadzania stochastycznych sąsiadów t (t-SNE). Do t-SNE wykorzystano liczbę perplexity równą 30, współczynnik uczenia 200 oraz 1000 iteracji optymalizacji. Uzyskane rzuty posłużyły do wizualizacji klastrów specyficznych dla emocji oraz zależności między modalnościami. Znormalizowane wagi uwagi międzymodalnej, uzyskane za pomocą grafowej sieci uwagi, wykorzystano do tworzenia map cieplnych uwagi. Na tych mapach przedstawiono względne wkłady modalności tekstowej, dźwiękowej i wizualnej podczas przewidywania emocji. Nauczane współczynniki uwagi wykorzystano jako wagi krawędzi do tworzenia grafów interakcji międzymodalnych, co umożliwiło wizualną analizę relacji międzymodalnych oraz przepływu informacji w ramach struktury fuzji. Wykresy trajektorii emocji utworzono poprzez monitorowanie rozwoju ukrytych osadzeń emocji w kolejnych wypowiedziach, aby zbadać czasowe dynamiki emocjonalne. Te trajektorie rzutują światło na to, jak zmieniają się stany emocjonalne i wkłady poszczególnych modalności w czasie. Wszystkie wizualizacje stworzono przy użyciu pakietów Pythona Matplotlib i Scikit-learn. W celu oceny interpretowalności, formowania klastrów, wkładów modalności oraz czasowych dynamik emocji przeprowadzono analizy jakościowe wizualizacji osadzeń, grafów interakcji oraz map cieplnych uwagi.

Niech zmienna równanie z_fusion w przestrzeni wektorowej ℝ, sformułowanie matematyczne, analiza teoretyczna. reprezentuje połączoną reprezentację stanu emocjonalnego uzyskaną za pomocą funkcji sieci grafowej z mechanizmem uwagi. W przeciwieństwie do wizualizacji na poziomie wyników wykresów stanu emocjonalnego, głównym celem modułu jest przekształcenie reprezentacji stanu emocjonalnego oraz odpowiadających im wag mechanizmu uwagi w zrozumiałą formę wizualną.

Korzystając z nauczonych wartości αji, tworzona jest mapa cieplna uwagi, umożliwiająca wizualną ocenę wkładu każdej modalności. Następnie sumowane są przychodzące wagi uwagi, aby określić złożony wskaźnik ważności dla każdej modalności:

Równowaga statyczna; \( s_i = \frac{1}{|v|} \sum_{j \in v} a_{ji} \); diagram formuły matematycznej.    (22)

gdzie si reprezentuje względną emocjonalną przyczynę modalności I. Aby ułatwić tworzenie mapy cieplnej uwagi, uzyskane wartości są normalizowane i odwzorowywane na paletę kolorów, co ułatwia użytkownikowi identyfikację dominującej modalności w różnych krokach czasowych lub stanach interaktywnych. Dzięki różnorodnym modalnościom wejściowym – wizualnym, dźwiękowym lub tekstowym – taki interfejs pomaga użytkownikowi zrozumieć, jak działa mechanizm uwagi systemu.

Nauczony graf jest specyficznie modelowany jako „ważony graf interakcji”, aby reprezentować zależności między modalnościami emocji ludzkich. Samą modalność reprezentuje każdy węzeł w grafie, a siłę interakcji związanych z emocjami ludzkimi reprezentują wagi w postaci αji na krawędziach je łączących. Powyższy ważony graf obrazuje intensywność interakcji emocjonalnych człowieka. Definicja i oraz j jest następująca:

Równanie przedstawiające wzór na średnią ważoną; pojęcie matematyczne wykorzystywane w analizie danych.   (23)

Grubość linii lub przezroczystość w wizualizacji grafu są odpowiednio wyświetlane dzięki tym wagom. Upraszcza to zrozumienie sposobu oddziaływania modalności. Projektant może lepiej zrozumieć, jak wskaźniki emocjonalne oddziałują na etapie procesu fuzji, dzięki grafom oddziaływania międzymodalnościowego.

Scalone osadzania emocji Równanie pokazujące zmienną związaną z fuzją Z<sub>t</sub><sup>fusion</sup> w kontekście matematycznym. w różnych krokach czasowych są redukowane do przestrzeni o niższej liczbie wymiarów za pomocą algorytmu redukcji wymiarowości, takiego jak PCA lub t-SNE, w celu przedstawienia ewolucji emocji w czasie:

Równanie matematyczne pokazujące yt jako funkcję fuzji Zt w kontekście przestrzeni wektorowych.   (24)

gdzie funkcja rzutowania jest reprezentowana przez symbol funkcji Φ, pojęcie statystyczne, reprezentacja równania. Pojawienie się trajektorii emocji 2D/3D, które pokazują przejścia emocjonalne, intensywność oraz stabilność w interakcjach, można interpretować jako intuicyjny obraz ewolucji stanów emocjonalnych w czasie. Te aspekty mogą być wykorzystywane w inteligentnych interakcjach, podejmowaniu decyzji oraz monitorowaniu w czasie rzeczywistym.

W przeciwieństwie do konwencjonalnych systemów emocjonalnych, które jedynie zapewniają mapowania na określone klasy lub wyniki, ten system koncentruje się na pokazaniu, w jaki sposób emocje ludzkie kształtują się w jego wnętrzu. Ujawnia swój proces podejmowania decyzji, oferując wizualizacje cech pośrednich, w tym czynniki wagowe, interakcje między modelami oraz odpowiadające im ścieżki. Pozwala to użytkownikowi zrozumieć, w jaki sposób każdy czynnik — wizualny, głosowy lub językowy — wpływa na generowane przez niego odpowiedzi na emocje ludzkie.

Mapowanie emocji na zrozumiałe formy za pomocą reprezentacji wizualnych może zatem zniwelować lukę między analizą emocji przy użyciu metod uczenia głębokiego a ich integracją w projektowaniu inteligentnych interfejsów. Dane zebrane z obu podejść mogą następnie zostać wykorzystane do tworzenia bardziej precyzyjnych interfejsów użytkownika. W związku z tym proponowane podejście może dostarczyć projektantom interakcji kluczowych informacji umożliwiających tworzenie dokładniejszych interfejsów użytkownika. Innymi słowy, rozumienie emocji staje się bardzo aktywną częścią projektowania interakcji. Dokładność może wzrosnąć wyłącznie wtedy, gdy rozumienie emocji zostanie aktywnie włączone do projektowania interakcji.

Moduł mapowania wizualnego umożliwia wyjaśnialność na kilka powiązanych, ale różnych sposobów: wyjaśnialność na poziomie cech ujawnia podstawowe reprezentacje emocji tworzone przez sieć DNN, umożliwiając zrozumienie semantyki stosowanej do opisu każdej cechy związanej z emocjami; wyjaśnialność na poziomie modalności wykorzystuje dane z grafów interakcji oraz map cieplne uwagi wizualnej, aby opisać, w jaki sposób każda modalność – wizualna, dźwiękowa lub tekstowa – przyczynia się do decyzji dotyczących wyrażania emocji; wreszcie trajektorie wynikające z osadzania emocji pozwalają zrozumieć, jak każda modalność wizualna i tekstowa zmienia się w czasie z perspektywy dynamicznej interakcji. Zobacz algorytm 2 (Supplementary File 1).

Połączone wielomodalne cechy emocjonalne są odwzorowywane na wizualnie znaczące reprezentacje do projektowania inteligentnej interakcji przy użyciu proponowanego algorytmu wizualnego 2. Wagi uwagi wielomodalnej opartej na grafie są wykorzystywane do ilościowego określenia różnic między wejściowymi elementami wizualnymi, dźwiękowymi i tekstowymi w każdym kroku czasowym. Następnie różnice te są odwzorowywane na reprezentacje wizualne, aby podkreślić główne źródła wpływające na emocje, przy użyciu elementów wizualnych mapy cieplnej. Aby zapewnić pogłębiony wgląd w interakcję między elementami wejściowymi i przekazać ewolucję emocji generowaną przez elementy wejściowe wielomodalne, obliczane są siły wzajemnych interakcji w celu utworzenia wag interakcji wielomodalnych. Tymczasem widok ewolucji emocji jest tworzony poprzez odwzorowanie połączonych elementów emocjonalnych gromadzonych w czasie do przestrzeni o niskiej liczbie wymiarów, w celu wytworzenia ciągłej ewolucji elementu emocjonalnego.

Prognozowanie emocji i informacja zwrotna dotycząca interakcji

Wynik scalonej reprezentacji emocji, przedstawiony jako równanie z_fusion w przestrzeni wektorowej ℝ, sformułowanie matematyczne, analiza teoretyczna, jest następnie wykorzystywany jako funkcja zarówno do sprzężenia zwrotnego interakcji, jak i do przewidywania emocji. Ponadto przewidywanie emocji opisane jest jako model wielozadaniowy obejmujący zadanie regresji służące rozpoznawaniu ciągłej intensywności emocji oraz zadanie klasyfikacji służące rozpoznawaniu emocji dyskretnych. Do rozpoznawania emocji dyskretnych stosowany jest następujący model klasyfikacji oparty na funkcji softmax:

Równanie Softmax dla predykcji wyjścia sieci neuronowej; wzór: ŷ = softmax(W_cz^fusion + b_c).   (25)

gdzie Prognozowanie, równanie regresji, \(\hat{y}\); wykres; analiza danych; ocena modelu predykcyjnego oznacza oczekiwane prawdopodobieństwa klas emocji, a Wc i bc to parametry do nauczenia. Do poprawy celu klasyfikacji wykorzystano funkcję straty entropii krzyżowej:

Wzór na stratę klasyfikacji, Lcls=-ΣKk=1 yk log(ŷk), równanie matematyczne.  (26)

gdzie yk to rzeczywista etykieta, a K to liczba klas emocji. Gałąź regresyjna służy do równoległego szacowania intensywności emocji, generując przewidywania różnych ciągłych cech afektywnych, w tym walencji i pobudzenia. Nadaj jej następującą definicję:

Równanie dla równowagi statycznej, wzór Ŝ = WrZ^fusion + br, treść edukacyjna.   (27)

gdzie oczekiwana wartość intensywności emocji jest wskazywana przez diagram spektroskopii; wzór ΣFx=0; eksperyment analizy DNA; badanie wzbudzenia optycznego.. Do poprawy zadania regresji wykorzystywana jest funkcja straty oparta na średnim błędzie kwadratowym:

Wzór regularyzacji: Lreg = ||s - ŝ||²₂, równanie optymalizacji funkcji straty.   (28)

Ogólnie rzecz biorąc, dwa zadania są łączone w celu predykcyjnym:

Równanie funkcji straty: L<sub>pred</sub> = L<sub>cls</sub> + λL<sub>reg</sub>, ilustrujące klasyfikację i regresję.   (29)

gdzie cele regresji i klasyfikacji są zrównoważone przez λ. Sugeruje to dynamiczną modyfikację modułu wizualizacji na podstawie zidentyfikowanego stanu emocjonalnego, aby umożliwić tego typu interaktywną pętlę zwrotną. Kontekst interakcji w danym czasie t jest reprezentowany przez ct. Odpowiedź modułu wizualizacji jest dana przez:

Równanie dla transformacji fuzji, \(V_t = \Psi(z_t^{fusion}, \hat{y}_t, \hat{s}_t, c_t)\).    (30)

gdzie funkcja adaptacji wizualizacji jest reprezentowana przez Symbol funkcji falowej kwantowej Ψ(x) w równaniu matematycznym, związany z badaniami fizyki cząstek.. Umożliwia to dostosowanie map cieplnych modalności, grafów interakcji oraz trajektorii emocji w czasie rzeczywistym na podstawie przewidywanych zmian i emocji. Oznacza to, że system zapewnia znaczące wsparcie dla sprzężenia zwrotnego, dodatkowo dobrze radząc sobie z przewidywaniem stanów emocjonalnych.

Wyniki

Niniejsza praca waliduje proponowany model mapowania wizualnego dla multimodalnych cech emocjonalnych pod kątem interpretowalności uwzględniającej interakcje oraz wydajności predykcyjnej, wykorzystując dwa zestawy danych referencyjnych: CH-SIMS oraz CMU-MOSEI. Wyniki eksperymentalne wskazują, że sugerowane podejście konsekwentnie osiąga lepsze rezultaty niż obecne techniki multimodalnego rozpoznawania emocji w różnych metrykach, w tym korelacji, dokładności, wyniku F1 oraz średniego błędu absolutnego (MAE). Rozplątana reprezentacja emocji, mechanizm fuzji międzymodalnej oparty na grafach oraz strategia głębokiego uczenia reprezentacji end-to-end przyczyniają się do tej poprawy, umożliwiając bardziej stabilne i semantycznie spójne modelowanie emocji. Sugerowane podejście dostarcza bogatszych wglądów na poziomie cech dzięki mapowaniu wizualnemu, co wykracza poza zyski ilościowe i ułatwia zrozumienie wkładu poszczególnych modalności oraz dynamiki emocjonalnej. Pomimo różnic w języku, ekspresji kulturowej i wielkości zbiorów danych, wspomniany wzrost wydajności jest konsekwentnie obserwowany w obu zestawach danych, co dowodzi silnej zdolności generalizacji proponowanego modelu.

W proponowanej pracy wykorzystano publiczne zbiory danych do multimodalnych emocji CH-SIMS oraz CMU-MOSEI. Zbiór danych CH-SIMS składa się z 2 281 klipów wideo z filmów, seriali telewizyjnych i programów rozrywkowych. W CH-SIMS dostępne są zsynchronizowane dane tekstowe, audio i wizualne. Etykiety sentymentu zarówno jednomodalne, jak i multimodalne są klasyfikowane na kategorie: pozytywną, neutralną i negatywną. Duży angielski multimodalny zbiór danych CMU-MOSEI zawiera około 23 453 adnotowanych klipów wideo z udziałem ponad 1 0 mówców omawiających szeroki zakres tematów. Zbiór ten zawiera zarówno ciągłe adnotacje intensywności emocji, takie jak walencja i pobudzenie, jak i kategoryczne etykiety emocji. Przeprowadzenie eksperymentów na tych dwóch zbiorach danych z wykorzystaniem proponowanej struktury, obejmującej różnorodne warunki językowe, kulturowe i emocjonalne, wzmacnia odporność i niezawodność wyników. Tabela 2 przedstawia szczegóły środowiska symulacyjnego.

Główne ustawienia eksperymentalne i implementacyjne wykorzystane do oceny proponowanego schematu zostały podsumowane w tym środowisku symulacyjnym. Aby zapewnić jednolity wymiar cech w obrębie modalności tekstowych, dźwiękowych i wizualnych, zastosowano jednolicie kodery oparte na transformerach. Wykorzystano mechanizm uwagi oparty na grafach do fuzji międzymodalnej, co umożliwia adaptacyjną naukę zależności międzymodalnych w odniesieniu do stanów emocjonalnych.

Sugerowana struktura wyodrębnia reprezentacje tekstowe, słuchowe i wizualne przy użyciu koderów modalności opartych na transformatorach. Warstwy w pełni połączone z aktywacją ReLU rzutują osadzenia specyficzne dla danej modalności do wspólnej przestrzeni ukrytej. Następnie zastosowano oddzielne kodery specyficzne dla emocji i modalności, z których każdy składa się z dwóch warstw w pełni połączonych oraz nielinearnej aktywacji i normalizacji, w celu nauczenia reprezentacji rozplątanych. Reprezentacje ukryte są rzutowane do 256-wymiarowej przestrzeni cech, w której informacje dla każdej modalności i emocji są uczone osobno. Aby zachować informacje o modalności i wspomóc efektywne rozplątywanie, zastosowano dekodery rekonstrukcyjne. Przed fuzją multimodalną i predykcją, moduł uwagi między-modalnej oparty na grafach modeluje zależności emocjonalne między modalnościami przy użyciu reprezentacji ukrytych. Sieć została wytrenowana przy użyciu optymalizatora Adam z początkową prędkością uczenia 1 × 10⁻4 i rozmiarem serii 32. Zastosowano wczesne zatrzymanie na podstawie straty walidacyjnej, aby zapobiec przeuczeniu. Całkowita funkcja celu obejmowała straty klasyfikacji, rekonstrukcji i spójności reprezentacji, z których każda była ważona za pomocą dostrajalnych hiperparametrów. Trenowanie modelu trwało do 10 epok, a model osiągający najlepsze wyniki na zbiorze walidacyjnym został zachowany do testowania.

Zaproponowany schemat oceniono przy użyciu metryk klasyfikacji, w tym dokładności (Accuracy), precyzji (Precision), czułości (Recall) oraz miary F1 (F1-score), wraz z metrykami regresji, takimi jak średni błąd bezwzględny (MAE). Precyzję, czułość i miarę F1 obliczono z zastosowaniem średniej makro (macro-averaging), aby uwzględnić niezbalansowanie klas w kategoriach emocji. W eksperymentach klasyfikacyjnych jako klasy rzeczywiste (ground-truth) wykorzystano zdefiniowane etykiety emocji/sentymentu dostarczone przez zbiory danych CH-SIMS i CMU-MOSEI. W przypadku predykcji sentymentu opartej na regresji, zmiennymi celowymi były ciągłe wyniki intensywności sentymentu ze zbiorów danych. Wygenerowano macierze pomyłek w celu analizy wydajności predykcji dla poszczególnych klas oraz wzorców błędnej klasyfikacji przy przedziale ufności 95%. Aby zapewnić powtarzalność, każdy eksperyment powtórzono 5 razy, stosując różne losowe inicjalizacje, a raportowane wyniki odpowiadają średniej ± odchyleniu standardowemu wydajności ze wszystkich uruchomień. Istotność statystyczną oceniono za pomocą odpowiednich procedur testowania hipotez, a w stosownych przypadkach obliczono przedziały ufności. Czas uczenia mierzono jako całkowity czas upływający do osiągnięcia zbieżności modelu na określonej platformie sprzętowej.

Zaproponowaną metodę można porównać z szeregiem reprezentatywnych modeli bazowych, w tym z modelami wczesnej i późnej fuzji. Do modeli tych należą TFN, metody oparte na LSTM, niskorandowe modele fuzji multimodalnej, adaptacyjne transformery multimodalne oraz nowe architektury oparte na uwadze międzymodalnej (cross-modal attention). Modele bazowe te odzwierciedlają najnowocześniejsze techniki, które koncentrują się przede wszystkim na poprawie dokładności rozpoznawania emocji poprzez zastosowanie różnych metod fuzji. W przeciwieństwie do tych metod, które skupiają się głównie na predykcji na poziomie wyjściowym, sugerowane rozwiązanie wykorzystujące uczenie reprezentacji rozplątanej (disentangled representation learning) oraz fuzję opartą na grafach poprawia interpretowalność oraz świadomość interakcji. Przykładami modeli bazowych zaimplementowanych przy użyciu oficjalnych repozytoriów lub publicznie dostępnych implementacji referencyjnych są: LSTM Fusion, TFN, niskorandowa fuzja multimodalna (LMF), Adaptive-Graph oraz techniki oparte na transformerach. W przypadku ich dostępności zastosowano oryginalne ustawienia hiperparametrów autorów. Aby zapewnić sprawiedliwe porównanie, wszystkie ponownie wytrenowane modele bazowe oceniano przy użyciu tych samych podziałów zbioru danych, technik preprocessingu, parametrów optymalizacji i kryteriów ewaluacji. Tabele porównawcze wyraźnie wskazują odpowiednie referencje dla danych pochodzących bezpośrednio z wcześniejszych publikacji.

Dokładność

Dokładność klasyfikacji dyskretnych emocji została zmierzona zarówno dla CH-SIMS, jak i CMU-MOSEI; jednak trend dokładności różni się w zależności od charakterystyki obu zbiorów danych. Ponieważ CH-SIMS jest zbiorem o średniej wielkości, z równą liczbą kategorii sentymentu i starannie przetworzonymi klipami wideo, jego dokładność jest wysoka, co sugeruje, że model potrafi wychwycić subtelne multimodalne informacje emocjonalne przy niewielkim poziomie szumów. Natomiast dokładna klasyfikacja emocji w zbiorze CMU-MOSEI jest trudniejsza, ponieważ jest to zbiór wielkoskalowy z mówcami o zróżnicowanym pochodzeniu. W związku z tym, oprócz zdolności modelu do identyfikacji sentymentu, dokładność w zbiorze CMU-MOSEI wskazuje na jego zdolność do generalizacji i odporność na różnorodne scenariusze interakcji. Poprawa dokładności w obu zbiorach danych pokazuje, że zaproponowane podejście wykazuje dobrą generalizację w odniesieniu do zbiorów danych o różnych językach, rozmiarach i poziomach złożoności emocjonalnej.

Dokładność klasyfikacji sugerowanego podejścia oraz innych powszechnych metod bazowych dla zbiorów danych CH-SIMS i CMU-MOSEI przedstawiono w Tabeli 3. Jak pokazano w Tabeli 3, zaproponowany model osiągnął najwyższą dokładność w obu zbiorach danych (CH-SIMS i CMU-MOSEI), przewyższając najsilniejszą metodę bazową (Adaptive-Graph) odpowiednio o około 3,3% i 3,1 punktu procentowego. Niższe wartości odchylenia standardowego wskazują również na większą stabilność w powtórzonych seriach eksperymentalnych. Tradycyjne podejścia oparte na fuzji LSTM wykazują niższą dokładność ze względu na ograniczoną zdolność do przechwytywania złożonych relacji międzymodalnych. TFN i LMF poprawiają dokładność klasyfikacji poprzez modelowanie relacji międzymodalnych.

Wynik F1 (F1-Score)

W problemach klasyfikacji emocji równowaga między czułością (recall) a precyzją (precision) jest mierzona za pomocą miary F1-score. Jest ona zatem bardziej odpowiednia dla multimodalnych zbiorów danych do klasyfikacji emocji, które prawdopodobnie charakteryzują się nierówną liczebnością klas. W zadaniach klasyfikacji emocji równowaga między czułością a precyzją jest mierzona za pomocą F1-score. Ponieważ oczekuje się, że multimodalne zbiory danych do klasyfikacji emocji będą niezbalansowane, miara F1-score jest bardziej właściwa. Im lepiej model potrafi wykrywać klasy emocji, tym wyższy jest wynik F1-score.

Rysunek 3 przedstawia ocenę wyniku F1 sugerowanej techniki w porównaniu z metodami bazowymi na zbiorze danych CH-SIMS. Najniższy wynik F1 wskazuje na ograniczone możliwości modelu bazowego opartego na LSTM w modelowaniu złożonych, multimodalnych relacji emocjonalnych. Porównanie wyników F1 uzyskanych przez oceniane techniki na zbiorze danych CH-SIMS przedstawiono na Rysunku 3. Jak wykazano, bardziej zaawansowane struktury oparte na grafach i transformatorach regularnie przewyższają konwencjonalne metody oparte na fuzji. Najniższy wynik F1 odnotowano dla modelu LSTM (0,71), a następnie dla TFN (0,74) i LMF (0,76). Zastosowanie metody Adaptive-Graph pozwoliło podnieść wynik F1 do 0,79, co potwierdza znaczenie modelowania połączeń międzymodalnych. Proponowany model, z wynikiem F1 równym 0,82, przewyższył metodę Adaptive-Graph o 3,8%, LMF o 7,9%, TFN o 10,8% oraz LSTM o 15,5%. Wyniki te pokazują, że zaproponowany mechanizm uwagi międzymodalnej opartej na grafach oraz nauka rozdzielonych reprezentacji (disentangled representation learning) skuteczniej przechwytują komplementarne informacje emocjonalne z modalności tekstowych, audio i wizualnych, co prowadzi do lepszej wydajności klasyfikacji.

Trendy względne są spójne, mimo że wszystkie metody wykazują niewielki spadek wyniku F1 w porównaniu z CH-SIMS, co przedstawiono na Rysunku 4. Wyniki wskazują na stałą poprawę wydajności, przechodząc od tradycyjnych metod fuzji do strategii multimodalnego uczenia opartego na grafach. Modele z najniższym wynikiem F1 to LSTM (0,69), TFN (0,72) oraz LMF (0,74). Wydajność modelu Adaptive-Graph wzrosła do 0,7, co pokazuje, jak skutecznie można modelować połączenia międzymodalne. Zaproponowany framework przewyższył wszystkie pozostałe podejścia, osiągając najwyższy wynik F1 wynoszący 0,80. Poprawa w stosunku do najsilniejszego modelu bazowego, Adaptive-Graph, dowodzi wkładu zaproponowanego uczenia rozplątanej reprezentacji emocji oraz grafowego mechanizmu uwagi międzymodalnej w wychwytywanie uzupełniających się wskazówek emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej. Wyniki te pokazują, że zaproponowany framework do multimodalnego rozpoznawania emocji jest niezawodny i wydajny. Zaproponowane podejście wykazuje znaczną poprawę w stosunku zarówno do metody opartej na grafach, jak i konwencjonalnej metody fuzji, co dodatkowo potwierdza silną zdolność generalizacji tej metody. Poprawa wyniku F1 w zbiorze danych CMU-MOSEI dowodzi, że proponowane podejście pozwala osiągnąć zbalansowaną wydajność klasyfikacji emocji nawet w szumnych i zróżnicowanych środowiskach.

Precyzja

W inteligentnych systemach komunikacyjnych precyzja ma kluczowe znaczenie, ponieważ błędny sygnał emocjonalny może obniżyć komfort użytkowania. Precyzja definiowana jest jako stosunek liczby poprawnie przewidzianych instancji konkretnej emocji do całkowitej liczby przypadków zaklasyfikowanych jako ta emocja. Ponieważ rozdzielone reprezentacje emocji są mniej zaszumione i mniej podatne na błędną klasyfikację w danej modalności, zaproponowany model osiąga lepsze wyniki niż modele bazowe na zbiorze danych CH-SIMS przedstawionym na Rysunku 5.

Dokładność osiągnięta przez kilka multimodalnych technik rozpoznawania emocji na zbiorach danych CH-SIMS i CMU-MOSEI została zestawiona na Rysunku 5. Wraz z przejściem modeli od tradycyjnych technik opartych na fuzji do bardziej zaawansowanych architektur opartych na grafach, precyzja sukcesywnie rośnie. Zaproponowany framework osiągnął maksymalną precyzję na poziomie 0,82 dla zbioru CH-SIMS, przy czym precyzja wzrosła z 0,71 dla LSTM do 0,74, 0,76 i 0,79 odpowiednio dla TFN, LMF i Adaptive-Graph. W przypadku zbioru CMU-MOSEI precyzja wzrosła z 0,69 dla LSTM do 0,72, 0,74 i 0,7 odpowiednio dla TFN, LMF i Adaptive-Graph. Zaproponowane podejście osiągnęło najwyższą precyzję na poziomie 0,80. Zaproponowany framework zwiększył precyzję o około 3,8% w przypadku CH-SIMS i o 3,9% dla CMU-MOSEI w porównaniu z najsilniejszym modelem bazowym (Adaptive-Graph). Wyniki te pokazują, że dzięki przechwytywaniu uzupełniających informacji emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej, zaproponowane uczenie reprezentacji rozplątanych oraz grafowy mechanizm uwagi między-modalnej skutecznie redukują liczbę fałszywie dodatnich przewidywań. Wpływ nieistotnej modalności jest dodatkowo łagodzony przez grafową uwagę między-modalną. Zwiększona różnorodność mówców i ekspresji językowych w korpusie CMU-MOSEI powoduje niewielki spadek precyzji dla wszystkich modeli.

Przypomnienie

W zadaniach rozpoznawania emocji kluczowe znaczenie ma pełność (recall), będąca miarą zdolności modelu do odpowiedniego przypisania do konkretnej klasy instancji emocjonalnych, które do niej należą, ponieważ brak informacji o emocjach może negatywnie wpływać na jakość interakcji. Wyższa wartość pełności sugeruje, że model identyfikuje mniej fałszywie negatywnych wyników i więcej rzeczywistych ekspresji emocjonalnych. Pełność można uznać za miarę efektywności, z jaką informacje emocjonalne są wyodrębniane z modalności tekstowej, dźwiękowej i wizualnej w kontekście multimodalnej analizy emocji.

Przewaga proponowanej techniki nad podejściami bazowymi w zbiorach danych CH-SIMS i CMU-MOSEI została przedstawiona w porównaniu czułości (recall) na Rysunku 6. W miarę ewolucji modeli od konwencjonalnych metod opartych na fuzji do bardziej zaawansowanych multimodalnych struktur opartych na grafach, wyniki konsekwentnie wykazują wzrost czułości. Czułość w zbiorze danych CH-SIMS wzrosła z 0,70 dla LSTM do 0,73, 0,75 i 0,78 odpowiednio dla TFN, LMF i Adaptive-Graph; maksymalną czułość na poziomie 0,82 osiągnęła proponowana architektura. Proponowane podejście osiągnęło najlepszą czułość 0,80 w zbiorze danych CMU-MOSEI, gdzie wartość ta wzrosła z 0,68 dla LSTM do 0,71, 0,73 i 0,76 odpowiednio dla TFN, LMF i Adaptive-Graph. Proponowana architektura przyniosła względną poprawę o około 5,1% w CH-SIMS i 5,3% w CMU-MOSEI w porównaniu do najsilniejszego modelu bazowego (Adaptive-Graph). Wyniki te pokazują, że dzięki przechwytywaniu komplementarnych wskazówek emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej, proponowane uczenie rozplątanych reprezentacji oraz mechanizm uwagi między-modalnej oparty na grafach skutecznie redukuje liczbę fałszywie negatywnych predykcji, poprawiając tym samym identyfikację klas emocji w obu zbiorach danych. Ponieważ tradycyjne metody mają ograniczoną zdolność modelowania złożonych relacji między-modalnych, mają one tendencję do niższych wartości czułości. Dzięki bardziej jawnemu modelowaniu relacji między modalnościami, TFN i LMF osiągają umiarkowane zyski. Metoda Adaptive-Graph, symulując ustrukturyzowane relacje między modalnościami, dodatkowo poprawiła czułość. W obu zbiorach danych proponowana metoda osiąga najwyższą czułość, co wskazuje na jej lepszą zdolność do wykrywania instancji emocjonalnych w różnych scenariuszach interakcji. Poprawa jest bardziej widoczna w wielkoskalowym zbiorze danych CMU-MOSEI, co demonstruje odporność i zdolność do generalizacji proponowanej architektury.

Średni błąd bezwzględny (MAE)

Średni błąd bezwzględny (MAE) jest wykorzystywany do oceny wydajności zadań przewidywania ciągłej intensywności emocji, takich jak przewidywanie walencji lub pobudzenia. W przeciwieństwie do dokładności, MAE lepiej odzwierciedla bliskość przewidywanej intensywności emocjonalnej względem rzeczywistego stanu emocjonalnego. Właśnie dlatego MAE jest bardziej odpowiedni dla zestawów danych takich jak CH-SIMS i CMU-MOSEI, które posiadają ciągłe etykiety afektywne. Niższa wartość MAE wskazuje na większą dokładność w przewidywaniu intensywności emocji.

Porównanie MAE pomiędzy proponowanym modelem a podejściami bazowymi dla zbiorów danych CH-SIMS i CMU-MOSEI przedstawiono w Tabeli 4. Tradycyjne metody fuzji oparte na LSTM wykazują tendencję do wyższych wartości MAE ze względu na ich ograniczoną zdolność do modelowania złożonych multimodalnych zależności emocjonalnych. TFN i LMF mogą zredukować MAE poprzez modelowanie interakcji multimodalnych, a podejście Adaptive-Graph dodatkowo obniża tę wartość dzięki uczeniu relacji grafowych między modalnościami. Proponowany model osiąga najniższe MAE dla obu zbiorów danych, co wskazuje na dokładniejszą estymację intensywności emocji. Warto zauważyć, że poprawa jest bardziej znacząca w przypadku zbioru danych CMU-MOSEI, gdzie duża zmienność danych i warunki dotyczące mówców czynią zadanie predykcji bardziej wymagającym.

Macierz pomyłek dla zbioru danych CH-SIMS

Zgodnie z macierzami pomyłek dla zbioru danych CH-SIMS, bazowe metody wczesnej fuzji LSTM oraz TFN wykazują znaczne pomieszanie klas emocji neutralnych i pozytywnych. Sugeruje to, że metody te nie radzą sobie najlepiej z identyfikacją subtelnych multimodalnych ekspresji emocjonalnych. Z drugiej strony, proponowana metoda wyraźnie wykazuje silną dominację na przekątnej, z bardzo niewielką liczbą elementów poza przekątną, co poprawia rozdzielność klas. Mechanizm rozplątanego uczenia emocji (disentangled emotion learning) w proponowanej metodzie zapewnia spójną reprezentację emocji pomiędzy modalnościami, a zastosowane podejście do fuzji grafowej poprawia rozróżnianie między blisko powiązanymi klasami sentymentu. Rysunek 7A–E przedstawia macierz pomyłek dla zbioru danych CH-SIMS w przypadku różnych metod bazowych.

Macierz pomyłek dla zbioru danych CMU-MOSEI

Sugerowana struktura wykorzystuje niezmienne dla modalności osadzenia emocji oraz adaptacyjne wagi uwagi, aby znacząco zredukować wskaźnik błędnej klasyfikacji, szczególnie w przypadku wejść niejednoznacznych emocjonalnie. Potwierdza to, że proponowana struktura sprawdza się w różnych wielkoskalowych scenariuszach interakcji multimodalnych. Ze względu na rozmiar zbioru danych, zmienność mówców oraz ciągły charakter etykiet sentymentu, macierze pomyłek dla zbioru CMU-MOSEI wykazują wyższy ogólny wskaźnik błędnej klasyfikacji. Metody bazowe wykazują znaczny stopień pomyłek między różnymi kategoriami emocji. Rycina 8A–E przedstawia macierz pomyłek dla zbioru danych CMU-MOSEI z zastosowaniem różnych metod bazowych.

Czas trenowania na epokę

Kompromisy obliczeniowe zaawansowanych technik fuzji multimodalnej zostają podkreślone poprzez porównanie czasu trenowania na epokę. Ze względu na kodery transformera oraz mechanizmy uwagi grafowej, proponowany model wymaga nieco więcej czasu trenowania niż proste podejścia do fuzji, jednak wzrost ten nie jest nadmierny. Zaproponowany schemat wykazał wysoką skuteczność na benchmarkowych zbiorach danych do multimodalnej analizy emocji i wykazuje potencjał do integracji z inteligentnymi systemami interakcji człowiek-maszyna. Niemniej jednak, w obecnym badaniu nie oceniono przydatności do wdrożenia w czasie rzeczywistym, co wymaga dalszych badań poprzez analizy opóźnień, przepustowości, pamięci oraz samego wdrożenia. Co istotne, poprawiona stabilność zbieżności oraz lepsza wydajność predykcyjna i interpretowalność sprawiają, że dodatkowy koszt obliczeniowy jest uzasadniony. Rycina 9 przedstawia wynik czasu trenowania na epokę dla proponowanej metody.

Badanie ablacyjne

Aby określić wpływ każdego istotnego elementu w zaproponowanym schemacie, takiego jak moduł mapowania wizualnego, graficzna fuzja międzymodalna oraz rozplątana reprezentacja emocji, przeprowadzono badanie ablacyjne. W celu zrozumienia tego wpływu, każdy element usuwano pojedynczo. Wyniki eksperymentalne wskazują, że strategia fuzji grafowej poprawia modelowanie zależności międzymodalnych, a wkład rozplątanej reprezentacji emocji jest najważniejszy dla stabilności wydajności. Pomocnicza rola modułu mapowania wizualnego została potwierdzona przez niewielki wpływ jego usunięcia na wyniki. Wyniki badania ablacyjnego przy tych samych warunkach treningowych i ewaluacyjnych przedstawiono w Table 5. Największy spadek wydajności zaobserwowano po usunięciu modułu graficznej uwagi międzymodalnej, co obniżyło dokładność z 81.72% do 7.8% oraz wskaźnik F1 z 0.823 do 0.776. Podkreśla to znaczenie modelowania złożonych interakcji międzymodalnych. Rola modułu uczenia reprezentacji rozplątanej w tworzeniu solidnych reprezentacji specyficznych dla emocji została wykazana przez fakt, że jego usunięcie obniżyło dokładność o 2.78 punktu procentowego, a wskaźnik F1 o 0.032. Główną zaletą modułu mapowania wizualnego jest interpretowalność, a nie dokładność klasyfikacji, co potwierdza nieco mniejszy spadek wydajności predykcji po jego usunięciu. Konfiguracja Basic Fusion wykazała najgorsze wyniki, co dowodzi, że najlepsza wydajność multimodalnego rozpoznawania emocji wymaga połączonego wpływu wszystkich zaproponowanych modułów.

DOSTĘPNOŚĆ DANYCH:

Zbiory danych wykorzystane w niniejszym badaniu są publicznie dostępnymi zbiorami referencyjnymi. Zbiór danych CMU-MOSEI jest udostępniany przez Carnegie Mellon University Multimodal SDK i został opisany w pracy Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), a dostęp do niego jest możliwy pod adresem https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. Zbiór danych CH-SIMS został opisany w pracy Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) i jest publicznie dostępny poprzez zasoby udostępnione przez autorów, w tym pod adresem https://github.com/thuiar/MMSA. Wszystkie eksperymenty przeprowadzono z wykorzystaniem oficjalnych wersji tych zbiorów danych. Surowe dane wyekstrahowane, przetworzone pliki danych, wyniki preprocessingu, partycje treningowe/walidacyjne/testowe, pochodne reprezentacje cech oraz szczegóły implementacji wspierające wyniki niniejszego badania są publicznie dostępne w repozytorium Zenodo pod adresem https://doi.org/10.5281/zenodo.2124921.

Schemat uczenia multimodalnego; klasyfikacja emocji przy użyciu tekstu, dźwięku i wideo za pomocą sieci uwagi.
Rycina 1Schemat proponowanego modelu wizualnego mapowania cech emocji multimodalnych. Ilustracja koncepcyjna ogólnej architektury, przedstawiająca komponenty ekstrakcji cech multimodalnych, uczenia rozdzielnych reprezentacji, fuzji uwagi międzymodalnej opartej na grafach oraz mapowania wizualnego dla interpretowalnej multimodalnej analizy emocji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Schemat multimodalnej analizy emocji z tekstem, dźwiękiem i wideo; macierz uwagi; embeddingi emocji.
Rycina 2Schematyczny diagram przepływu proponowanego protokołu obliczeniowego.
Koncepcyjna reprezentacja kompletnego procesu przetwarzania, obejmująca etapy pozyskiwania zbioru danych, wstępnego przetwarzania, ekstrakcji cech specyficznych dla danej modalności, fuzji multimodalnej, wizualizacji oraz predykcji emocji Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Wykres porównawczy wyniku F1 dla metod: LSTM, TFN, LMF, Adaptive-Graph oraz Proponowanej, z paskami błędów.
Rysunek 3Porównanie wydajności miary F1 na zbiorze danych CH-SIMSŚrednie wartości miary F1 uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z wykorzystaniem różnych inicjalizacji ziarna losowego. Słupki błędów reprezentują ± jedno odchylenie standardowe (SD)Wyższe wartości miary F1 wskazują na lepszą wydajność klasyfikacji emocji. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.

Wykres porównawczy wyniku F1 dla poszczególnych metod (LSTM, TFN, LMF) wykazujący najwyższą wydajność proponowanej metody.
Rysunek 4Porównanie wyników miary F1 dla zbioru danych CMU-MOSEIŚrednie wartości miary F1 uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) przy użyciu różnych inicjalizacji ziarna losowego. Słupki błędu przedstawiają ± jedno odchylenie standardowe (SD), oraz odpowiadający średnia ± SD wartości są wyświetlane nad każdym punktem danych. Wyższe wartości miary F1 wskazują na lepszą wydajność klasyfikacji emocji. Aby wyświetlić powiększoną wersję tej figury, kliknij tutaj.

Tabela porównawcza precyzji dla CH-SIMS, CMU-MOSEI z wykorzystaniem metod LSTM, TFN, LMF, Adaptive-Graph.
Rysunek 5Porównanie precyzji na zbiorach danych CH-SIMS oraz CMU-MOSEI. Średnie wyniki precyzji uzyskane przez LSTM, TFN, LMF, Adaptive-Graph oraz proponowaną strukturę w ramach pięć niezależnych serii eksperymentalnych (n = 5)Słupki błędów przedstawiają ± jedno odchylenie standardowe (SD) obliczone na podstawie powtórzeń z różnymi inicjalizacjami losowych ziarn. Zaproponowany model osiąga najwyższą precyzję na obu zbiorach danych, wykazując poprawioną dyskryminację klas emocji dzięki efektywnemu uczeniu cech multimodalnych i grafowej fuzji międzymodalnej. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Porównanie wskaźników odzyskiwania dla CH-SIMS i CMU-MOSEI w zależności od metod w analizie wykresu słupkowego.
Rycina 6: Porównanie parametrów przywołania (recall) na zbiorach danych CH-SIMS i CMU-MOSEI. Średnie wyniki czułości (recall) uzyskane przez LSTM, TFN, LMF, Adaptive-Graph oraz proponowany model w ramach pięć niezależnych serii eksperymentalnych (n = 5). Słupki błędów wskazują ± jedno odchylenie standardowe (SD) uzyskane w wyniku powtórzonych eksperymentów. Zaproponowane ramy konsekwentnie osiągają najwyższą czułość (recall) w obu zbiorach danych, co wskazuje na lepszą zdolność do wychwytywania multimodalnych informacji emocjonalnych i redukcji wyników fałszywie ujemnych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Wykresy macierzy pomyłek dla dokładności klasyfikacji; przewidywane etykiety: negatywna, neutralna, pozytywna.
Rysunek 7Macierz pomyłek dla zbioru danych CH-SIMS z zastosowaniem różnych metod bazowychWiersze odpowiadają rzeczywistym klasom emocji, a kolumny odpowiadają klasom przewidzianym. Wartości w komórkach reprezentują procent próbek znormalizowany względem każdej klasy rzeczywistej. Macierz pomyłek została obliczona z wykorzystaniem wydzielonej partycji testowej zbioru CH-SIMS. Wyższe wartości procentowe na przekątnej wskazują na lepszą dokładność rozpoznawania dla odpowiadającej kategorii emocji. Macierze pomyłek dla (A) LSTM z wczesną fuzją, (B) TFN, (C) LMF, (D) adaptacyjny graf, i (E) Zaproponowana metoda w zbiorze danych CH-SIMS. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykresy macierzy pomyłek przedstawiające etykiety przewidywane w zestawieniu z etykietami rzeczywistymi dla modeli klasyfikacji.
Rycina 8Macierz pomyłek dla zbioru danych CMU-MOSEI z zastosowaniem różnych metod bazowychWiersze reprezentują rzeczywiste etykiety emocji, a kolumny etykiety przewidywane. Wartości podano jako procenty znormalizowane według klasy w zbiorze testowym CMU-MOSEI. Macierz ilustruje zarówno prawidłowo sklasyfikowane próbki (wpisy na przekątnej), jak i pomylenia między kategoriami emocji (wpisy poza przekątną). Macierz pomyłek dla CMU-MOSEI (A) LSTM z wczesną fuzją, (B) TFN, (C) LMF, (D) adaptacyjny graf, oraz (E) Zaproponowana metoda na zbiorze danych CMU-MOSEI. Prosimy o kliknięcie tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres porównania czasu trenowania dla zbiorów danych CH-SIMS i CMU-MOSEI w ciągu 10 epok.
Rysunek 9Porównanie czasu trenowania na jedną epokę w odniesieniu do benchmarkowych multimodalnych zbiorów danych emocji.
Średni czas trenowania na jedną epokę uzyskany z pięć niezależnych powtórzeń eksperymentalnych (n = 5) dla zbiorów danych CH-SIMS i CMU-MOSEI przy identycznych ustawieniach sprzętowych i programowych. Słupki błędów reprezentują ± jedno odchylenie standardowe (SD) obliczone na podstawie powtórzonych eksperymentów z wykorzystaniem różnych inicjalizacji ziarna losującego. Niższe wartości wskazują na wyższą wydajność obliczeniową, natomiast stabilne czasy trenowania pomiędzy poszczególnymi uruchomieniami świadczą o lepszej powtarzalności i spójności procesu trenowania. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Zbiór danychModalnościLiczba próbekJęzykEtykiety emocji/sentymentu
CH-SIMS34Wideo, Audio, Tekst2 281 segmentów wideoChińskiMultimodalne i unimodalne etykiety sentymentu (negatywny, neutralny, pozytywny)
CMU-MOSEI35Wideo, Audio, Tekst~23 453 adnotowanych klipówAngielskiEtykiety sentymentu i intensywności emocji (ciągłe i kategoryczne)

Tabela 1: Opis zbiorów danych. Podsumowanie zbiorów danych wykorzystanych w niniejszym badaniu, modalności, liczby próbek, języka oraz etykiet emocji/sentymentu dla zbiorów danych CH-SIMS i CMU-MOSEI.

KomponentSpecyfikacja
Środowisko programistycznePython z PyTorch
Ekstraktor cech wizualnychVision Transformer (ViT)
Ekstraktor cech audioWav2Vec 2.0
Ekstraktor cech tekstowychRoBERTa
Strategia fuzjiGraph-based Cross-Modal Attention Network
Wymiar cech768 na modalność
Optymalizator treningowyAdam
Szybkość uczenia1.0E-04
Wielkość partii (batch size)16
SprzętNVIDIA GPU (np. seria RTX)
Zbiory danych do ewaluacjiCH-SIMS, CMU-MOSEI
Wymiar latentny2.56E+02
Wymiar osadzenia (embedding)768
Funkcja aktywacjiReLU
OptymalizatorAdam
Szybkość uczenia1.0E-04
Wielkość partii (batch size)32
Epoki100
Wczesne zatrzymanie (early stopping)Włączone
Funkcja stratyKlasyfikacja + Rekonstrukcja + Konsystencja

Tabela 2: Środowisko symulacyjne. Konfiguracja eksperymentalna i szczegóły implementacji środowiska symulacyjnego, takie jak specyfika modelu, cechy, optymalizator oraz wykorzystany sprzęt.

MetodaDokładność CH-SIMS (%)Dokładność CMU-MOSEI (%)
LSTM (fuzja wczesna/późna)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Graf adaptacyjny78.46 ± 0.7376.89 ± 0.81
Proponowana metoda81.72 ± 0.6179.94 ± 0.69

Tabela 3: Ocena dokładności proponowanej metody w porównaniu z technikami bazowymi na zbiorach danych CH-SIMS i CMU-MOSEI. Wyniki przedstawiono jako średnia ± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowego. Wszystkie metody oceniano z wykorzystaniem tych samych partycji treningowych, walidacyjnych i testowych dla odpowiednich zbiorów danych, aby zapewnić rzetelność porównania.

MetodaCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (Early/Late Fusion)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.34 ± 0.0090.379 ± 0.010
Proponowana metoda0.298 ± 0.070.341 ± 0.08

Tabela 4: Wynik średniego błędu bezwzględnego. Wyniki przedstawiono jako średnia ± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) przy zastosowaniu różnych inicjalizacji ziarna losowego. Wszystkie metody oceniono przy użyciu identycznych podziałów na zbiory treningowe, walidacyjne i testowe w obrębie odpowiednich zbiorów danych, aby zapewnić rzetelne porównanie. Porównanie MAE dla ciągłej predykcji intensywności emocji z wykorzystaniem proponowanego modelu oraz podejść bazowych dla obu zbiorów danych.

Wariant modeluDokładność (%)miara F1
Pełny model81.72 ± 0.610.823 ± 0.008
Bez rozplątania78.94 ± 0.740.791 ± 0.010
Bez fuzji grafu77.88 ± 0.810.776 ± 0.011
Bez mapowania wizualnego80.11 ± 0.660.807 ± 0.009
Podstawowa fuzja74.91 ± 0.980.742 ± 0.013

Tabela 5: Wyniki badania ablacyjnego z metodami bazowymi. Wyniki przedstawiono jako średnia ± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowego. Wszystkie metody oceniano przy użyciu identycznych podziałów zbiorów treningowych, walidacyjnych i testowych dla odpowiednich zbiorów danych, aby zapewnić sprawiedliwe porównanie. Porównanie wydajności między wariantami modelu, wskazujące na skuteczność uczenia się z reprezentacji rozplątanych, fuzji opartej na grafach oraz modułu mapowania wizualnego.

Plik uzupełniający 1: Algorytm 1 i Algorytm 2.Prosimy kliknąć tutaj, aby pobrać ten plik.

Dyskusja

Wyniki eksperymentalne wykazują, że w odniesieniu do zbiorów danych CH-SIMS i CMU-MOSEI proponowany framework mapowania wizualnego dla multimodalnych cech emocji przewyższa aktualne techniki multimodalnego rozpoznawania emocji. W porównaniu z modelami wczesnej i późnej fuzji, takimi jak EF-LSTM i TFN, proponowana technika osiąga wyższą dokładność oraz wartości F1 Score, co świadczy o jej odporności w przetwarzaniu zróżnicowanych informacji emocjonalnych. Poprawę działania tej metody można przypisać rozdzielonej reprezentacji emocji, która tłumi szum specyficzny dla danej modalności i zapewnia spójność emocjonalną pomiędzy modalnościami wizualną, audio i tekstową36.

Niedawno multimodalne modele oparte na transformatorach, takie jak Adaptive Multimodal Transformers37 oraz MIAR38, wykazały imponujące wyniki w modelowaniu zależności międzymodalnych. Niemniej jednak modele te koncentrują się głównie na predykcji i nie posiadają mechanizmów wspierających interpretowalność na poziomie cech. W przeciwieństwie do nich, proponowany system łączy opartą na grafach uwagę międzymodalną z modułem mapowania wizualnego, co umożliwia przejrzystą analizę interakcji między modalnościami a emocjami. Jest to kluczowy aspekt, który obecnie pomijany jest w literaturze, w której wnioskowanie emocjonalne traktowane jest jako proces typu „czarna skrzynka”.

Zaproponowany model wykazał spójną wydajność w zestawach danych referencyjnych CH-SIMS i CMU-MOSEI. Chociaż model ten może znaleźć zastosowanie w inteligentnej interakcji człowiek-maszyna, monitorowaniu stanu zdrowia, adaptacyjnych środowiskach uczenia się oraz innych systemach rozpoznających emocje, w obecnym badaniu metodę oceniono wyłącznie w kontrolowanych warunkach referencyjnych. Nie przeprowadzono wdrożenia w rzeczywistych warunkach, oceny interfejsu użytkownika, badania użyteczności ani ewaluacji z udziałem ludzi. W związku z tym praktyczna skuteczność modelu w środowiskach operacyjnych wymaga dalszych badań. Przyszłe prace skupią się na ewaluacjach zorientowanych na wdrożenie, badaniach zorientowanych na użytkownika, analizie opóźnień, ocenie zużycia pamięci oraz wydajności interakcji w czasie rzeczywistym.

Co więcej, poprawa wyników w różnych zróżnicowanych kulturowo i językowo zbiorach danych potwierdza zasadność zaproponowanego modelu. W przeciwieństwie do wcześniejszych prac walidowanych na pojedynczym zbiorze danych lub w konkretnym scenariuszu interakcji, zaproponowany model wykazuje stabilną wydajność w odniesieniu do różnych języków, mówców i ekspresji emocjonalnych. W związku z tym zaproponowany model jest bardzo odpowiedni dla praktycznych inteligentnych systemów interakcyjnych, które wymagają dokładnego rozpoznawania emocji i interpretowalnego podejmowania decyzji.

Interpretowalność proponowanego modelu została oceniona poprzez analizę opartą na wizualizacji wyuczonych reprezentacji multimodalnych. W szczególności zbadano latentne osadzenia emocji, mapy uwagi między-modalnej, grafy interakcji modalności oraz czasowe trajektorie emocji, aby uzyskać wgląd w proces podejmowania decyzji przez model oraz wkład poszczególnych modalności. Celem modułu mapowania wizualnego jest zwiększenie przejrzystości poprzez umożliwienie obserwacji interakcji na poziomie cech oraz dynamiki emocjonalnej. Jednakże w niniejszej pracy nie uwzględniono formalnych metryk interpretowalności, ewaluacji wierności uwagi (attention-faithfulness) ani badań z udziałem użytkowników. W związku z tym zgłaszane korzyści w zakresie interpretowalności należy traktować jako dowody oparte na wizualizacji, a nie jako ilościowo zwalidowane miary wyjaśnialności.

Z teoretycznego punktu widzenia, niniejsze badanie wnosi następujące wkłady do wielomodalnego obliczeniowego analizowania afektu: proponuje systematyczny sposób modelowania emocji, który wyraźnie rozróżnia reprezentacje specyficzne dla emocji od reprezentacji specyficznych dla modalności. Poprzez zapewnienie spójności emocjonalnej między modalnościami w wspólnej przestrzeni latentnej, sugerowany framework rozwija teorię uczenia reprezentacji w systemach wielomodalnych. Włączenie mechanizmów uwagi opartych na grafach dodatkowo formalizuje zależności między różnymi modalnościami w wyrażaniu emocji.

Z praktycznego punktu widzenia proponowany model jest bardzo korzystny dla projektowania inteligentnych interakcji oraz interfejsów użytkownika uwzględniających emocje. Moduł mapowania wizualnego w proponowanym modelu pozwala projektantom systemów zrozumieć wpływ różnych modalności na przewidywanie emocji, co jest dla nich niezwykle istotne. Proponowany model znajduje szerokie zastosowanie w takich rozwiązaniach jak afektywne agenty konwersacyjne, adaptacyjne systemy uczenia się, interfejsy monitorowania zdrowia oraz platformy oceny doświadczeń użytkownika.

Zaproponowane ramy posiadają jednak pewne ograniczenia. Zastosowanie mechanizmów uwagi grafowej i koderów transformera zwiększa złożoność, co może być problematyczne w przypadku urządzeń o ograniczonych możliwościach. Ponadto w obecnym badaniu pominięto inne sygnały fizjologiczne, takie jak EEG i okulografia, koncentrując się na modalnościach wizualnej, dźwiękowej i tekstowej. Wydajność obliczeniowa sugerowanych ram pod kątem wdrożenia w czasie rzeczywistym nie została konkretnie oceniona, mimo że osiągnięto konkurencyjną skuteczność predykcji i poprawiono możliwości wizualizacji. Przyszłe badania przeanalizują wydajność wdrożenia w rzeczywistych kontekstach inteligentnej interakcji, opóźnienie wnioskowania, przepustowość, zużycie pamięci oraz techniki kompresji modeli. Aby dodatkowo poprawić dokładność modelowania emocji i responsywność interakcji, przyszłe badania skupią się na opracowaniu lekkich modeli, technik optymalizacji w czasie rzeczywistym oraz włączeniu dodatkowych modalności. Wydajność wdrożenia w czasie rzeczywistym nie została oceniona, a zastosowanie koderów transformera i metod uwagi opartych na grafach zwiększa złożoność obliczeniową. Do walidacji metodologii wykorzystano wyłącznie zbiory danych referencyjnych CH-SIMS i CMU-MOSEI, co może wprowadzać błędy specyficzne dla danych zbiorów i ograniczać możliwość generalizacji na inne domeny, języki i populacje użytkowników. Dodatkowo obecne badanie nie obejmuje sygnałów fizjologicznych, takich jak dane EEG czy okulograficzne; zamiast tego koncentruje się na modalnościach wizualnej, dźwiękowej i tekstowej. Chociaż szczegółowe opisy implementacji i środowiska symulacyjnego poprawiły powtarzalność, kod źródłowy i wstępnie wytrenowane modele nie są obecnie udostępnione publicznie.

W niniejszej pracy zastosowano nowatorski system mapowania wizualnego do multimodalnego uczenia cech emocjonalnych na potrzeby projektowania inteligentnych interakcji. Sugerowana metoda integruje end-to-end uczenie reprezentacji oparte na transformerach, rozdzielone modelowanie emocji oraz grafową uwagę między modalnościami, aby osiągnąć wysoką dokładność predykcyjną i interpretowalność. Eksperymenty na zbiorach danych CH-SIMS oraz CMU-MOSEI wykazują, że proponowany system przewyższa najnowocześniejsze modele multimodalnego rozpoznawania emocji pod względem dokładności oraz wyniku F1. Co ważniejsze, proponowane rozwiązanie mapowania wizualnego niweluje lukę między rozpoznawaniem emocji a strategią interakcji i wyznacza nowy kierunek w projektowaniu interpretowalnych, świadomych interakcji multimodalnych systemów obliczeń afektywnych.

W celu usprawnienia interpretowalnego i inteligentnego projektowania interakcji, w niniejszym badaniu wprowadzono nowatorski framework mapowania wizualnego do uczenia multimodalnych cech emocji. Zaproponowany system skutecznie integruje detekcję emocji i interpretowalność w ramach jednej architektury, łącząc ekstrakcję multimodalnych cech opartą na transformerach, uczenie rozdzielonych reprezentacji emocji, fuzję uwagi między-modalnej opartą na grafach oraz metody mapowania wizualnego. Poza zapewnieniem przejrzystych wizualizacji wkładu poszczególnych modalności, interakcji między-modalnych i temporalnej dynamiki emocji, ewaluacja eksperymentalna na zestawach danych referencyjnych CH-SIMS i CMU-MOSEI wykazała poprawę wydajności w stosunku do reprezentatywnych metod bazowych w kilku metrykach, w tym Accuracy, Precision, Recall, F1-score oraz Mean Absolute Error (MAE). Jednak badanie to, ograniczone do ewaluacji na dwóch zestawach danych referencyjnych, nie obejmuje studiów nad wdrożeniem w rzeczywistych warunkach, ocen zorientowanych na użytkownika, ilościowych analiz wyjaśnialności ani integracji modalności fizjologicznych. Ponadto środowiska o ograniczonych zasobach mogą napotkać trudności ze względu na koszt obliczeniowy enkoderów transformerów i procesów uwagi opartych na grafach. Chociaż przyszłe prace skupią się na szerszej walidacji na różnych zestawach danych, integracji dodatkowych modalności, badaniach użyteczności, udostępnieniu reprodukowalnych zasobów oraz optymalizacji pod kątem scenariuszy wdrożeń w czasie rzeczywistym, zaproponowany framework wykazuje ogólnie potencjał interpretowalnej multimodalnej analizy emocji dla obliczeń afektywnych i aplikacji inteligentnych interakcji.

Oświadczenia

Autorzy nie deklarują żadnych konfliktów interesów.

Podziękowania

Autorzy pragną podziękować za wsparcie udzielone przez School of Housing, Building and Planning, Universiti Sains Malaysia, Penang, Malezja, oraz School of Design Art, Changsha University of Science & Technology, Changsha, Chiny. Autorzy wyrażają również wdzięczność Xiamen Academy of Arts and Design, Fuzhou University, Xiamen, Chiny, za wsparcie akademickie i badawcze podczas realizacji niniejszej pracy.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AdamBiblioteka optymalizatorów PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Learning Rate = 1 × 10-4)Optymalizacja parametrów podczas trenowania modelu
CH-SIMSOryginalne repozytorium zbioru danychNajnowsza wersja publicznaZbiór danych referencyjnych do chińskiej multimodalnej analizy sentymentu/emocji
CMU-MOSEIRepozytorium CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (Najnowsza wersja publiczna)Zbiór danych referencyjnych do multimodalnego rozpoznawania sentymentu i emocji
Disentangled Emotion EncoderWłasna implementacjahttps://pytorch-geometric.readthedocs.io/en/latest/(Architektura Dual Encoder)Separacja reprezentacji ukrytych specyficznych dla emocji oraz specyficznych dla modalności
Graph Attention Network (GAT)PyTorch GeometricMulti-head GAT (https://pytorch-geometric.readthedocs.io/en/latest/)Modelowanie między-modalnych relacji emocjonalnych i adaptacyjna fuzja cech
Graph-Based Cross-Modal Attention LayerWłasna implementacjaMulti-Head Attention FusionUczenie szczegółowych zależności emocjonalnych pomiędzy modalnościami
MatplotlibProjekt Matplotlib3.7+Generowanie wykresów i analityka wizualna
NetworkXProjekt NetworkX3.0+Konstrukcja i wizualizacja grafów interakcji między-modalnych
NVIDIA GPUNVIDIA CorporationGPU z obsługą CUDAAkceleracja trenowania transformatorów i grafowych sieci neuronowych
Principal Component Analysis (PCA)Scikit-learnsklearn.decomposition.PCAWstępna redukcja wymiarowości wysokowymiarowych osadzeń emocji
PythonPython Software Foundation3.8+Podstawowy język programowania do implementacji frameworka multimodalnej analizy emocji
PyTorchPyTorch Foundation2.0+Opracowywanie, trenowanie i optymalizacja głębokich sieci neuronowych
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, osadzenia 768-dim)Ekstrakcja kontekstowych lingwistycznych i semantycznych reprezentacji emocji
SeabornProjekt Seaborn0.12+Generowanie map ciepła atencji i wizualizacji statystycznych
t-distributed Stochastic Neighbor Embedding (t-SNE)Scikit-learn
scikit-learn.org (Perplexity = 30, Iterations = 1000)
Wizualizacja klastrów i trajektorii ukrytych emocji
Ubuntu LinuxCanonical Ubuntu20.04 LTS lub nowszaŚrodowisko wykonawcze eksperymentów
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, osadzenia 768-dimEkstrakcja wizualnych reprezentacji uwzględniających emocje z klatek wideo
Wav2Vec 2.0Meta AI ResearchModel bazowy, osadzenia 768-dimEkstrakcja kontekstowych akustycznych i mownych cech emocji

Bibliografia

  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Przedruki i uprawnienia

Tagi

Predykcja emocjiuczenie reprezentacjiuwaga mi dzy modalno ciamienkodery Transformerreprezentacja rozpl tanaczasowe trajektorie emocjiinterpretowalno cech