Исследовательская статья

Визуальное картирование признаков мультимодальных эмоций для проектирования интеллектуального взаимодействия

DOI:

10.3791/71171

21 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе предлагается комплексная многомодальная структура анализа эмоций, использующая трансформерные кодировщики, распутанные представления эмоций и основанный на графах кросс-модальный механизм внимания с визуальным отображением для повышения точности распознавания эмоций на двух наборах данных.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Визуальное картирование мультимодальных признаков эмоций имеет решающее значение для проектирования интеллектуальных интерфейсов, позволяя машинам понимать, интерпретировать и реагировать на аффективные состояния человека. Тем не менее, современные алгоритмы мультимодального распознавания эмоций сосредоточены преимущественно на прогнозной эффективности, предоставляя мало данных об интерпретируемости, осведомленности о взаимодействии или кросс-модальных взаимодействиях на уровне признаков. В данной работе представлена платформа для визуального картирования аспектов мультимодальных эмоций, которая объединяет ориентированную на взаимодействие визуализацию, интерпретируемое обучение представлениям и прогнозирование эмоций. Для извлечения высокоуровневых эмбеддингов эмоций из текстовой, аудио- и визуальной модальностей без использования созданных вручную признаков применялись энкодеры на базе трансформеров. Для повышения робастности специфическая для эмоций и специфическая для модальности информация была разделена с помощью метода распутывания представлений (disentangled representation learning). Кроме того, была создана кросс-модальная сеть внимания на основе графов, использующая адаптивное взвешивание внимания для имитации тонких эмоциональных связей между модальностями. Для повышения прозрачности был разработан модуль многопроекционного визуального картирования, отображающий временные траектории эмоций, распределения кросс-модального внимания и латентные эмбеддинги эмоций. Для оценки предложенной платформы использовались набор данных Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) и китайский набор данных для мультимодального анализа сентимента (CH-SIMS). Согласно результатам экспериментов, предложенная платформа обеспечила улучшенную интерпретируемость на уровне признаков и визуализацию с учетом взаимодействия, при этом стабильно превосходя репрезентативные базовые методы по точности, F1-мере, корреляции и средней абсолютной ошибке. Кроме того, модуль визуального картирования облегчил качественную интерпретацию мультимодальных представлений эмоций, кросс-модальных взаимодействий и временной динамики эмоций, поддерживая визуализацию и анализ с учетом взаимодействия.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Способность правильно идентифицировать и понимать человеческие эмоции стала крайне важной для улучшения взаимодействия между человеком и машиной. Помимо того, что анализ эмоций необходим для совершенствования человеко-компьютерного взаимодействия, он обладает потенциалом революционизировать ряд областей, включая предварительную медицинскую диагностику1, поведенческий анализ в учебных классах2, психологическое наблюдение за пациентами3, определение усталости водителей в транспортных средствах4 и интеллектуальное управление в системах «умный дом»5. Последние достижения в области аффективных вычислений и глубокого обучения6 усилили интерес к созданию систем реального времени, способных запечатлеть всю сложность человеческих эмоций.

Многие современные методы опираются преимущественно на унимодальные данные, такие как текстовые, графические или слуховые сигналы7,8,9. Такие подходы неоднократно оказывались неспособными распознать тонкие сигналы, например, сарказм или контекстуальные нюансы. В связи с этим исследования перешли к мультимодальной оценке эмоций, которая объединяет дополняющие друг друга данные из нескольких источников для преодоления этих ограничений10,11,12. Преимущества слияния нескольких модальностей были продемонстрированы на базовых моделях, таких как долгосрочная краткосрочная память с ранним слиянием (EF-LSTM)13, облегченные и FM глубокие нейронные сети (LF-DNN)14, тензорные сети слияния (TFN) и подходы к мультимодальному слиянию с низким рангом. Однако большинство этих методов опираются на офлайн-генерацию признаков и не подходят для динамических ситуаций в реальном мире.

С целью учета эмоциональных состояний за последние десять лет значительно развились исследования и приложения в области мультимодального распознавания эмоций15. Одной из наиболее сложных и значимых областей современных исследований является непрерывный мониторинг эмоциональных состояний с использованием различных источников данных16. Концепция мультимодальности возникла естественным образом с появлением столь разнообразных систем знаний, что привело к многим достижениям в применении анализа эмоций в таких областях, как аффективные вычисления, человеко-компьютерное взаимодействие (HCI), обучение, видеоигры, обслуживание клиентов, медицинский уход, оценка пользовательского опыта (UX) и т. д. Тем не менее, применение методов распознавания эмоций при оценке UX не всегда было простым процессом.

Одной из основных причин сосредоточиться на мультимодальном распознавании, а не на унимодальных методах, являются неотъемлемые недостатки использования единственного источника информации. Системы унимодального детектирования эмоций могут иметь более низкую точность из-за отсутствующих или нечетких данных, тогда как схемы MER более надежны и обеспечивают более всестороннее и глубокое понимание экспрессивных состояний за счет интеграции нескольких источников данных17. Например, одного только языка мимики может быть недостаточно для точной классификации чувств, особенно когда жесты сложны или неясны. Однако сочетание мимики с другими формами коммуникации, такими как речь или физические сигналы, может повысить точность распознавания чувств.

Обширные исследования в области распознавания эмоций проводились с использованием нескольких модальностей. Ранние работы были сосредоточены на выявлении отличительных признаков из различных модальностей, таких как графические, акустические или текстовые данные. Однако становится все более очевидным, что интеграция различных модальностей может обеспечить сбалансированную эмоциональную информацию, что ведет к более надежному и точному определению тональности. В данном разделе рассматриваются ключевые достижения в одномодальном и мультимодальном анализе эмоций с упором на базовые подходы, их недостатки и обоснование нашего метода.

Первоначальные исследования по распознаванию эмоций были сосредоточены преимущественно на одной модальности. В визуальной области новаторские исследования привели к категоризации прототипных мимических движений20. Последующие достижения включали методы захвата временной динамики, такие как анализ визуального движения21 и скрытые марковские модели22, в то время как лицевые реакции были разделены на единицы действия с помощью системы кодирования лицевых движений (FACS)23. LSTM и сверточные нейронные сети (CNN) успешно применялись для извлечения значимых признаков непосредственно из необработанных аудиосигналов; методологии идентификации эмоций на основе аудио эволюционировали от традиционной обработки сигналов до глубокого обучения24. Извлечение контекстуальных эмоциональных сигналов в текстовом анализе эмоций было значительно улучшено за счет рекуррентных нейронных сетей (RNN), включающих механизмы внимания, а в последнее время — за счет моделей на базе трансформеров. Несмотря на достигнутые успехи, унимодальные методы по своей сути неспособны точно отобразить всю сложность человеческих переживаний, так как в них отсутствует дополнительная информация, содержащаяся в других модальностях.

В 2021 году были предложены некоторые модели на основе механизмов внимания, такие как модель DialogXL25, предназначенные для сбора долгосрочных контекстных данных в области идентификации тональности диалогов. Kim и соавт.26 представили модель EmoBERTa в 2021 году для повышения точности ERC. Эта модель использует данные о говорящих для улучшения характеристик участников разговоров и их взаимодействия друг с другом. В 2022 году Li и соавт.27 представили метод CoG-BART. В данной структуре используется контролируемое контрастивное обучение для повышения способности модели интерпретировать релевантные данные. Следует отметить, что контролируемое обучение требует значительного объема размеченных данных.

Типичным примером такой работы является фреймворк Multimodal Interaction-Aware Representation (MIAR)28, в котором используются токены взаимодействия признаков и контрастивное выравнивание для улучшения обобщения между модальностями. MIAR улучшает выравнивание модальностей и демонстрирует высокую эффективность на нескольких наборах данных; однако он сосредоточен главным образом на точности прогнозирования, не затрагивая вопрос визуального отображения. Аналогично, модель Cross-Attentional Audio-Visual Fusion29 эффективно фиксирует детализированные аудиовизуальные взаимодействия для прогнозирования валентности и активации, но ограничена двумя модальностями и не обладает возможностями визуализации. Подходы к темпоральному моделированию на основе сетей LSTM и слияния автоэнкодеров успешно улавливают временную динамику эмоций, однако дают ограниченное представление о взаимодействиях модальностей и изученных эмоциональных представлениях. В последнее время методы на основе трансформеров, такие как Transformer-based Multimodal Fusion Network (TMFN)30, продемонстрировали высокую эффективность на наборах данных CMU-MOSI и CMU-MOSEI благодаря улучшенному мультимодальному слиянию и контрастивному обучению. Тем не менее, эти подходы остаются преимущественно ориентированными на производительность и предоставляют ограниченную поддержку интерпретируемости, анализа на уровне признаков и визуализации, ориентированной на взаимодействие.

Для улучшения интеграции текстовых, акустических и визуальных данных было предложено несколько методов мультимодального распознавания эмоций. Несмотря на то, что методы раннего слияния, такие как EF-LSTM и LF-DNN, не позволяли фиксировать сложные кросс-модальные взаимодействия, они продемонстрировали преимущества использования мультимодальной информации для анализа настроений и эмоций. Хотя модель TFN повысила эффективность на эталонных наборах данных, таких как CMU-MOSI и CMU-MOSEI, и ввела явное моделирование интермодальных взаимодействий, ее ограниченная интерпретируемость и высокая вычислительная сложность препятствовали ее практическому применению. Для улучшения выравнивания модальностей и динамического слияния признаков в более современных методах, таких как MIAR, моделях слияния на основе перекрестного внимания (cross-attentional fusion), TMFN и адаптивных мультимодальных трансформерах, стали использоваться топологии трансформеров и механизмы внимания. Эти методы были сосредоточены преимущественно на прогностической способности, предоставляя мало сведений о представлениях эмоций на уровне признаков и кросс-модальных зависимостях, несмотря на достижение конкурентоспособных результатов по общепринятым метрикам оценки, таким как точность (accuracy), F1-мера (F1-score) и средняя абсолютная ошибка (mean absolute error). Кроме того, лишь в немногих исследованиях были разработаны методы визуализации, способные раскрыть латентные эмбеддинги эмоций, распределение внимания и временную динамику эмоций, или была интегрирована модель интермодальных взаимодействий на основе графов. Предлагаемый подход включает многовидовое визуальное отображение, слияние кросс-модального внимания на основе графов и обучение распутанным представлениям (disentangled representation learning) для преодоления этих недостатков и повышения эффективности мультимодального распознавания эмоций.

Аналогичным образом, в Adaptive Multimodal Transformer32 предлагается объединение на основе обмена для адаптивного смягчения влияния зашумленной или недостающей модальной информации, что повышает эффективность классификации тональности. Хотя этот подход позволяет эффективно устранить расхождения в распределении модальной информации, его архитектура специфична для задачи анализа тональности и дает ограниченное представление об изученных эмоциональных репрезентациях. Другим значимым вкладом является Multimodal Fusion Model33, которая объединяет CNN, мультипликативные LSTM и внимание на базе трансформеров для распознавания мультимодальных эмоций в режиме реального времени. Модель выполняет полное слияние видео-, аудио- и текстовых модальностей и демонстрирует высокую стабильность распознавания. Тем не менее, как и другие существующие модели, она ориентирована преимущественно на точность прогнозирования и не имеет явных признаков для визуализации и интерпретируемости, ориентированной на взаимодействие.

В заключение следует отметить, что, хотя современные подходы к мультимодальному распознаванию эмоций достигли значительных успехов в улавливании кросс-модальных взаимодействий и повышении точности прогнозирования, большинство из них сосредоточено на задачах, ориентированных на распознавание. Мало внимания уделялось таким областям, как интерпретируемость на уровне признаков, визуализация эмоциональных представлений в пространстве изображений и внедрение предлагаемой структуры для проектирования интеллектуального взаимодействия. Именно с учетом этих проблем предлагается данная структура.

Большинство современных методов сосредоточены прежде всего на повышении прогностической точности, предлагая при этом слабую интерпретируемость выученных эмоциональных представлений и кросс-модальных взаимодействий, несмотря на значительные успехи в области мультимодального распознавания эмоций28,29. Сложные взаимодействия между текстовой, акустической и визуальной модальностями зачастую трудно моделировать с помощью текущих стратегий слияния, особенно при наличии расхождений между модальностями и нехватки информации 28,31. Хотя архитектуры на основе трансформеров и механизмы внимания улучшили обучение представлениям, их прозрачность и интерпретируемость часто снижаются из-за отсутствия явного разделения информации, специфичной для эмоций, и информации, специфичной для модальностей31,32,33. Кроме того, лишь в небольшом количестве исследований изучалось графовое моделирование интермодальных взаимодействий или создавались системы визуализации, способные раскрыть временную динамику эмоций, распределение внимания и эмбеддинги эмоций. Эти недостатки демонстрируют необходимость в интерпретируемой мультимодальной структуре для интеллектуального человеко-машинного взаимодействия, которая сочетала бы в себе ориентированное на взаимодействие визуальное картирование с эффективным кросс-модальным обучением.

В данной работе представлена интерпретируемая структура для визуального картирования мультимодальных аспектов эмоций при проектировании интеллектуальных интерфейсов. Система использует сквозное глубокое обучение для извлечения высокоуровневых эмоциональных представлений из текстовых, аудио- и визуальных модальностей без необходимости создания признаков вручную. Кросс-модальные эмоциональные взаимодействия моделируются с помощью механизма слияния на основе графового внимания, который разделяет специфичную для эмоций и специфичную для модальности информацию, что обеспечивает распутывающее обучение представлениям и повышает интерпретируемость и устойчивость. Кроме того, создан модуль многоракурсной визуализации для отображения временной динамики эмоций, паттернов кросс-модального внимания и эмбеддингов эмоций. Эффективность и применимость предложенной структуры в интеллектуальных системах взаимодействия человека и машины оцениваются путем валидации на эталонных наборах данных для мультимодального распознавания эмоций.

Данная работа предлагает уникальную структуру для визуального картирования мультимодальных аспектов эмоций, которая выходит за рамки традиционных подходов, ориентированных на прогнозирование, чтобы преодолеть недостатки моделирования кросс-модальных взаимодействий и ограниченную интерпретируемость в современных системах идентификации мультимодальных эмоций. В рамках единой архитектуры предлагаемый подход объединяет мультимодальное обучение представлениям на основе трансформеров, распутанное моделирование признаков с учетом эмоций, слияние кросс-модального внимания на основе графов и визуализацию, ориентированную на взаимодействие. В отличие от существующих подходов, которые в основном сосредоточены на показателях классификации, данная структура четко разделяет специфичные для эмоций и специфичные для модальностей представления для повышения интерпретируемости, робастности и кросс-модальной согласованности. Кроме того, представлен механизм внимания на основе графов, который позволяет осуществлять адаптивное моделирование интермодальных взаимодействий путем захвата детальной эмоциональной взаимозависимости между текстовой, аудио- и визуальной модальностями. Для повышения прозрачности создан модуль многоракурсного визуального картирования, раскрывающий временные траектории эмоций, паттерны кросс-модального внимания и латентные эмбеддинги эмоций, что дает интуитивное понимание процесса принятия решений моделью. Помимо обеспечения улучшенной визуализации и интерпретируемости мультимодальной эмоциональной динамики, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала конкурентоспособные результаты с точки зрения точности, F1-меры, средней абсолютной ошибки и корреляции.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Целью предлагаемой работы является совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального сопоставления мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с рекомендациями по эксплуатации, стандартами исследований и условиями лицензирования, установленными их соответствующими создателями. Мультимодальный контент наборов данных, включая текстовые, аудио- и видеоданные, был предварительно собран и аннотирован поставщиками данных в соответствии с их санкционированными разрешениями участников и протоколами сбора данных. В данном исследовании не было прямого взаимодействия с людьми, не проводился набор новых участников и не осуществлялся сбор персональных данных. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не требовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование было проведено в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этическими процедурами исследований и применимыми политиками использования данных.

Для обучения характеристикам эмоций в различных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени используется компонент многовидового визуального отображения, эффективность которого оценивается при распознавании эмоций. Результаты показывают, что предложенный метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов с учетом эмоций в реальных условиях. На рисунке 1 показана архитектурная схема предлагаемой работы. Рисунок 1 демонстрирует полный рабочий процесс предлагаемой структуры визуального отображения для многомодального обучения признакам эмоций в контексте интеллектуальных систем взаимодействия. Процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют дополняющую друг друга эмоциональную информацию из лингвистической, просодической и мимической модальностей соответственно. Специфичный для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где встраивания (embeddings), специфичные для эмоций, отделяются от признаков, специфичных для модальностей, чтобы обеспечить согласованность распознанных эмоций в гетерогенных источниках данных. Встраивания специфичных для эмоций признаков из каждой модальности затем агрегируются сетью кросс-модального внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. Наконец, структура предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.

Мультимодальный сбор данных

Наборы данных CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных датасета, содержащих синхронизированную видео-, аудио- и текстовую информацию. Набор данных CH-SIMS состоит из мультимодальных исследований китайцев и включает 2 281 видеофрагмент, отобранный из различных сегментов фильмов, телесериалов и развлекательных шоу. Добавление соответствующих аудио- и текстовых данных к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически осуществимыми. С другой стороны, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является датасет CMU-MOSEI, сформированный из более чем 23 000 видеоклипов с фразами более чем 1 000 говорящих на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.

Текстовые транскрипции, аудиосигналы и видеокадры собираются и выравниваются по временным меткам для обеспечения точного согласования на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и объединения на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокального тона и лингвистического содержания. Такой метод мультимодального сбора данных обеспечивает эффективное извлечение межмодальной эмоциональной динамики, что является необходимым условием для проектирования интеллектуального взаимодействия и понятного визуального отображения.

Таблица 1 представляет основные структуры наборов данных мультимодальных эмоций, использованных в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произносимые слова, интонации голоса и выражения лица, CH-SIMS и CMU-MOSEI интегрируют видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет детально изучить взаимодействие модальностей и вариации эмоций в Китае. С другой стороны, набор данных CMU-MOSEI более важен для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассматриваемых в данной работе, так как он содержит большой объем данных на различных языках, по разным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, это упрощает процесс выбора информации при тестировании моделей.

Мультимодальная предобработка и синхронизация

Временные метки аннотаций из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечило согласованное обучение мультимодальному представлению. Каждое высказывание служило базовой единицей анализа и было связано с соответствующими аудио- и видеосегментами в пределах того же временного интервала. Выравнивание проводилось на уровне высказывания. Транскрипт был разделен на сегменты на основе меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио- и визуальными данными устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попавших в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента выбирались с заданной частотой и кодировались с помощью Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения всех признаков модальностей к единой границе высказывания, так как три модальности генерировали последовательности признаков разной длины. Для нормализации последовательностей разной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями. При обучении использовались маски внимания, чтобы отделить заполняющие элементы от значимых позиций признаков. Специфичные для каждой модальности эмбеддинги проецировались в общее латентное пространство перед слиянием, чтобы нивелировать различия в длине последовательностей разных модальностей. Это гарантировало размерную согласованность и позволило механизму внимания на основе графов обеспечить эффективное обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований исключались образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.

Извлечение признаков на основе трансформера

Метод глубокого обучения используется для получения высокоуровневых признаковых представлений с учетом эмоционального состояния на основе информации из нескольких модальностей, таких как зрение, звук и текст, сквозным (end-to-end) способом после выравнивания мультимодальных данных и проведения необходимой предварительной обработки. Благодаря использованию трансформерного кодировщика для извлечения внутренне дискриминативных признаковых представлений из необработанных мультимодальных данных, предлагаемый метод исключает необходимость в ручном конструировании признаков. Для обеспечения согласованности между наборами данных, используемыми в предлагаемом подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой отдельной модальности, включая изображение, звук и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе, в частности, в методе извлечения признаков, применяемом к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для получения высокоуровневых признаков из данных различных объемов.

Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния

Для извлечения визуальной информации из видеокадров с целью получения пространственных представлений, релевантных эмоциям, использовалась модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого сегмента видео масштабировались до размера (224 × 224) пикселей и отбирались с регулярными временными интервалами. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров проецировались в 768-мерное пространство вложений с использованием предобученной модели ViT в качестве визуального базиса. Эмбеддинги на уровне кадров объединялись с помощью усредняющего пулинга для создания окончательного визуального представления каждого сегмента. В процессе обучения для улучшения обобщающей способности использовались нормализация изображений и общепринятые методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая структура мультимодального слияния применялась для объединения этих визуальных эмбеддингов с текстовыми и слуховыми представлениями.

Для сохранения временной динамики эмоций видеообразцы из наборов данных CH-SIMS и CMU-MOSEI будут равномерно отобраны для визуальной модальности. Кадры каждого видео, figure-protocol-1, могут быть разделены на N секций фиксированного размера, которые затем выравниваются и инверсивно переносятся в пространство латентных вложений с размерностью figure-protocol-2. Последовательность создается путем добавления позиционных вложений и обучаемого токена группировки:

figure-protocol-3   (1)

где figure-protocol-4 обозначает позиционное кодирование, а figure-protocol-5 является матрицей встраивания патчей.

Для обработки последовательности встроенных патчей используются каскадные слои кодировщика трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:

figure-protocol-6   (2)

figure-protocol-7   (3)

Для получения вектора визуальных признаков, учитывающего эмоции, в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса figure-protocol-8. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании различных наборов данных, эмбеддинги на уровне кадров из каждого сегмента видео объединяются для фиксации мимики и эволюции эмоций.

Аудиальная модальность с использованием Wav2Vec 2.0 для просодии и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с помощью предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегации выходных скрытых представлений с использованием усредняющего пулинга (mean pooling). Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и значимых для эмоций характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы, и их частота дискретизации была приведена к 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных меток, предоставленных в аннотациях набора данных. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем на основе финальных аудиоэмбеддингов было выполнено слияние через кросс-модальное внимание на базе графов и обучение распутанным представлениям (disentangled representation learning).

Для аудиомодальности используется Wav2Vec-2.0 для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала существует сверточное кодирование признаков figure-protocol-9:

figure-protocol-10   (4)

где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на основе трансформера полезна для вышеупомянутых структур, так как она представляет долгосрочные временные зависимости:

figure-protocol-11   (5)

Эти контекстные акустические представления включают просодические и семантические акустические данные, которые имеют важное значение для выражения эмоций. Эмбеддинг аудио конкретной длины создается путем выполнения процедуры временного пулинга:

figure-protocol-12   (6)

Данная архитектура позволяет избежать использования акустических признаков, таких как MFCC, и обеспечивает устойчивость результатов на английских речевых данных из CMU-MOSEI и китайских речевых данных из CH-SIMS за счет простого извлечения представлений непосредственно из форм волны.

Текстовая модальность с использованием RoBERTa для получения контекстуальных эмбеддингов эмоций

Для текстовой модальности к транскриптам речи из двух наборов данных был применен глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Кодировщики на базе RoBERTa использовались для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с использованием соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Чтобы обеспечить согласованную пакетную обработку, входные последовательности были преобразованы в эмбеддинги токенов, а затем дополнены или обрезаны до заранее определенной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделители. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных кодировщиком-трансформером, с использованием итогового представления предложения, эквивалентного [CLS]. Для адаптации полученных представлений к задаче распознавания эмоций предобученные кодировщики RoBERTa были доработаны посредством мультимодального обучения. Затем предложенная архитектура мультимодального слияния использовалась для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.

Встраивания токенов и позиционные кодировки могут быть объединены для каждого токенизированного входного элемента, figure-protocol-13, чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как

figure-protocol-14   (7)

Эта форма представлена слоями L-трансформера, который использует механизм самовнимания (self-attention) для выявления контекстных зависимостей между словами:

figure-protocol-15  (8)

Контекстный эмбеддинг эмоций получается с использованием конечного скрытого состояния классификационного токена:

figure-protocol-16   (9)

Полярность настроения, сильные эмоции и связанные с ними смысловые нюансы являются примерами лингвистических характеристик, связанных с эмоциями, которые будут представлены данным эмбеддингом. RoBERTa упрощает языконезависимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.

С помощью предложенного этапа глубокого обучения представлению признаков извлекаются три специфичных для каждой модальности вектора признаков размерностью 768: визуальный fv, аудио- fa и текстовый ft . В рамках проектирования интеллектуального взаимодействия эти изученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на основе графов и обучения распутанным представлениям.

Обучение распутанным представлениям

После изучения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков визуальной, аудиальной и текстовой модальностей может дать несвязное описание эмоций. Если специфические для модальностей вложения признаков аудиальной, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, так что figure-protocol-17  и figure-protocol-18, то целью данного этапа является факторизация всех признаков модальностей в два различных латентных описания, которые включают описания эмоций с учетом предыдущей семантики каждой из различных модальностей.

Это достигается путем подачи признаков каждой модальности, fm , в две параллельные проекционные сети: кодировщик эмоций figure-protocol-19 и кодировщик модальности figure-protocol-20, в которых формируются два соответствующих кодирования.

figure-protocol-21  (10)

Где figure-protocol-22 означает латентный признак, связанный с эмоцией, а figure-protocol-23 представляет латентный признак, специфичный для конкретной модальности. Это позволяет эмбеддингам, специфичным для эмоций, взаимодействовать с общим пространством многократно по нескольким входным данным, включая аудио-, визуальные и текстовые, сохраняя при этом уникальные структурные данные, связанные с каждой модальностью.

Эффективное разделение обеспечивается за счет реконструкции с ограничениями независимости. Реконструкция признака исходной модальности определяется следующим образом:

figure-protocol-24  (11)

где figure-protocol-25  — это сеть-декодер. Потери реконструкции сохраняют следующие данные:

figure-protocol-26   (12)

Кроме того, ортогональность или декорреляция между изображениями эмоций и специфических для модальности признаков часто ограничивает перекрытие информации:

figure-protocol-27   (13)

Достигая этих целей, модель может сформировать представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное слияние на основе графов и функции визуального отображения, особенно при проектировании интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.

Согласованность эмоций в разных модальностях

Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это связано с тем, что стратегии слияния больше не должны учитывать значительные разрывы между двумя представлениями, так как специфичные для модальностей эмоцональные эмбеддинги разделяют общее латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом figure-protocol-28. Взвешенное слияние будет более стабильным при согласованности специфических для эмоций представлений, поскольку вариации между сигналами различных модальностей больше не будут влиять на результат.

figure-protocol-29   (14)

Путем обеспечения семантического выравнивания эмоциональной информации эта цель минимизирует расхождения между модальностями и гарантирует, что восприятие эмоций остается стабильным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное репрезентативное пространство путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.

Влияние на кросс-модальное слияние

Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку эмоциоспецифические эмбеддинги выровнены в общем латентном пространстве. Слитое представление эмоций определяется следующим образом:

figure-protocol-30  (15)

Где αm обозначает вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфические для эмоций представления согласованы, так как результат слияния демонстрирует взаимодополняющие эмоциональные признаки, а не противоречивые сигналы модальностей.

С математической точки зрения, снижение figure-protocol-31 дисперсии между различными типами эмоционально-специфических представлений относительно figure-protocol-32 эквивалентно следующему:

figure-protocol-33   (16)

где figure-protocol-34 представляет собой среднее выражение эмоции. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.

Конечной целью обучения при визуализации распутанных эмоций является объединение фрагментации, реконструкции и однообразности эмоций:

figure-protocol-35   (17)

два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между надежностью кросс-модальных эмоций и диссоциацией. Предложенная модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления для достижения этой цели, с акцентом на создании прочной основы для последующего слияния на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.

Кросс-модальное слияние внимания на основе графов

Для моделирования детальных эмоциональных связей между модальностями была использована графовая кросс-модальная сеть внимания. Чтобы облегчить поток информации между модальностями, был построен полносвязный мультимодальный граф, в котором каждое модально-специфическое эмбеддинг-представление (текстовое, аудио и визуальное) выступало в качестве узла графа. Отношения между модальностями использовались для создания матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проектирования выходов нескольких голов внимания. Затем было сформировано единое мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем передавалось в модули прогнозирования и визуализации для анализа с учетом взаимодействий и распознавания эмоций. Модуль графового слияния имел размерность скрытого представления 256 и два слоя графового внимания, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем графового внимания следовали нормализация слоя, остаточные связи и слой dropout с коэффициентом 0,2 для повышения стабильности обучения и уменьшения переобучения. После конкатенации и проектирования выходов нескольких голов внимания в общее латентное пространство представления узлов объединялись в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многоракурсного визуального картирования и прогнозирования эмоций.

Различные кросс-модальные взаимодействия были зафиксированы с помощью многоголового графового внимания. Функция softmax использовалась для нормализации коэффициентов внимания между связанными узлами для каждого узла. Для повышения стабильности обучения и предотвращения переобучения за стековыми слоями графового внимания в модуле слияния графов следовали остаточные связи, послойная нормализация и регуляризация с помощью дропаута.

Пусть члены figure-protocol-36 по отдельности представляют собой представления, соответствующие конкретным эмоциям, полученные из визуальной, аудио- и текстовой модальностей; каждый компонент находится в общем латентном пространстве figure-protocol-37. Модели для узлов модальностей используют обозначение графа figure-protocol-38, где узлы совокупности figure-protocol-39 соответствуют самим трем узлам модальностей, чтобы эксплицитно усилить эмоциональные зависимости, общие для представлений различных модальностей.

После присвоения каждому узлу графа вектора признаков, специфичного для конкретной эмоции, мы имеем следующее:

figure-protocol-40   (18)

В отличие от традиционных методов слияния, в которых используются предопределенные или фиксированные веса слияния, предлагаемый метод обучает адаптивным весам ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.

Для кросс-модального слияния используется графовая сеть внимания (GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:

figure-protocol-41   (19)

Эмоциональный эффект переключения из режима j в модальность i измеряется нормированными весами αij.

Далее, объединенный вид каждого узла модальности вычисляется как взвешенная группировка его соседей:

figure-protocol-42   (20)

где функция активации figure-protocol-43 является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального интегрированного представления эмоций:

figure-protocol-44   (21)

Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального отображения, поскольку он позволяет фиксировать взаимодополняющую информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.

Алгоритм 1 (Дополнительный файл 1) представляет собой общую схему выполнения кросс-модального слияния на основе графов. Сначала создается граф, в котором специфические для данной эмоции характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем рассчитываются показатели внимания для пар узлов каждого графа, которые представляют собой комбинацию эмоциональной зависимости. После этого показатели внимания нормализуются для определения относительного вклада каждой модальности в указанный эмоциональный контекст, что позволяет обучать весам внимания. На заключительном этапе формируется общее встраивание эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, реализованное в алгоритме общее слияние мультимодальных признаков, связанных с определенными эмоциями, демонстрирует потенциал в плане адаптивности, интерпретируемости и контекстуального интеллекта.

Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети перекрестного модального внимания для мультимодального слияния эмоций. Эмоциональные эмбеддинги, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальности, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем представления модальностей с учетом весов внимания объединяются для формирования единого эмоционального эмбеддинга, в котором матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обучаемая сетью, динамически модулирует вклад модальностей, позволяя системе фокусироваться на наиболее информативной модальности, игнорируя зашумленные и менее значимые данные. Слитое представление эмоций обеспечивает точное распознавание эмоций и детальный анализ эмоциональных состояний, таких как нейтральное, объятия и беспокойство.

Модуль визуального картирования

С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать единое представление эмоционального состояния в визуальную форму, которая будет понятной и легко воспринимаемой после процесса кросс-модального слияния на основе графа.

Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двухмерное пространство для отображения с использованием стохастического вложения соседей t-распределения (t-SNE). Для t-SNE использовались значение perplexity, равное 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания, использовались для создания тепловых карт внимания. На этих тепловых картах отображены относительные вклады текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально исследовать межмодальные связи и информационные потоки внутри структуры слияния. Для изучения временной эмоциональной динамики были построены графики траекторий эмоций путем отслеживания развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории позволяют понять, как изменяются эмоциональные состояния и вклад модальностей с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и тепловых карт внимания.

Пусть переменная figure-protocol-45 обозначает объединяющее представление эмоционального состояния, сформированное функцией графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.

Используя вычисленное значение αji, создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем веса входящего внимания суммируются для определения совокупного показателя значимости каждой модальности:

figure-protocol-46    (22)

где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и отображаются на цветовой карте, что позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в различных интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым входным модальностям такой интерфейс помогает пользователю понять, как работает механизм внимания системы.

Обученный граф специально смоделирован как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом в графе, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на соединяющих их ребрах. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определение i и j следующее:

figure-protocol-47   (23)

Благодаря этим весам толщина линий или прозрачность визуализации графа отображаются соответствующим образом. Это упрощает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия разработчик может лучше понять, как взаимодействуют эмоциональные индикаторы в процессе слияния.

Объединенные эмбеддинги эмоций figure-protocol-48 на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:

figure-protocol-49   (24)

где функция проекции представлена выражением figure-protocol-50. Появление 2D/3D траекторий эмоций, демонстрирующих переходы, интенсивность и стабильность эмоций во взаимодействиях, может быть интерпретировано как наглядное изображение эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.

В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, эта система сосредоточена на демонстрации механизмов формирования человеческих эмоций внутри неё. Она раскрывает процесс принятия решений, предоставляя визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействия между моделями и соответствующие им пути. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.

Таким образом, отображение эмоций в понятные формы с помощью визуальных репрезентаций может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией при проектировании интеллектуальных интерфейсов. Данные, полученные обоими подходами, затем могут быть использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам интерфейсов важную информацию для разработки более точных пользовательских интерфейсов. Иными словами, понимание эмоций становится активной частью проектирования взаимодействия. Точность может возрасти только в том случае, если понимание эмоций будет активно интегрировано в процесс проектирования взаимодействия.

Модуль визуального картирования обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает базовые представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальностей использует данные графов взаимодействия и тепловых карт визуального внимания для описания того, как каждая модальность — визуальная, аудио- или текстовая — влияет на решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют нам понять, как каждая визуальная и текстовая модальность изменяется с течением времени с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Supplementary File 1).

Объединенные мультимодальные эмоциональные признаки отображаются на визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения (Algorithm 2). Веса мультимодального внимания на основе графов используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются на визуальные представления с помощью элементов тепловых карт для выделения основных источников, влияющих на эмоции. Чтобы обеспечить наглядное представление взаимодействия между входными элементами и передать эволюцию эмоций, вызванную мультимодальными входными данными, затем вычисляется сила попарного взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается вид эмоциональной эволюции путем отображения объединенных эмоциональных элементов, собранных за определенный период времени, в низкоразмерное пространство для получения непрерывной эволюции эмоционального элемента.

Прогнозирование эмоций и обратная связь при взаимодействии

Результат объединенного представления эмоций, выраженный как figure-protocol-51, затем используется в качестве функции как для обратной связи при взаимодействии, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая модель классификации на основе функции softmax:

figure-protocol-52   (25)

где figure-protocol-53 представляет ожидаемые вероятности классов эмоций, а Wc  и bc являются обучаемыми параметрами. Для улучшения задачи классификации используется перекрестная энтропия (cross-entropy loss):

figure-protocol-54  (26)

где yk — истинная метка, а K — количество классов эмоций. Параллельно используется регрессионная ветвь для оценки интенсивности эмоций, которая выдает прогноз различных непрерывных аффективных атрибутов, включая валентность и возбуждение. Приведите следующее определение:

figure-protocol-55   (27)

где ожидаемый показатель интенсивности эмоций обозначен как figure-protocol-56. Для оптимизации задачи регрессии используется функция потерь среднеквадратичной ошибки:

figure-protocol-57   (28)

В целом, эти две задачи объединены в целевой функции прогнозирования:

figure-protocol-58   (29)

где цели регрессии и классификации сбалансированы с помощью λ. Предлагается динамическая модификация модуля визуализации на основе выявленного эмоционального состояния для обеспечения такого типа обратной связи, учитывающей взаимодействие. Контекст взаимодействия в данный момент времени t представлен ct. Ответ модуля визуализации определяется следующим образом:

figure-protocol-59    (30)

где функция адаптации визуализации представлена как figure-protocol-60. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Это свидетельствует о том, что система обеспечивает существенную поддержку обратной связи в дополнение к высокой точности прогнозирования эмоционального состояния.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Данная работа подтверждает эффективность предлагаемой структуры визуального картирования мультимодальных признаков эмоций с точки зрения как интерпретируемости с учетом взаимодействия, так и прогностической способности, используя два эталонных набора данных: CH-SIMS и CMU-MOSEI. Согласно результатам экспериментов, предложенный подход стабильно демонстрирует более высокие результаты по сравнению с существующими методами мультимодального распознавания эмоций по ряду показателей, включая корреляцию, точность, F1-меру и среднюю абсолютную ошибку (MAE). Распутанное представление эмоций, механизм кросс-модального слияния на основе графов и стратегия сквозного глубокого обучения представлениям способствуют этому улучшению, обеспечивая более стабильное и семантически согласованное моделирование эмоций. Предложенный подход обеспечивает более глубокое понимание на уровне признаков благодаря визуальному картированию, что выходит за рамки количественных улучшений и упрощает анализ вклада каждой модальности и эмоционаной динамики. Несмотря на различия в языке, культурных особенностях выражения эмоций и объеме данных, вышеупомянутое повышение производительности последовательно наблюдается на обоих наборах данных, что демонстрирует высокую обобщающую способность предлагаемой структуры.

В предлагаемой работе используются общедоступные наборы данных для мультимодального анализа эмоций CH-SIMS и CMU-MOSEI. Набор данных CH-SIMS включает 2 281 видеоклип из фильмов, телевизионных драм и развлекательных шоу. В CH-SIMS доступны синхронизированные текстовые, аудио- и визуальные данные. Как унимодальные, так и мультимодальные метки тональности классифицированы по категориям: положительная, нейтральная и отрицательная. Обширный англоязычный мультимодальный набор данных CMU-MOSEI содержит около 23 453 аннотированных видеоклипов с участием более 1 000 говорящих, обсуждающих широкий круг тем. Этот набор данных содержит как непрерывные аннотации интенсивности эмоций, такие как валентность и возбуждение, так и категориальные метки эмоций. Эксперименты на этих двух наборах данных с использованием предложенного фреймворка подтверждают его устойчивость и надежность за счет поддержки различных лингвистических, культурных и эмоциональных условий. В Таблице 2 представлены сведения о среде моделирования.

Основные экспериментальные и практические настройки, использованные для оценки предлагаемой структуры, обобщены в данной симуляционной среде. Для обеспечения единообразной размерности признаков в текстовой, аудио- и визуальной модальностях повсеместно применяются энкодеры на базе трансформеров. В системе используется механизм внимания на основе графов для кросс-модального слияния, что позволяет адаптивно изучать взаимозависимости между модальностями в отношении эмоциональных состояний.

Предложенная архитектура извлекает текстовые, слуховые и визуальные представления с помощью модальных кодировщиков на базе трансформеров. Полносвязные слои с активацией ReLU проецируют специфичные для каждой модальности эмбеддинги в общее латентное пространство. Затем для обучения распутанных представлений используются отдельные кодировщики, специфичные для конкретных эмоций и модальностей, каждый из которых состоит из двух полносвязных слоев с нелинейной активацией и нормализацией. Латентные представления проецируются в 256-мерное пространство признаков, где информация для каждой модальности и эмоции изучается по отдельности. Для сохранения информации о модальности и обеспечения эффективного распутывания используются декодеры реконструкции. Перед мультимодальным объединением и прогнозированием модуль кросс-модального внимания на основе графов моделирует эмоциональные зависимости между модальностями с использованием латентных представлений. Сеть обучалась с помощью оптимизатора Adam с начальной скоростью обучения 1 × 10⁻4 и размером пакета 32. Для предотвращения переобучения применялась ранняя остановка на основе потерь на валидационной выборке. Общая целевая функция состояла из потерь классификации, реконструкции и согласованности представлений, каждая из которых была взвешена с помощью настраиваемых гиперпараметров. Обучение модели проводилось в течение до 100 эпох, и для тестирования была выбрана модель с наилучшими показателями на валидационном наборе данных.

Предложенная структура была оценена с помощью метрик классификации, включая точность (Accuracy), прецизионность (Precision), полноту (Recall) и F1-меру, а также метрик регрессии, таких как средняя абсолютная ошибка (MAE). Прецизионность, полнота и F1-мера рассчитывались с использованием макроусреднения для учета дисбаланса классов по категориям эмоций. В экспериментах по классификации в качестве эталонных классов использовались предопределенные метки эмоций/сентимента из наборов данных CH-SIMS и CMU-MOSEI. Для прогнозирования сентимента на основе регрессии в качестве целевых переменных служили непрерывные показатели интенсивности сентимента из этих наборов данных. Для анализа эффективности прогнозирования по каждому классу и паттернов ошибочной классификации были построены матрицы ошибок с доверительным интервалом 95%. Для обеспечения робастности каждый эксперимент повторяли 5 раз с использованием различных случайных инициализаций; представленные результаты соответствуют среднему значению. ±± стандартное отклонение производительности по всем сериям запусков. Статистическая значимость оценивалась с использованием соответствующих процедур проверки гипотез, а в необходимых случаях рассчитывались доверительные интервалы. Время обучения измерялось как общее затраченное время, необходимое для сходимости модели на указанной аппаратной платформе.

Предложенный метод можно сравнить с рядом репрезентативных базовых моделей, включая модели раннего и позднего слияния (fusion), такие как TFN, методы на базе LSTM, низкоранговые модели мультимодального слияния, адаптивные мультимодальные трансформеры и новые архитектуры на основе перекрестного модального внимания. Эти базовые модели отражают передовые методы, направленные прежде всего на повышение точности распознавания эмоций с помощью различных способов слияния данных. В отличие от данных методов, которые сосредоточены главным образом на прогнозировании на уровне выходных данных, предложенная архитектура за счет обучения распутанных представлений (disentangled representation learning) и слияния на основе графов повышает интерпретируемость и осведомленность о взаимодействиях. Примерами реализованных базовых моделей, созданных с использованием официальных репозиториев или общедоступных эталонных реализаций, являются LSTM Fusion, TFN, низкоранговое мультимодальное слияние (LMF), Adaptive-Graph и методы на базе трансформеров. В тех случаях, когда они были доступны, использовались оригинальные настройки гиперпараметров авторов. Все переобученные базовые модели оценивались с использованием одних и тех же разбиений наборов данных, методов предобработки, параметров оптимизации и критериев оценки для обеспечения честного сравнения. В таблицах сравнения четко указаны соответствующие ссылки на данные, полученные непосредственно из более ранних публикаций.

Точность

Точность классификации дискретных эмоций измерялась как для CH-SIMS, так и для CMU-MOSEI; однако тенденция изменения точности различалась в зависимости от характеристик этих двух наборов данных. Поскольку CH-SIMS является набором данных среднего размера с равным количеством категорий сентимента и тщательно предобработанными видеоклипами, его точность высока, что свидетельствует о способности модели фиксировать тонкую мультимодальную эмоциональную информацию при низком уровне шума. С другой стороны, точная классификация эмоций в CMU-MOSEI представляет собой более сложную задачу, так как это крупномасштабный набор данных с говорящими из самых разных групп. Следовательно, помимо способности модели определять сентимент, точность на наборе данных CMU-MOSEI указывает на ее способность к обобщению и устойчивость к различным сценариям взаимодействия. Повышение точности на обоих наборах данных показывает, что предложенный подход хорошо обобщается на данных разных языков, объемов и уровней эмоциональной сложности.

Точность классификации предлагаемого подхода и других общепринятых базовых моделей на наборах данных CH-SIMS и CMU-MOSEI представлена в Таблице 3. Как показано в Таблице 3, предложенная структура достигла наивысшей точности на обоих наборах данных, CH-SIMS и CMU-MOSEI, превзойдя самую сильную базовую модель (Adaptive-Graph) примерно на 3,3% и 3,1 процентного пункта соответственно. Более низкие значения стандартного отклонения также указывают на большую стабильность при повторных экспериментальных запусках. Традиционные подходы на основе слияния LSTM имеют более низкую точность из-за их ограниченной способности улавливать сложные кросс-модальные связи. TFN и LMF повышают точность классификации за счет моделирования кросс-модальных взаимосвязей.

F-мера

В задачах классификации эмоций баланс между полнотой (recall) и точностью (precision) измеряется с помощью F1-меры. Для наборов данных многомодальной классификации эмоций, в которых, скорее всего, будет наблюдаться неравномерное распределение классов, данный показатель является более подходящим. В задачах классификации эмоций баланс между полнотой и точностью измеряется с помощью F1-меры. Поскольку ожидается, что наборы данных многомодальной классификации эмоций будут несбалансированными, использование F1-меры более оправдано. Чем лучше модель определяет классы эмоций, тем выше значение F1-меры.

Рисунок 3 иллюстрирует оценку F1-меры предложенного метода в сравнении с базовыми моделями на наборе данных CH-SIMS. Самая низкая F1-мера базовой модели на основе LSTM свидетельствует о её ограниченной способности моделировать сложные кросс-модальные эмоциональные связи. Сравнение F1-мер, полученных при использовании оцениваемых методов на наборе данных CH-SIMS, приведено на Рисунке 3. Как показано, более сложные структуры на основе графов и трансформеров обычно превосходят традиционные методы слияния. Модель LSTM показала самый низкий результат с F1-мерой 0,71, за ней следуют TFN (0,74) и LMF (0,76). Использование Adaptive-Graph позволило повысить F1-меру до 0,79, что доказывает значимость моделирования межмодальных связей. Предложенная архитектура с F1-мерой 0,82 превзошла Adaptive-Graph на 3,8%, LMF — на 7,9%, TFN — на 10,8%, а LSTM — на 15,5%. Эти результаты показывают, что предлагаемый механизм кросс-модального внимания на основе графов и обучение распутанным представлениям более эффективно извлекают взаимодополняющую эмоциональную информацию из текстовой, аудио- и визуальной модальностей, что приводит к более высокой точности классификации.

Относительные тенденции остаются неизменными, хотя все методы демонстрируют небольшое снижение F1-меры по сравнению с CH-SIMS, как показано на Рисунке 4. Результаты свидетельствуют о стабильном повышении производительности при переходе от традиционных методов слияния к стратегиям многомодального обучения на основе графов. Модели с наименьшим значением F1-меры были LSTM (0,69), TFN (0,72) и LMF (0,74). Производительность модели Adaptive-Graph увеличилась до 0,77, что демонстрирует эффективность моделирования кросс-модальных связей. Предложенный фреймворк превзошел все остальные подходы, достигнув наивысшего значения F1-меры — 0,80. Улучшение показателей по сравнению с самым сильным базовым решением Adaptive-Graph подтверждает вклад предложенного обучения распутанным представлениям эмоций и механизма кросс-модального внимания на основе графов в улавливание дополняющих друг друга эмоциональных признаков в текстовой, акустической и визуальной модальностях. Эти результаты показывают, что предложенный фреймворк для многомодального распознавания эмоций является надежным и эффективным. Предложенный подход демонстрирует значительное улучшение по сравнению как с графовым подходом, так и с традиционным методом слияния, что дополнительно подтверждает высокую обобщающую способность метода. Повышение F1-меры на наборе данных CMU-MOSEI доказывает, что предложенный подход позволяет достичь сбалансированной производительности классификации эмоций даже в зашумленных и разнообразных условиях.

Точность

В интеллектуальных коммуникационных системах точность имеет решающее значение, так как ложный эмоциональный сигнал может ухудшить пользовательский опыт. Точность (precision) определяется как отношение количества верно предсказанных случаев конкретной эмоции к общему числу случаев, которые были спрогнозированы как данная эмоция. Поскольку распутанные представления эмоций характеризуются меньшим уровнем шума и меньшей склонностью к ошибочной классификации в модальности, предлагаемая модель превосходит базовые модели на наборе данных CH-SIMS, что показано на Рисунке 5.

На Рисунке 5 представлено сравнение точности нескольких методов многомодального распознавания эмоций на наборах данных CH-SIMS и CMU-MOSEI. При переходе моделей от традиционных методов на основе слияния к более сложным архитектурам на основе графов точность неуклонно растет. Предложенная структура достигла максимальной точности 0,82 на наборе данных CH-SIMS, при этом точность увеличилась с 0,71 для LSTM до 0,74, 0,76 и 0,79 для TFN, LMF и Adaptive-Graph соответственно. На наборе данных CMU-MOSEI точность выросла с 0,69 для LSTM до 0,72, 0,74 и 0,77 для TFN, LMF и Adaptive-Graph соответственно. Предложенный подход обеспечил наивысшую точность 0,80. Предложенная структура повысила точность примерно на 3,8% для CH-SIMS и на 3,9% для CMU-MOSEI по сравнению с наиболее сильным базовым решением (Adaptive-Graph). Эти результаты показывают, что предлагаемый метод обучения распутанных представлений и механизм кросс-модального внимания на основе графов успешно снижают количество ложноположительных прогнозов за счет захвата дополняющей эмоциональной информации в текстовой, акустической и визуальной модальностях. Влияние нерелевантной модальности дополнительно нивелируется кросс-модальным вниманием на основе графов. Более широкое разнообразие говорящих и лингвистических выражений в корпусе CMU-MOSEI приводит к небольшому снижению точности для всех моделей.

Полнота выборки

В задачах распознавания эмоций полнота (recall) — показатель способности модели правильно классифицировать эмоциональные случаи, относящиеся к определенному классу, — имеет решающее значение, поскольку отсутствие эмоциональной информации может негативно повлиять на качество взаимодействия. Более высокое значение полноты указывает на то, что модель выявляет меньше ложноотрицательных результатов и больше реальных эмоциональных выражений. Полноту можно рассматривать как меру эффективности извлечения эмоциональной информации из текстовых, аудио- и визуальных модальностей в контексте мультимодального анализа эмоций.

Преимущество предлагаемого метода по сравнению с базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI показано при сравнении полноты воспроизведения (recall) на Рисунке 6. По мере эволюции моделей от традиционных методов на основе слияния к более сложным мультимодальным графовым структурам результаты последовательно демонстрируют рост полноты воспроизведения. Полнота воспроизведения на наборе данных CH-SIMS увеличилась с 0.70 для LSTM до 0.73, 0.75 и 0.78 для TFN, LMF и Adaptive-Graph соответственно; максимальное значение 0.82 было достигнуто предложенной архитектурой. Предложенный подход обеспечил наилучшую полноту воспроизведения 0.80 на наборе данных CMU-MOSEI, где этот показатель вырос с 0.68 для LSTM до 0.71, 0.73 и 0.76 для TFN, LMF и Adaptive-Graph соответственно. Предложенная архитектура обеспечила относительное улучшение примерно на 5.1% для CH-SIMS и на 5.3% для CMU-MOSEI по сравнению с наиболее сильным базовым методом (Adaptive-Graph). Эти результаты показывают, что за счет захвата взаимодополняющих эмоциональных признаков в текстовой, акустической и визуальной модальностях, предложенное обучение распутанных представлений и механизм кросс-модального внимания на основе графов успешно сокращают количество ложноотрицательных прогнозов, тем самым улучшая идентификацию классов эмоций в обоих наборах данных. Поскольку традиционные методы имеют ограниченные возможности моделирования сложных кросс-модальных взаимосвязей, они, как правило, имеют более низкие значения полноты воспроизведения. За счет более явного моделирования отношений между модальностями TFN и LMF достигают умеренного прироста. Метод Adaptive-Graph еще больше улучшил полноту воспроизведения, имитируя структурированные связи между модальностями. Для обоих наборов данных предложенный метод достигает наивысшей полноты воспроизведения, что указывает на его лучшую способность обнаруживать эмоциональные экземпляры в различных сценариях взаимодействия. Улучшение более очевидно в крупномасштабном наборе данных CMU-MOSEI, что демонстрирует робастность и обобщающую способность предложенной архитектуры.

Средняя абсолютная ошибка (MAE)

Средняя абсолютная ошибка (MAE) используется для оценки эффективности задач по прогнозированию непрерывной интенсивности эмоций, таких как прогнозирование валентности или возбуждения. В отличие от точности (accuracy), MAE лучше отражает близость предсказанной интенсивности эмоций к фактическому эмоциональному состоянию. Именно поэтому MAE более подходит для таких наборов данных, как CH-SIMS и CMU-MOSEI, которые содержат непрерывные аффективные метки. Более низкое значение MAE указывает на более высокую точность прогнозирования интенсивности эмоций.

Сравнение MAE между предлагаемой структурой и базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI показано в Таблице 4. Традиционные методы слияния на основе LSTM, как правило, имеют более высокие значения MAE из-за их ограниченной способности моделировать сложные мультимодальные эмоциональные зависимости. TFN и LMF позволяют снизить MAE за счет моделирования мультимодальных взаимодействий, а подход Adaptive-Graph дополнительно снижает этот показатель путем изучения графовых взаимосвязей модальностей. Предлагаемая структура обеспечивает наименьшее значение MAE для обоих наборов данных, что указывает на более точную оценку интенсивности эмоций. Стоит отметить, что улучшение более значительно на наборе данных CMU-MOSEI, где масштабная вариативность данных и условия дикторов делают задачу прогнозирования более сложной.

Матрица ошибок для набора данных CH-SIMS

Согласно матрицам ошибок для набора данных CH-SIMS, базовые методы раннего объединения LSTM и TFN демонстрируют значительную путаницу между классами нейтральных и положительных эмоций. Это говорит о том, что данные методы недостаточно эффективны при распознавании тонких мультимодальных эмоциональных выражений. С другой стороны, предлагаемый метод демонстрирует явное сильное доминирование по диагонали с очень небольшим количеством внедиагональных элементов, что повышает разделимость классов. Механизм распутывания обучения эмоциям в предлагаемом методе обеспечивает согласованное представление эмоций во всех модальностях, а подход к графовому объединению улучшает дифференциацию между близкими по значению классами сентимента. На рисунке 7A–E показана матрица ошибок для набора данных CH-SIMS при использовании различных базовых методов.

Матрица ошибок для набора данных CMU-MOSEI

Предложенная структура использует инвариантные к модальности эмбеддинги эмоций и адаптивные веса внимания, что позволяет значительно снизить частоту ошибочной классификации, особенно для эмоционально неоднозначных входных данных. Это подтверждает эффективность предложенной структуры в различных сценариях крупномасштабного мультимодального взаимодействия. Из-за объема набора данных, вариативности говорящих и непрерывного характера меток сентимента матрицы ошибок для CMU-MOSEI демонстрируют более высокий общий уровень ошибочной классификации. Базовые методы демонстрируют значительную степень смешения различных категорий эмоций. На рисунке 8A–E показана матрица ошибок для набора данных CMU-MOSEI при использовании различных базовых методов.

Время обучения за одну эпоху

Вычислительные компромиссы передовых методов мультимодального слияния подчеркиваются сравнением времени обучения за эпоху. Из-за использования трансформерных кодировщиков и механизмов графового внимания предлагаемая модель требует немного больше времени обучения, чем простые подходы к слиянию, однако это увеличение является допустимым. Предложенная структура продемонстрировала высокую эффективность на эталонных наборах данных для мультимодального анализа эмоций и показала потенциал для интеграции в интеллектуальные системы человеко-машинного взаимодействия. Тем не менее, пригодность для развертывания в режиме реального времени в данном исследовании не оценивалась и требует дальнейшего изучения путем анализа задержки, пропускной способности, памяти и способов развертывания. Примечательно, что улучшенная стабильность сходимости, а также превосходные показатели предсказательной способности и интерпретируемости делают дополнительные вычислительные затраты оправданными. На рисунке 9 показаны результаты времени обучения за эпоху для предлагаемого метода.

Абляционное исследование

Для определения влияния каждого важного элемента предложенной структуры, такого как модуль визуального отображения, кросс-модальное слияние на основе графов и распутанное представление эмоций, было проведено исследование по абляции. Чтобы понять степень влияния, каждый элемент удалялся поочередно. Согласно результатам экспериментов, стратегия слияния на основе графов улучшает моделирование кросс-модальных зависимостей, а вклад распутанного представления эмоций является наиболее значимым для стабильности работы. Вспомогательная роль модуля визуального отображения подтверждается незначительным влиянием его удаления на производительность. Результаты исследования по абляции при одинаковых условиях обучения и оценки представлены в Таблице 5. Наибольшее снижение производительности наблюдалось после удаления модуля кросс-модального внимания на основе графов, что привело к снижению точности с 81.72% до 77.88% и F1-меры с 0.823 до 0.776. Это подчеркивает важность моделирования сложных межмодальных взаимодействий. Роль модуля обучения распутанным представлениям в формировании устойчивых специфических для эмоций представлений была продемонстрирована тем, что его удаление снизило точность на 2.78 процентных пункта, а F1-меру — на 0.032. Главным преимуществом модуля визуального отображения является интерпретируемость, а не точность классификации, о чем свидетельствует несколько меньшее снижение качества прогнозирования при его удалении. Конфигурация Basic Fusion показала наихудшие результаты, что доказывает: для достижения наилучшей производительности мультимодального распознавания эмоций требуется комбинированное воздействие всех предложенных модулей.

ДОСТУПНОСТЬ ДАННЫХ:

Наборы данных, использованные в данном исследовании, являются общедоступными эталонными наборами данных. Набор данных CMU-MOSEI предоставлен Multimodal SDK Университета Карнеги-Меллона и описан в работе Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), доступ к нему открыт по адресу https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. Набор данных CH-SIMS описан в работе Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) и общедоступен через ресурсы, предоставленные авторами, включая https://github.com/thuiar/MMSA. Все эксперименты проводились с использованием официальных версий этих наборов данных. Необработанные извлеченные данные, файлы обработанных данных, результаты предварительной обработки, разделения на обучающую/валидационную/тестовую выборки, производные представления признаков и детали реализации, подтверждающие выводы данного исследования, общедоступны в репозитории Zenodo по адресу https://doi.org/10.5281/zenodo.21124921.

figure-results-1
Рисунок 1: Схематическая диаграмма предлагаемой структуры визуального отображения признаков мультимодальных эмоций.Концептуальная иллюстрация общей архитектуры, демонстрирующая компоненты извлечения мультимодальных признаков, обучения распутанным представлениям, слияния кросс-модального внимания на основе графов и визуального отображения для интерпретируемого мультимодального анализа эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Схематическая диаграмма рабочего процесса предлагаемого вычислительного протокола.
Концептуальное представление сквозного конвейера обработки, включающего этапы сбора набора данных, предварительной обработки, извлечения признаков для каждой модальности, мультимодального слияния, визуализации и прогнозирования эмоций Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-3
Рисунок 3: Сравнение показателей F1-меры на наборе данных CH-SIMS. Средние значения F1-меры, полученные в результате пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений случайных чисел. Планки погрешностей представляют ±± одно стандартное отклонение (SD). Более высокие значения F1-меры указывают на лучшую эффективность классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 4: Сравнение показателей F1-score на наборе данных CMU-MOSEI. Средние значения F1-score, полученные в результате пяти независимых экспериментальных прогонов (n = 5) с использованием различных случайных начальных значений (seed). Планки погрешностей соответствуют ±± одному стандартному отклонению (SD), а соответствующие значения mean ±± SD указаны над каждой точкой данных. Более высокие значения F1-score указывают на более высокую эффективность классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-5
Рисунок 5: Сравнение точности на наборах данных CH-SIMS и CMU-MOSEI. Средние показатели точности, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемой структуры в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей представляют ±± одно стандартное отклонение (SD), рассчитанное по повторяющимся запускам с различными начальными значениями случайных чисел. Предлагаемая структура достигает наивысшей точности на обоих наборах данных, демонстрируя улучшенную дискриминацию классов эмоций за счет эффективного обучения мультимодальным признакам и кросс-модального слияния на основе графов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6: Сравнение полноты (recall) на наборах данных CH-SIMS и CMU-MOSEI. Средние показатели полноты, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемого фреймворка в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей указывают ±± одно стандартное отклонение (SD), рассчитанное по результатам повторных экспериментов. Предлагаемый фреймворк стабильно достигает наивысшей полноты на обоих наборах данных, что свидетельствует о превосходной способности улавливать мультимодальную эмоциональную информацию и сокращать количество ложноотрицательных прогнозов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-7
Рисунок 7: Матрица ошибок для набора данных CH-SIMS с использованием различных базовых методов. Строки соответствуют истинным классам эмоций, а столбцы — предсказанным классам. Значения в ячейках представляют процент образцов, нормализованный относительно каждого истинного класса. Матрица ошибок была рассчитана с использованием отдельного тестового раздела CH-SIMS. Более высокие значения процентов по диагонали указывают на более высокую точность распознавания для соответствующей категории эмоций. Матрицы ошибок для (A) LSTM с ранним слиянием, (B) TFN, (C) LMF, (D) адаптивного графа и (E) предлагаемого метода на наборе данных CH-SIMS. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-8
Рисунок 8: Матрица ошибок для набора данных CMU-MOSEI с использованием различных базовых методов. Строки соответствуют фактическим меткам эмоций, а столбцы — предсказанным меткам. Значения представлены в виде нормализованных по классу процентов на тестовом наборе CMU-MOSEI. Матрица иллюстрирует как правильно классифицированные образцы (диагональные элементы), так и ошибки классификации между категориями эмоций (внедиагональные элементы). Матрица ошибок на CMU-MOSEI (A) LSTM с ранним слиянием, (B) TFN, (C) LMF, (D) адаптивный граф и (E) предлагаемый метод на наборе данных CMU-MOSEI. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-9
Рисунок 9. Сравнение времени обучения за одну эпоху на эталонных мультимодальных наборах данных эмоций.
Среднее время обучения за эпоху, полученное в результате пяти независимых экспериментальных запусков (n = 5) для наборов данных CH-SIMS и CMU-MOSEI при идентичных аппаратных и программных настройках. Планки погрешностей представляют ±± одно стандартное отклонение (SD), рассчитанное на основе повторных экспериментов с использованием различных начальных значений случайных чисел. Более низкие значения указывают на более высокую вычислительную эффективность, в то время как стабильное время обучения между запусками свидетельствует о повышенной воспроизводимости и согласованности обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Набор данныхМетодыКоличество образцовЯзыкМетки эмоций/тональности
CH-SIMS34Видео, Аудио, Текст2 281 видеосегментаКитайский языкМультимодальные и унимодальные метки эмоциональной окраски (отрицательная, нейтральная, положительная)
CMU-MOSEI35Видео, Аудио, Текст~23 453 аннотированных клипаАнглийскийМетки эмоционального настроя и интенсивности эмоций (непрерывные и категориальные)

Таблица 1: Описание наборов данных. Сводка наборов данных, использованных в данном исследовании, модальностей, количества образцов, языка, меток эмоций/тональности для наборов данных CH-SIMS и CMU-MOSEI.

КомпонентСпецификация
Программный каркасPython с PyTorch
Экстрактор визуальных признаковVision Transformer (ViT)
Экстрактор аудиопризнаковWav2Vec 2.0
Экстрактор текстовых признаковRoBERTa
Стратегия объединенияГрафовая кросс-модальная сеть внимания
Размерность признаков768 на одну модальность
Оптимизатор обученияAdam
Скорость обучения1.00E-04
Размер пакета16
ОборудованиеNVIDIA GPU (например, серия RTX)
Наборы данных для оценкиCH-SIMS, CMU-MOSEI
Латентная размерность2.56E+02
Размерность эмбеддинга768
Функция активацииReLU
ОптимизаторAdam
Скорость обучения1.00E-04
Размер пакета32
Эпохи100
Ранняя остановкаВключена
Функция потерьКлассификация + Реконструкция + Согласованность

Таблица 2: Среда моделирования. Экспериментальная установка и детали реализации среды моделирования, такие как особенности модели, признаки, оптимизатор и используемое оборудование.

МетодТочность CH-SIMS (%)Точность CMU-MOSEI (%)
LSTM (раннее/позднее слияние)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
Предлагаемый метод81.72 ± 0.6179.94 ± 0.69

Таблица 3: Оценка точности предлагаемого метода в сравнении с базовыми методами на наборах данных CH-SIMS и CMU-MOSEI. Результаты представлены как среднее значение ±± стандартное отклонение, полученные в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений случайного зерна. Все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных для обеспечения справедливого сравнения.

МетодCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (раннее/позднее слияние)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
Предлагаемый метод0.298 ± 0.0070.341 ± 0.008

Таблица 4: Результат средней абсолютной ошибкиРезультаты представлены как среднее значение ±± стандартное отклонение получены из пять независимых экспериментальных повторов (n = 5) с использованием различных начальных значений случайных чисел. Все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных для обеспечения объективности сравнения. Сравнение MAE для непрерывного прогнозирования интенсивности эмоций с использованием предлагаемой структуры и базовых подходов на обоих наборах данных.

Вариант моделиТочность (%)F1-мера
Полная модель81.72 ± 0.610.823 ± 0.008
Без распутывания (disentanglement)78.94 ± 0.740.791 ± 0.010
Без слияния графов77.88 ± 0.810.776 ± 0.011
Без визуального отображения80.11 ± 0.660.807 ± 0.009
Базовое слияние74.91 ± 0.980.742 ± 0.013

Таблица 5: Результаты исследования абляции с базовыми методами. Результаты представлены как среднее значение ±± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных случайных начальных значений. Все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных для обеспечения справедливого сравнения. Сравнение производительности вариантов моделей, указывающее на эффективность обучения на основе распутанных представлений, графового слияния и модуля визуального картирования.

Дополнительный файл 1: Алгоритм 1 и Алгоритм 2.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальные результаты показывают, что на наборах данных CH-SIMS и CMU-MOSEI предложенная структура визуального сопоставления для мультимодальных характеристик эмоций превосходит современные методы распознавания мультимодальных эмоций. По сравнению с моделями раннего и позднего объединения, такими как EF-LSTM и TFN, предложенный метод обеспечивает более высокую точность и значения F1-меры, что демонстрирует его устойчивость при обработке разнообразной эмоциональной информации. Улучшение метода можно объяснить распутанным представлением эмоций, которое подавляет шум, специфичный для конкретной модальности, и обеспечивает согласованность эмоций между визуальной, аудио- и текстовой модальностями36.

В последнее время мультимодальные модели на основе трансформеров, такие как Adaptive Multimodal Transformers37 и MIAR38, демонстрируют впечатляющие результаты в моделировании кросс-модальных зависимостей. Тем не менее, эти модели ориентированы преимущественно на прогнозирование и не имеют механизмов, поддерживающих интерпретируемость на уровне признаков. Напротив, предлагаемая система сочетает в себе кросс-модальное внимание на основе графов с модулем визуального отображения, что позволяет проводить прозрачный анализ взаимодействий между модальностями и эмоциями. Это критически важный аспект, который в настоящее время отсутствует в литературе, где вывод об эмоциональном состоянии рассматривается как процесс «черного ящика».

Предложенная структура продемонстрировала стабильные результаты на эталонных наборах данных CH-SIMS и CMU-MOSEI. Несмотря на то что данная структура может найти применение в интеллектуальном человеко-машинном взаимодействии, мониторинге состояния здоровья, адаптивных средах обучения и других системах, учитывающих эмоциональное состояние, в настоящем исследовании метод оценивался только в контролируемых условиях бенчмаркинга. Внедрение в реальных условиях, оценка пользовательского интерфейса, исследование юзабилити или оценка с участием людей не проводились. Следовательно, практическая эффективность структуры в рабочих средах требует дальнейшего изучения. Будущая работа будет сосредоточена на оценках, ориентированных на развертывание, исследованиях с участием пользователей, анализе задержек, оценке потребления памяти и производительности взаимодействия в режиме реального времени.

Более того, повышение эффективности на различных культурно и лингвистически разнообразных наборах данных подтверждает валидность предложенного фреймворка. В отличие от предыдущих работ, прошедших валидацию на одном наборе данных или в конкретном сценарии взаимодействия, предложенный фреймворк демонстрирует стабильную производительность независимо от языка, говорящего и эмоционального выражения. Таким образом, предложенный фреймворк весьма подходит для практических интеллектуальных систем взаимодействия, требующих точного распознавания эмоций и интерпретируемого принятия решений.

Интерпретируемость предложенной структуры была оценена с помощью анализа изученных мультимодальных представлений на основе визуализации. В частности, для получения представления о процессе принятия решений моделью и вкладе каждой модальности были изучены латентные эмбеддинги эмоций, карты кросс-модального внимания, графы взаимодействия модальностей и временные траектории эмоций. Целью модуля визуального картирования является повышение прозрачности путем обеспечения возможности наблюдения за взаимодействиями на уровне признаков и эмоциональной динамикой. Однако формальные метрики интерпретируемости, оценка достоверности внимания и пользовательские исследования в данную работу не были включены. Следовательно, сообщаемые преимущества интерпретируемости следует рассматривать как доказательства на основе визуализации, а не как количественно подтвержденные показатели объяснимости.

С теоретической точки зрения данное исследование вносит следующий вклад в область мультимодальных аффективных вычислений: в нем предлагается систематический способ моделирования эмоций, который четко разграничивает представления, специфичные для конкретной эмоции, и представления, специфичные для конкретной модальности. Обеспечивая эмоциональную согласованность между модальностями в общем латентном пространстве, предложенная структура развивает теорию обучения представлениям в мультимодальных системах. Внедрение механизмов внимания на основе графов дополнительно формализует зависимости между различными модальностями при выражении эмоций.

С практической точки зрения предлагаемая структура весьма полезна для проектирования интеллектуального взаимодействия и пользовательских интерфейсов, учитывающих эмоциональное состояние. Модуль визуального сопоставления в данной структуре позволяет разработчикам систем понять влияние различных модальностей на прогнозирование эмоций, что имеет большое значение для проектирования систем. Предложенная структура будет очень полезна для таких приложений, как аффективные разговорные агенты, адаптивные системы обучения, интерфейсы мониторинга состояния здоровья и платформы оценки пользовательского опыта.

Тем не менее, предложенная структура имеет ряд ограничений. Использование механизмов внимания в графах и трансформерных энкодеров увеличивает сложность, что может быть проблематичным для устройств с ограниченными возможностями. Кроме того, в текущем исследовании игнорируются другие физиологические сигналы, такие как ЭЭГ и айтрекинг, в пользу сосредоточения внимания на визуальных, аудио- и текстовых модальностях. Вычислительная эффективность предложенной структуры для развертывания в режиме реального времени не оценивалась специально, несмотря на то, что она продемонстрировала конкурентоспособную точность прогнозирования и улучшенные возможности визуализации. В будущих исследованиях будут изучены производительность развертывания в реальных контекстах интеллектуального взаимодействия, задержка вывода, пропускная способность, потребление памяти и методы сжатия моделей. Для дальнейшего повышения точности моделирования эмоций и скорости отклика взаимодействия будущие исследования будут сосредоточены на разработке облегченных моделей, методах оптимизации в режиме реального времени и включении дополнительных модальностей. Производительность развертывания в режиме реального времени не оценивалась, а включение трансформерных энкодеров и методов внимания на основе графов повышает вычислительную сложность. Для валидации методологии использовались только эталонные наборы данных CH-SIMS и CMU-MOSEI, что может привести к смещениям, специфичным для конкретного набора данных, и ограничить обобщаемость на другие области, языки и группы пользователей. Кроме того, текущее исследование не включает физиологические сигналы, такие как данные ЭЭГ или айтрекинга; вместо этого оно концентрируется на визуальных, аудио- и текстовых модальностях. Хотя подробные описания реализации и среды симуляции повысили воспроизводимость, исходный код и предобученные модели в настоящее время не находятся в открытом доступе.

В данной работе используется новая платформа визуального картирования для многомодального обучения признакам эмоций в целях проектирования интеллектуального взаимодействия. Предложенный метод объединяет сквозное обучение представлениям на основе трансформеров, распутанное моделирование эмоций и кросс-модальное внимание на основе графов для достижения высокой точности прогнозирования и интерпретируемости. Эксперименты на наборах данных CH-SIMS и CMU-MOSEI показывают, что предлагаемая платформа превосходит современные многомодальные модели распознавания эмоций по точности и F1-мере. Что более важно, предложенное решение по визуальному картированию устраняет разрыв между распознаванием эмоций и стратегией взаимодействия, открывая новое направление для разработки интерпретируемых многомодальных систем аффективных вычислений, учитывающих особенности взаимодействия.

Для обеспечения интерпретируемого и интеллектуального дизайна взаимодействия в данном исследовании представлена новая платформа визуального картирования для изучения мультимодальных признаков эмоций. Предложенная система успешно объединяет детектирование эмоций и интерпретируемость в рамках единой архитектуры, сочетая извлечение мультимодальных признаков на основе трансформеров, обучение распутанному представлению эмоций, слияние кросс-модального внимания на основе графов и методы визуального картирования. Помимо предоставления четких визуальных представлений вклада каждой модальности, кросс-модальных взаимодействий и временной динамики эмоций, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала улучшение производительности по сравнению с репрезентативными базовыми методами по нескольким метрикам, включая Accuracy, Precision, Recall, F1-score и Mean Absolute Error (MAE). Однако данное исследование ограничено оценкой на двух эталонных наборах данных и не включает исследования по внедрению в реальных условиях, пользователько-ориентированные оценки, количественные анализы объяснимости, а также интеграцию физиологических модальностей. Кроме того, в условиях ограниченных ресурсов могут возникнуть трудности из-за вычислительной сложности трансформерных энкодеров и процессов внимания на основе графов. Несмотря на то, что будущие работы будут сосредоточены на более обширной валидации на различных наборах данных, интеграции дополнительных модальностей, исследованиях удобства использования, выпуске воспроизводимых ресурсов и оптимизации для сценариев развертывания в реальном времени, предлагаемая платформа в целом демонстрирует потенциал интерпретируемого мультимодального анализа эмоций для аффективных вычислений и приложений интеллектуального взаимодействия.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не имеют конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность за поддержку, оказанную Школой жилья, строительства и планирования Университета Sains Malaysia (Пенанг, Малайзия) и Школой дизайна и искусства Чаншаского университета естественных наук & Технологии, Чанша, Китай. Авторы также выражают благодарность Академии искусств и дизайна города Сямынь Университета Фучжоу, Сямынь, Китай, за академическую и исследовательскую поддержку на протяжении всей данной работы.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
АдамБиблиотека оптимизаторов PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Скорость обучения = 1 × 10-4)Оптимизация параметров при обучении модели
CH-SIMSРепозиторий исходного набора данныхПоследний публичный выпускЭталонный набор данных для китайского мультимодального анализа сентимента/эмоций
CMU-MOSEIРепозиторий CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (последний публичный релиз)Эталонный набор данных для мультимодального распознавания настроений и эмоций
Дистиллированный энкодер эмоцийИндивидуальная реализацияАрхитектура с двойным кодировщиком (Dual Encoder Architecture)Разделение специфичных для эмоций и специфичных для модальности латентных представлений
Графовая сеть внимания (GAT)PyTorch GeometricМногоголовый GAT (https://pytorch-geometric.readthedocs.io/en/latest/)Моделирование кросс-модальных эмоциональных связей и адаптивное слияние признаков
Слой кросс-модального внимания на основе графовИндивидуальная реализацияСлияние с механизмом многоголового вниманияИзучение детальных эмоциональных зависимостей между модальностями
MatplotlibПроект Matplotlib3.7+Построение графиков и визуальная аналитика
NetworkXПроект NetworkX3.0+Построение и визуализация графов кросс-модального взаимодействия
GPU NVIDIANVIDIA CorporationGPU с поддержкой CUDAУскорение обучения трансформеров и графовых нейронных сетей
Метод главных компонент (МГК)Scikit-learnsklearn.decomposition.PCAПервичное снижение размерности многомерных эмбеддингов эмоций
PythonPython Software Foundation3.8+Основной язык программирования для реализации среды мультимодального анализа эмоций
PyTorchPyTorch Foundation2.0+Разработка, обучение и оптимизация глубоких нейронных сетей
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, эмбеддинги размерности 768)Извлечение контекстуальных лингвистических и семантических представлений эмоций
SeabornПроект Seaborn0.12+Построение карт внимания и статистическая визуализация
t-распределенное стохастическое вложение соседей (t-SNE)Scikit-learn
scikit-learn.org (перплексия = 30, количество итераций = 1000)
Визуализация латентных кластеров и траекторий эмоций
Ubuntu LinuxCanonical Ubuntu20.04 LTS или более поздняя версияСреда проведения эксперимента
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, эмбеддинги размерности 768Извлечение визуальных представлений из видеокадров с учетом эмоционального состояния
Wav2Vec 2.0Исследовательский центр Meta AIБазовая модель, 768-мерные эмбеддингиИзвлечение контекстных акустических признаков и признаков эмоциональной окраски речи

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи