Исследовательская статья

Визуальное картирование признаков мультимодальных эмоций для проектирования интеллектуального взаимодействия

96 просмотров

DOI:

10.3791/71171

21 августа 2026 г.

В этой статье

Краткое содержание

В данной работе предлагается комплексная многомодальная структура анализа эмоций, использующая трансформерные кодировщики, распутанные представления эмоций и основанный на графах кросс-модальный механизм внимания с визуальным отображением для повышения точности распознавания эмоций на двух наборах данных.

Аннотация

Визуальное картирование мультимодальных признаков эмоций имеет решающее значение для проектирования интеллектуальных интерфейсов, позволяя машинам понимать, интерпретировать и реагировать на аффективные состояния человека. Тем не менее, современные алгоритмы мультимодального распознавания эмоций сосредоточены преимущественно на прогнозной эффективности, предоставляя мало данных об интерпретируемости, осведомленности о взаимодействии или кросс-модальных взаимодействиях на уровне признаков. В данной работе представлена платформа для визуального картирования аспектов мультимодальных эмоций, которая объединяет ориентированную на взаимодействие визуализацию, интерпретируемое обучение представлениям и прогнозирование эмоций. Для извлечения высокоуровневых эмбеддингов эмоций из текстовой, аудио- и визуальной модальностей без использования созданных вручную признаков применялись энкодеры на базе трансформеров. Для повышения робастности специфическая для эмоций и специфическая для модальности информация была разделена с помощью метода распутывания представлений (disentangled representation learning). Кроме того, была создана кросс-модальная сеть внимания на основе графов, использующая адаптивное взвешивание внимания для имитации тонких эмоциональных связей между модальностями. Для повышения прозрачности был разработан модуль многопроекционного визуального картирования, отображающий временные траектории эмоций, распределения кросс-модального внимания и латентные эмбеддинги эмоций. Для оценки предложенной платформы использовались набор данных Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) и китайский набор данных для мультимодального анализа сентимента (CH-SIMS). Согласно результатам экспериментов, предложенная платформа обеспечила улучшенную интерпретируемость на уровне признаков и визуализацию с учетом взаимодействия, при этом стабильно превосходя репрезентативные базовые методы по точности, F1-мере, корреляции и средней абсолютной ошибке. Кроме того, модуль визуального картирования облегчил качественную интерпретацию мультимодальных представлений эмоций, кросс-модальных взаимодействий и временной динамики эмоций, поддерживая визуализацию и анализ с учетом взаимодействия.

Введение

Способность правильно идентифицировать и понимать человеческие эмоции стала крайне важной для улучшения взаимодействия между человеком и машиной. Помимо того, что анализ эмоций необходим для совершенствования человеко-компьютерного взаимодействия, он обладает потенциалом революционизировать ряд областей, включая предварительную медицинскую диагностику1, поведенческий анализ в учебных классах2, психологическое наблюдение за пациентами3, определение усталости водителей в транспортных средствах4 и интеллектуальное управление в системах «умный дом»5. Последние достижения в области аффективных вычислений и глубокого обучения6 усилили интерес к созданию систем реального времени, способных запечатлеть всю сложность человеческих эмоций.

Многие современные методы опираются преимущественно на унимодальные данные, такие как текстовые, графические или слуховые сигналы7,8,9. Такие подходы неоднократно оказывались неспособными распознать тонкие сигналы, например, сарказм или контекстуальные нюансы. В связи с этим исследования перешли к мультимодальной оценке эмоций, которая объединяет дополняющие друг друга данные из нескольких источников для преодоления этих ограничений10,11,12. Преимущества слияния нескольких модальностей были продемонстрированы на базовых моделях, таких как долгосрочная краткосрочная память с ранним слиянием (EF-LSTM)13, облегченные и FM глубокие нейронные сети (LF-DNN)14, тензорные сети слияния (TFN) и подходы к мультимодальному слиянию с низким рангом. Однако большинство этих методов опираются на офлайн-генерацию признаков и не подходят для динамических ситуаций в реальном мире.

С целью учета эмоциональных состояний за последние десять лет значительно развились исследования и приложения в области мультимодального распознавания эмоций15. Одной из наиболее сложных и значимых областей современных исследований является непрерывный мониторинг эмоциональных состояний с использованием различных источников данных16. Концепция мультимодальности возникла естественным образом с появлением столь разнообразных систем знаний, что привело к многим достижениям в применении анализа эмоций в таких областях, как аффективные вычисления, человеко-компьютерное взаимодействие (HCI), обучение, видеоигры, обслуживание клиентов, медицинский уход, оценка пользовательского опыта (UX) и т. д. Тем не менее, применение методов распознавания эмоций при оценке UX не всегда было простым процессом.

Одной из основных причин сосредоточиться на мультимодальном распознавании, а не на унимодальных методах, являются неотъемлемые недостатки использования единственного источника информации. Системы унимодального детектирования эмоций могут иметь более низкую точность из-за отсутствующих или нечетких данных, тогда как схемы MER более надежны и обеспечивают более всестороннее и глубокое понимание экспрессивных состояний за счет интеграции нескольких источников данных17. Например, одного только языка мимики может быть недостаточно для точной классификации чувств, особенно когда жесты сложны или неясны. Однако сочетание мимики с другими формами коммуникации, такими как речь или физические сигналы, может повысить точность распознавания чувств.

Обширные исследования в области распознавания эмоций проводились с использованием нескольких модальностей. Ранние работы были сосредоточены на выявлении отличительных признаков из различных модальностей, таких как графические, акустические или текстовые данные. Однако становится все более очевидным, что интеграция различных модальностей может обеспечить сбалансированную эмоциональную информацию, что ведет к более надежному и точному определению тональности. В данном разделе рассматриваются ключевые достижения в одномодальном и мультимодальном анализе эмоций с упором на базовые подходы, их недостатки и обоснование нашего метода.

Первоначальные исследования по распознаванию эмоций были сосредоточены преимущественно на одной модальности. В визуальной области новаторские исследования привели к категоризации прототипных мимических движений20. Последующие достижения включали методы захвата временной динамики, такие как анализ визуального движения21 и скрытые марковские модели22, в то время как лицевые реакции были разделены на единицы действия с помощью системы кодирования лицевых движений (FACS)23. LSTM и сверточные нейронные сети (CNN) успешно применялись для извлечения значимых признаков непосредственно из необработанных аудиосигналов; методологии идентификации эмоций на основе аудио эволюционировали от традиционной обработки сигналов до глубокого обучения24. Извлечение контекстуальных эмоциональных сигналов в текстовом анализе эмоций было значительно улучшено за счет рекуррентных нейронных сетей (RNN), включающих механизмы внимания, а в последнее время — за счет моделей на базе трансформеров. Несмотря на достигнутые успехи, унимодальные методы по своей сути неспособны точно отобразить всю сложность человеческих переживаний, так как в них отсутствует дополнительная информация, содержащаяся в других модальностях.

В 2021 году были предложены некоторые модели на основе механизмов внимания, такие как модель DialogXL25, предназначенные для сбора долгосрочных контекстных данных в области идентификации тональности диалогов. Kim и соавт.26 представили модель EmoBERTa в 2021 году для повышения точности ERC. Эта модель использует данные о говорящих для улучшения характеристик участников разговоров и их взаимодействия друг с другом. В 2022 году Li и соавт.27 представили метод CoG-BART. В данной структуре используется контролируемое контрастивное обучение для повышения способности модели интерпретировать релевантные данные. Следует отметить, что контролируемое обучение требует значительного объема размеченных данных.

Типичным примером такой работы является фреймворк Multimodal Interaction-Aware Representation (MIAR)28, в котором используются токены взаимодействия признаков и контрастивное выравнивание для улучшения обобщения между модальностями. MIAR улучшает выравнивание модальностей и демонстрирует высокую эффективность на нескольких наборах данных; однако он сосредоточен главным образом на точности прогнозирования, не затрагивая вопрос визуального отображения. Аналогично, модель Cross-Attentional Audio-Visual Fusion29 эффективно фиксирует детализированные аудиовизуальные взаимодействия для прогнозирования валентности и активации, но ограничена двумя модальностями и не обладает возможностями визуализации. Подходы к темпоральному моделированию на основе сетей LSTM и слияния автоэнкодеров успешно улавливают временную динамику эмоций, однако дают ограниченное представление о взаимодействиях модальностей и изученных эмоциональных представлениях. В последнее время методы на основе трансформеров, такие как Transformer-based Multimodal Fusion Network (TMFN)30, продемонстрировали высокую эффективность на наборах данных CMU-MOSI и CMU-MOSEI благодаря улучшенному мультимодальному слиянию и контрастивному обучению. Тем не менее, эти подходы остаются преимущественно ориентированными на производительность и предоставляют ограниченную поддержку интерпретируемости, анализа на уровне признаков и визуализации, ориентированной на взаимодействие.

Для улучшения интеграции текстовых, акустических и визуальных данных было предложено несколько методов мультимодального распознавания эмоций. Несмотря на то, что методы раннего слияния, такие как EF-LSTM и LF-DNN, не позволяли фиксировать сложные кросс-модальные взаимодействия, они продемонстрировали преимущества использования мультимодальной информации для анализа настроений и эмоций. Хотя модель TFN повысила эффективность на эталонных наборах данных, таких как CMU-MOSI и CMU-MOSEI, и ввела явное моделирование интермодальных взаимодействий, ее ограниченная интерпретируемость и высокая вычислительная сложность препятствовали ее практическому применению. Для улучшения выравнивания модальностей и динамического слияния признаков в более современных методах, таких как MIAR, моделях слияния на основе перекрестного внимания (cross-attentional fusion), TMFN и адаптивных мультимодальных трансформерах, стали использоваться топологии трансформеров и механизмы внимания. Эти методы были сосредоточены преимущественно на прогностической способности, предоставляя мало сведений о представлениях эмоций на уровне признаков и кросс-модальных зависимостях, несмотря на достижение конкурентоспособных результатов по общепринятым метрикам оценки, таким как точность (accuracy), F1-мера (F1-score) и средняя абсолютная ошибка (mean absolute error). Кроме того, лишь в немногих исследованиях были разработаны методы визуализации, способные раскрыть латентные эмбеддинги эмоций, распределение внимания и временную динамику эмоций, или была интегрирована модель интермодальных взаимодействий на основе графов. Предлагаемый подход включает многовидовое визуальное отображение, слияние кросс-модального внимания на основе графов и обучение распутанным представлениям (disentangled representation learning) для преодоления этих недостатков и повышения эффективности мультимодального распознавания эмоций.

Аналогичным образом, в Adaptive Multimodal Transformer32 предлагается объединение на основе обмена для адаптивного смягчения влияния зашумленной или недостающей модальной информации, что повышает эффективность классификации тональности. Хотя этот подход позволяет эффективно устранить расхождения в распределении модальной информации, его архитектура специфична для задачи анализа тональности и дает ограниченное представление об изученных эмоциональных репрезентациях. Другим значимым вкладом является Multimodal Fusion Model33, которая объединяет CNN, мультипликативные LSTM и внимание на базе трансформеров для распознавания мультимодальных эмоций в режиме реального времени. Модель выполняет полное слияние видео-, аудио- и текстовых модальностей и демонстрирует высокую стабильность распознавания. Тем не менее, как и другие существующие модели, она ориентирована преимущественно на точность прогнозирования и не имеет явных признаков для визуализации и интерпретируемости, ориентированной на взаимодействие.

В заключение следует отметить, что, хотя современные подходы к мультимодальному распознаванию эмоций достигли значительных успехов в улавливании кросс-модальных взаимодействий и повышении точности прогнозирования, большинство из них сосредоточено на задачах, ориентированных на распознавание. Мало внимания уделялось таким областям, как интерпретируемость на уровне признаков, визуализация эмоциональных представлений в пространстве изображений и внедрение предлагаемой структуры для проектирования интеллектуального взаимодействия. Именно с учетом этих проблем предлагается данная структура.

Большинство современных методов сосредоточены прежде всего на повышении прогностической точности, предлагая при этом слабую интерпретируемость выученных эмоциональных представлений и кросс-модальных взаимодействий, несмотря на значительные успехи в области мультимодального распознавания эмоций28,29. Сложные взаимодействия между текстовой, акустической и визуальной модальностями зачастую трудно моделировать с помощью текущих стратегий слияния, особенно при наличии расхождений между модальностями и нехватки информации 28,31. Хотя архитектуры на основе трансформеров и механизмы внимания улучшили обучение представлениям, их прозрачность и интерпретируемость часто снижаются из-за отсутствия явного разделения информации, специфичной для эмоций, и информации, специфичной для модальностей31,32,33. Кроме того, лишь в небольшом количестве исследований изучалось графовое моделирование интермодальных взаимодействий или создавались системы визуализации, способные раскрыть временную динамику эмоций, распределение внимания и эмбеддинги эмоций. Эти недостатки демонстрируют необходимость в интерпретируемой мультимодальной структуре для интеллектуального человеко-машинного взаимодействия, которая сочетала бы в себе ориентированное на взаимодействие визуальное картирование с эффективным кросс-модальным обучением.

В данной работе представлена интерпретируемая структура для визуального картирования мультимодальных аспектов эмоций при проектировании интеллектуальных интерфейсов. Система использует сквозное глубокое обучение для извлечения высокоуровневых эмоциональных представлений из текстовых, аудио- и визуальных модальностей без необходимости создания признаков вручную. Кросс-модальные эмоциональные взаимодействия моделируются с помощью механизма слияния на основе графового внимания, который разделяет специфичную для эмоций и специфичную для модальности информацию, что обеспечивает распутывающее обучение представлениям и повышает интерпретируемость и устойчивость. Кроме того, создан модуль многоракурсной визуализации для отображения временной динамики эмоций, паттернов кросс-модального внимания и эмбеддингов эмоций. Эффективность и применимость предложенной структуры в интеллектуальных системах взаимодействия человека и машины оцениваются путем валидации на эталонных наборах данных для мультимодального распознавания эмоций.

Данная работа предлагает уникальную структуру для визуального картирования мультимодальных аспектов эмоций, которая выходит за рамки традиционных подходов, ориентированных на прогнозирование, чтобы преодолеть недостатки моделирования кросс-модальных взаимодействий и ограниченную интерпретируемость в современных системах идентификации мультимодальных эмоций. В рамках единой архитектуры предлагаемый подход объединяет мультимодальное обучение представлениям на основе трансформеров, распутанное моделирование признаков с учетом эмоций, слияние кросс-модального внимания на основе графов и визуализацию, ориентированную на взаимодействие. В отличие от существующих подходов, которые в основном сосредоточены на показателях классификации, данная структура четко разделяет специфичные для эмоций и специфичные для модальностей представления для повышения интерпретируемости, робастности и кросс-модальной согласованности. Кроме того, представлен механизм внимания на основе графов, который позволяет осуществлять адаптивное моделирование интермодальных взаимодействий путем захвата детальной эмоциональной взаимозависимости между текстовой, аудио- и визуальной модальностями. Для повышения прозрачности создан модуль многоракурсного визуального картирования, раскрывающий временные траектории эмоций, паттерны кросс-модального внимания и латентные эмбеддинги эмоций, что дает интуитивное понимание процесса принятия решений моделью. Помимо обеспечения улучшенной визуализации и интерпретируемости мультимодальной эмоциональной динамики, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала конкурентоспособные результаты с точки зрения точности, F1-меры, средней абсолютной ошибки и корреляции.

Протокол

Предлагаемая работа направлена на совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального отображения мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с правилами использования, стандартами исследований и условиями лицензирования, установленными их создателями. Мультимодальный контент наборов данных, включая текстовые, аудио- и видеоданные, был первоначально собран и аннотирован поставщиками данных в соответствии с полученными разрешениями участников и протоколами сбора данных. В данном исследовании не предусматривалось прямого взаимодействия с людьми, набора новых участников или сбора персональных данных. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не потребовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование было проведено в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этическими процедурами исследования и применимыми политиками использования данных.

Для изучения характеристик эмоций в различных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Компонент многопроекционного визуального отображения используется для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени, а его эффективность оценивается для распознавания эмоций. Результаты показывают, что предлагаемый метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов с учетом эмоций в реальных условиях. На рисунке 1 показана архитектурная схема предлагаемой работы. На рисунке 1 представлена полная схема предлагаемого фреймворка визуального отображения для обучения многомодальным признакам эмоций в контексте систем интеллектуального взаимодействия. Рабочий процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют взаимодополняющую эмоциональную информацию из лингвистической, просодической модальностей и модальности мимики соответственно. Специфический для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где эмбеддинги, специфичные для эмоций, отделяются от признаков, специфичных для модальности, чтобы обеспечить согласованность выученных эмоций в гетерогенных источниках данных. Эмбеддинги специфических эмоций из каждой модальности затем агрегируются кросс-модальной сетью внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. Наконец, фреймворк предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.

Мультимодальный сбор данных

Наборы данных CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных датасета, содержащих синхронизированные видео-, аудио- и текстовые данные. Набор данных CH-SIMS включает результаты мультимодальных исследований китайцев и состоит из 2 281 видеофрагмента, извлеченного из различных сегментов кинофильмов, телевизионных драм и развлекательных шоу. Добавление соответствующих аудио- и текстовых данных к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически реализуемыми. В свою очередь, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является датасет CMU-MOSEI, который был сформирован из более чем 23 000 видеоклипов с фразами, произнесенными более чем 1 000 говорящими на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.

Текстовые транскрипции, аудиосигналы и видеокадры собираются и синхронизируются по временным меткам для достижения точного соответствия на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и слияния на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокальных тонов и лингвистического содержания. Такой метод мультимодального сбора данных позволяет эффективно извлекать межмодальную эмоциональную динамику, что крайне важно для проектирования интеллектуального взаимодействия и понятного визуального отображения.

Таблица 1 представляет основные структуры мультимодальных наборов данных эмоций, использованных в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произнесенные слова, интонации голоса и мимика, CH-SIMS и CMU-MOSEI интегрируют видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет провести тщательный анализ взаимодействия модальностей и вариативности эмоций в Китае. С другой стороны, набор данных CMU-MOSEI имеет большее значение для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассмотренных в данной работе, поскольку он содержит большой объем данных на разных языках, по различным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, он снижает трудности при выборе информации при тестировании моделей.

Мультимодальная предобработка и синхронизация

Временные метки из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечило согласованное обучение мультимодальным представлениям. Каждое высказывание служило основной единицей анализа и было связано с соответствующими аудио- и видеосегментами в том же временном интервале. Выравнивание проводилось на уровне высказываний. Транскрипт был разделен на сегменты на основе временных меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио и видео устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попадающих в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента сэмплировались с заданной частотой и кодировались с использованием Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения признаков всех модальностей к единой границе высказывания, так как три модальности генерировали последовательности признаков различной длины. Для нормализации последовательностей разной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями. В процессе обучения использовались маски внимания, чтобы отделить дополняющие элементы от фактических позиций признаков. Эмбеддинги конкретных модальностей проецировались в общее латентное пространство перед слиянием, чтобы преодолеть различие в длине последовательностей разных модальностей. Это гарантировало размерную согласованность и позволило механизму внимания на основе графов эффективно реализовать обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований были исключены образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.

Извлечение признаков на основе трансформеров

Метод глубокого обучения используется для извлечения высокоуровневых признаков, учитывающих эмоциональную составляющую, из информации различных модальностей, таких как зрение, звук и текст, в сквозном режиме после выравнивания мультимодальных данных и выполнения необходимой предобработки. Благодаря использованию трансформерного энкодера для получения внутренне дискриминативных представлений признаков из необработанных мультимодальных данных, предлагаемый метод устраняет необходимость в ручном проектировании признаков. Для обеспечения согласованности между наборами данных, используемыми в предлагаемом подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой из отдельных модальностей, включая изображения, аудио и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе, в частности, в методе извлечения признаков, примененном к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для изучения высокоуровневых признаков в данных различного объема.

Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния

Для извлечения визуальной информации из кадров видео с целью получения пространственных представлений, релевантных эмоциям, была использована модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого видеосегмента были масштабированы до (224 × 224) пикселей и отобраны через регулярные временные интервалы. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров были спроецированы в 768-мерное пространство эмбеддингов с использованием предобученной модели ViT в качестве визуального базового компонента (backbone). Эмбеддинги на уровне кадров объединялись с помощью среднего пулинга для создания итогового визуального представления для каждого сегмента. В процессе обучения для улучшения обобщающей способности применялись нормализация изображений и стандартные методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая структура мультимодального слияния была использована для объединения этих визуальных эмбеддингов с текстовыми и аудиопредставлениями.

Для сохранения временной динамики эмоций видеообразцы из наборов данных CH-SIMS и CMU-MOSEI будут подвергнуты равномерному семплированию для визуальной модальности. Кадры каждого видео, Формула математического векторного представления, \(x_v \in \mathbb{R}^{H \times W \times C}\), уравнения., могут быть разделены на N сегментов фиксированного размера, которые затем выравниваются и переносятся в обратном порядке в пространство латентных эмбеддингов с размерностью Уравнение, описывающее назначение переменной: \( d_v = 768 \).. Последовательность создается путем добавления позиционных эмбеддингов и обучаемого группового токена:

Уравнение, описывающее сумму взвешенных компонентов; математический анализ; методология исследования.   (1)

где Уравнение E_pos, концепция статического равновесия, образовательная формула для физического исследовательского анализа обозначает позиционное кодирование, а Математическая формула, демонстрирующая представление векторного пространства: \( E \in \mathbb{R}^{(P^2C) \times 768} \). представляет собой матрицу вложения патчей.

Для обработки последовательности встроенных патчей используются стекированные слои энкодера трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:

Уравнение итерационной математической модели с использованием функций MSA и LNO, символьное представление.   (2)

Уравнение послойной нормализации и сети прямого распространения в нейронных вычислениях.   (3)

Для получения вектора визуальных признаков с учетом эмоций в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса Уравнение векторного пространства \( f_v \in \mathbb{R}^{768} \), математическая концепция, обозначение, алгебра.. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании наборов данных, объединяются эмбеддинги на уровне кадров из каждого сегмента видео для фиксации мимики и эволюции эмоций.

Аудиомодальность с использованием Wav2Vec 2.0 для просодии и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с использованием предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегирования выходных скрытых представлений с помощью среднего пулинга. Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и релевантных эмоциям характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы и передискретизированы до 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных меток, предоставленных в аннотациях датасета. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем, с использованием итоговых аудиоэмбеддингов, было выполнено кросс-модальное слияние на основе графового внимания и обучение распутанным представлениям.

В аудиомодальности Wav2Vec-2.0 используется для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала Математическое выражение, символ: \( x_a \in \mathbb{R}^T \), означающий элемент в пространстве вещественных векторов. существует сверточное кодирование признаков:

Математическое уравнение, функция свертки, диаграмма линейного преобразования, исследовательский анализ.   (4)

где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на базе трансформера дополняет вышеупомянутые структуры, представляя долгосрочные временные зависимости:

C равно преобразованию Фурье от Z; математическое уравнение для анализа обработки сигналов.   (5)

Просодические и семантические акустические данные, которые необходимы для выражения эмоций, включены в эти контекстуальные акустические представления. Эмбеддинг аудио определенной длины создается путем выполнения процедуры временного пулинга:

Математическое выражение для операции пулинга в вычислительной модели, уравнение fa=Pool(C),fa∈ℝ⁷⁶⁸.   (6)

Данная архитектура исключает использование таких акустических признаков, как MFCC, и обеспечивает устойчивость за счет использования данных англоязычной речи из CMU-MOSEI и китайской речи из CH-SIMS путем простого извлечения представлений из форм волны.

Текстовая модальность с использованием RoBERTa для получения контекстных эмбеддингов эмоций

Для текстовой модальности к транскриптам речи из двух наборов данных применяется глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Трансформерные энкодеры на базе RoBERTa использовались для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с помощью соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Для обеспечения согласованности пакетной обработки входные последовательности преобразовывались в токен-эмбеддинги, после чего дополнялись или обрезались до заданной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделители. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных трансформерным энкодером, с использованием финального представления предложения, эквивалентного [CLS]. Для адаптации полученных представлений к задаче распознавания эмоций предобученные энкодеры RoBERTa были доработаны в процессе мультимодального обучения. Затем предложенная структура мультимодального слияния была использована для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.

Эмбеддинги токенов и позиционные кодировки могут быть объединены для каждого токенизированного входного элемента, Анализ динамической системы, уравнение: xt={w1,w2,...,wn}, математическая формула для переменных состояния., чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как

Гамильтоново уравнение, \(H_0 = E_{tok}(x_t) + E_{pos}\); представление формулы квантовой механики.   (7)

Эта форма представлена через слои L-трансформера, который использует механизм самовнимания (self-attention) для выявления контекстных зависимостей между словами:

Уравнение слоев трансформера в нейронных сетях L, математическая формула.  (8)

Контекстный эмбеддинг эмоций получается с использованием конечного скрытого состояния токена классификации:

Уравнение, описывающее векторное преобразование, fₜ = Hᴸ[CLS], fₜ ∈ ℝ⁷⁶⁸, относящееся к анализу данных.   (9)

Полярность настроений, интенсивные эмоции и связанные с ними смыслы являются примерами лингвистических характеристик, относящихся к эмоциям, которые будут представлены этим эмбеддингом. RoBERTa упрощает языково-независимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.

На предлагаемом этапе обучения глубокому представлению признаков извлекаются три специфичные для каждой модальности векторные характеристики размерностью 768: визуальная fv, аудио fa и текстовая ft . В дизайне интеллектуального взаимодействия эти полученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на основе графов и обучения распутанным представлениям.

Обучение распутанным представлениям

После получения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков визуальной, слуховой и текстовой модальностей может позволить получить несвязное описание эмоций. Если специфические для каждой модальности вложения признаков слуховой, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, такие что Математический символ, формула векторного пространства, \(f_m \in \mathbb{R}^{768}\), для размерности данных. и Уравнения для элементов теории множеств; m ∈ {v, a, t}; математическая нотация, образовательное использование., целью данного этапа является факторизация всех признаков модальностей на два отдельных латентных описания, которые включают описания эмоций с учетом предшествующей семантики каждой из различных модальностей.

Это достигается путем подачи признаков каждой модальности, fm , в две параллельные проекционные сети: кодировщик эмоций Уравнение статического равновесия, E_e(.), представляющее динамику энергетического баланса на схеме системы. и кодировщик модальности Символ функции Em; математическая нотация; используется в уравнениях в образовательных целях., в которых формируются два кодирования.

Математические уравнения, описывающие статистическую механику; переменные отображают процесс равновесия.  (10)

Где Уравнение, \( z^e_m \in \mathbb{R}^{d_e} \), математическое обозначение. скрытый признак, связанный с эмоцией, а Математическая концепция; символ zm ∈ ℝdm; векторное пространство; анализ размерности; уравнение. представляет собой скрытый признак, специфичный для конкретной модальности. Это позволяет специфичным для эмоций эмбеддингам взаимодействовать с пространством многократно по нескольким входным данным, включая аудио-визуальные и текстовые, сохраняя при этом уникальные структурные данные, связанные с каждой модальностью.

Эффективное разделение обеспечивается за счет реконструкции с ограничениями независимости. Реконструкция признака исходной модальности определяется следующим образом:

Уравнение динамического процесса; формула: f̂ₘ = D(zₘᵉ, zₘᵐ); концептуальная схема; контекст исследования.  (11)

где Статистический процесс; формула \( D(.) \); математическое уравнение для анализа данных. представляет собой сеть-декодер. Потеря при реконструкции сохраняет следующие данные:

Формула потерь при реконструкции, математическое уравнение для анализа обработки сигналов, Σm||fm-f̂m||².   (12)

Кроме того, ортогональность или декорреляция между эмоциями и специфичными для модальности изображениями часто ограничивают перекрытие информации:

Уравнение статического равновесия Σm||(ze^T)zm||2, математическая формула, для образовательных целей.   (13)

Достижение этих целей позволит модели выучить представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное объединение на основе графов и функции визуального картирования, особенно для проектирования интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.

Согласованность эмоций между модальностями

Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это объясняется тем, что стратегии слияния больше не требуют учета значительных разрывов между двумя представлениями, так как специфичные для модальностей эмбеддинги эмоций разделяют общее латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом Уравнения химического равновесия с символами Z<sub>v</sub><sup>e</sup>, Z<sub>a</sub><sup>e</sup>, Z<sub>t</sub><sup>e</sup>.. Взвешенное слияние будет более стабильным при согласованности специфичных для эмоций представлений, так как вариации между сигналами различных модальностей больше не будут влиять на результат.

Уравнение контрастивной функции потерь, математическая формула, демонстрирующая суммирование и индексы переменных.   (14)

Путем обеспечения семантического выравнивания эмоциональной информации эта цель сводит к минимуму расхождения между модальностями и гарантирует, что восприятие эмоций остается неизменным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное репрезентативное пространство путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.

Влияние на кросс-модальное слияние

Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку специфичные для эмоций эмбеддинги выравниваются в общем латентном пространстве. Слитое представление эмоции определяется следующим образом:

Уравнение статического равновесия Σm∈{v,a,t}amzem диаграмма для анализа слияния в образовательных исследованиях.  (15)

Где αm представляет собой вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфичные для эмоций представления согласуются, так как результат слияния демонстрирует взаимодополняющие эмоциональные признаки, а не противоречивые сигналы модальностей.

С математической точки зрения снижение Уравнение статического равновесия, ΣFx=0, векторная механика, образовательная формула. дисперсии между различными типами специфических для эмоций представлений по отношению к Уравнение статического равновесия, ΣFx=0, векторная механика, образовательная формула. эквивалентно следующему:

Формула расчета дисперсии, Var(z^e), математическое выражение, уравнение статистического анализа.   (16)

где Символ Z^-e, химическое уравнение, относящееся к исследованиям заряда ионов, представление формулы. представляет среднее выражение эмоций. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.

Конечной целью обучения при визуализации распутанных эмоций является объединение фрагментации, реконструкции и однородности эмоций:

Математическая формула, L_total = L_rec + λ1L_dis + λ2L_con, диаграмма уравнения, оптимизация.   (17)

какие два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между кросс-модальной надежностью эмоций и диссоциацией. Для достижения этой цели предлагаемая модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления, уделяя особое внимание созданию надежной основы для последующего слияния на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.

Графовое кросс-модальное внимание для слияния данных

Для имитации детальных эмоциональных связей между модальностями была использована кросс-модальная сеть внимания на основе графов. Чтобы облегчить поток информации между модальностями был построен полностью связный мультимодальный граф, в котором каждый специфический для модальности эмбеддинг (текстовый, аудио- и визуальный) представлен в виде узла графа. Отношения между модальностями использовались для создания матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проекции выходов нескольких голов внимания. Затем было получено единое мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем поступало в модули прогнозирования и визуализации для анализа с учетом взаимодействия и распознавания эмоций. Модуль слияния графов имел размерность скрытого представления 256 и два слоя внимания графа, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем внимания графа следовали нормализация слоя, остаточные связи (residual connections) и слой дропаута с коэффициентом 0,2 для повышения стабильности обучения и снижения переобучения. После конкатенации и проекции выходов нескольких голов внимания в общее латентное пространство представления узлов были объединены в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многовидового визуального картирования и прогнозирования эмоций.

Разнообразные кросс-модальные взаимодействия регистрировались с помощью многоголового графового внимания. Для нормализации коэффициентов внимания между связанными узлами для каждого узла использовалась функция softmax. Для повышения стабильности обучения и предотвращения переобучения за стековыми слоями графового внимания модуля объединения графов следовали остаточные связи, послойная нормализация и регуляризация методом dropout.

Пусть обозначения Символы уравнений химического равновесия Z<sub>v</sub><sup>e</sup>, Z<sub>a</sub><sup>e</sup>, Z<sub>t</sub><sup>e</sup>. по отдельности представляют собой представления, соответствующие конкретным эмоциям, собранным визуальным, аудио- и текстовым модальностями; каждый компонент находится в общем латентном пространстве Математический символ R^d_e для векторных пространств; диаграмма уравнения для пространственного анализа.. Модели для узлов модальностей используют обозначение графа Уравнение теории графов G=(V,E), представляющее вершины и ребра; символьное представление., где узлы совокупности Расчет скорости по формуле v={v,a,t}; уравнение кинематики; образовательный контент. соответствуют трем узлам модальностей, чтобы эксплицитно усилить эмоциональные зависимости, общие для различных представлений модальностей.

После присвоения каждому узлу графа вектора признаков, специфичного для определенной эмоции, мы получаем следующее:

Уравнение статического равновесия \(H=[Z_v^e, Z_a^e, Z_t^e]^T \in \mathbb{R}^{3 \times a_e}\).   (18)

В отличие от традиционных методов слияния, в которых используются предопределенные или фиксированные веса слияния, предлагаемый метод позволяет определять адаптивные веса ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.

Для кросс-модального слияния используется графовая сеть внимания (GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:

Уравнение активации нейронной сети: LeakyReLU; формула; выражение машинного обучения.   (19)

Эмоциональный эффект перехода от моды j к модальности i измеряется нормированными весами αij.

Затем вычисляемый объединенный вид каждого узла модальности определяется как взвешенная группировка его соседей:

Формула графовой нейронной сети, \( h'_i = \sigma(\sum_{{j \in N(i)}} \alpha_{ij} W z_j^e) \).   (20)

где функция активации Символ сигма-функции (σ), математическое обозначение. является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального комбинированного представления эмоций:

Уравнение процесса слияния данных, z_fusion = 1/|v| Σ h'_i, математическая формула.   (21)

Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального картирования, поскольку он позволяет извлекать дополняющую друг друга информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.

Алгоритм 1 (Дополнительный файл 1) представляет собой общую схему реализации кросс-модального слияния на основе графов. Сначала создается граф, в котором специфические для каждой эмоции характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем рассчитываются показатели внимания для каждой пары узлов графа, которые представляют собой комбинацию эмоциональной зависимости. После этого показатели внимания нормализуются для определения относительного вклада каждой модальности в заданный эмоциональный контекст, что позволяет обучать веса внимания. На заключительном этапе формируется общий вектор вложения эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, общее слияние мультимодальных признаков, связанных с определенными эмоциями, в данном алгоритме демонстрирует потенциал с точки зрения адаптивности, интерпретируемости и контекстуального интеллекта.

Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети кросс-модального внимания для мультимодального слияния признаков сентимент-анализа. Эмоциональные эмбеддинги, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальностей, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем представления модальностей, взвешенные с помощью внимания, объединяются для формирования единого эмоционального эмбеддинга, при этом матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обучаемая сетью, динамически модулирует вклад каждой модальности, позволяя системе фокусироваться на наиболее информативном канале, игнорируя зашумленные и менее значимые данные. Слитое эмоциональное представление обеспечивает точное распознавание эмоций и детальный анализ таких эмоциональных состояний, как нейтральное, объятие и беспокойство.

Модуль визуального картирования

С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать унифицированное представление эмоционального состояния в понятную и легко воспринимаемую визуальную форму на основе графа после процесса кросс-модального слияния.

Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двумерное пространство для отображения с использованием стохастического соседства с t-распределением (t-SNE). Для t-SNE использовались значение перплексии 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Для создания тепловых карт внимания использовались нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания. На этих тепловых картах отображен относительный вклад текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально изучить межмодальные связи и информационные потоки внутри структуры слияния. Для анализа временной эмоциональной динамики были построены графики траекторий эмоций путем мониторинга развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории проясняют, как меняются эмоциональные состояния и вклад модальностей с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и тепловых карт внимания.

Пусть переменная уравнение z_fusion в векторном пространстве ℝ, математическая формулировка, теоретический анализ. будет представлять собой объединенное представление эмоционального состояния, полученное с помощью функции графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.

С помощью полученных αji создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем входящие веса внимания суммируются для определения совокупного показателя значимости каждой модальности:

Статическое равновесие; \( s_i = \frac{1}{|v|} \sum_{j \in v} a_{ji} \); схема математической формулы.    (22)

где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и отображаются на цветовой карте, которая позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым модальностям ввода такой интерфейс помогает пользователю понять принципы работы механизма внимания системы.

Обучаемый граф специально моделируется как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом графа, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на ребрах, которые их соединяют. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определения i и j следующие:

Уравнение, демонстрирующее формулу средневзвешенных значений; математическая концепция для анализа данных.   (23)

Благодаря этим весовым коэффициентам толщина линий или прозрачность визуализации графа отображаются надлежащим образом. Это облегчает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия дизайнер может лучше понять, как эмоциональные индикаторы взаимодействуют в процессе слияния.

Объединенные эмбеддинги эмоций Уравнение, показывающее переменную Z<sub>t</sub><sup>fusion</sup>, связанную со слиянием, в математическом контексте. на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:

Математическое уравнение, представляющее yt как функцию слияния Zt в контексте векторных пространств.   (24)

где функция проекции представлена символ функции Φ, статистическая концепция, представление уравнения.. Появление 2D/3D траекторий эмоций, которые демонстрируют переходы, интенсивность и стабильность эмоций в ходе взаимодействий, может быть интерпретировано как интуитивное изображение эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.

В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, данная система ориентирована на демонстрацию механизмов формирования человеческих эмоций внутри нее. Она раскрывает процесс принятия решений, предоставляя визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействия между моделями и соответствующие пути их прохождения. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.

Таким образом, сопоставление эмоций с понятными формами с помощью визуальных представлений может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией в проектирование интеллектуальных интерфейсов. Данные, собранные обоими подходами, могут быть затем использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам взаимодействия важную информацию для создания более точных пользовательских интерфейсов. Другими словами, понимание эмоций становится активной частью дизайна взаимодействия. Точность может повыситься только в том случае, если понимание эмоций будет активно внедрено в процесс проектирования взаимодействия.

Модуль визуального отображения обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает лежащие в основе представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальности использует данные из графов взаимодействия и тепловых карт визуального внимания для описания того, как каждая модальность — визуальная, аудио- или текстовая — влияет на решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют понять, как каждая визуальная и текстовая модальность изменяется со временем с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Supplementary File 1).

Объединенные мультимодальные эмоциональные признаки отображаются на визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения 2. Веса графового мультимодального внимания используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются на визуальные представления для выделения основных источников, влияющих на эмоции, с помощью визуальных элементов тепловой карты. Чтобы обеспечить детальный обзор взаимодействия между входными элементами и передать эволюцию эмоций, вызванную мультимодальными входными данными, затем вычисляются попарные интенсивности взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается представление эволюции эмоций путем отображения объединенных эмоциональных элементов, собранных за определенный период времени, в низкоразмерное пространство для получения непрерывной эволюции эмоционального элемента.

Прогнозирование эмоций и обратная связь при взаимодействии

Результат объединенного представления эмоций, выраженный как уравнение z_fusion в векторном пространстве ℝ, математическая формулировка, теоретический анализ., затем используется в качестве функции как для обратной связи по взаимодействию, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая классификационная модель на основе функции softmax:

Уравнение Softmax для прогнозирования выходных данных нейронной сети; формула: ŷ = softmax(W_cz^fusion + b_c).   (25)

где Прогнозирование, уравнение регрессии, \(\hat{y}\); график; анализ данных; оценка прогностической модели представляет собой ожидаемые вероятности классов эмоций, а Wc  и bc являются обучаемыми ограничениями. Для улучшения цели классификации используется перекрестная энтропия:

Формула потерь классификации, Lcls=-ΣKk=1 yk log(ŷk), математическое уравнение.  (26)

где yk — это истинная метка, а K — количество классов эмоций. Регрессионная ветвь используется для параллельной оценки интенсивности эмоций, создавая прогноз различных непрерывных аффективных атрибутов, включая валентность и возбуждение. Приведите следующее определение:

Уравнение статического равновесия, формула Ŝ = WrZ^fusion + br, образовательный контент.   (27)

где ожидаемый показатель интенсивности эмоций обозначен как Спектроскопическая диаграмма; формула ΣFx=0; эксперимент по анализу ДНК; исследование оптического возбуждения.. Для улучшения задачи регрессии используется функция потерь среднеквадратичной ошибки:

Формула регуляризации: Lreg = ||s - ŝ||²₂, уравнение оптимизации функции потерь.   (28)

В целом, эти две задачи объединяются в целевой функции прогнозирования:

Уравнение функции потерь: L<sub>pred</sub> = L<sub>cls</sub> + λL<sub>reg</sub>, иллюстрирующее классификацию и регрессию.   (29)

где цели регрессии и классификации сбалансированы с помощью λ. Это предполагает динамическую модификацию модуля визуализации на основе определенного эмоционального состояния для обеспечения такого типа обратной связи, учитывающей взаимодействие. Контекст взаимодействия в данный момент времени t представлен как ct. Ответ модуля визуализации определяется следующим образом:

Уравнение для трансформации слияния, \(V_t = \Psi(z_t^{fusion}, \hat{y}_t, \hat{s}_t, c_t)\).    (30)

где функция адаптации визуализации представлена Символ квантовой волновой функции Ψ(x) в математическом уравнении, относящемся к исследованию физики частиц.. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Это свидетельствует о том, что система, помимо высокой эффективности в прогнозировании эмоционального состояния, обеспечивает существенную поддержку обратной связи.

Результаты

В данной работе подтверждается эффективность предложенного фреймворка визуального картирования мультимодальных признаков эмоций с точки зрения как интерпретируемости с учетом взаимодействия, так и прогностической способности, с использованием двух эталонных наборов данных: CH-SIMS и CMU-MOSEI. Согласно результатам экспериментов, предложенный подход стабильно превосходит современные методы мультимодального распознавания эмоций по ряду показателей, включая корреляцию, точность, F1-меру и среднюю абсолютную ошибку (MAE). Распутанное представление эмоций, механизм кросс-модального слияния на основе графов и стратегия сквозного глубокого обучения представлениям способствуют этому улучшению, обеспечивая более стабильное и семантически согласованное моделирование эмоций. Предложенный подход обеспечивает более глубокое понимание на уровне признаков благодаря визуальному картированию, что выходит за рамки количественного прироста и упрощает понимание вклада каждой модальности и динамики эмоций. Несмотря на различия в языке, культурных особенностях выражения и объеме данных, вышеупомянутое повышение производительности последовательно наблюдается на обоих наборах данных, что демонстрирует высокую обобщающую способность предложенного фреймворка.

В предлагаемой работе используются общедоступные наборы данных для мультимодального анализа эмоций CH-SIMS и CMU-MOSEI. Набор данных CH-SIMS состоит из 2 281 видеоклипа из фильмов, телесериалов и развлекательных шоу. В CH-SIMS доступны синхронизированные текстовые, аудио- и визуальные данные. Как унимодальные, так и мультимодальные метки сентимента классифицированы по категориям: положительная, нейтральная и отрицательная. Крупный английский мультимодальный набор данных, известный как CMU-MOSEI, содержит около 23 453 аннотированных видеоклипов с участием более 1 000 говорящих, обсуждающих широкий круг тем. Этот набор данных содержит как непрерывные аннотации интенсивности эмоций, такие как валентность и возбуждение, так и категориальные метки эмоций. Эксперименты на этих двух наборах данных с использованием предложенного фреймворка, охватывающего различные лингвистические, культурные и эмоциональные условия, повышают робастность и надежность результатов. В Таблице 2 приведены сведения о среде моделирования.

Основные экспериментальные и прикладные настройки, использованные для оценки предлагаемой структуры, обобщены в данной симуляционной среде. Для обеспечения единообразной размерности признаков в текстовой, аудио и визуальной модальностях повсеместно применяются энкодеры на базе трансформеров. В системе используется механизм внимания на основе графов для кросс-модального слияния, что позволяет адаптивно изучать взаимозависимости между модальностями в отношении эмоциональных состояний.

Предлагаемая архитектура извлекает текстовые, слуховые и визуальные представления с помощью кодировщиков модальностей на базе трансформеров. Полносвязные слои с активацией ReLU проецируют эмбеддинги конкретных модальностей в общее латентное пространство. Затем для обучения распутанным представлениям используются отдельные кодировщики для каждой эмоции и каждой модальности, каждый из которых состоит из двух полносвязных слоев с нелинейной активацией и нормализацией. Латентные представления проецируются в 256-мерное пространство признаков, в котором информация для каждой модальности и эмоции изучается отдельно. Для сохранения информации о модальности и обеспечения эффективного распутывания используются декодеры реконструкции. Перед мультимодальным объединением и прогнозированием модуль кросс-модального внимания на основе графов моделирует эмоциональные зависимости между модальностями с использованием латентных представлений. Сеть обучалась с помощью оптимизатора Adam с начальной скоростью обучения 1 × 10⁻4 и размером пакета 32. Для предотвращения переобучения применялась ранняя остановка на основе потерь на валидационной выборке. Общая целевая функция включала потери классификации, реконструкции и согласованности представлений, каждая из которых была взвешена с помощью настраиваемых гиперпараметров. Обучение модели проводилось до 100 эпох, и для тестирования была сохранена модель с наилучшими показателями на валидационном наборе данных.

Предложенная структура оценивалась с использованием метрик классификации, включая Accuracy (точность), Precision (прецизионность), Recall (полноту) и F1-score, а также метрик регрессии, таких как Mean Absolute Error (MAE, средняя абсолютная ошибка). Precision, Recall и F1-score рассчитывались с использованием макро-усреднения для учета дисбаланса классов в категориях эмоций. Для экспериментов по классификации в качестве истинных классов использовались предопределенные метки эмоций/сентимента из наборов данных CH-SIMS и CMU-MOSEI. При регрессионном прогнозировании сентимента целевыми переменными служили непрерывные показатели интенсивности сентимента из этих наборов данных. Для анализа эффективности прогнозирования по классам и паттернов ошибочной классификации были построены матрицы ошибок (confusion matrices) с доверительным интервалом 95%. Для обеспечения устойчивости результатов каждый эксперимент повторяли 5 раз с различными случайными инициализациями; представленные результаты соответствуют среднему значению ± стандартному отклонению показателей по всем запускам. Статистическая значимость оценивалась с помощью соответствующих процедур проверки гипотез, а в необходимых случаях рассчитывались доверительные интервалы. Время обучения измерялось как общее затраченное время, необходимое для сходимости модели на указанной аппаратной платформе.

Для сравнения с предлагаемым методом может быть использован ряд репрезентативных базовых моделей, включая раннее и позднее слияние: TFN, методы на основе LSTM, низкоранговые модели мультимодального слияния, адаптивные мультимодальные трансформеры и новые архитектуры на основе перекрестного модального внимания. Эти базовые модели отражают передовые методы, направленные преимущественно на повышение точности распознавания эмоций с помощью различных способов слияния. В отличие от этих методов, которые сосредоточены в основном на прогнозировании на уровне выходных данных, предлагаемая структура с обучением распутанных представлений и слиянием на основе графов улучшает интерпретируемость и осведомленность о взаимодействиях. Примерами базовых моделей, реализованных с использованием их официальных репозиториев или общедоступных эталонных реализаций, являются LSTM Fusion, TFN, низкоранговое мультимодальное слияние (LMF), Adaptive-Graph и методы на основе трансформеров. В случаях, когда они были доступны, использовались оригинальные настройки гиперпараметров авторов. Все переобученные базовые модели оценивались с использованием одних и тех же разделений наборов данных, методов предварительной обработки, параметров оптимизации и критериев оценки для обеспечения справедливого сравнения. В таблицах сравнения четко указаны соответствующие ссылки на данные, взятые непосредственно из предыдущих публикаций.

Точность

Точность классификации дискретных эмоций измерялась как для CH-SIMS, так и для CMU-MOSEI; однако тенденция изменения точности различается в зависимости от характеристик двух наборов данных. Поскольку CH-SIMS представляет собой набор данных среднего размера с равным количеством категорий сентимента и тщательно предобработанными видеоклипами, точность в нем высока, что говорит о способности модели улавливать тонкую мультимодальную эмоциональную информацию при низком уровне шума. С другой стороны, точная классификация эмоций в CMU-MOSEI затруднена, так как это крупномасштабный набор данных с говорящими из разных социальных групп. Таким образом, помимо способности модели определять сентимент, точность на наборе данных CMU-MOSEI указывает на ее способность к обобщению и устойчивость к различным сценариям взаимодействия. Повышение точности для обоих наборов данных показывает, что предлагаемый подход хорошо обобщается на данные разных языков, размеров и уровней эмоциональной сложности.

Точность классификации предлагаемого подхода и других распространенных базовых методов на наборах данных CH-SIMS и CMU-MOSEI представлена в Таблице 3. Как показано в Таблице 3, предложенная структура достигла наивысшей точности на обоих наборах данных (CH-SIMS и CMU-MOSEI), превзойдя самый сильный базовый метод (Adaptive-Graph) примерно на 3,3% и 3,1 процентных пункта соответственно. Более низкие значения стандартного отклонения также указывают на большую стабильность при повторных экспериментальных запусках. Традиционные подходы на основе слияния LSTM имеют более низкую точность из-за их ограниченной способности улавливать сложные кросс-модальные связи. TFN и LMF повышают точность классификации за счет моделирования этих кросс-модальных связей.

F1-мера

В задачах классификации эмоций баланс между полнотой (recall) и точностью (precision) измеряется с помощью F1-меры. Таким образом, она более подходит для мультимодальных наборов данных по классификации эмоций, в которых количество представителей классов, скорее всего, будет неравномерным. В задачах классификации эмоций баланс между полнотой и точностью измеряется с помощью F1-меры. Поскольку ожидается, что мультимодальные наборы данных по классификации эмоций будут несбалансированными, F1-мера является более подходящим показателем. Чем лучше модель определяет классы эмоций, тем выше значение F1-меры.

Рисунок 3 иллюстрирует оценку F1-меры предложенного метода в сравнении с базовыми моделями на наборе данных CH-SIMS. Самый низкий показатель F1-меры у базовой модели на основе LSTM указывает на её ограниченную способность моделировать сложные кросс-модальные эмоциональные связи. Сравнение значений F1-меры для оцениваемых методов на наборе данных CH-SIMS приведено на Рисунке 3. Как показано, более сложные структуры на основе графов и трансформеров регулярно превосходят традиционные методы слияния. Модель LSTM показала самый низкий результат с F1-мерой 0.71, за ней следуют TFN (0.74) и LMF (0.76). Использование Adaptive-Graph позволило повысить F1-меру до 0.79, что подтверждает значимость моделирования межмодальных связей. Предложенная архитектура с F1-мерой 0.82 превзошла Adaptive-Graph на 3.8%, LMF на 7.9%, TFN на 10.8% и LSTM на 15.5%. Эти результаты показывают, что предложенный механизм кросс-модального внимания на основе графов и обучение распутанным представлениям более эффективно извлекают дополняющую друг друга эмоциональную информацию из текстовой, аудио- и визуальной модальностей, что приводит к повышению качества классификации.

Относительные тенденции остаются неизменными, хотя во всех методах наблюдается небольшое снижение F1-меры по сравнению с CH-SIMS, как показано на Рисунке 4. Результаты демонстрируют устойчивое повышение производительности при переходе от традиционных методов слияния к стратегиям многомодального обучения на основе графов. Модели с самыми низкими значениями F1-меры были LSTM (0,69), TFN (0,72) и LMF (0,74). Производительность модели Adaptive-Graph увеличилась до 0,77, что демонстрирует эффективность моделирования кросс-модальных связей. Предложенная архитектура превзошла все остальные подходы, достигнув максимального значения F1-меры 0,80. Улучшение показателей по сравнению с самым сильным базовым решением, Adaptive-Graph, доказывает вклад предложенного обучения распутанному представлению эмоций и механизма кросс-модального внимания на основе графов в улавливание дополняющих друг друга эмоциональных признаков в текстовой, акустической и визуальной модальностях. Эти результаты показывают, что предложенная архитектура для многомодального распознавания эмоций является надежной и эффективной. Предложенный подход демонстрирует значительное улучшение по сравнению как с графовым подходом, так и с традиционным методом слияния, что дополнительно подтверждает высокую обобщающую способность метода. Повышение F1-меры на наборе данных CMU-MOSEI доказывает, что предложенный подход позволяет достичь сбалансированной эффективности классификации эмоций даже в зашумленных и разнообразных средах.

Точность

В интеллектуальных коммуникационных системах точность имеет решающее значение, так как ложный эмоциональный сигнал может ухудшить пользовательский опыт. Отношение точно предсказанных случаев конкретной эмоции к общему количеству случаев, спрогнозированных как данная эмоция, известно как точность (precision). Поскольку распутанные представления эмоций менее зашумлены и менее подвержены ошибочной классификации в данной модальности, предлагаемая модель превосходит базовые модели на наборе данных CH-SIMS, представленном на Рисунке 5.

На рисунке 5 приведено сравнение точности нескольких методов мультимодального распознавания эмоций на наборах данных CH-SIMS и CMU-MOSEI. При переходе от традиционных методов на основе слияния данных к более сложным архитектурам на базе графов точность неуклонно растет. Предложенная архитектура достигла максимальной точности 0,82 на наборе данных CH-SIMS, при этом точность увеличивалась с 0,71 для LSTM до 0,74, 0,76 и 0,79 для TFN, LMF и Adaptive-Graph соответственно. На наборе данных CMU-MOSEI точность выросла с 0,69 для LSTM до 0,72, 0,74 и 0,77 для TFN, LMF и Adaptive-Graph соответственно. Предложенный подход обеспечил наивысшую точность 0,80. По сравнению с лучшим базовым методом (Adaptive-Graph), предложенная архитектура повысила точность примерно на 3,8% для CH-SIMS и на 3,9% для CMU-MOSEI. Эти результаты показывают, что предложенное обучение распутанным представлениям и механизм кросс-модального внимания на основе графов успешно снижают количество ложноположительных прогнозов за счет извлечения дополняющей друг друга эмоциональной информации из текстовой, акустической и визуальной модальностей. Графовый механизм кросс-модального внимания дополнительно минимизирует влияние иррелевантной модальности. Более высокая вариативность дикторов и лингвистических выражений в корпусе CMU-MOSEI приводит к небольшому снижению точности для всех моделей.

Повторение

В задачах распознавания эмоций полнота (recall) — показатель способности модели правильно классифицировать эмоциональные случаи, относящиеся к определенному классу, — имеет решающее значение, поскольку отсутствие эмоциональной информации может негативно повлиять на качество взаимодействия. Более высокое значение полноты свидетельствует о том, что модель выявляет меньше ложноотрицательных результатов и больше реальных эмоциональных проявлений. Полноту можно рассматривать как меру эффективности извлечения эмоциональной информации из текстовых, аудио- и визуальных модальностей в контексте мультимодального анализа эмоций.

Преимущество предлагаемого метода по сравнению с базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI показано при сравнении полноты (recall) на Рисунке 6. По мере эволюции моделей от традиционных методов на основе слияния к более сложным графовым мультимодальным структурам результаты последовательно демонстрируют рост полноты. Полнота на наборе данных CH-SIMS увеличилась с 0.70 для LSTM до 0.73, 0.75 и 0.78 для TFN, LMF и Adaptive-Graph соответственно; максимальное значение полноты 0.82 было достигнуто с помощью предложенной архитектуры. Предложенный подход обеспечил наилучшую полноту 0.80 на наборе данных CMU-MOSEI, где показатель вырос с 0.68 для LSTM до 0.71, 0.73 и 0.76 для TFN, LMF и Adaptive-Graph соответственно. Предложенная архитектура обеспечила относительное улучшение примерно на 5.1% для CH-SIMS и 5.3% для CMU-MOSEI по сравнению с самым сильным базовым методом (Adaptive-Graph). Эти результаты показывают, что за счет захвата взаимодополняющих эмоциональных признаков в текстовой, акустической и визуальной модальностях предлагаемое обучение распутанных представлений и механизм кросс-модального внимания на основе графов успешно снижают количество ложноотрицательных прогнозов, тем самым улучшая идентификацию классов эмоций в обоих наборах данных. Поскольку традиционные методы имеют ограниченные возможности моделирования сложных кросс-модальных связей, они, как правило, имеют более низкие значения полноты. За счет более явного моделирования взаимосвязей модальностей TFN и LMF достигают умеренного прироста. Метод Adaptive-Graph еще больше повысил полноту за счет имитации структурированных связей между модальностями. Для обоих наборов данных предлагаемый метод обеспечивает самую высокую полноту, что указывает на его лучшую способность обнаруживать эмоциональные случаи в различных сценариях взаимодействия. Улучшение более заметно на крупномасштабном наборе данных CMU-MOSEI, что демонстрирует устойчивость и обобщающую способность предложенной архитектуры.

Средняя абсолютная ошибка (MAE)

Средняя абсолютная ошибка (MAE) используется для оценки эффективности задач по прогнозированию непрерывной интенсивности эмоций, таких как прогнозирование валентности или возбуждения. В отличие от точности, MAE лучше отражает близость предсказанной интенсивности эмоций к фактическому эмоциональному состоянию. Именно поэтому MAE более уместна для таких наборов данных, как CH-SIMS и CMU-MOSEI, которые содержат непрерывные аффективные метки. Более низкое значение MAE указывает на более высокую точность прогнозирования интенсивности эмоций.

Сравнение MAE между предлагаемой структурой и базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI представлено в Таблице 4. Традиционные методы слияния на основе LSTM, как правило, имеют более высокие значения MAE из-за их ограниченной способности моделировать сложные мультимодальные эмоциональные зависимости. TFN и LMF позволяют снизить MAE за счет моделирования мультимодальных взаимодействий, а подход Adaptive-Graph дополнительно снижает этот показатель, изучая взаимосвязи в графах модальностей. Предлагаемая структура достигает наименьшего значения MAE на обоих наборах данных, что свидетельствует о более точной оценке интенсивности эмоций. Стоит отметить, что улучшение более значительно на наборе данных CMU-MOSEI, где крупномасштабная вариативность данных и условия записи говорящих делают задачу прогнозирования более сложной.

Матрица путаницы для набора данных CH-SIMS

Согласно матрицам ошибок для набора данных CH-SIMS, базовые методы раннего слияния LSTM и TFN демонстрируют значительную путаницу между классами нейтральных и положительных эмоций. Это говорит о том, что данные методы недостаточно эффективны при распознавании тонких мультимодальных эмоциональных выражений. С другой стороны, предлагаемый метод демонстрирует выраженное доминирование по диагонали с минимальным количеством внедиагональных элементов, что повышает разделимость классов. Механизм распутывания обучения эмоциям в предлагаемом методе обеспечивает согласованное представление эмоций в разных модальностях, а подход на основе графового слияния улучшает дифференциацию между близкородственными классами сентимента. На рисунке 7A–E представлена матрица ошибок для набора данных CH-SIMS при использовании различных базовых методов.

Матрица ошибок для набора данных CMU-MOSEI

Предложенная структура использует инвариантные к модальности эмбеддинги эмоций и адаптивные веса внимания для значительного снижения частоты ошибочной классификации, особенно для эмоционально неоднозначных входных данных. Это подтверждает, что предложенная структура эффективно работает в различных крупномасштабных сценариях мультимодального взаимодействия. Из-за размера набора данных, вариативности дикторов и непрерывного характера меток сентимента матрицы ошибок для CMU-MOSEI демонстрируют более высокую общую частоту ошибочной классификации. Базовые методы показывают значительную степень смешения между различными категориями эмоций. На рисунке 8A–E представлена матрица ошибок для набора данных CMU-MOSEI при использовании различных базовых методов.

Время обучения за одну эпоху

Вычислительные компромиссы современных методов мультимодального объединения подчеркиваются сравнением времени обучения за одну эпоху. Из-за использования трансформерных энкодеров и механизмов графового внимания предложенная модель требует несколько большего времени обучения, чем простые подходы к объединению, однако это увеличение является допустимым. Предложенная архитектура продемонстрировала высокую эффективность на эталонных наборах данных для мультимодального анализа эмоций и показала потенциал для интеграции в интеллектуальные системы взаимодействия человека и машины. Тем не менее, пригодность для развертывания в режиме реального времени в данном исследовании не оценивалась и требует дальнейшего изучения путем анализа задержки, пропускной способности, памяти и условий развертывания. Стоит отметить, что повышенная стабильность сходимости, а также превосходные прогностические показатели и интерпретируемость оправдывают дополнительные вычислительные затраты. На рисунке 9 показаны результаты времени обучения за одну эпоху для предложенного метода.

Абляционный анализ

Для определения влияния каждого важного элемента предлагаемой структуры, такого как модуль визуального сопоставления, кросс-модальное слияние на основе графов и распутанное представление эмоций, было проведено абляционное исследование. Чтобы понять степень этого влияния, каждый элемент исключался по одному. Согласно результатам экспериментов, стратегия слияния на основе графов улучшает моделирование кросс-модальных зависимостей, а вклад распутанного представления эмоций является наиболее значимым для стабильности производительности. Вспомогательная роль модуля визуального сопоставления подтверждается незначительным влиянием его удаления на общие показатели. Результаты абляционного исследования при одинаковых условиях обучения и оценки представлены в Таблице 5. Наибольшее снижение производительности наблюдалось после удаления модуля кросс-модального внимания на основе графов, что привело к снижению точности с 81.72% до 77.88% и F1-меры с 0.823 до 0.776. Это подчеркивает важность моделирования сложных межмодальных взаимодействий. Роль модуля обучения распутанным представлениям в формировании устойчивых специфичных для эмоций репрезентаций была подтверждена тем, что его удаление снизило точность на 2.78 процентных пункта, а F1-меру — на 0.032. Основным преимуществом модуля визуального сопоставления является интерпретируемость, а не точность классификации, о чем свидетельствует несколько меньшее снижение качества прогнозирования при его исключении. Конфигурация Basic Fusion показала наихудшие результаты, что доказывает: для достижения наилучшей производительности при мультимодальном распознавании эмоций необходимо комбинированное воздействие всех предложенных модулей.

ДОСТУПНОСТЬ ДАННЫХ:

Наборы данных, использованные в данном исследовании, представляют собой общедоступные эталонные датасеты. Набор данных CMU-MOSEI предоставляется Multimodal SDK Университета Карнеги — Меллона и описан в работе Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), доступ к нему открыт по адресу https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. Набор данных CH-SIMS описан в работе Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) и общедоступен через ресурсы, предоставленные авторами, включая https://github.com/thuiar/MMSA. Все эксперименты проводились с использованием официальных версий этих наборов данных. Необработанные извлеченные данные, файлы обработанных данных, результаты предварительной обработки, разбиения на обучающую/валидационную/тестовую выборки, производные представления признаков и детали реализации, подтверждающие выводы данного исследования, общедоступны в репозитории Zenodo по адресу https://doi.org/10.5281/zenodo.21124921.

Схема мультимодального обучения; классификация эмоций с использованием текста, аудио и видео через сеть внимания.
Рисунок 1: Схематическая диаграмма предлагаемого фреймворка визуального картирования мультимодальных признаков эмоций. Концептуальная иллюстрация общей архитектуры, демонстрирующая компоненты извлечения мультимодальных признаков, обучения распутанным представлениям, кросс-модального слияния на основе графового внимания и визуального картирования для интерпретируемого мультимодального анализа эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Схема мультимодального анализа эмоций: текст, аудио, видео; матрица внимания; эмбеддинги эмоций.
Рисунок 2: Схематическая диаграмма рабочего процесса предлагаемого вычислительного протокола.
Концептуальное представление сквозного конвейера обработки, включающего этапы сбора набора данных, предобработки, извлечения признаков для каждой модальности, мультимодального слияния, визуализации и прогнозирования эмоций Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График сравнения F1-меры для методов: LSTM, TFN, LMF, Adaptive-Graph и предлагаемого метода с планками погрешностей.
Рисунок 3: Сравнение значений F1-меры на наборе данных CH-SIMS. Средние значения F1-меры, полученные в результате пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений случайных чисел. Планки погрешностей соответствуют ±± одному стандартному отклонению (SD). Более высокие значения F1-меры указывают на лучшую эффективность классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График сравнения F1-меры методов (LSTM, TFN, LMF), демонстрирующий наивысшую эффективность предлагаемого метода.
Рисунок 4: Сравнение показателей F1-меры на наборе данных CMU-MOSEI. Средние значения F1-меры, полученные в результате пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений генератора случайных чисел. Планки погрешностей представляют ±± одно стандартное отклонение (SD), а соответствующие значения среднего ±± SD указаны над каждой точкой данных. Более высокие значения F1-меры указывают на лучшую эффективность классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

График сравнения точности для CH-SIMS, CMU-MOSEI с использованием методов LSTM, TFN, LMF, Adaptive-Graph.
Рисунок 5: Сравнение точности на наборах данных CH-SIMS и CMU-MOSEI. Средние значения точности, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемой структуры в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей представляют ±± одно стандартное отклонение (SD), рассчитанное на основе повторных запусков с различными случайными значениями начальных параметров (seed). Предлагаемая структура достигает наивысшей точности на обоих наборах данных, демонстрируя улучшенную дискриминацию эмоциональных классов за счет эффективного обучения мультимодальным признакам и кросс-модального слияния на основе графов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Сравнение показателей полноты для CH-SIMS и CMU-MOSEI по различным методам на гистограмме.
Рисунок 6: Сравнение полноты на наборах данных CH-SIMS и CMU-MOSEI. Средние значения показателей полноты, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемой структуры в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей указывают ±± одно стандартное отклонение (SD), рассчитанное на основе повторных экспериментов. Предлагаемая структура последовательно достигает наивысшей полноты на обоих наборах данных, что указывает на превосходящую способность улавливать мультимодальную эмоциональную информацию и сокращать количество ложноотрицательных прогнозов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Графики матрицы ошибок для точности классификации; предсказанные метки: отрицательная, нейтральная, положительная.
Рисунок 7: Матрица ошибок для набора данных CH-SIMS с использованием различных базовых методов. Строки соответствуют истинным классам эмоций, а столбцы — предсказанным классам. Значения в ячейках представляют процент образцов, нормализованный относительно каждого истинного класса. Матрица ошибок была рассчитана с использованием отдельной тестовой выборки CH-SIMS. Более высокие значения процентов по диагонали указывают на более высокую точность распознавания для соответствующей категории эмоций. Матрицы ошибок для (A) LSTM с ранним слиянием, (B) TFN, (C) LMF, (D) адаптивного графа и (E) предлагаемого метода на наборе данных CH-SIMS. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Графики матрицы ошибок, отображающие предсказанные и истинные метки для моделей классификации.
Рисунок 8: Матрица ошибок для датасета CMU-MOSEI с использованием различных базовых методов. Строки представляют фактические метки эмоций, а столбцы — предсказанные метки. Значения представлены в виде нормированных по классу процентов на тестовом наборе данных CMU-MOSEI. Матрица иллюстрирует как правильно классифицированные образцы (диагональные элементы), так и ошибки классификации между категориями эмоций (внедиагональные элементы). Матрица ошибок на CMU-MOSEI (A) Early fusion LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph и (E) Предложенный метод на датасете CMU-MOSEI. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

График сравнения времени обучения для наборов данных CH-SIMS и CMU-MOSEI за 10 эпох.
Рисунок 9Сравнение времени обучения за одну эпоху на эталонных мультимодальных наборах данных для распознавания эмоций.
Среднее время обучения за одну эпоху, полученное из пять независимых экспериментальных повторов (n = 5) для наборов данных CH-SIMS и CMU-MOSEI при идентичных аппаратных и программных настройках. Планки погрешностей обозначают ±± одно стандартное отклонение (SD) рассчитано на основе повторяющихся экспериментов с использованием различных начальных значений случайных чисел (random seed). Более низкие значения указывают на более высокую вычислительную эффективность, в то время как стабильное время обучения в разных запусках свидетельствует о повышенной воспроизводимости и согласованности процесса обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Набор данныхМодальностиКоличество образцовЯзыкМетки эмоций/сентимента
CH-SIMS34Видео, аудио, текст2,281 видеосегментКитайскийМультимодальные и унимодальные метки сентимента (отрицательный, нейтральный, положительный)
CMU-MOSEI35Видео, аудио, текст~23,453 аннотированных клипаАнглийскийМетки интенсивности сентимента и эмоций (непрерывные и категориальные)

Таблица 1: Описание наборов данных. Сводка наборов данных, использованных в данном исследовании, с указанием модальностей, количества образцов, языка, а также меток эмоций/тональности для наборов данных CH-SIMS и CMU-MOSEI.

КомпонентТехнические характеристики
Программная платформаPython с PyTorch
Экстрактор визуальных признаковVision Transformer (ViT) (Визуальный трансформер)
Экстрактор признаков аудиосигналаWav2Vec 2.0
Экстрактор признаков текстаRoBERTa
Стратегия слиянияСеть кросс-модального внимания на основе графов
Размерность признаков768 на каждую модальность
Оптимизатор обученияАдам
Скорость обучения1,00E-04
Размер партии16
ОборудованиеГрафический процессор NVIDIA GPU (например, серии RTX)
Наборы данных для оценкиCH-SIMS, CMU-MOSEI
Латентное измерение2,56E+02
Размерность эмбеддинга768
Функция активацииReLU (линейная функция выпрямления)
ОптимизаторАдам
Скорость обучения1,00E-04
Размер партии32
Эпохи100
Ранняя остановкаВключено
Функция потерьКлассификация + Реконструкция + Согласованность

Таблица 2: Среда моделирования. Экспериментальная установка и детали реализации среды моделирования, такие как спецификации модели, признаки, оптимизатор и используемое оборудование.

МетодТочность CH-SIMS (%)Точность CMU-MOSEI (%)
LSTM (Раннее/Позднее объединение)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Адаптивный граф78.46 ± 0.7376.89 ± 0.81
Предлагаемый метод81.72 ± 0.6179.94 ± 0.69

Таблица 3: Оценка точности предлагаемого метода по сравнению с базовыми методами на наборах данных CH-SIMS и CMU-MOSEI. Результаты представлены как среднее значение ± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных случайных значений (seed). Для обеспечения справедливого сравнения все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных.

МетодCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (раннее/позднее слияние)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Адаптивный граф0.334 ± 0.0090.379 ± 0.010
Предлагаемый метод0.298 ± 0.0070.341 ± 0.008

Таблица 4: Результаты средней абсолютной ошибки. Результаты представлены как среднее значение ± стандартное отклонение, полученное в ходе пяти независимых экспериментальных прогонов (n = 5) с использованием различных начальных значений случайных чисел. Все методы оценивались с использованием идентичных разделений на обучающую, валидационную и тестовую выборки соответствующих наборов данных для обеспечения справедливого сравнения. Сравнение MAE для непрерывного прогнозирования интенсивности эмоций с использованием предлагаемого фреймворка и базовых подходов на обоих наборах данных.

Вариант моделиТочность (%)F-мера
Полная модель81.72 ± 0.610.823 ± 0.008
Без распутывания78.94 ± 0.740.791 ± 0.010
Без слияния графов77.88 ± 0.810.776 ± 0.011
Без визуального картирования80.11 ± 0.660.807 ± 0.009
Основы слияния74.91 ± 0.980.742 ± 0.013

Таблица 5: Результаты абляционного анализа с базовыми методами. Результаты представлены как среднее ±± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных случайных начальных значений (seed). Все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных для обеспечения справедливого сравнения. Сравнение производительности вариантов моделей, указывающее на эффективность обучения на распутанных представлениях, графового слияния и модуля визуального отображения.

Дополнительный файл 1: Алгоритм 1 и Алгоритм 2.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Экспериментальные результаты показывают, что на наборах данных CH-SIMS и CMU-MOSEI предложенная структура визуального сопоставления для мультимодальных характеристик эмоций превосходит современные методы распознавания мультимодальных эмоций. По сравнению с моделями раннего и позднего объединения, такими как EF-LSTM и TFN, предложенный метод обеспечивает более высокую точность и значения F1-меры, что демонстрирует его устойчивость при обработке разнообразной эмоциональной информации. Улучшение метода можно объяснить распутанным представлением эмоций, которое подавляет шум, специфичный для конкретной модальности, и обеспечивает согласованность эмоций между визуальной, аудио- и текстовой модальностями36.

В последнее время мультимодальные модели на основе трансформеров, такие как Adaptive Multimodal Transformers37 и MIAR38, демонстрируют впечатляющие результаты в моделировании кросс-модальных зависимостей. Тем не менее, эти модели ориентированы преимущественно на прогнозирование и не имеют механизмов, поддерживающих интерпретируемость на уровне признаков. Напротив, предлагаемая система сочетает в себе кросс-модальное внимание на основе графов с модулем визуального отображения, что позволяет проводить прозрачный анализ взаимодействий между модальностями и эмоциями. Это критически важный аспект, который в настоящее время отсутствует в литературе, где вывод об эмоциональном состоянии рассматривается как процесс «черного ящика».

Предложенная структура продемонстрировала стабильные результаты на эталонных наборах данных CH-SIMS и CMU-MOSEI. Несмотря на то что данная структура может найти применение в интеллектуальном человеко-машинном взаимодействии, мониторинге состояния здоровья, адаптивных средах обучения и других системах, учитывающих эмоциональное состояние, в настоящем исследовании метод оценивался только в контролируемых условиях бенчмаркинга. Внедрение в реальных условиях, оценка пользовательского интерфейса, исследование юзабилити или оценка с участием людей не проводились. Следовательно, практическая эффективность структуры в рабочих средах требует дальнейшего изучения. Будущая работа будет сосредоточена на оценках, ориентированных на развертывание, исследованиях с участием пользователей, анализе задержек, оценке потребления памяти и производительности взаимодействия в режиме реального времени.

Более того, повышение эффективности на различных культурно и лингвистически разнообразных наборах данных подтверждает валидность предложенного фреймворка. В отличие от предыдущих работ, прошедших валидацию на одном наборе данных или в конкретном сценарии взаимодействия, предложенный фреймворк демонстрирует стабильную производительность независимо от языка, говорящего и эмоционального выражения. Таким образом, предложенный фреймворк весьма подходит для практических интеллектуальных систем взаимодействия, требующих точного распознавания эмоций и интерпретируемого принятия решений.

Интерпретируемость предложенной структуры была оценена с помощью анализа изученных мультимодальных представлений на основе визуализации. В частности, для получения представления о процессе принятия решений моделью и вкладе каждой модальности были изучены латентные эмбеддинги эмоций, карты кросс-модального внимания, графы взаимодействия модальностей и временные траектории эмоций. Целью модуля визуального картирования является повышение прозрачности путем обеспечения возможности наблюдения за взаимодействиями на уровне признаков и эмоциональной динамикой. Однако формальные метрики интерпретируемости, оценка достоверности внимания и пользовательские исследования в данную работу не были включены. Следовательно, сообщаемые преимущества интерпретируемости следует рассматривать как доказательства на основе визуализации, а не как количественно подтвержденные показатели объяснимости.

С теоретической точки зрения данное исследование вносит следующий вклад в область мультимодальных аффективных вычислений: в нем предлагается систематический способ моделирования эмоций, который четко разграничивает представления, специфичные для конкретной эмоции, и представления, специфичные для конкретной модальности. Обеспечивая эмоциональную согласованность между модальностями в общем латентном пространстве, предложенная структура развивает теорию обучения представлениям в мультимодальных системах. Внедрение механизмов внимания на основе графов дополнительно формализует зависимости между различными модальностями при выражении эмоций.

С практической точки зрения предлагаемая структура весьма полезна для проектирования интеллектуального взаимодействия и пользовательских интерфейсов, учитывающих эмоциональное состояние. Модуль визуального сопоставления в данной структуре позволяет разработчикам систем понять влияние различных модальностей на прогнозирование эмоций, что имеет большое значение для проектирования систем. Предложенная структура будет очень полезна для таких приложений, как аффективные разговорные агенты, адаптивные системы обучения, интерфейсы мониторинга состояния здоровья и платформы оценки пользовательского опыта.

Тем не менее, предложенная структура имеет ряд ограничений. Использование механизмов внимания в графах и трансформерных энкодеров увеличивает сложность, что может быть проблематичным для устройств с ограниченными возможностями. Кроме того, в текущем исследовании игнорируются другие физиологические сигналы, такие как ЭЭГ и айтрекинг, в пользу сосредоточения внимания на визуальных, аудио- и текстовых модальностях. Вычислительная эффективность предложенной структуры для развертывания в режиме реального времени не оценивалась специально, несмотря на то, что она продемонстрировала конкурентоспособную точность прогнозирования и улучшенные возможности визуализации. В будущих исследованиях будут изучены производительность развертывания в реальных контекстах интеллектуального взаимодействия, задержка вывода, пропускная способность, потребление памяти и методы сжатия моделей. Для дальнейшего повышения точности моделирования эмоций и скорости отклика взаимодействия будущие исследования будут сосредоточены на разработке облегченных моделей, методах оптимизации в режиме реального времени и включении дополнительных модальностей. Производительность развертывания в режиме реального времени не оценивалась, а включение трансформерных энкодеров и методов внимания на основе графов повышает вычислительную сложность. Для валидации методологии использовались только эталонные наборы данных CH-SIMS и CMU-MOSEI, что может привести к смещениям, специфичным для конкретного набора данных, и ограничить обобщаемость на другие области, языки и группы пользователей. Кроме того, текущее исследование не включает физиологические сигналы, такие как данные ЭЭГ или айтрекинга; вместо этого оно концентрируется на визуальных, аудио- и текстовых модальностях. Хотя подробные описания реализации и среды симуляции повысили воспроизводимость, исходный код и предобученные модели в настоящее время не находятся в открытом доступе.

В данной работе используется новая платформа визуального картирования для многомодального обучения признакам эмоций в целях проектирования интеллектуального взаимодействия. Предложенный метод объединяет сквозное обучение представлениям на основе трансформеров, распутанное моделирование эмоций и кросс-модальное внимание на основе графов для достижения высокой точности прогнозирования и интерпретируемости. Эксперименты на наборах данных CH-SIMS и CMU-MOSEI показывают, что предлагаемая платформа превосходит современные многомодальные модели распознавания эмоций по точности и F1-мере. Что более важно, предложенное решение по визуальному картированию устраняет разрыв между распознаванием эмоций и стратегией взаимодействия, открывая новое направление для разработки интерпретируемых многомодальных систем аффективных вычислений, учитывающих особенности взаимодействия.

Для обеспечения интерпретируемого и интеллектуального дизайна взаимодействия в данном исследовании представлена новая платформа визуального картирования для изучения мультимодальных признаков эмоций. Предложенная система успешно объединяет детектирование эмоций и интерпретируемость в рамках единой архитектуры, сочетая извлечение мультимодальных признаков на основе трансформеров, обучение распутанному представлению эмоций, слияние кросс-модального внимания на основе графов и методы визуального картирования. Помимо предоставления четких визуальных представлений вклада каждой модальности, кросс-модальных взаимодействий и временной динамики эмоций, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала улучшение производительности по сравнению с репрезентативными базовыми методами по нескольким метрикам, включая Accuracy, Precision, Recall, F1-score и Mean Absolute Error (MAE). Однако данное исследование ограничено оценкой на двух эталонных наборах данных и не включает исследования по внедрению в реальных условиях, пользователько-ориентированные оценки, количественные анализы объяснимости, а также интеграцию физиологических модальностей. Кроме того, в условиях ограниченных ресурсов могут возникнуть трудности из-за вычислительной сложности трансформерных энкодеров и процессов внимания на основе графов. Несмотря на то, что будущие работы будут сосредоточены на более обширной валидации на различных наборах данных, интеграции дополнительных модальностей, исследованиях удобства использования, выпуске воспроизводимых ресурсов и оптимизации для сценариев развертывания в реальном времени, предлагаемая платформа в целом демонстрирует потенциал интерпретируемого мультимодального анализа эмоций для аффективных вычислений и приложений интеллектуального взаимодействия.

Раскрытие информации

Авторы не имеют конфликта интересов.

Благодарности

Авторы выражают благодарность за поддержку, оказанную Школой жилья, строительства и планирования Университета Sains Malaysia (Пенанг, Малайзия) и Школой дизайна и искусства Чаншаского университета естественных наук & Технологии, Чанша, Китай. Авторы также выражают благодарность Академии искусств и дизайна города Сямынь Университета Фучжоу, Сямынь, Китай, за академическую и исследовательскую поддержку на протяжении всей данной работы.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
АдамБиблиотека оптимизаторов PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Скорость обучения = 1 × 10-4)Оптимизация параметров при обучении модели
CH-SIMSРепозиторий исходного набора данныхПоследний публичный выпускЭталонный набор данных для китайского мультимодального анализа сентимента/эмоций
CMU-MOSEIРепозиторий CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (последний публичный релиз)Эталонный набор данных для мультимодального распознавания настроений и эмоций
Дистиллированный энкодер эмоцийИндивидуальная реализацияАрхитектура с двойным кодировщиком (Dual Encoder Architecture)Разделение специфичных для эмоций и специфичных для модальности латентных представлений
Графовая сеть внимания (GAT)PyTorch GeometricМногоголовый GAT (https://pytorch-geometric.readthedocs.io/en/latest/)Моделирование кросс-модальных эмоциональных связей и адаптивное слияние признаков
Слой кросс-модального внимания на основе графовИндивидуальная реализацияСлияние с механизмом многоголового вниманияИзучение детальных эмоциональных зависимостей между модальностями
MatplotlibПроект Matplotlib3.7+Построение графиков и визуальная аналитика
NetworkXПроект NetworkX3.0+Построение и визуализация графов кросс-модального взаимодействия
GPU NVIDIANVIDIA CorporationGPU с поддержкой CUDAУскорение обучения трансформеров и графовых нейронных сетей
Метод главных компонент (МГК)Scikit-learnsklearn.decomposition.PCAПервичное снижение размерности многомерных эмбеддингов эмоций
PythonPython Software Foundation3.8+Основной язык программирования для реализации среды мультимодального анализа эмоций
PyTorchPyTorch Foundation2.0+Разработка, обучение и оптимизация глубоких нейронных сетей
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, эмбеддинги размерности 768)Извлечение контекстуальных лингвистических и семантических представлений эмоций
SeabornПроект Seaborn0.12+Построение карт внимания и статистическая визуализация
t-распределенное стохастическое вложение соседей (t-SNE)Scikit-learn
scikit-learn.org (перплексия = 30, количество итераций = 1000)
Визуализация латентных кластеров и траекторий эмоций
Ubuntu LinuxCanonical Ubuntu20.04 LTS или более поздняя версияСреда проведения эксперимента
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, эмбеддинги размерности 768Извлечение визуальных представлений из видеокадров с учетом эмоционального состояния
Wav2Vec 2.0Исследовательский центр Meta AIБазовая модель, 768-мерные эмбеддингиИзвлечение контекстных акустических признаков и признаков эмоциональной окраски речи

Ссылки

  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Перепечатки и разрешения

Теги