Предлагаемая работа направлена на совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального отображения мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с правилами использования, стандартами исследований и условиями лицензирования, установленными их создателями. Мультимодальный контент наборов данных, включая текстовые, аудио- и видеоданные, был первоначально собран и аннотирован поставщиками данных в соответствии с полученными разрешениями участников и протоколами сбора данных. В данном исследовании не предусматривалось прямого взаимодействия с людьми, набора новых участников или сбора персональных данных. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не потребовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование было проведено в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этическими процедурами исследования и применимыми политиками использования данных.
Для изучения характеристик эмоций в различных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Компонент многопроекционного визуального отображения используется для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени, а его эффективность оценивается для распознавания эмоций. Результаты показывают, что предлагаемый метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов с учетом эмоций в реальных условиях. На рисунке 1 показана архитектурная схема предлагаемой работы. На рисунке 1 представлена полная схема предлагаемого фреймворка визуального отображения для обучения многомодальным признакам эмоций в контексте систем интеллектуального взаимодействия. Рабочий процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют взаимодополняющую эмоциональную информацию из лингвистической, просодической модальностей и модальности мимики соответственно. Специфический для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где эмбеддинги, специфичные для эмоций, отделяются от признаков, специфичных для модальности, чтобы обеспечить согласованность выученных эмоций в гетерогенных источниках данных. Эмбеддинги специфических эмоций из каждой модальности затем агрегируются кросс-модальной сетью внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. Наконец, фреймворк предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.
Мультимодальный сбор данных
Наборы данных CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных датасета, содержащих синхронизированные видео-, аудио- и текстовые данные. Набор данных CH-SIMS включает результаты мультимодальных исследований китайцев и состоит из 2 281 видеофрагмента, извлеченного из различных сегментов кинофильмов, телевизионных драм и развлекательных шоу. Добавление соответствующих аудио- и текстовых данных к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически реализуемыми. В свою очередь, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является датасет CMU-MOSEI, который был сформирован из более чем 23 000 видеоклипов с фразами, произнесенными более чем 1 000 говорящими на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.
Текстовые транскрипции, аудиосигналы и видеокадры собираются и синхронизируются по временным меткам для достижения точного соответствия на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и слияния на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокальных тонов и лингвистического содержания. Такой метод мультимодального сбора данных позволяет эффективно извлекать межмодальную эмоциональную динамику, что крайне важно для проектирования интеллектуального взаимодействия и понятного визуального отображения.
Таблица 1 представляет основные структуры мультимодальных наборов данных эмоций, использованных в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произнесенные слова, интонации голоса и мимика, CH-SIMS и CMU-MOSEI интегрируют видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет провести тщательный анализ взаимодействия модальностей и вариативности эмоций в Китае. С другой стороны, набор данных CMU-MOSEI имеет большее значение для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассмотренных в данной работе, поскольку он содержит большой объем данных на разных языках, по различным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, он снижает трудности при выборе информации при тестировании моделей.
Мультимодальная предобработка и синхронизация
Временные метки из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечило согласованное обучение мультимодальным представлениям. Каждое высказывание служило основной единицей анализа и было связано с соответствующими аудио- и видеосегментами в том же временном интервале. Выравнивание проводилось на уровне высказываний. Транскрипт был разделен на сегменты на основе временных меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио и видео устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попадающих в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента сэмплировались с заданной частотой и кодировались с использованием Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения признаков всех модальностей к единой границе высказывания, так как три модальности генерировали последовательности признаков различной длины. Для нормализации последовательностей разной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями. В процессе обучения использовались маски внимания, чтобы отделить дополняющие элементы от фактических позиций признаков. Эмбеддинги конкретных модальностей проецировались в общее латентное пространство перед слиянием, чтобы преодолеть различие в длине последовательностей разных модальностей. Это гарантировало размерную согласованность и позволило механизму внимания на основе графов эффективно реализовать обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований были исключены образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.
Извлечение признаков на основе трансформеров
Метод глубокого обучения используется для извлечения высокоуровневых признаков, учитывающих эмоциональную составляющую, из информации различных модальностей, таких как зрение, звук и текст, в сквозном режиме после выравнивания мультимодальных данных и выполнения необходимой предобработки. Благодаря использованию трансформерного энкодера для получения внутренне дискриминативных представлений признаков из необработанных мультимодальных данных, предлагаемый метод устраняет необходимость в ручном проектировании признаков. Для обеспечения согласованности между наборами данных, используемыми в предлагаемом подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой из отдельных модальностей, включая изображения, аудио и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе, в частности, в методе извлечения признаков, примененном к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для изучения высокоуровневых признаков в данных различного объема.
Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния
Для извлечения визуальной информации из кадров видео с целью получения пространственных представлений, релевантных эмоциям, была использована модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого видеосегмента были масштабированы до (224 × 224) пикселей и отобраны через регулярные временные интервалы. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров были спроецированы в 768-мерное пространство эмбеддингов с использованием предобученной модели ViT в качестве визуального базового компонента (backbone). Эмбеддинги на уровне кадров объединялись с помощью среднего пулинга для создания итогового визуального представления для каждого сегмента. В процессе обучения для улучшения обобщающей способности применялись нормализация изображений и стандартные методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая структура мультимодального слияния была использована для объединения этих визуальных эмбеддингов с текстовыми и аудиопредставлениями.
Для сохранения временной динамики эмоций видеообразцы из наборов данных CH-SIMS и CMU-MOSEI будут подвергнуты равномерному семплированию для визуальной модальности. Кадры каждого видео,
, могут быть разделены на N сегментов фиксированного размера, которые затем выравниваются и переносятся в обратном порядке в пространство латентных эмбеддингов с размерностью
. Последовательность создается путем добавления позиционных эмбеддингов и обучаемого группового токена:
(1)
где
обозначает позиционное кодирование, а
представляет собой матрицу вложения патчей.
Для обработки последовательности встроенных патчей используются стекированные слои энкодера трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:
(2)
(3)
Для получения вектора визуальных признаков с учетом эмоций в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса
. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании наборов данных, объединяются эмбеддинги на уровне кадров из каждого сегмента видео для фиксации мимики и эволюции эмоций.
Аудиомодальность с использованием Wav2Vec 2.0 для просодии и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с использованием предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегирования выходных скрытых представлений с помощью среднего пулинга. Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и релевантных эмоциям характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы и передискретизированы до 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных меток, предоставленных в аннотациях датасета. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем, с использованием итоговых аудиоэмбеддингов, было выполнено кросс-модальное слияние на основе графового внимания и обучение распутанным представлениям.
В аудиомодальности Wav2Vec-2.0 используется для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала
существует сверточное кодирование признаков:
(4)
где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на базе трансформера дополняет вышеупомянутые структуры, представляя долгосрочные временные зависимости:
(5)
Просодические и семантические акустические данные, которые необходимы для выражения эмоций, включены в эти контекстуальные акустические представления. Эмбеддинг аудио определенной длины создается путем выполнения процедуры временного пулинга:
(6)
Данная архитектура исключает использование таких акустических признаков, как MFCC, и обеспечивает устойчивость за счет использования данных англоязычной речи из CMU-MOSEI и китайской речи из CH-SIMS путем простого извлечения представлений из форм волны.
Текстовая модальность с использованием RoBERTa для получения контекстных эмбеддингов эмоций
Для текстовой модальности к транскриптам речи из двух наборов данных применяется глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Трансформерные энкодеры на базе RoBERTa использовались для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с помощью соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Для обеспечения согласованности пакетной обработки входные последовательности преобразовывались в токен-эмбеддинги, после чего дополнялись или обрезались до заданной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделители. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных трансформерным энкодером, с использованием финального представления предложения, эквивалентного [CLS]. Для адаптации полученных представлений к задаче распознавания эмоций предобученные энкодеры RoBERTa были доработаны в процессе мультимодального обучения. Затем предложенная структура мультимодального слияния была использована для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.
Эмбеддинги токенов и позиционные кодировки могут быть объединены для каждого токенизированного входного элемента,
, чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как
(7)
Эта форма представлена через слои L-трансформера, который использует механизм самовнимания (self-attention) для выявления контекстных зависимостей между словами:
(8)
Контекстный эмбеддинг эмоций получается с использованием конечного скрытого состояния токена классификации:
(9)
Полярность настроений, интенсивные эмоции и связанные с ними смыслы являются примерами лингвистических характеристик, относящихся к эмоциям, которые будут представлены этим эмбеддингом. RoBERTa упрощает языково-независимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.
На предлагаемом этапе обучения глубокому представлению признаков извлекаются три специфичные для каждой модальности векторные характеристики размерностью 768: визуальная fv, аудио fa и текстовая ft . В дизайне интеллектуального взаимодействия эти полученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на основе графов и обучения распутанным представлениям.
Обучение распутанным представлениям
После получения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков визуальной, слуховой и текстовой модальностей может позволить получить несвязное описание эмоций. Если специфические для каждой модальности вложения признаков слуховой, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, такие что
и
, целью данного этапа является факторизация всех признаков модальностей на два отдельных латентных описания, которые включают описания эмоций с учетом предшествующей семантики каждой из различных модальностей.
Это достигается путем подачи признаков каждой модальности, fm , в две параллельные проекционные сети: кодировщик эмоций
и кодировщик модальности
, в которых формируются два кодирования.
(10)
Где
скрытый признак, связанный с эмоцией, а
представляет собой скрытый признак, специфичный для конкретной модальности. Это позволяет специфичным для эмоций эмбеддингам взаимодействовать с пространством многократно по нескольким входным данным, включая аудио-визуальные и текстовые, сохраняя при этом уникальные структурные данные, связанные с каждой модальностью.
Эффективное разделение обеспечивается за счет реконструкции с ограничениями независимости. Реконструкция признака исходной модальности определяется следующим образом:
(11)
где
представляет собой сеть-декодер. Потеря при реконструкции сохраняет следующие данные:
(12)
Кроме того, ортогональность или декорреляция между эмоциями и специфичными для модальности изображениями часто ограничивают перекрытие информации:
(13)
Достижение этих целей позволит модели выучить представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное объединение на основе графов и функции визуального картирования, особенно для проектирования интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.
Согласованность эмоций между модальностями
Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это объясняется тем, что стратегии слияния больше не требуют учета значительных разрывов между двумя представлениями, так как специфичные для модальностей эмбеддинги эмоций разделяют общее латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом
. Взвешенное слияние будет более стабильным при согласованности специфичных для эмоций представлений, так как вариации между сигналами различных модальностей больше не будут влиять на результат.
(14)
Путем обеспечения семантического выравнивания эмоциональной информации эта цель сводит к минимуму расхождения между модальностями и гарантирует, что восприятие эмоций остается неизменным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное репрезентативное пространство путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.
Влияние на кросс-модальное слияние
Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку специфичные для эмоций эмбеддинги выравниваются в общем латентном пространстве. Слитое представление эмоции определяется следующим образом:
(15)
Где αm представляет собой вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфичные для эмоций представления согласуются, так как результат слияния демонстрирует взаимодополняющие эмоциональные признаки, а не противоречивые сигналы модальностей.
С математической точки зрения снижение
дисперсии между различными типами специфических для эмоций представлений по отношению к
эквивалентно следующему:
(16)
где
представляет среднее выражение эмоций. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.
Конечной целью обучения при визуализации распутанных эмоций является объединение фрагментации, реконструкции и однородности эмоций:
(17)
какие два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между кросс-модальной надежностью эмоций и диссоциацией. Для достижения этой цели предлагаемая модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления, уделяя особое внимание созданию надежной основы для последующего слияния на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.
Графовое кросс-модальное внимание для слияния данных
Для имитации детальных эмоциональных связей между модальностями была использована кросс-модальная сеть внимания на основе графов. Чтобы облегчить поток информации между модальностями был построен полностью связный мультимодальный граф, в котором каждый специфический для модальности эмбеддинг (текстовый, аудио- и визуальный) представлен в виде узла графа. Отношения между модальностями использовались для создания матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проекции выходов нескольких голов внимания. Затем было получено единое мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем поступало в модули прогнозирования и визуализации для анализа с учетом взаимодействия и распознавания эмоций. Модуль слияния графов имел размерность скрытого представления 256 и два слоя внимания графа, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем внимания графа следовали нормализация слоя, остаточные связи (residual connections) и слой дропаута с коэффициентом 0,2 для повышения стабильности обучения и снижения переобучения. После конкатенации и проекции выходов нескольких голов внимания в общее латентное пространство представления узлов были объединены в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многовидового визуального картирования и прогнозирования эмоций.
Разнообразные кросс-модальные взаимодействия регистрировались с помощью многоголового графового внимания. Для нормализации коэффициентов внимания между связанными узлами для каждого узла использовалась функция softmax. Для повышения стабильности обучения и предотвращения переобучения за стековыми слоями графового внимания модуля объединения графов следовали остаточные связи, послойная нормализация и регуляризация методом dropout.
Пусть обозначения
по отдельности представляют собой представления, соответствующие конкретным эмоциям, собранным визуальным, аудио- и текстовым модальностями; каждый компонент находится в общем латентном пространстве
. Модели для узлов модальностей используют обозначение графа
, где узлы совокупности
соответствуют трем узлам модальностей, чтобы эксплицитно усилить эмоциональные зависимости, общие для различных представлений модальностей.
После присвоения каждому узлу графа вектора признаков, специфичного для определенной эмоции, мы получаем следующее:
(18)
В отличие от традиционных методов слияния, в которых используются предопределенные или фиксированные веса слияния, предлагаемый метод позволяет определять адаптивные веса ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.
Для кросс-модального слияния используется графовая сеть внимания (GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:
(19)
Эмоциональный эффект перехода от моды j к модальности i измеряется нормированными весами αij.
Затем вычисляемый объединенный вид каждого узла модальности определяется как взвешенная группировка его соседей:
(20)
где функция активации
является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального комбинированного представления эмоций:
(21)
Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального картирования, поскольку он позволяет извлекать дополняющую друг друга информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.
Алгоритм 1 (Дополнительный файл 1) представляет собой общую схему реализации кросс-модального слияния на основе графов. Сначала создается граф, в котором специфические для каждой эмоции характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем рассчитываются показатели внимания для каждой пары узлов графа, которые представляют собой комбинацию эмоциональной зависимости. После этого показатели внимания нормализуются для определения относительного вклада каждой модальности в заданный эмоциональный контекст, что позволяет обучать веса внимания. На заключительном этапе формируется общий вектор вложения эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, общее слияние мультимодальных признаков, связанных с определенными эмоциями, в данном алгоритме демонстрирует потенциал с точки зрения адаптивности, интерпретируемости и контекстуального интеллекта.
Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети кросс-модального внимания для мультимодального слияния признаков сентимент-анализа. Эмоциональные эмбеддинги, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальностей, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем представления модальностей, взвешенные с помощью внимания, объединяются для формирования единого эмоционального эмбеддинга, при этом матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обучаемая сетью, динамически модулирует вклад каждой модальности, позволяя системе фокусироваться на наиболее информативном канале, игнорируя зашумленные и менее значимые данные. Слитое эмоциональное представление обеспечивает точное распознавание эмоций и детальный анализ таких эмоциональных состояний, как нейтральное, объятие и беспокойство.
Модуль визуального картирования
С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать унифицированное представление эмоционального состояния в понятную и легко воспринимаемую визуальную форму на основе графа после процесса кросс-модального слияния.
Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двумерное пространство для отображения с использованием стохастического соседства с t-распределением (t-SNE). Для t-SNE использовались значение перплексии 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Для создания тепловых карт внимания использовались нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания. На этих тепловых картах отображен относительный вклад текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально изучить межмодальные связи и информационные потоки внутри структуры слияния. Для анализа временной эмоциональной динамики были построены графики траекторий эмоций путем мониторинга развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории проясняют, как меняются эмоциональные состояния и вклад модальностей с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и тепловых карт внимания.
Пусть переменная
будет представлять собой объединенное представление эмоционального состояния, полученное с помощью функции графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.
С помощью полученных αji создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем входящие веса внимания суммируются для определения совокупного показателя значимости каждой модальности:
(22)
где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и отображаются на цветовой карте, которая позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым модальностям ввода такой интерфейс помогает пользователю понять принципы работы механизма внимания системы.
Обучаемый граф специально моделируется как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом графа, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на ребрах, которые их соединяют. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определения i и j следующие:
(23)
Благодаря этим весовым коэффициентам толщина линий или прозрачность визуализации графа отображаются надлежащим образом. Это облегчает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия дизайнер может лучше понять, как эмоциональные индикаторы взаимодействуют в процессе слияния.
Объединенные эмбеддинги эмоций
на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:
(24)
где функция проекции представлена
. Появление 2D/3D траекторий эмоций, которые демонстрируют переходы, интенсивность и стабильность эмоций в ходе взаимодействий, может быть интерпретировано как интуитивное изображение эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.
В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, данная система ориентирована на демонстрацию механизмов формирования человеческих эмоций внутри нее. Она раскрывает процесс принятия решений, предоставляя визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействия между моделями и соответствующие пути их прохождения. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.
Таким образом, сопоставление эмоций с понятными формами с помощью визуальных представлений может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией в проектирование интеллектуальных интерфейсов. Данные, собранные обоими подходами, могут быть затем использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам взаимодействия важную информацию для создания более точных пользовательских интерфейсов. Другими словами, понимание эмоций становится активной частью дизайна взаимодействия. Точность может повыситься только в том случае, если понимание эмоций будет активно внедрено в процесс проектирования взаимодействия.
Модуль визуального отображения обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает лежащие в основе представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальности использует данные из графов взаимодействия и тепловых карт визуального внимания для описания того, как каждая модальность — визуальная, аудио- или текстовая — влияет на решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют понять, как каждая визуальная и текстовая модальность изменяется со временем с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Supplementary File 1).
Объединенные мультимодальные эмоциональные признаки отображаются на визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения 2. Веса графового мультимодального внимания используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются на визуальные представления для выделения основных источников, влияющих на эмоции, с помощью визуальных элементов тепловой карты. Чтобы обеспечить детальный обзор взаимодействия между входными элементами и передать эволюцию эмоций, вызванную мультимодальными входными данными, затем вычисляются попарные интенсивности взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается представление эволюции эмоций путем отображения объединенных эмоциональных элементов, собранных за определенный период времени, в низкоразмерное пространство для получения непрерывной эволюции эмоционального элемента.
Прогнозирование эмоций и обратная связь при взаимодействии
Результат объединенного представления эмоций, выраженный как
, затем используется в качестве функции как для обратной связи по взаимодействию, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая классификационная модель на основе функции softmax:
(25)
где
представляет собой ожидаемые вероятности классов эмоций, а Wc и bc являются обучаемыми ограничениями. Для улучшения цели классификации используется перекрестная энтропия:
(26)
где yk — это истинная метка, а K — количество классов эмоций. Регрессионная ветвь используется для параллельной оценки интенсивности эмоций, создавая прогноз различных непрерывных аффективных атрибутов, включая валентность и возбуждение. Приведите следующее определение:
(27)
где ожидаемый показатель интенсивности эмоций обозначен как
. Для улучшения задачи регрессии используется функция потерь среднеквадратичной ошибки:
(28)
В целом, эти две задачи объединяются в целевой функции прогнозирования:
(29)
где цели регрессии и классификации сбалансированы с помощью λ. Это предполагает динамическую модификацию модуля визуализации на основе определенного эмоционального состояния для обеспечения такого типа обратной связи, учитывающей взаимодействие. Контекст взаимодействия в данный момент времени t представлен как ct. Ответ модуля визуализации определяется следующим образом:
(30)
где функция адаптации визуализации представлена
. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Это свидетельствует о том, что система, помимо высокой эффективности в прогнозировании эмоционального состояния, обеспечивает существенную поддержку обратной связи.