$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Целью предлагаемой работы является совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального сопоставления мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с рекомендациями по эксплуатации, стандартами исследований и условиями лицензирования, установленными их соответствующими создателями. Мультимодальный контент наборов данных, включая текстовые, аудио- и видеоданные, был предварительно собран и аннотирован поставщиками данных в соответствии с их санкционированными разрешениями участников и протоколами сбора данных. В данном исследовании не было прямого взаимодействия с людьми, не проводился набор новых участников и не осуществлялся сбор персональных данных. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не требовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование было проведено в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этическими процедурами исследований и применимыми политиками использования данных.
Для обучения характеристикам эмоций в различных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени используется компонент многовидового визуального отображения, эффективность которого оценивается при распознавании эмоций. Результаты показывают, что предложенный метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов с учетом эмоций в реальных условиях. На рисунке 1 показана архитектурная схема предлагаемой работы. Рисунок 1 демонстрирует полный рабочий процесс предлагаемой структуры визуального отображения для многомодального обучения признакам эмоций в контексте интеллектуальных систем взаимодействия. Процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют дополняющую друг друга эмоциональную информацию из лингвистической, просодической и мимической модальностей соответственно. Специфичный для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где встраивания (embeddings), специфичные для эмоций, отделяются от признаков, специфичных для модальностей, чтобы обеспечить согласованность распознанных эмоций в гетерогенных источниках данных. Встраивания специфичных для эмоций признаков из каждой модальности затем агрегируются сетью кросс-модального внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. Наконец, структура предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.
Мультимодальный сбор данных
Наборы данных CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных датасета, содержащих синхронизированную видео-, аудио- и текстовую информацию. Набор данных CH-SIMS состоит из мультимодальных исследований китайцев и включает 2 281 видеофрагмент, отобранный из различных сегментов фильмов, телесериалов и развлекательных шоу. Добавление соответствующих аудио- и текстовых данных к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически осуществимыми. С другой стороны, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является датасет CMU-MOSEI, сформированный из более чем 23 000 видеоклипов с фразами более чем 1 000 говорящих на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.
Текстовые транскрипции, аудиосигналы и видеокадры собираются и выравниваются по временным меткам для обеспечения точного согласования на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и объединения на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокального тона и лингвистического содержания. Такой метод мультимодального сбора данных обеспечивает эффективное извлечение межмодальной эмоциональной динамики, что является необходимым условием для проектирования интеллектуального взаимодействия и понятного визуального отображения.
Таблица 1 представляет основные структуры наборов данных мультимодальных эмоций, использованных в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произносимые слова, интонации голоса и выражения лица, CH-SIMS и CMU-MOSEI интегрируют видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет детально изучить взаимодействие модальностей и вариации эмоций в Китае. С другой стороны, набор данных CMU-MOSEI более важен для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассматриваемых в данной работе, так как он содержит большой объем данных на различных языках, по разным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, это упрощает процесс выбора информации при тестировании моделей.
Мультимодальная предобработка и синхронизация
Временные метки аннотаций из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечило согласованное обучение мультимодальному представлению. Каждое высказывание служило базовой единицей анализа и было связано с соответствующими аудио- и видеосегментами в пределах того же временного интервала. Выравнивание проводилось на уровне высказывания. Транскрипт был разделен на сегменты на основе меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио- и визуальными данными устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попавших в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента выбирались с заданной частотой и кодировались с помощью Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения всех признаков модальностей к единой границе высказывания, так как три модальности генерировали последовательности признаков разной длины. Для нормализации последовательностей разной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями. При обучении использовались маски внимания, чтобы отделить заполняющие элементы от значимых позиций признаков. Специфичные для каждой модальности эмбеддинги проецировались в общее латентное пространство перед слиянием, чтобы нивелировать различия в длине последовательностей разных модальностей. Это гарантировало размерную согласованность и позволило механизму внимания на основе графов обеспечить эффективное обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований исключались образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.
Извлечение признаков на основе трансформера
Метод глубокого обучения используется для получения высокоуровневых признаковых представлений с учетом эмоционального состояния на основе информации из нескольких модальностей, таких как зрение, звук и текст, сквозным (end-to-end) способом после выравнивания мультимодальных данных и проведения необходимой предварительной обработки. Благодаря использованию трансформерного кодировщика для извлечения внутренне дискриминативных признаковых представлений из необработанных мультимодальных данных, предлагаемый метод исключает необходимость в ручном конструировании признаков. Для обеспечения согласованности между наборами данных, используемыми в предлагаемом подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой отдельной модальности, включая изображение, звук и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе, в частности, в методе извлечения признаков, применяемом к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для получения высокоуровневых признаков из данных различных объемов.
Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния
Для извлечения визуальной информации из видеокадров с целью получения пространственных представлений, релевантных эмоциям, использовалась модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого сегмента видео масштабировались до размера (224 × 224) пикселей и отбирались с регулярными временными интервалами. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров проецировались в 768-мерное пространство вложений с использованием предобученной модели ViT в качестве визуального базиса. Эмбеддинги на уровне кадров объединялись с помощью усредняющего пулинга для создания окончательного визуального представления каждого сегмента. В процессе обучения для улучшения обобщающей способности использовались нормализация изображений и общепринятые методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая структура мультимодального слияния применялась для объединения этих визуальных эмбеддингов с текстовыми и слуховыми представлениями.
Для сохранения временной динамики эмоций видеообразцы из наборов данных CH-SIMS и CMU-MOSEI будут равномерно отобраны для визуальной модальности. Кадры каждого видео,
, могут быть разделены на N секций фиксированного размера, которые затем выравниваются и инверсивно переносятся в пространство латентных вложений с размерностью
. Последовательность создается путем добавления позиционных вложений и обучаемого токена группировки:
(1)
где
обозначает позиционное кодирование, а
является матрицей встраивания патчей.
Для обработки последовательности встроенных патчей используются каскадные слои кодировщика трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:
(2)
(3)
Для получения вектора визуальных признаков, учитывающего эмоции, в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса
. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании различных наборов данных, эмбеддинги на уровне кадров из каждого сегмента видео объединяются для фиксации мимики и эволюции эмоций.
Аудиальная модальность с использованием Wav2Vec 2.0 для просодии и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с помощью предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегации выходных скрытых представлений с использованием усредняющего пулинга (mean pooling). Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и значимых для эмоций характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы, и их частота дискретизации была приведена к 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных меток, предоставленных в аннотациях набора данных. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем на основе финальных аудиоэмбеддингов было выполнено слияние через кросс-модальное внимание на базе графов и обучение распутанным представлениям (disentangled representation learning).
Для аудиомодальности используется Wav2Vec-2.0 для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала существует сверточное кодирование признаков
:
(4)
где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на основе трансформера полезна для вышеупомянутых структур, так как она представляет долгосрочные временные зависимости:
(5)
Эти контекстные акустические представления включают просодические и семантические акустические данные, которые имеют важное значение для выражения эмоций. Эмбеддинг аудио конкретной длины создается путем выполнения процедуры временного пулинга:
(6)
Данная архитектура позволяет избежать использования акустических признаков, таких как MFCC, и обеспечивает устойчивость результатов на английских речевых данных из CMU-MOSEI и китайских речевых данных из CH-SIMS за счет простого извлечения представлений непосредственно из форм волны.
Текстовая модальность с использованием RoBERTa для получения контекстуальных эмбеддингов эмоций
Для текстовой модальности к транскриптам речи из двух наборов данных был применен глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Кодировщики на базе RoBERTa использовались для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с использованием соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Чтобы обеспечить согласованную пакетную обработку, входные последовательности были преобразованы в эмбеддинги токенов, а затем дополнены или обрезаны до заранее определенной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделители. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных кодировщиком-трансформером, с использованием итогового представления предложения, эквивалентного [CLS]. Для адаптации полученных представлений к задаче распознавания эмоций предобученные кодировщики RoBERTa были доработаны посредством мультимодального обучения. Затем предложенная архитектура мультимодального слияния использовалась для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.
Встраивания токенов и позиционные кодировки могут быть объединены для каждого токенизированного входного элемента,
, чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как
(7)
Эта форма представлена слоями L-трансформера, который использует механизм самовнимания (self-attention) для выявления контекстных зависимостей между словами:
(8)
Контекстный эмбеддинг эмоций получается с использованием конечного скрытого состояния классификационного токена:
(9)
Полярность настроения, сильные эмоции и связанные с ними смысловые нюансы являются примерами лингвистических характеристик, связанных с эмоциями, которые будут представлены данным эмбеддингом. RoBERTa упрощает языконезависимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.
С помощью предложенного этапа глубокого обучения представлению признаков извлекаются три специфичных для каждой модальности вектора признаков размерностью 768: визуальный fv, аудио- fa и текстовый ft . В рамках проектирования интеллектуального взаимодействия эти изученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на основе графов и обучения распутанным представлениям.
Обучение распутанным представлениям
После изучения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков визуальной, аудиальной и текстовой модальностей может дать несвязное описание эмоций. Если специфические для модальностей вложения признаков аудиальной, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, так что
и
, то целью данного этапа является факторизация всех признаков модальностей в два различных латентных описания, которые включают описания эмоций с учетом предыдущей семантики каждой из различных модальностей.
Это достигается путем подачи признаков каждой модальности, fm , в две параллельные проекционные сети: кодировщик эмоций
и кодировщик модальности
, в которых формируются два соответствующих кодирования.
(10)
Где
означает латентный признак, связанный с эмоцией, а
представляет латентный признак, специфичный для конкретной модальности. Это позволяет эмбеддингам, специфичным для эмоций, взаимодействовать с общим пространством многократно по нескольким входным данным, включая аудио-, визуальные и текстовые, сохраняя при этом уникальные структурные данные, связанные с каждой модальностью.
Эффективное разделение обеспечивается за счет реконструкции с ограничениями независимости. Реконструкция признака исходной модальности определяется следующим образом:
(11)
где
— это сеть-декодер. Потери реконструкции сохраняют следующие данные:
(12)
Кроме того, ортогональность или декорреляция между изображениями эмоций и специфических для модальности признаков часто ограничивает перекрытие информации:
(13)
Достигая этих целей, модель может сформировать представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное слияние на основе графов и функции визуального отображения, особенно при проектировании интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.
Согласованность эмоций в разных модальностях
Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это связано с тем, что стратегии слияния больше не должны учитывать значительные разрывы между двумя представлениями, так как специфичные для модальностей эмоцональные эмбеддинги разделяют общее латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом
. Взвешенное слияние будет более стабильным при согласованности специфических для эмоций представлений, поскольку вариации между сигналами различных модальностей больше не будут влиять на результат.
(14)
Путем обеспечения семантического выравнивания эмоциональной информации эта цель минимизирует расхождения между модальностями и гарантирует, что восприятие эмоций остается стабильным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное репрезентативное пространство путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.
Влияние на кросс-модальное слияние
Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку эмоциоспецифические эмбеддинги выровнены в общем латентном пространстве. Слитое представление эмоций определяется следующим образом:
(15)
Где αm обозначает вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфические для эмоций представления согласованы, так как результат слияния демонстрирует взаимодополняющие эмоциональные признаки, а не противоречивые сигналы модальностей.
С математической точки зрения, снижение
дисперсии между различными типами эмоционально-специфических представлений относительно
эквивалентно следующему:
(16)
где
представляет собой среднее выражение эмоции. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.
Конечной целью обучения при визуализации распутанных эмоций является объединение фрагментации, реконструкции и однообразности эмоций:
(17)
два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между надежностью кросс-модальных эмоций и диссоциацией. Предложенная модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления для достижения этой цели, с акцентом на создании прочной основы для последующего слияния на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.
Кросс-модальное слияние внимания на основе графов
Для моделирования детальных эмоциональных связей между модальностями была использована графовая кросс-модальная сеть внимания. Чтобы облегчить поток информации между модальностями, был построен полносвязный мультимодальный граф, в котором каждое модально-специфическое эмбеддинг-представление (текстовое, аудио и визуальное) выступало в качестве узла графа. Отношения между модальностями использовались для создания матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проектирования выходов нескольких голов внимания. Затем было сформировано единое мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем передавалось в модули прогнозирования и визуализации для анализа с учетом взаимодействий и распознавания эмоций. Модуль графового слияния имел размерность скрытого представления 256 и два слоя графового внимания, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем графового внимания следовали нормализация слоя, остаточные связи и слой dropout с коэффициентом 0,2 для повышения стабильности обучения и уменьшения переобучения. После конкатенации и проектирования выходов нескольких голов внимания в общее латентное пространство представления узлов объединялись в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многоракурсного визуального картирования и прогнозирования эмоций.
Различные кросс-модальные взаимодействия были зафиксированы с помощью многоголового графового внимания. Функция softmax использовалась для нормализации коэффициентов внимания между связанными узлами для каждого узла. Для повышения стабильности обучения и предотвращения переобучения за стековыми слоями графового внимания в модуле слияния графов следовали остаточные связи, послойная нормализация и регуляризация с помощью дропаута.
Пусть члены
по отдельности представляют собой представления, соответствующие конкретным эмоциям, полученные из визуальной, аудио- и текстовой модальностей; каждый компонент находится в общем латентном пространстве
. Модели для узлов модальностей используют обозначение графа
, где узлы совокупности
соответствуют самим трем узлам модальностей, чтобы эксплицитно усилить эмоциональные зависимости, общие для представлений различных модальностей.
После присвоения каждому узлу графа вектора признаков, специфичного для конкретной эмоции, мы имеем следующее:
(18)
В отличие от традиционных методов слияния, в которых используются предопределенные или фиксированные веса слияния, предлагаемый метод обучает адаптивным весам ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.
Для кросс-модального слияния используется графовая сеть внимания (GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:
(19)
Эмоциональный эффект переключения из режима j в модальность i измеряется нормированными весами αij.
Далее, объединенный вид каждого узла модальности вычисляется как взвешенная группировка его соседей:
(20)
где функция активации
является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального интегрированного представления эмоций:
(21)
Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального отображения, поскольку он позволяет фиксировать взаимодополняющую информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.
Алгоритм 1 (Дополнительный файл 1) представляет собой общую схему выполнения кросс-модального слияния на основе графов. Сначала создается граф, в котором специфические для данной эмоции характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем рассчитываются показатели внимания для пар узлов каждого графа, которые представляют собой комбинацию эмоциональной зависимости. После этого показатели внимания нормализуются для определения относительного вклада каждой модальности в указанный эмоциональный контекст, что позволяет обучать весам внимания. На заключительном этапе формируется общее встраивание эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, реализованное в алгоритме общее слияние мультимодальных признаков, связанных с определенными эмоциями, демонстрирует потенциал в плане адаптивности, интерпретируемости и контекстуального интеллекта.
Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети перекрестного модального внимания для мультимодального слияния эмоций. Эмоциональные эмбеддинги, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальности, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем представления модальностей с учетом весов внимания объединяются для формирования единого эмоционального эмбеддинга, в котором матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обучаемая сетью, динамически модулирует вклад модальностей, позволяя системе фокусироваться на наиболее информативной модальности, игнорируя зашумленные и менее значимые данные. Слитое представление эмоций обеспечивает точное распознавание эмоций и детальный анализ эмоциональных состояний, таких как нейтральное, объятия и беспокойство.
Модуль визуального картирования
С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать единое представление эмоционального состояния в визуальную форму, которая будет понятной и легко воспринимаемой после процесса кросс-модального слияния на основе графа.
Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двухмерное пространство для отображения с использованием стохастического вложения соседей t-распределения (t-SNE). Для t-SNE использовались значение perplexity, равное 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания, использовались для создания тепловых карт внимания. На этих тепловых картах отображены относительные вклады текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально исследовать межмодальные связи и информационные потоки внутри структуры слияния. Для изучения временной эмоциональной динамики были построены графики траекторий эмоций путем отслеживания развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории позволяют понять, как изменяются эмоциональные состояния и вклад модальностей с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и тепловых карт внимания.
Пусть переменная
обозначает объединяющее представление эмоционального состояния, сформированное функцией графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.
Используя вычисленное значение αji, создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем веса входящего внимания суммируются для определения совокупного показателя значимости каждой модальности:
(22)
где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и отображаются на цветовой карте, что позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в различных интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым входным модальностям такой интерфейс помогает пользователю понять, как работает механизм внимания системы.
Обученный граф специально смоделирован как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом в графе, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на соединяющих их ребрах. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определение i и j следующее:
(23)
Благодаря этим весам толщина линий или прозрачность визуализации графа отображаются соответствующим образом. Это упрощает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия разработчик может лучше понять, как взаимодействуют эмоциональные индикаторы в процессе слияния.
Объединенные эмбеддинги эмоций
на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:
(24)
где функция проекции представлена выражением
. Появление 2D/3D траекторий эмоций, демонстрирующих переходы, интенсивность и стабильность эмоций во взаимодействиях, может быть интерпретировано как наглядное изображение эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.
В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, эта система сосредоточена на демонстрации механизмов формирования человеческих эмоций внутри неё. Она раскрывает процесс принятия решений, предоставляя визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействия между моделями и соответствующие им пути. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.
Таким образом, отображение эмоций в понятные формы с помощью визуальных репрезентаций может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией при проектировании интеллектуальных интерфейсов. Данные, полученные обоими подходами, затем могут быть использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам интерфейсов важную информацию для разработки более точных пользовательских интерфейсов. Иными словами, понимание эмоций становится активной частью проектирования взаимодействия. Точность может возрасти только в том случае, если понимание эмоций будет активно интегрировано в процесс проектирования взаимодействия.
Модуль визуального картирования обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает базовые представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальностей использует данные графов взаимодействия и тепловых карт визуального внимания для описания того, как каждая модальность — визуальная, аудио- или текстовая — влияет на решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют нам понять, как каждая визуальная и текстовая модальность изменяется с течением времени с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Supplementary File 1).
Объединенные мультимодальные эмоциональные признаки отображаются на визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения (Algorithm 2). Веса мультимодального внимания на основе графов используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются на визуальные представления с помощью элементов тепловых карт для выделения основных источников, влияющих на эмоции. Чтобы обеспечить наглядное представление взаимодействия между входными элементами и передать эволюцию эмоций, вызванную мультимодальными входными данными, затем вычисляется сила попарного взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается вид эмоциональной эволюции путем отображения объединенных эмоциональных элементов, собранных за определенный период времени, в низкоразмерное пространство для получения непрерывной эволюции эмоционального элемента.
Прогнозирование эмоций и обратная связь при взаимодействии
Результат объединенного представления эмоций, выраженный как
, затем используется в качестве функции как для обратной связи при взаимодействии, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая модель классификации на основе функции softmax:
(25)
где
представляет ожидаемые вероятности классов эмоций, а Wc и bc являются обучаемыми параметрами. Для улучшения задачи классификации используется перекрестная энтропия (cross-entropy loss):
(26)
где yk — истинная метка, а K — количество классов эмоций. Параллельно используется регрессионная ветвь для оценки интенсивности эмоций, которая выдает прогноз различных непрерывных аффективных атрибутов, включая валентность и возбуждение. Приведите следующее определение:
(27)
где ожидаемый показатель интенсивности эмоций обозначен как
. Для оптимизации задачи регрессии используется функция потерь среднеквадратичной ошибки:
(28)
В целом, эти две задачи объединены в целевой функции прогнозирования:
(29)
где цели регрессии и классификации сбалансированы с помощью λ. Предлагается динамическая модификация модуля визуализации на основе выявленного эмоционального состояния для обеспечения такого типа обратной связи, учитывающей взаимодействие. Контекст взаимодействия в данный момент времени t представлен ct. Ответ модуля визуализации определяется следующим образом:
(30)
где функция адаптации визуализации представлена как
. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Это свидетельствует о том, что система обеспечивает существенную поддержку обратной связи в дополнение к высокой точности прогнозирования эмоционального состояния.