Research Article

Вычислительное моделирование аффективного пользовательского опыта с использованием мультимодальных физиологических и поведенческих сигналов

DOI:

10.3791/69823

April 7th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает вычислительную структуру, которая моделирует аффективный пользовательский опыт, интегрируя физиологические и поведенческие сигналы в мультимодальной форме, используя методы корреляционного обучения признаков и мультимодального слияния. Этот протокол предлагает и тестирует фреймворк для мультимодального аффективного моделирования на основе бенчмаркового набора данных AMIGOS.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе предлагается воспроизводимый вычислительный протокол мультимодального аффективного моделирования, использующий физиологические сигналы. Цель протокола — обеспечить офлайн-распознавание эмоций путём интеграции нескольких биосигналов с использованием унифицированного фреймворка глубокого обучения. Предлагаемая работа состоит из пяти этапов: сбор данных, предварительная обработка, выравнивание признаков, мультимодальное слияние и оценка. В этой работе в качестве экспериментальной базы использовались сигналы ЭЭГ, ЭКГ и ГСР из общедоступных данных AMIGOS. Биосигналы предварительно обрабатывались и нормализовались для выделения модально-специфических признаков. Гетерогенные пространства признаков были выровнены между модальностями с помощью глубокого канонического корреляционного анализа, за которым последовала мультимодальная сеть слияния для классификации аффективного состояния. Протокол был оценён с помощью офлайн-экспериментов и сравниван с традиционными моделями слияния и классификации с использованием стандартных показателей производительности, таких как точность, точность, отзыв, F1-балл и AUC. Данное исследование сосредоточено на разработке и валидации вычислительной структуры для мультимодального аффективного моделирования пользовательского опыта, а не на внедрении интерактивной системы в реальном времени. С точностью 92,1% прогнозирования UX-аффективного состояния и 94,2% F1-балла для классификации валентно-возбуждения, результаты стабильно превосходили базовые модели по эмоциональным измерениям. Эти результаты подтвердили эффективность предлагаемого мультимодального процесса слияния для вычислительного аффективного моделирования путём бенчмаркинга физиологических данных.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сложное взаимодействие мышления, чувств и действий формирует то, как люди думают и действуют. Аффективные вычисления изучают эти взаимосвязи, используя междисциплинарные знания нейронауки, психологии и искусственного интеллекта для создания систем, способных анализировать, понимать и реагировать на человеческие эмоции. Эта область всё больше применяется в коммуникации между человеком и технологиями путём интеграции экспрессивного сознания в отзывчивые структуры ИИ, что позволяет технологиям взаимодействовать не только с интеллектуальными, но и с эмоциональными условиями, что приводит к более индивидуализированному и эмоционально осознанному знанию пользователя. Эмоция, сложный умственный процесс, отражает человеческое восприятие и играет значительную роль в человеческихвзаимодействиях 1. Сегодня существует множество приложений для взаимодействия человека и компьютера (HCI), которые требуют исследований в области распознаванияэмоций 2. Среда системы HCI динамична и сложна. В большинстве случаев необходимо синхронизировать свои функции с ответчиками; Поэтому эмоциональный интеллект может лучше адаптироваться в такой атмосфере. Поэтому в этом исследовании рассматривается вычислительное моделирование аффективного пользовательского опыта через мультимодальные физиологические и поведенческиесигналы 3. Вместо того чтобы разрабатывать или валидировать интерактивную систему на практике, работа больше склоняется к вкладу в методологию, связанную с мультимодальней интеграцией сигналов, или к влиянию на вывод в контекстах погружения или выставочных условий. Чтобы избежать широты концепций, эта работа сосредоточена на двух основных концепциях: реализации мультимодальной аффективной моделирующей структуры с использованием вычислительных подходов и мультимодальных методах слияния данных для сочетания физиологических и поведенческих данных. Все остальные темы, возникающие в рукописи, приводятся для контекста с точки зрения актуальности разработанных моделей.

Каждая форма эмоций передаёт разную информацию о чувствах человека, которую нельзя получить из другой сенсорной системы. Извлечение эмоций из движения тела, которое включает общий паттерн движения тела, имеет преимущества в том, что идентифицирует невербальные чувства человека4. Речь и внешний вид лица могут передавать материал, недоступный в движениях тела и сигналах человеческого тела. Люди используют различные эмоциональные методы одновременно и в комбинации. Каждая модальность ограничена и имеет свои сильные стороны. Для правильного обнаружения чувства мультимодальные методы распознавания эмоций, возможно, обладают более высокой производительностью распознавания, чем унимодальное распознавание эмоций. Тем не менее, при эмоциональном сдвиге сигналы мимики, биосигналы/физиологические сигналы и речевые сигналы обычно появляются раньше других сигналов. Таким образом, компьютерное зрение обнаружения эмоций в основном связано с эмоциональными выражениями лица5.

Аффективные вычисления были всесторонне изучены в области взаимодействия ребёнка и робота (CRI); Эмоционально осознанные системы изменяют свою реакцию в зависимости от физиологических и поведенческих сигналов пользователей. Эти работы иллюстрируют возможность биофизического чувствования эмоций и адаптивного взаимодействия. Однако в основном разработанные системы CRI подходят только для структурированных, ориентированных на задачи и участников. В результате системы CRI имеют ограниченную универсальность на динамичные, публичные среды, такие как интерактивные выставки. В их работе говорится, что эмоционально осознанные роботы являются необходимыми для повышения мотивации, а также для решения некоторых вопросов, таких как персонализация. Вовлечённость — ключевой элемент аффективного взаимодействия ребёнка и робота, поскольку эмоционально реактивные роботы обеспечивают более насыщенный и эффективный опыт обучения. Автор6 представляет рамки для выявления вовлечённости пользователей на основе характеристик задачи и социального взаимодействия. Они доказывают, что распознавание эмоциональных сигналов, включая мимику и социальное поведение, позволяет роботам динамически корректировать свои реакции для усиления взаимодействия и вовлечённости пользователей. Аффективная адаптация в долгосрочной КРИ — это постоянная задача. Авторы в7-й статье представляют эмоции детей в определённый период, подчёркивая, что роботам необходимо адаптироваться к личным моделям эмоций и стилям обучения.

Он также достиг высоких результатов благодаря ЭЭГ благодаря высокому временному разрешению и чувствительности к аффективным состояниям. Недавние работы 8,9,10 с использованием методов глубокого обучения повысили межсубъектную устойчивость за счёт внедрения пространственно-временного моделирования и механизмов внимания на основе графов. Однако большинство исследований остаются унимодальными, и лишь некоторые учитывают взаимодействие восприятия и эмоций через несколько сенсорных каналов; поэтому они менее применимы в иммерсивных UX-сценариях11, 12, 13. Модель была оценена на наборе данных, который показал улучшенную производительность по сравнению с современными современными методами. Эмоционально-зависимый алгоритм критического отбора был предложен авторамив 14 году, при этом были изучены прочность, коэффициент кластеризации и центральность собственного вектора функций функциональной сети связности ЭЭГ. Авторы из15 исследовали глубокую, простую рекуррентную единичную сеть с целью получить временные признаки из ЭЭГ-сигналов, и экспериментальные результаты превзошли аналогичные исследования влитературе 16,17,18,19. Практически невозможно собрать большой набор данных ЭЭГ-сигналов, но можно попробовать другие методы, например, межсубъектный подход.

Недавние исследования 20,21 достигли значительных успехов в использовании чрезвычайно продвинутых алгоритмов пространственно-временного моделирования для решения проблемы межсубъектной классификации эмоций на основе сигналов ЭЭГ. Это включает гибридную пространственно-временную сеть с улучшенной адаптацией доменов и динамическим вниманием к графам для обработки межсубъектной вариабельности классификации эмоций по сигналамЭЭГ 22. В частности, благодаря временным моделированию и пространственному моделированию взаимоотношений мозга с динамическим вниманием они значительно повысили результаты классификации эмоций независимо от субъекта. Другое исследование по этой проблеме включает пространственно-временную изоморфную сеть взаимодействия между областямимозга 23. В этом исследовании уделяется большее внимание моделированию пространственно-временных инвариантов для значительного повышения межсубъектной устойчивости для классификации эмоций по сигналам ЭЭГ. Хотя эти два исследования успешно задокументировали выдающиеся результаты классификации эмоций, основанные исключительно на нейронных сигналах, они ограничиваются мономодальными сигналами и не исследуют мультимодальные взаимодействия P-E. Напротив, текущие исследования сосредоточены на расширенных унимодальных моделях сигналов с помощью решений глубокого обучения, которые связывают несколько P/E модальностей через глубокое корреляционное обучение, обеспечивая более богатое решение для аффективного UX-моделирования.

Хотя современные исследования, включая проект по выразительно сознательному интерфейсу ребёнка и робота с использованием биофизической информации, подтвердили потенциал использования мультимодальных физиологических сигналов для улучшения распознавания аффектов, они всё же ограничены ограничениями, связанными с областью. В частности, эти системы в значительной степени оптимизированы для структурированного, ориентированного на задачи взаимодействия с детьми и не поддаются обобщению на более сложные, динамичные среды, такие как интерактивные выставки. Кроме того, используемые методы слияния признаков в базовой работе не являются масштабируемыми и, как правило, опираются на поверхностные методы слияния, которые не позволяют эффективно отражать сложное взаимодействие восприятия и эмоций, существующее в мультисенсорных UX-средах. Кроме того, базовая статья не использует передовые методы глубокого обучения, которые могут выравнивать и объединять высокомерные мультимодальные потоки данных, такие как ЭЭГ, мимика и отслеживание глаз, под разными воздействиями окружающей среды. Это выявляет фундаментальный пробел в знаниях при создании высокопроизводительной вычислительной парадигмы, которая не только учитывает разные демографические группы аудитории и стимулирующие контексты, но и отражает взаимодействие восприятия и эмоций через глубокий канонический корреляционный анализ (DCCA) и архитектуры мультимодальных сетей слияния (MMFN). Преодоление этого разрыва может существенно повлиять на понимание пользовательского опыта (UX).

Основная цель этой работы — создать вычислительную систему, которая способствует эмоционально адаптивному пользовательскому опыту в интерактивных выставочных контекстах с помощью мультимодального биофизического и поведенческого сенсора. Опираясь на базовые принципы моделирования эмоций, основанные на исследованиях взаимодействия ребёнка и робота и аффективных вычислений, эта структура направлена на моделирование и запись взаимодействий восприятия и эмоций пользователя на основе гетерогенных физиологических и поведенческих признаков, таких как ЭЭГ, ЭКГ, ЭДА, мимики и отслеживание глаз. Через интеграцию глубокого канонического корреляционного анализа (DCCA) с мультимодальной сетью слияния (MMFN) система стремится изучать общие латентные эмоциональные представления между модальностями и проецировать эти представления на аффективные условия пользовательского опыта (UX). Задача архитектуры — преодолеть препятствия поверхностного слияния признаков и возрастных эмоциональных моделей, поддерживая контекстно-осознанное вывод эмоций и мультисенсорную интеграцию в динамической, публичной среде. Наконец, эта работа направлена на разработку более продвинутых интеллектуальных и эмоционально чувствительных выставочных систем, которые реагируют на актуальные временные аффективные режимы обратной связи и взаимодействия пользователей, а значит, ещё больше усиливают вовлечённость, удовлетворение и когнитивно-эмоциональный резонанс в цифровых культурных переживаниях.

Данная статья вносит вклад в литературу следующим образом: вычислительная основа для мультимодального аффективного моделирования, учитывающая как физиологические, так и поведенческие данные. Мультимодальный подход к слиянию, который способствует эффективному изучению восприятия и представления эмоций из множества источников данных. Эта предложенная работа вводит новую вычислительную парадигму для расширения аффективного пользовательского опыта (UX) с помощью мультимодального сенсорного процесса на базе ИИ и мультисенсорного интеграционного конвейера взаимодействия восприятия-эмоций. Основной вклад — слияние DCCA с MMFN для обеспечения сильного выравнивания признаков и высокоуровневого обучения представления в гетерогенных модальностях, таких как ЭЭГ, ЭКГ, ЭДА, мимика и отслеживание глаз. Это позволяет моделировать точное офлайн-сопоставление сенсорного восприятия с такими эмоциональными состояниями, как интерес, вовлечённость, удивление или скука. Экспериментальная валидация с использованием общедоступного набора данных AMIGOS показывает, что разработанная модель DCCA+MMFN работает лучше базовых моделей (например, 1D-CNN, CNN-ResNet и LSTM-CNN) со средней точностью классификации 89,4% для состояний валентно-возбуждения и 87,1% для дискретных классов эмоций.

В отличие от предыдущих исследований, которые либо акцентировали внимание участников, либо ориентированные на задачи, либо использовали поверхностные методы слияния признаков, предлагаемый подход предлагает глубокое обучение, специально разработанное для динамических реальных выставочных сред. Благодаря интеграции DCCA и MMFN эта работа предоставляет расширяемый и устойчивый к шуму метод, способный понимать непрерывные сдвиги восприятия и эмоций в разнородных группах пользователей. Это явное слияние высокомерных физиологических, поведенческих и экологических сигналов является основным новшеством для аффективного UX-моделирования. В данной статье представлена основанная на ИИ фреймворк для моделирования аффективного пользовательского опыта в интерактивных выставках с использованием мультимодального сенсора и мультисенсорной интеграции. Предлагаемая структура обеспечивает надёжное выравнивание и слияние гетерогенных методов, таких как ЭЭГ, ЭКГ, ЭДА, мимики и отслеживание глаз, путём объединения DCCA с MMFN. В отличие от предыдущих исследований, ограничивавшихся либо пользовательскими, либо ориентированными на задачи, предлагаемый подход поддерживает непрерывное моделирование восприятия-эмоций в динамических публичных средах, что является ключевым шагом вперед в аффективных UX-исследованиях.

Создание систематического, повторяемого мультимодального вычислительного подхода к моделированию физиологического аффекта, который методично обрабатывает выравнивание гетерогенных признаков до слияния, является главной новшеством этой работы. Предлагаемая структура обеспечивает коррелированное обучение представления в сигналах ЭЭГ, ЭКГ и ГСР, вводя промежуточную кроссмодальную стадию латентного выравнивания с использованием DCCA, в отличие от традиционных мультимодальных исследований распознавания эмоций, основанных на прямой конкатенации признаков или слиянии на уровне решения. Гарантируя согласованность модальности до классификации, этот подход, основанный на выравнивании, повышает обобщимость и устойчивость между аффективными измерениями. Этот вклад представляет собой ориентированный на бенчмарки, сквозной рабочий процесс, который стандартизирует предобработку, выравнивание представлений, мультимодальное слияние и оценку в рамках единой архитектуры глубокого обучения, позволяя повторяемое и независимое от задачи физиологическое моделирование эмоций, а не предлагать единое алгоритмическое изменение. Предлагаемая рамка в этом исследовании представлена как осуществимость и концептуальная демонстрация мультимодального аффективного моделирования для выставочных переживаний. Вместо того чтобы пытаться напрямую моделировать реальные мультисенсорные выставочные среды, набор данных AMIGOS используется в качестве эталонного прокси для проверки подхода к моделированию в контролируемой среде.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Набор данных AMIGOS, использованный в этом исследовании, является общедоступным и был собран с предварительного одобрения и информированного согласия институционального надзорного совета, как указано в оригинальной публикации. Это исследование включает только вторичный анализ набора данных, и дополнительное этическое одобрение не требовалось.

Настоящий метод использует подходы выравнивания признаков и мультимодального слияния для обработки мультимодальных физиологических и поведенческих данных с целью описания корреляций восприятия и эмоций. В данном исследовании предлагается вычислительная модель аффективного пользовательского опыта (UX) в интерактивных выставках, используя мультимодальное биофизическое сенсорное ощущение и моделирование эмоций на основе искусственного интеллекта. Основываясь на биофизических данных, полученных в базовой статье, эта методология оцифровывает вычислительное моделирование состояний пользователей на основе синхронизированных ЭЭГ, ЭКГ, ЭДА, отслеживания глаз, мимики и входных данных окружающей среды. Термин «пространственно-временное моделирование» в рукописи относится к пространственному многоканальному физиологическому представлению признаков и межмодальному корреляционному выравниванию с помощью DCCA. Временное: последовательное кодирование через BiLSTM и сохранение временных зависимостей в сегментированных окнах. Эти разнообразные сигналы изначально предварительно обрабатываются и нормализуются с учётом временных и пространственных корреляций между модальностями. Векторы признаков изучаются независимо для каждой модальности, фиксируя эмоциональные паттерны, такие как возбуждение, внимание и вовлечённость. Для успешного обучения на основе общих эмоциональных представлений в гетерогенных потоках данных используется DCCA. DCCA проецирует каждую модальность в латентное общее подпространство, где коррелированные признаки максимизированы, сохраняя при этом специфическую информацию за счёт расширенной кроссмодальной релевантности. Эти латентные вложения, выровненные по модальности, затем передаются в мультимодальную сеть слияния (MMFN), которая объединяет временную и контекстную информацию через гибридный BiLSTM и внимательные слои. Это слияние позволяет системе создавать высокоуровневые аффективные состояния, которые превращаются в индикаторы пользовательского опыта (например, скука, интерес, дискомфорт). Наконец, классификационный модуль оценивает аффективное UX-состояние и даёт обратную связь для адаптации выставок, например, корректируя визуальные или аудиостимулы в вычислительном моделировании. Рисунок 1 показывает архитектуру предлагаемого метода.

Рисунок 1
Рисунок 1: Архитектура предлагаемого метода. Структура предлагаемого фреймворка UX-моделирования, объединяющая мультимодальные входы, включая ЭЭГ, ЭКГ, ЭДА, мимику и взгляд, с использованием DCCA и MMFN. Сокращения; UX = пользовательский опыт; ЭЭГ = электроэнцефалография; ЭКГ = электрокардиография; EDA = электродермальная активность; DCCA = глубокий канонический корреляционный анализ; MMFN = Мультимодальная термоядерная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Предлагаемая архитектура на рисунке 1 иллюстрирует систему сквозного аффективного пользовательского опыта (UX), использующую глубокий канонический корреляционный анализ (DCCA) и мультимодальную сеть слияния (MMFN) для моделирования взаимодействия восприятия и эмоций в интерактивных выставках. Система начинает с принятия необработанных мультимодальных входов, таких как физиологические сигналы ЭЭГ, ЭКГ и EDA; мимики и взгляд, поведенческие сигналы; а также контекстуальные входы, такие как аудиовизуальная и экологическая информация. Эти сигналы затем подаются в модуль предварительной обработки и выделения признаков, где выполняется обработка специфичных для сигнала (например, удаление шума, нормализация, вычисление признаков) для получения значимых дескрипторов для каждой модальности. Во-вторых, модуль DCCA проецирует пары модальностей в общее латентное пространство и изучает максимально коррелированные вложения, которые кодируют внутренние эмоциональные паттерны между модальностями. Высококорреляционные особенности этих множественных модулей DCCA впоследствии объединяются с Multimodal Fusion Network (MMFN), которая иерархически объединяет изученные признаки с глубокими слоями обучения, возможно, BiLSTM, механизмами внимания или трансформерами для создания компактного и высокоуровневого аффективного представления. Это интегрированное представление затем погружается в слой классификации эмоций и UX-состояний, где модель предсказывает аффективные результаты, такие как валентность, возбуждение или когнитивные/эмоциональные состояния, такие как вовлечённость, скука или перегрузка. Адаптивная UX-обратная связь опционально предоставляется при завершении конвейера, позволяющая системе интерактивно реагировать на состояния пользователя, адаптируя стимулы или контент в контексте выставки. Эта масштабируемая и модульная архитектура гарантирует сильное моделирование эмоций за счет корреляционного обучения представления и глубокой мультимодальной интеграции, что отлично подходит для вычислительного моделирования аффективных вычислений в интерактивных или опытных средах.

Выбор слияния DCCA с MMFN основан на текущих ограничениях стандартных унимодальных и мелких моделей термоядерного синтеза. Хотя CNN-ResNet и LSTM-CNN извлекают временные или пространственные признаки, они плохо справляются с балансом между гетерогенными модальностями, такими как ЭЭГ, ЭДА и мимика под разными стимуляциями окружающей среды. DCCA максимизирует кроссмодальную корреляцию для обеспечения совместного латентного представления, тогда как MMFN использует иерархические механизмы слияния и внимания для динамического выделения наиболее информативных сигналов. В сочетании эти модули предлагают более надёжный, понятный и широко применимый подход к аффективному UX-моделированию для интерактивных мультисенсорных сред.

Сбор данных
В предложенной модельной модели взаимодействия восприятия и эмоций для интерактивных выставок общедоступный набор данныхAMIGOS 24 используется в качестве основы мультимодальных аффективных данных. Набор данных AMIGOS предоставляет исчерпывающий набор физиологических и поведенческих показателей от людей, проходящих через стимулы, вызывающие аффект, такие как видеоклипы. Эти данные содержат синхронизированные сигналы ЭЭГ, ЭКГ и ГСР, видеозаписи лица и самосообщаемые эмоциональные метки в дискретных (например, счастливая, грустная) и размерная (валентность/возбуждение) формах. Эти методы хорошо соответствуют потребностям предлагаемой здесь системы, которая направлена на выявление состояний аффективного пользовательского опыта (UX) во время иммерсивных, мультисенсорных демонстрационных взаимодействий. Набор данных включает записи 40 участников, каждый из которых был подвергнут как коротким (видеоклипы <150 секунд), так и длинным (фильмы >14 мин) эмоциональных стимулов, в условиях, имитирующих реальный медиа-взаимодействие. Для объёма предлагаемой работы используется предварительно обработанное подмножество набора данных: записи от 30 участников с высококачественными сигналами ЭЭГ, ЭКГ и ГСР без артефактов, а также полные файлы видео с лицом и аннотации. Это выбранные сэмплы для имитации мультимодальной эмоциональной динамики в выставочных ситуациях. Изученный набор данных является базой для обучения и бенчмаркинга для конвейера DCCA + Multimodal Fusion Network (MMFN), где эмоциональные состояния, такие как вовлечённость, скука, замешательство и возбуждение, исследуются как реакции на визуальные, слуховые и пространственные стимулы в симулированной выставочной среде. Таблица 1 показывает описание предлагаемого метода в наборе данных.

ПараметрПодробности
Название набора данныхAMIGOS (Набор данных для исследований аффектов, личности и настроения)
Нет. участниковвсего 40 (30 использовались в предлагаемых работах с полными мультимодальными данными)
Тип стимуловКороткие и длинные видеоклипы (эмоционально аннотированные)
Каналы EEG14-канальная EEG-гарнитура Emotiv EPOC
ЭКГДатчик сердечного ритма (для ВСР и возбуждения)
GSRДатчик проводимости кожи (измеряет симпатическую активность)
Видео с лицомВидео с высоким разрешением фронтального лица для анализа экспрессии
Эмоциональные ярлыкиСамооценённая валентность, возбуждение, доминирование (шкала 1–9), плюс дискретные метки
Частота дискретизацииЭЭГ: 128 Гц, ЭКГ/ГСР: 1000 Гц
Формат данных.mat файлы и синхронизированные логи временных меток
Синхронизация модальностиДа — синхронизировано на всех сенсорах и видео
Продолжительность сеансаКороткие клипы (<150 с) и длинные фильмы (>14 мин)
Подход к применениюАффективное UX-моделирование, мультимодальное слияние, отображение восприятия-эмоций в реальном времени

Таблица 1: Описание набора данных AMIGOS. Описание набора данных AMIGOS, используемого в предлагаемой структуре, включая информацию об участниках, методы, частоты выборки и экспериментальный дизайн. Сокращения; AMIGOS = набор данных для исследований аффектов, личности и настроения отдельных лиц и групп.

Общедоступный набор данных AMIGOS, применяемый в предлагаемой структуре, состоит из мультимодальных поведенческих и физиологических данных, собранных от 40 участников, из которых 33 были выбраны для этого исследования на основе качества и полноты записей. Набор данных записывает эмоциональные реакции на короткие и длинные видеоклипы и содержит такие сигналы, как ЭЭГ (из 14-канальной гарнитуры Emotive), ЭКГ для изменения сердечного ритма, ГСР для проводимости кожи и высокое разрешение для измерения выражения эмоции. Эмоциональные состояния самосообщаются как в измерениях (валентность, возбуждение, доминирование), так и в дискретных категориях. Данные хорошо согласованы друг с другом по модальностям и правильно дискретируются — 128 Гц для ЭЭГ, 1000 Гц для ЭКГ и ГСР. Такая конфигурация делает набор данных идеальным для моделирования пользовательского опыта (UX) в интерактивных выставках, чтобы взаимодействие восприятия и эмоций можно было точно отслеживать с помощью мультимодальных сенсоров на базе ИИ.

Предобработка данных
Все этапы предварительной обработки, обучение моделей и оценки реализовывались в индивидуальных скриптах на Python (Python 3.10, PyTorch 2.0) отдельно, при этом каждый модуль занимался предобработкой сигналов, выравниванием на основе DCCA, обучением MMFN и оценкой производительности; настройка ключевых параметров и некоторые важные вычислительные конфигурации приведены в таблице 1. Для обработки общедоступного набора данных AMIGOS для аффективного UX-моделирования интерактивных показаний изначально реализуйте систематическую систему предварительной обработки данных по физиологическим и поведенческим модальностям, таким как ЭЭГ, ЭКГ, ГСР и видео лица. Сначала стандартизируйте и синхронизируйте каждую модальность, а затем выполняйте специфическую модальность предварительную обработку. В настоящее время контекстуальная информация получается только из внутренних аудиовизуальных сигналов внутри видеостимулов, например, мимики, визуальных движений и акустических особенностей, таких как просодия речи и фоновый звук.

Нормализация сигнала и ресемплирование
Сырые физиологические сигналы x(t) из всех модальностей повторно дискретируются до общей частоты fs=128 Гц для выравнивания времени между модальностями:

Уравнение 1(1)

Ресемплирование выполнялось с использованием стандартной функции библиотеки обработки сигналов, а не специально разработанного алгоритма. В частности, реализация была выполнена с использованием утилиты для пересэмплирования, доступной в экосистеме обработки сигналов Python (SciPy), которая применяет интерполяцию на основе метода Фурье для преобразования сигналов в целевую частоту дискретизации. Целевая частота дискретизации fs была выбрана для обеспечения равномерного временного разрешения между модальностями до сегментации и извлечения признаков. Каждый сигнал впоследствии нормализуется z-баллом для устранения изменчивости между субъектами:

Уравнение 2(2)

где μx и σx — это среднее значение окна пробного периода и стандартное отклонение сигнала.

Предварительная обработка ЭЭГ
ЭЭГ-сигналы, захваченные с 14 каналов, проходят полосную фильтрацию с выбором 4–45 Гц для сохранения когнитивно-связанных частот:

Уравнение 3(3)

Для определения частотных паттернов в сигналах используется спектр мощности, который может различаться в зависимости от типа эмоции, например, мозгового сигнала, и может давать полезную информацию о сигнале. Метод Уэлча является более совершенным методом уравнения 3 периодограмм, которое даёт оценку спектральной плотности и может использоваться для получения спектрограмм. Техника Уэлча сегментирует сигнал во временной области на дискретные интервалы времени и конструкции. Спектрограмма для каждого сегмента, затем все спектрограммы усредняются, как показано в уравнении 4. Этот процесс более плавный по сравнению с полным FFT-подходом, поэтому он получает максимальную мощность от сигналов. Наконец, спектральная плотность мощности (PSD)19 рассчитывается с помощью метода Уэлча для захвата характеристик частотной области:

Уравнение 4(4)

Особенности PSD суммированы по пяти диапазонам: Тета (4–8 Гц), Альфа (8–13 Гц), Бета (13–30 Гц), Низкая гамма (30–45 Гц).

Видео-черты лица
Извлекая единицы действия лица (AU) и векторы взгляда для каждого кадра видео с помощью многоканального набора данных ЭЭГ или аналогичного программного обеспечения, они затем объединяются во временные последовательности:

Уравнение 5(5)

Отображение меток эмоций
AMIGOS присваивают как оценки валентного возбуждения, так и дискретные эмоциональные метки. Непрерывные значения нормализуются до [0,1]:

Уравнение 6(6)

Где V — фактическое наблюдаемое значение до нормализации , Vmin — наименьшее значение переменной в наборе данных, Vmax — наибольшее значение переменной в наборе данных, а V' — нормированное значение в диапазоне от 0 до 1. Эти метки применяются в качестве основной правды для моделирования контролируемого аффекта. Эти метки применяются в качестве основной правды для моделирования контролируемого аффекта.

Синхронизация между модальностями
Все модальности синхронизируются с помощью выравнивания временных меток или динамического искажения времени (DTW), когда это необходимо:

Уравнение 7(7)

Заранее обработанные данные, богатые признаками, затем вводятся в модуль глубокого канонического корреляционного анализа (DCCA), который изучает максимально коррелированные представления между модальностями.

Извлечение признаков с помощью DCCA
В предполагаемой системе аффективного UX-моделирования для интерактивных экспозиций DCCA используется для изучения связанных латентных характеристик в гетерогенных методах, таких как ЭЭГ, ЭКГ, ЭДА, мимики и данные отслеживания глаз. Цель — изучить общее пространство представлений, в котором сигналы из различных модальностей, пусть и индивидуально шумные или специфичные для модальности, максимально коррелируют и семантически согласованы с точки зрения воспринимаемых эмоциональных состояний. В этой работе DCCA применялся к следующим парам модальности: i) ЭЭГ–ЭКГ, ii) ЭЭГ–ГСР и iii) ЭЭГ – представления черт лица. Эти пары были отобраны с целью зафиксировать комплементарные нейрофизиологические и нейронно-поведенческие корреляции, соответствующие аффективному взаимодействию. Для расширения DCCA до мультимодального режима были вычислены попарные вложения DCCA для каждой пары модальностей и затем объединены с использованием предложенного MMFN, что позволяет эффективно интегрировать более двух модальностей без изменения основной формулировки DCCA.

Выполняя корреляционно-ориентированное латентное выравнивание перед слиянием, DCCA структурно отделяет выравнивание представлений от синтеза решений, в отличие от сетей кросс-модального внимания или тензорного синтеза, которые работают непосредственно с возможными несогласованными представлениями. Избыточность уменьшается, а когерентность представлений улучшается благодаря двухступенчатой архитектуре. Кроме того, DCCA напрямую оптимизирует кроссмодальную статистическую зависимость, а не опирается только на общие функции потерь, что больше подходит для гетерогенных физиологических данных, чем для многозадачных обучающих фреймворков. Во-первых, DCCA20 используются для вычисления представлений ряда модальностей путём их последовательного рассмотрения через несколько слоёв нелинейных преобразований. Рисунок 2 иллюстрирует конструкцию DCCA, использованную в этой исследовательской работе. Мы использовали метод поиска по сетке для определения оптимальных гиперпараметров для проектирования модели глубокого обучения, используемой в подходе DCCA. После тщательного экспериментального анализа авторы выбрали стохастический градиентный оптимизатор спуска, потери перекрестной энтропии и регулирующий параметр 1e5. Далее авторы выбрали 15 шагов оптимизации, используя вектор смещения как все нули, валидационный набор как ранний критерий остановки и инициализатор Xavier в качестве весового инициализатора. Рисунок 2 показывает рабочий процесс DCCA.

Рисунок 2
Рисунок 2: Рабочий процесс DCCA. Рабочий процесс DCCA, показывающий отображение характеристик из различных модальностей в общее латентное пространство для максимизации корреляции.
Сокращения; DCCA = Глубокий канонический корреляционный анализ. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2 визуально показывает внутреннюю рабочую структуру глубокого канонического корреляционного анализа (DCCA) для обучения совместного представления между двумя разными модальностями — EEG (модальность A) и EDA (модальность B). Обе модальности подключаются к соответствующим глубоким сетям экстракторов признаков (Feature Extractor A и B), которые имеют несколько скрытых слоёв, изучающих абстрактные, специфичные для модальности признаки. До слияния кроссмодальное латентное выравнивание осуществляется с помощью глубокого канонического корреляционного анализа (DCCA). Для каждой пары модальности строятся две параллельные глубокие проекционные сети (ЭЭГ–ЭКГ, ЭЭГ–ЭДА и ЭЭГ–Лицовые). С помощью активации ReLU каждая проекционная сеть состоит из трёх полностью связанных слоёв с размерами [256, 128, 64]. Для общего латентного пространства 64 является предельной вложенной размерностью. При коэффициенте регуляризации L2 1e-5 для обеспечения численной устойчивости целевая функция максимизирует каноническую корреляцию между проектируемыми вложениями модальности. Векторы смещения инициализируются до нуля, а веса — с помощью инициализации Ксавье. Для стабилизации обучения выравниванию модули DCCA обучаются отдельно перед обучением MMFN. Для поддержания согласованности выравнивания между DCCA и MMFN не проводится полная настройка. Эти конвейеры нейронных сетей принимают входные потоки данных параллельно, но изолированно. Выход экстрактора признаков из каждой из них затем проецируется в общее латентное пространство, где признаки обеих модальностей отображаются для сопоставимости по структуре. Проекции оптимизируются в соответствии с целью DCCA — максимизировать корреляцию между соответствующими латентными представлениями EEG и EDA. Приобретая это максимально коррелированное подпространство, DCCA гарантирует, что выходные вложения сохраняют комплементарные и семантически значимые закономерности из обеих модальностей, которые необходимы для последующих приложений, таких как распознавание эмоций или аффективные вычисления.

В этой работе признаки конвертируются с помощью DCCA, а затем интегрируются для категоризации. Модель DCCA, показанная на рисунке 2, использует модель глубокого обучения для преобразования признаков. Слой CCA вычисляет корреляцию, которая затем используется для комбинирования и классификации признаков. Предположим, что матрица Уравнение 8 хранит испытания модальности ЭЭГ, а матрица Уравнение 9 включает эксперименты с видеоклипами лица. В этом случае размеры признаков в ЭЭГ и видеоклипах лица представлены соответственно n1 и n2, а общее количество испытаний — МА. Для каждой модальности авторы создали следующую глубокую нейронную сеть для нелинейной перестройки входных характеристик:

Уравнение 10(8)

где параметры нелинейного преобразования представлены как HT 1 и HT 2; последующие характеристики каждой нейронной сети представлены как Уравнение 11 и Уравнение 12 и измерение характеристики DCCA как n. Рекурсивно изученные параметры HT1 и HT2, полученные из DCCA, максимально повысили корреляцию между ON 1 и ON 2 до возможного уровня:

Уравнение 13(9)

Взаимно изученные параметры, такие как HT 1 и HT 2 , обучались алгоритмом обратного распространения. Для получения нужного ответа градиенты целевой функции были аппроксимированы, как было предложено. Изменённые функции ON1 и ON2 ∈ SP находятся в объединённом гиперпространственном SP после обучения двух нейронных сетей. Авторы DCCA mainly20 не упоминали конкретно использование изменённых характеристик. Изменённые функции могут использоваться так, чтобы лучше всего служить приложению пользователя. В этой работе авторы получили следующие сплавленные признаки из изменённых признаков:

Уравнение 14(10)

где α и β представляют веса, поддерживающие α + β = 1. Характеристики ON, интегрированные с помощью DCCA, вводятся в классификатор SoftMax. Задачи распознавания эмоций используются для обучения классификатора. Как уже упоминалось, создание DCCA для слияния данных в различных форматах имеет определённые преимущества. Для наблюдения характеристик и корреляции модально-центричных преобразований, например, DCCA явно получает ON1 и ON2 для каждой модальности на уровне слияния признаков. Кроме того, данные на основе эмоций можно сохранять, управляя нелинейными функциями отображения f1(·) и f2(·). Кроме того, авторы используют эквивалентные веса для каждой модальности в слиянии взвешенной суммы. Мультимодальная сеть слияния (MMFN), прогнозирующая состояния пользовательского опыта, получает это объединённое пространство. Для мультимодального выравнивания используется иерархический подход, при котором сырые сигналы сначала временно выравниваются с ресемплированием и выравниванием временных меток, а выравнивание семантически насыщенных сигналов из различных модальностей получается с помощью глубокого канонического корреляционного анализа (DCCA). Это гарантирует, что модально-ориентированные представления преобразуются в общее латентное пространство до процесса слияния, основанного на внимании, в MMFN.

Мультимодальная сеть слияния (MMFN) для аффективного UX-моделирования
MMFN кодирует каждую модальность отдельно, затем объединяет их с помощью механизма слияния и внимания, чтобы получить интегрированное представление для прогнозирования эмоций.

Модально-специфическое кодирование
Пусть x(i)R di — вектор характеристик для i-й модальности (например, EEG, EDA). Каждая модальность кодируется нейронным кодировщиком:

Уравнение 15(11)

Гейтовый механизм термоядерного синтеза
Для управления потоком информации из каждой модальности используется элемент слияния:

Уравнение 16(12)

Уравнение 17(13)

σ — это функция активации сигмовидной формы. ⊙характеризует развитие по элементам. Это позволяет сети динамически снижать вес шумных модальностей или полезных функций.

Кросс-модальное слияние внимания
Слой внимания узнаёт, какой вес нужно придавать представлению каждой модальности:

Уравнение 18(14)

Уравнение 19(15)

α(i) — это весаУравнение 21внимания, сплавленное конечное представление.

Прогнозирование аффективного состояния
Слитый вектор входит в выходной слой для предсказания валентности/возбуждения или UX-состояний:

Уравнение 2222(16)

Где Уравнение 23 можно использовать для представления: класс дискретных эмоций (счастливый, нейтральный, грустный), непрерывная шкала (валентность/возбуждение) и категории UX (вовлечённый, отвлечённый, перегруженный).

Рисунок 3
Рисунок 3: Структура MMFN. Структура MMFN с модально-специфическими энкодерами, гейт-слиянием и интеграцией на основе внимания для прогнозирования аффективного состояния.
Сокращения; MMFN = Мультимодальная термоядерная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3 показывает рабочий процесс мультимодальной сети слияния (MMFN), используемой в аффективной вычислительной структуре для прогнозирования эмоций и пользовательского опыта (UX). Модально-специфические энкодеры, гейт-слияные слои, модуль интеграции на основе внимания и финальная классифицированная головка составляют иерархическую архитектуру слияния MMFN. Он иллюстрирует, как различные гетерогенные вводные модальности, такие как ЭЭГ (модальность A), EDA (модальность B) и мимики (модальность C), обрабатываются с помощью собственных специализированных сетей кодировщиков (кодировщики A, B и C). Независимый кодировщик, состоящий из двух полностью связанных слоёв с активацией ReLU, обрабатывает каждую модальность (ЭЭГ, ЭКГ, ЭДА и признаки лица), прежде чем слой двунаправленной долгой краткосрочной памяти (BiLSTM) фиксирует временные зависимости. Каждый кодировщик изучает модально-специфическое представление признаков, сохраняющее значимые эмоциональные или физиологические особенности из соответствующего потока данных. Каждое направление в BiLSTM содержит 128 скрытых единиц, что придаёт каждой модальности 256-мерное контекстное вложение. Чтобы избежать перенагона, dropout (скорость = 0,5) выполняется после слоя BiLSTM. Затем к закодированным представлениям модальности применяется гейтированный подход слияния, использующий сигмовидную активацию для динамического управления вкладом модальности. Слой самовнимания затем рассчитывает веса внимания по разным методам, чтобы подавлять шумные сигналы и выделять релевантную информацию. Полностью связанный слой и либо линейный выходной слой для задач регрессии валентно-возбуждения, либо выходной слой Softmax для задач дискретной классификации проецируют слитое представление. Выход каждого энкодера затем поступает в мультимодальный слой слияния, который проводит конкатенацию всех модальных признаков и применяет механизм внимания для выделения более информативных сигналов и маскового шума. Эта операция создаёт общее латентное представление, интегрирующее эмоциональные сигналы по всем модальностям в высокоуровневый плотный вектор.

Слои BiLSTM, применяемые к модально-специфическим последовательным вложениям, напрямую моделируют временную динамику. BiLSTM позволяет контекстуально моделировать изменяющиеся аффективные состояния, фиксируя как прямые, так и обратные временные зависимости в сегментированных физиологических последовательностях. Кроме того, адаптивное взвешивание временных информативных признаков становится возможным благодаря слою слияния на основе внимания, который функционирует над временно закодированными представлениями. Авторы недавно обновили текст, чтобы сделать более очевидным, как построение последовательностей, повторяющееся кодирование и взвешивание внимания работают вместе для поддержки временного моделирования.

Предлагаемый псевдокод 1 показывает общий процесс аффективного моделирования пользовательского опыта с использованием DCCA-MMFN в воспроизводимой форме. Для начала мультимодальные физиологические и поведенческие сигналы подаются в независимый этап предварительной обработки, включающий снижение шума и нормализацию масштабов. Затем эти признаки вводятся в DCCA, где коррелированные признаки совместно изучаются для заданных пар модальности с целью обеспечения надёжного кросс-модального выравнивания. Выровненные признаки впоследствии объединяются в MMFN, состоящий из механизмов гейта и внимания для модуляции специфической для модальности, направленных на продвижение информативных модальностей и подавление шума. Окончательное комбинированное представление признаков используется для обучения классификатора, предназначенного для оценки аффективного и UX-связанного состояния, а общая оценка эффективности проводится на основе стандартных метрик. Пошаговый характер предлагаемого псевдокода обеспечивает прозрачность, осуществимость и простоту воспроизведения другими для всех технически подвешенных лиц, заинтересованных в этом протоколе.

Предлагаемая рамка направлена на прогнозирование состояния аффективного пользовательского опыта (UX) с использованием мультимодальных физиологических и поведенческих сигналов из набора данных AMIGOS на основе следующих шагов: Шаг 1: Входные мультимодальные данные состоят из ЭЭГ, ЭКГ, ЭДА, глаза и мимики. Изначально используется мультимодальный набор данных AMIGOS, и каждая модальность проходит предварительную обработку сигнала, включая фильтрацию шума и нормализацию для обеспечения качества и согласованности данных. Шаг 2: Для поддержания временной однородности между модальностями все сигналы передискретируются до стандартной частоты. Далее проводится модально-специфическое извлечение признаков для получения уникальных представлений признаков, соответствующих каждому типу сигнала. Шаг 3: Для фиксации кроссмодальных отношений выбранные пары модальности (ЭЭГ–ЭКГ, ЭЭГ–ЭДА и ЭЭГ–Лицолицо) обрабатываются с помощью глубокого канонического корреляционного анализа (DCCA). Сети DCCA обучаются изучать коррелированные латентные представления между парными модальностями, что приводит к выровненным вложениям признаков для каждой пары модальности. Эти выровненные представления затем объединяются в единое мультимодальное пространство признаков. Шаг 4: Агрегированные выровненные признаки предоставляются в качестве входных данных для мультимодальной сети синтеза (MMFN), где используются механизмы внимания и стратегии гейт-синтеза для эффективной интеграции дополнительной информации между модальностями. Этот процесс слияния создаёт комплексное аффективное представление. Шаг 5: Полученное представление затем используется для обучения классификатора с мечеными эмоциональными данными для предсказания аффективного UX-состояния. Наконец, производительность модели оценивается с использованием стандартных метрик, включая точность, точность, воспоминание, F1-балл и площадь под кривой (AUC). Предсказанное аффективное UX-состояние возвращается как конечный результат фреймворка.

Моделирование восприятия-эмоций с использованием предлагаемой структуры DCCA-MMFN
В предлагаемой вычислительной структуре аффективного пользовательского опыта (UX) интерактивных выставок модуль моделирования восприятия–эмоций является центральным процессом, связывающим перцептивные реакции пользователя на стимулы окружающей среды с их мультимодальными биофизически выведенными эмоциональными состояниями. Этот модуль основан на общих представлениях физиологических и поведенческих модальний, таких как ЭЭГ, ЭДА, ЭКГ, мимики и движения глаз, полученных DCCA, для фиксации аффективной динамики пользователя. Одновременно метаданные о окружающей выставочной среде — визуальные стимулы, звуковые ландшафты, паттерны интерактивности и окружающие характеристики — используются для кодирования перцептивных сигналов. Используя мультимодальную сеть слияния (MMFN) для объединения этих мультимодальных представлений, модель получает детальные, нелинейные отображения из признаков перцептивных стимулов и эмоциональных меток или измерений (например, валентность, возбуждение, вовлечённость). Такое картирование позволяет системе постоянно отслеживать, как пользователь эмоционально реагирует на различные элементы выставки, а затем корректировать контент или интерфейс соответственно, чтобы повысить вовлечённость, удовлетворение или когнитивный резонанс. Наконец, моделирование восприятия и эмоций способствует эмоционально-осознанной адаптации взаимодействия, что является ядром вычислительного моделирования и систем экспозиции, чувствительных к пользователю.

Сначала модули DCCA были обучены изучению коррелированных латентных представлений для каждой пары модальности. Полученное вложение служит входом для MMFN, который дополнительно обучается последовательно для задачи аффективного предсказания. Для поддержания стабильности тренировки не проводится полная настройка.

КатегорияПараметрЦенность / Описание
Предварительная обработка сигналаПолосный фильтр ЭЭГ4–45 Гц
Частота передискретизации128 Гц
Длина окна2 с
Перекрытие окон50%
НормализацияНормализация Z-балла
Архитектура DCCAКоличество скрытых слоёв3 слоя на каждую модальность
Количество нейронов на слой128–64–32
Размер латентной размерности (n)32
Параметр регуляризации1 × 10⁻⁵
ОптимизаторАдам
Скорость обучения0.001
Размер партии32
Максимальные эпохи обучения150
Раннее прекращение терпения15 эпох
Конфигурация MMFNТип кодировщикаBiLSTM
Скрытые юниты64
Процент отсева0.3
Стратегия термоядерного синтезаГейт-синтез с вниманием
Тип вниманияЭЭГ, ЭКГ, ГСР, Видео
Обучение и оценкаФункция потерьПотеря перекрестной энтропии
Разделение поезд–испытание5-кратная перекрестная валидация
Метрики оценкиТочность, Точность, Отзыв, результат в Формуле-1, Каппа Коэна, AUC–ROC
Контрольные точки воспроизводимостиФорма тензора входа ЭЭГКаналы × временные сэмплы (например, 14 × 256 за окно)
Выходное представление DCCA32-мерное общее латентное вложение
Выход MMFNВероятности класса эмоций (валентно-возбужденные или дискретные классы)
Ожидаемая эффективность валидацииТочность классификации 85–90%

Таблица 2: Параметры предлагаемого алгоритма DCCA–MMFN. Краткое изложение параметров предварительной обработки, архитектуры, слияния, обучения, оценки и воспроизводимости, рассмотренных в предлагаемом фреймворке аффективного UX-моделирования. Сокращения; DCCA = глубокий канонический корреляционный анализ; MMFN = мультимодальная термоядерная сеть; UX = пользовательский опыт.

В Таблице 2 приведён весь набор параметров, используемых в предлагаемой структуре DCCA-MMFN, который учитывает предварительную обработку сигналов, проектирование глубокой архитектуры, технику термоядерного синтеза, а также условия обучения. Физиологические сигналы равномерно переанализировались и нормализованы для синхронизации с соответствующими модальностями. Уровень DCCA был настроен на использование многоуровневых нелинейных преобразований, что помогало в изучении максимально коррелированных латентных пространств, тогда как компонент MMFN использовал сети энкодеров BiLSTM с ограниченными механизмами внимания для динамического взвешивания ценности различных модальностей. Требования к обучению и оценке чётко определены, что обеспечивает справедливое сравнение с существующими вариантами.

Предлагаемая структура призвана служить вычислительной основой для систем, осознанных к аффекту, которые используют поведенческую и физиологическую информацию в нескольких измерениях. Архитектура концептуально адаптируется к реальным средам, таким как интеллектуальные выставочные пространства, адаптивные умные интерфейсы и системы взаимодействия человека и компьютера, осознанные к эффектам, несмотря на то, что текущее исследование подтверждает модель через контролируемые офлайн-эксперименты с использованием общедоступного набора данных AMIGOS. Фреймворк может служить фундаментальным модулем для приложений, требующих надёжного вывода эмоций, предлагая унифицированные методы слияния, кросс-модальное выравнивание и структурированную предобработку. Однако вместо экспериментальных внедрений эти среды описываются в исследовании как возможные контексты развертывания.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Оценка предлагаемой системы
Для оценки предлагаемой системы были проведены эксперименты с общедоступным набором данных AMIGOS, который обеспечивает синхронизированные измерения ЭЭГ, ЭКГ, ГСР, видео и аудио 40 пользователей, подвергшихся воздействию эмоционально активных стимулов. Для целей этого исследования авторы использовали данные 33 участников (после предварительной обработки и удаления неполных исследований), в результате чего было получено 1 320 действительных образцов по измерениям валентности...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Пространственные, экологические и физические контексты взаимодействия, такие как пространственная планировка, плотность толпы или условия окружающей среды, явно не указаны в наборе данных AMIGOS. Таким образом, такие факторы также не моделируются напрямую в текущих экспериментах. Предлагаемая вычислительная модель моделирования аффективного пользовательского опыта (UX) развивается гораздо дальше, чем фундаментальные концепции базовой работы, которые касались взаимодействия ребёнка и робо...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликтов интересов.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают признательность за поддержку Школы космического дизайна и Школы промышленного дизайна Университета Хонгик. Авторы также благодарят партнёров и участников выставки за их вклад в исследование.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Набор данныхНабор данных AMIGOS40 участников; ЭЭГ (128 Гц), ЭКГ (1000 Гц), ГСР (1000 Гц), видео лица, самосообщаемые метки валентности/возбужденияМультимодальные наземные данные истинности для моделирования аффективных состояний
Физиологические сенсорыЭЭГ-гарнитураEmotiv EPOC+ (14 каналов, 128 Гц)Фиксация мозговой активности, связанной с вниманием, возбуждением и вовлечённостью
ЭКГ-датчикBiopac MP150 или эквивалент (1000 Гц)Вариабельность и возбуждение сердечных сокращений
Датчик GSR/EDAShimmer GSR+ или эквивалент (1000 Гц)Проводимость кожи как мера возбуждения
Поведенческие сенсорыУстройство для отслеживания глазTobii Pro X2-60 или эквивалентФиксация взгляда на запись и саккады
Запись мимикиВидеокамера высокого разрешения; проанализировано с помощью OpenFace (AU, векторы взгляда)Извлечение лицевых единиц действия (AU) и подсказок взгляда
Экологические ресурсыАудиовизуальная система записиМикрофон + Камера (синхронизировано со стимулами)Захват контекстуальных стимулов во время выставки
Программное обеспечение / Наборы инструментовOpenFaceОткрытый набор инструментов для анализа поведения лицаЭвакуация боевых единиц (AU), направление взгляда
MATLAB / Python (NumPy, SciPy, scikit-learn)Предварительная обработка сигнала (ресемплирование, нормализация z-score, вычисление PSD)Предварительная обработка данных и извлечение признаков
TensorFlowv2.13 / PyTorchv2.0Фреймворк глубокого обучения для DCCA и MMFNВнедрение и обучение модели
Алгоритмы / МоделиГлубокий канонический корреляционный анализ (DCCA)Метод нелинейного выравнивания признаковИзучение коррелированных латентных представлений между модальностями
Мультимодальная термоядерная сеть (MMFN)BiLSTM + слои слияния на основе вниманияИерархическое слияние гетерогенных модальностей для классификации состояний UX
Метрики оценкиТочность, Точность, Отзыв, F1-Score, Коэн s Kappa, AUC-ROC, матрица путаницыРеализовано с помощью метрик scikit-learn / TensorFlowОценка эффективности модели
Вычислительное оборудованиеКластер рабочих станций / GPUNVIDIA RTX 3080 (10 ГБ) или эквивалент, 32 ГБ оперативной памяти, процессор Intel i9Обучение и симуляция моделей

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Affective ModelingMultimodal FusionPhysiological SignalsEmotion RecognitionDeep Learning FrameworkEEG SignalsECG SignalsGSR SignalsFeature AlignmentOffline Experiments

Related Articles