$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Набор данных AMIGOS, использованный в этом исследовании, является общедоступным и был собран с предварительного одобрения и информированного согласия институционального надзорного совета, как указано в оригинальной публикации. Это исследование включает только вторичный анализ набора данных, и дополнительное этическое одобрение не требовалось.
Настоящий метод использует подходы выравнивания признаков и мультимодального слияния для обработки мультимодальных физиологических и поведенческих данных с целью описания корреляций восприятия и эмоций. В данном исследовании предлагается вычислительная модель аффективного пользовательского опыта (UX) в интерактивных выставках, используя мультимодальное биофизическое сенсорное ощущение и моделирование эмоций на основе искусственного интеллекта. Основываясь на биофизических данных, полученных в базовой статье, эта методология оцифровывает вычислительное моделирование состояний пользователей на основе синхронизированных ЭЭГ, ЭКГ, ЭДА, отслеживания глаз, мимики и входных данных окружающей среды. Термин «пространственно-временное моделирование» в рукописи относится к пространственному многоканальному физиологическому представлению признаков и межмодальному корреляционному выравниванию с помощью DCCA. Временное: последовательное кодирование через BiLSTM и сохранение временных зависимостей в сегментированных окнах. Эти разнообразные сигналы изначально предварительно обрабатываются и нормализуются с учётом временных и пространственных корреляций между модальностями. Векторы признаков изучаются независимо для каждой модальности, фиксируя эмоциональные паттерны, такие как возбуждение, внимание и вовлечённость. Для успешного обучения на основе общих эмоциональных представлений в гетерогенных потоках данных используется DCCA. DCCA проецирует каждую модальность в латентное общее подпространство, где коррелированные признаки максимизированы, сохраняя при этом специфическую информацию за счёт расширенной кроссмодальной релевантности. Эти латентные вложения, выровненные по модальности, затем передаются в мультимодальную сеть слияния (MMFN), которая объединяет временную и контекстную информацию через гибридный BiLSTM и внимательные слои. Это слияние позволяет системе создавать высокоуровневые аффективные состояния, которые превращаются в индикаторы пользовательского опыта (например, скука, интерес, дискомфорт). Наконец, классификационный модуль оценивает аффективное UX-состояние и даёт обратную связь для адаптации выставок, например, корректируя визуальные или аудиостимулы в вычислительном моделировании. Рисунок 1 показывает архитектуру предлагаемого метода.

Рисунок 1: Архитектура предлагаемого метода. Структура предлагаемого фреймворка UX-моделирования, объединяющая мультимодальные входы, включая ЭЭГ, ЭКГ, ЭДА, мимику и взгляд, с использованием DCCA и MMFN. Сокращения; UX = пользовательский опыт; ЭЭГ = электроэнцефалография; ЭКГ = электрокардиография; EDA = электродермальная активность; DCCA = глубокий канонический корреляционный анализ; MMFN = Мультимодальная термоядерная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Предлагаемая архитектура на рисунке 1 иллюстрирует систему сквозного аффективного пользовательского опыта (UX), использующую глубокий канонический корреляционный анализ (DCCA) и мультимодальную сеть слияния (MMFN) для моделирования взаимодействия восприятия и эмоций в интерактивных выставках. Система начинает с принятия необработанных мультимодальных входов, таких как физиологические сигналы ЭЭГ, ЭКГ и EDA; мимики и взгляд, поведенческие сигналы; а также контекстуальные входы, такие как аудиовизуальная и экологическая информация. Эти сигналы затем подаются в модуль предварительной обработки и выделения признаков, где выполняется обработка специфичных для сигнала (например, удаление шума, нормализация, вычисление признаков) для получения значимых дескрипторов для каждой модальности. Во-вторых, модуль DCCA проецирует пары модальностей в общее латентное пространство и изучает максимально коррелированные вложения, которые кодируют внутренние эмоциональные паттерны между модальностями. Высококорреляционные особенности этих множественных модулей DCCA впоследствии объединяются с Multimodal Fusion Network (MMFN), которая иерархически объединяет изученные признаки с глубокими слоями обучения, возможно, BiLSTM, механизмами внимания или трансформерами для создания компактного и высокоуровневого аффективного представления. Это интегрированное представление затем погружается в слой классификации эмоций и UX-состояний, где модель предсказывает аффективные результаты, такие как валентность, возбуждение или когнитивные/эмоциональные состояния, такие как вовлечённость, скука или перегрузка. Адаптивная UX-обратная связь опционально предоставляется при завершении конвейера, позволяющая системе интерактивно реагировать на состояния пользователя, адаптируя стимулы или контент в контексте выставки. Эта масштабируемая и модульная архитектура гарантирует сильное моделирование эмоций за счет корреляционного обучения представления и глубокой мультимодальной интеграции, что отлично подходит для вычислительного моделирования аффективных вычислений в интерактивных или опытных средах.
Выбор слияния DCCA с MMFN основан на текущих ограничениях стандартных унимодальных и мелких моделей термоядерного синтеза. Хотя CNN-ResNet и LSTM-CNN извлекают временные или пространственные признаки, они плохо справляются с балансом между гетерогенными модальностями, такими как ЭЭГ, ЭДА и мимика под разными стимуляциями окружающей среды. DCCA максимизирует кроссмодальную корреляцию для обеспечения совместного латентного представления, тогда как MMFN использует иерархические механизмы слияния и внимания для динамического выделения наиболее информативных сигналов. В сочетании эти модули предлагают более надёжный, понятный и широко применимый подход к аффективному UX-моделированию для интерактивных мультисенсорных сред.
Сбор данных
В предложенной модельной модели взаимодействия восприятия и эмоций для интерактивных выставок общедоступный набор данныхAMIGOS 24 используется в качестве основы мультимодальных аффективных данных. Набор данных AMIGOS предоставляет исчерпывающий набор физиологических и поведенческих показателей от людей, проходящих через стимулы, вызывающие аффект, такие как видеоклипы. Эти данные содержат синхронизированные сигналы ЭЭГ, ЭКГ и ГСР, видеозаписи лица и самосообщаемые эмоциональные метки в дискретных (например, счастливая, грустная) и размерная (валентность/возбуждение) формах. Эти методы хорошо соответствуют потребностям предлагаемой здесь системы, которая направлена на выявление состояний аффективного пользовательского опыта (UX) во время иммерсивных, мультисенсорных демонстрационных взаимодействий. Набор данных включает записи 40 участников, каждый из которых был подвергнут как коротким (видеоклипы <150 секунд), так и длинным (фильмы >14 мин) эмоциональных стимулов, в условиях, имитирующих реальный медиа-взаимодействие. Для объёма предлагаемой работы используется предварительно обработанное подмножество набора данных: записи от 30 участников с высококачественными сигналами ЭЭГ, ЭКГ и ГСР без артефактов, а также полные файлы видео с лицом и аннотации. Это выбранные сэмплы для имитации мультимодальной эмоциональной динамики в выставочных ситуациях. Изученный набор данных является базой для обучения и бенчмаркинга для конвейера DCCA + Multimodal Fusion Network (MMFN), где эмоциональные состояния, такие как вовлечённость, скука, замешательство и возбуждение, исследуются как реакции на визуальные, слуховые и пространственные стимулы в симулированной выставочной среде. Таблица 1 показывает описание предлагаемого метода в наборе данных.
| Параметр | Подробности |
| Название набора данных | AMIGOS (Набор данных для исследований аффектов, личности и настроения) |
| Нет. участников | всего 40 (30 использовались в предлагаемых работах с полными мультимодальными данными) |
| Тип стимулов | Короткие и длинные видеоклипы (эмоционально аннотированные) |
| Каналы EEG | 14-канальная EEG-гарнитура Emotiv EPOC |
| ЭКГ | Датчик сердечного ритма (для ВСР и возбуждения) |
| GSR | Датчик проводимости кожи (измеряет симпатическую активность) |
| Видео с лицом | Видео с высоким разрешением фронтального лица для анализа экспрессии |
| Эмоциональные ярлыки | Самооценённая валентность, возбуждение, доминирование (шкала 1–9), плюс дискретные метки |
| Частота дискретизации | ЭЭГ: 128 Гц, ЭКГ/ГСР: 1000 Гц |
| Формат данных | .mat файлы и синхронизированные логи временных меток |
| Синхронизация модальности | Да — синхронизировано на всех сенсорах и видео |
| Продолжительность сеанса | Короткие клипы (<150 с) и длинные фильмы (>14 мин) |
| Подход к применению | Аффективное UX-моделирование, мультимодальное слияние, отображение восприятия-эмоций в реальном времени |
Таблица 1: Описание набора данных AMIGOS. Описание набора данных AMIGOS, используемого в предлагаемой структуре, включая информацию об участниках, методы, частоты выборки и экспериментальный дизайн. Сокращения; AMIGOS = набор данных для исследований аффектов, личности и настроения отдельных лиц и групп.
Общедоступный набор данных AMIGOS, применяемый в предлагаемой структуре, состоит из мультимодальных поведенческих и физиологических данных, собранных от 40 участников, из которых 33 были выбраны для этого исследования на основе качества и полноты записей. Набор данных записывает эмоциональные реакции на короткие и длинные видеоклипы и содержит такие сигналы, как ЭЭГ (из 14-канальной гарнитуры Emotive), ЭКГ для изменения сердечного ритма, ГСР для проводимости кожи и высокое разрешение для измерения выражения эмоции. Эмоциональные состояния самосообщаются как в измерениях (валентность, возбуждение, доминирование), так и в дискретных категориях. Данные хорошо согласованы друг с другом по модальностям и правильно дискретируются — 128 Гц для ЭЭГ, 1000 Гц для ЭКГ и ГСР. Такая конфигурация делает набор данных идеальным для моделирования пользовательского опыта (UX) в интерактивных выставках, чтобы взаимодействие восприятия и эмоций можно было точно отслеживать с помощью мультимодальных сенсоров на базе ИИ.
Предобработка данных
Все этапы предварительной обработки, обучение моделей и оценки реализовывались в индивидуальных скриптах на Python (Python 3.10, PyTorch 2.0) отдельно, при этом каждый модуль занимался предобработкой сигналов, выравниванием на основе DCCA, обучением MMFN и оценкой производительности; настройка ключевых параметров и некоторые важные вычислительные конфигурации приведены в таблице 1. Для обработки общедоступного набора данных AMIGOS для аффективного UX-моделирования интерактивных показаний изначально реализуйте систематическую систему предварительной обработки данных по физиологическим и поведенческим модальностям, таким как ЭЭГ, ЭКГ, ГСР и видео лица. Сначала стандартизируйте и синхронизируйте каждую модальность, а затем выполняйте специфическую модальность предварительную обработку. В настоящее время контекстуальная информация получается только из внутренних аудиовизуальных сигналов внутри видеостимулов, например, мимики, визуальных движений и акустических особенностей, таких как просодия речи и фоновый звук.
Нормализация сигнала и ресемплирование
Сырые физиологические сигналы x(t) из всех модальностей повторно дискретируются до общей частоты fs=128 Гц для выравнивания времени между модальностями:
(1)
Ресемплирование выполнялось с использованием стандартной функции библиотеки обработки сигналов, а не специально разработанного алгоритма. В частности, реализация была выполнена с использованием утилиты для пересэмплирования, доступной в экосистеме обработки сигналов Python (SciPy), которая применяет интерполяцию на основе метода Фурье для преобразования сигналов в целевую частоту дискретизации. Целевая частота дискретизации fs была выбрана для обеспечения равномерного временного разрешения между модальностями до сегментации и извлечения признаков. Каждый сигнал впоследствии нормализуется z-баллом для устранения изменчивости между субъектами:
(2)
где μx и σx — это среднее значение окна пробного периода и стандартное отклонение сигнала.
Предварительная обработка ЭЭГ
ЭЭГ-сигналы, захваченные с 14 каналов, проходят полосную фильтрацию с выбором 4–45 Гц для сохранения когнитивно-связанных частот:
(3)
Для определения частотных паттернов в сигналах используется спектр мощности, который может различаться в зависимости от типа эмоции, например, мозгового сигнала, и может давать полезную информацию о сигнале. Метод Уэлча является более совершенным методом уравнения 3 периодограмм, которое даёт оценку спектральной плотности и может использоваться для получения спектрограмм. Техника Уэлча сегментирует сигнал во временной области на дискретные интервалы времени и конструкции. Спектрограмма для каждого сегмента, затем все спектрограммы усредняются, как показано в уравнении 4. Этот процесс более плавный по сравнению с полным FFT-подходом, поэтому он получает максимальную мощность от сигналов. Наконец, спектральная плотность мощности (PSD)19 рассчитывается с помощью метода Уэлча для захвата характеристик частотной области:
(4)
Особенности PSD суммированы по пяти диапазонам: Тета (4–8 Гц), Альфа (8–13 Гц), Бета (13–30 Гц), Низкая гамма (30–45 Гц).
Видео-черты лица
Извлекая единицы действия лица (AU) и векторы взгляда для каждого кадра видео с помощью многоканального набора данных ЭЭГ или аналогичного программного обеспечения, они затем объединяются во временные последовательности:
(5)
Отображение меток эмоций
AMIGOS присваивают как оценки валентного возбуждения, так и дискретные эмоциональные метки. Непрерывные значения нормализуются до [0,1]:
(6)
Где V — фактическое наблюдаемое значение до нормализации , Vmin — наименьшее значение переменной в наборе данных, Vmax — наибольшее значение переменной в наборе данных, а V' — нормированное значение в диапазоне от 0 до 1. Эти метки применяются в качестве основной правды для моделирования контролируемого аффекта. Эти метки применяются в качестве основной правды для моделирования контролируемого аффекта.
Синхронизация между модальностями
Все модальности синхронизируются с помощью выравнивания временных меток или динамического искажения времени (DTW), когда это необходимо:
(7)
Заранее обработанные данные, богатые признаками, затем вводятся в модуль глубокого канонического корреляционного анализа (DCCA), который изучает максимально коррелированные представления между модальностями.
Извлечение признаков с помощью DCCA
В предполагаемой системе аффективного UX-моделирования для интерактивных экспозиций DCCA используется для изучения связанных латентных характеристик в гетерогенных методах, таких как ЭЭГ, ЭКГ, ЭДА, мимики и данные отслеживания глаз. Цель — изучить общее пространство представлений, в котором сигналы из различных модальностей, пусть и индивидуально шумные или специфичные для модальности, максимально коррелируют и семантически согласованы с точки зрения воспринимаемых эмоциональных состояний. В этой работе DCCA применялся к следующим парам модальности: i) ЭЭГ–ЭКГ, ii) ЭЭГ–ГСР и iii) ЭЭГ – представления черт лица. Эти пары были отобраны с целью зафиксировать комплементарные нейрофизиологические и нейронно-поведенческие корреляции, соответствующие аффективному взаимодействию. Для расширения DCCA до мультимодального режима были вычислены попарные вложения DCCA для каждой пары модальностей и затем объединены с использованием предложенного MMFN, что позволяет эффективно интегрировать более двух модальностей без изменения основной формулировки DCCA.
Выполняя корреляционно-ориентированное латентное выравнивание перед слиянием, DCCA структурно отделяет выравнивание представлений от синтеза решений, в отличие от сетей кросс-модального внимания или тензорного синтеза, которые работают непосредственно с возможными несогласованными представлениями. Избыточность уменьшается, а когерентность представлений улучшается благодаря двухступенчатой архитектуре. Кроме того, DCCA напрямую оптимизирует кроссмодальную статистическую зависимость, а не опирается только на общие функции потерь, что больше подходит для гетерогенных физиологических данных, чем для многозадачных обучающих фреймворков. Во-первых, DCCA20 используются для вычисления представлений ряда модальностей путём их последовательного рассмотрения через несколько слоёв нелинейных преобразований. Рисунок 2 иллюстрирует конструкцию DCCA, использованную в этой исследовательской работе. Мы использовали метод поиска по сетке для определения оптимальных гиперпараметров для проектирования модели глубокого обучения, используемой в подходе DCCA. После тщательного экспериментального анализа авторы выбрали стохастический градиентный оптимизатор спуска, потери перекрестной энтропии и регулирующий параметр 1e5. Далее авторы выбрали 15 шагов оптимизации, используя вектор смещения как все нули, валидационный набор как ранний критерий остановки и инициализатор Xavier в качестве весового инициализатора. Рисунок 2 показывает рабочий процесс DCCA.

Рисунок 2: Рабочий процесс DCCA. Рабочий процесс DCCA, показывающий отображение характеристик из различных модальностей в общее латентное пространство для максимизации корреляции.
Сокращения; DCCA = Глубокий канонический корреляционный анализ. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 2 визуально показывает внутреннюю рабочую структуру глубокого канонического корреляционного анализа (DCCA) для обучения совместного представления между двумя разными модальностями — EEG (модальность A) и EDA (модальность B). Обе модальности подключаются к соответствующим глубоким сетям экстракторов признаков (Feature Extractor A и B), которые имеют несколько скрытых слоёв, изучающих абстрактные, специфичные для модальности признаки. До слияния кроссмодальное латентное выравнивание осуществляется с помощью глубокого канонического корреляционного анализа (DCCA). Для каждой пары модальности строятся две параллельные глубокие проекционные сети (ЭЭГ–ЭКГ, ЭЭГ–ЭДА и ЭЭГ–Лицовые). С помощью активации ReLU каждая проекционная сеть состоит из трёх полностью связанных слоёв с размерами [256, 128, 64]. Для общего латентного пространства 64 является предельной вложенной размерностью. При коэффициенте регуляризации L2 1e-5 для обеспечения численной устойчивости целевая функция максимизирует каноническую корреляцию между проектируемыми вложениями модальности. Векторы смещения инициализируются до нуля, а веса — с помощью инициализации Ксавье. Для стабилизации обучения выравниванию модули DCCA обучаются отдельно перед обучением MMFN. Для поддержания согласованности выравнивания между DCCA и MMFN не проводится полная настройка. Эти конвейеры нейронных сетей принимают входные потоки данных параллельно, но изолированно. Выход экстрактора признаков из каждой из них затем проецируется в общее латентное пространство, где признаки обеих модальностей отображаются для сопоставимости по структуре. Проекции оптимизируются в соответствии с целью DCCA — максимизировать корреляцию между соответствующими латентными представлениями EEG и EDA. Приобретая это максимально коррелированное подпространство, DCCA гарантирует, что выходные вложения сохраняют комплементарные и семантически значимые закономерности из обеих модальностей, которые необходимы для последующих приложений, таких как распознавание эмоций или аффективные вычисления.
В этой работе признаки конвертируются с помощью DCCA, а затем интегрируются для категоризации. Модель DCCA, показанная на рисунке 2, использует модель глубокого обучения для преобразования признаков. Слой CCA вычисляет корреляцию, которая затем используется для комбинирования и классификации признаков. Предположим, что матрица
хранит испытания модальности ЭЭГ, а матрица
включает эксперименты с видеоклипами лица. В этом случае размеры признаков в ЭЭГ и видеоклипах лица представлены соответственно n1 и n2, а общее количество испытаний — МА. Для каждой модальности авторы создали следующую глубокую нейронную сеть для нелинейной перестройки входных характеристик:
(8)
где параметры нелинейного преобразования представлены как HT 1 и HT 2; последующие характеристики каждой нейронной сети представлены как
и
и измерение характеристики DCCA как n. Рекурсивно изученные параметры HT1 и HT2, полученные из DCCA, максимально повысили корреляцию между ON 1 и ON 2 до возможного уровня:
(9)
Взаимно изученные параметры, такие как HT 1 и HT 2 , обучались алгоритмом обратного распространения. Для получения нужного ответа градиенты целевой функции были аппроксимированы, как было предложено. Изменённые функции ON1 и ON2 ∈ SP находятся в объединённом гиперпространственном SP после обучения двух нейронных сетей. Авторы DCCA mainly20 не упоминали конкретно использование изменённых характеристик. Изменённые функции могут использоваться так, чтобы лучше всего служить приложению пользователя. В этой работе авторы получили следующие сплавленные признаки из изменённых признаков:
(10)
где α и β представляют веса, поддерживающие α + β = 1. Характеристики ON, интегрированные с помощью DCCA, вводятся в классификатор SoftMax. Задачи распознавания эмоций используются для обучения классификатора. Как уже упоминалось, создание DCCA для слияния данных в различных форматах имеет определённые преимущества. Для наблюдения характеристик и корреляции модально-центричных преобразований, например, DCCA явно получает ON1 и ON2 для каждой модальности на уровне слияния признаков. Кроме того, данные на основе эмоций можно сохранять, управляя нелинейными функциями отображения f1(·) и f2(·). Кроме того, авторы используют эквивалентные веса для каждой модальности в слиянии взвешенной суммы. Мультимодальная сеть слияния (MMFN), прогнозирующая состояния пользовательского опыта, получает это объединённое пространство. Для мультимодального выравнивания используется иерархический подход, при котором сырые сигналы сначала временно выравниваются с ресемплированием и выравниванием временных меток, а выравнивание семантически насыщенных сигналов из различных модальностей получается с помощью глубокого канонического корреляционного анализа (DCCA). Это гарантирует, что модально-ориентированные представления преобразуются в общее латентное пространство до процесса слияния, основанного на внимании, в MMFN.
Мультимодальная сеть слияния (MMFN) для аффективного UX-моделирования
MMFN кодирует каждую модальность отдельно, затем объединяет их с помощью механизма слияния и внимания, чтобы получить интегрированное представление для прогнозирования эмоций.
Модально-специфическое кодирование
Пусть x(i)∈R di — вектор характеристик для i-й модальности (например, EEG, EDA). Каждая модальность кодируется нейронным кодировщиком:
(11)
Гейтовый механизм термоядерного синтеза
Для управления потоком информации из каждой модальности используется элемент слияния:
(12)
(13)
σ — это функция активации сигмовидной формы. ⊙характеризует развитие по элементам. Это позволяет сети динамически снижать вес шумных модальностей или полезных функций.
Кросс-модальное слияние внимания
Слой внимания узнаёт, какой вес нужно придавать представлению каждой модальности:
(14)
(15)
α(i) — это веса
внимания, сплавленное конечное представление.
Прогнозирование аффективного состояния
Слитый вектор входит в выходной слой для предсказания валентности/возбуждения или UX-состояний:
22(16)
Где
можно использовать для представления: класс дискретных эмоций (счастливый, нейтральный, грустный), непрерывная шкала (валентность/возбуждение) и категории UX (вовлечённый, отвлечённый, перегруженный).

Рисунок 3: Структура MMFN. Структура MMFN с модально-специфическими энкодерами, гейт-слиянием и интеграцией на основе внимания для прогнозирования аффективного состояния.
Сокращения; MMFN = Мультимодальная термоядерная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 3 показывает рабочий процесс мультимодальной сети слияния (MMFN), используемой в аффективной вычислительной структуре для прогнозирования эмоций и пользовательского опыта (UX). Модально-специфические энкодеры, гейт-слияные слои, модуль интеграции на основе внимания и финальная классифицированная головка составляют иерархическую архитектуру слияния MMFN. Он иллюстрирует, как различные гетерогенные вводные модальности, такие как ЭЭГ (модальность A), EDA (модальность B) и мимики (модальность C), обрабатываются с помощью собственных специализированных сетей кодировщиков (кодировщики A, B и C). Независимый кодировщик, состоящий из двух полностью связанных слоёв с активацией ReLU, обрабатывает каждую модальность (ЭЭГ, ЭКГ, ЭДА и признаки лица), прежде чем слой двунаправленной долгой краткосрочной памяти (BiLSTM) фиксирует временные зависимости. Каждый кодировщик изучает модально-специфическое представление признаков, сохраняющее значимые эмоциональные или физиологические особенности из соответствующего потока данных. Каждое направление в BiLSTM содержит 128 скрытых единиц, что придаёт каждой модальности 256-мерное контекстное вложение. Чтобы избежать перенагона, dropout (скорость = 0,5) выполняется после слоя BiLSTM. Затем к закодированным представлениям модальности применяется гейтированный подход слияния, использующий сигмовидную активацию для динамического управления вкладом модальности. Слой самовнимания затем рассчитывает веса внимания по разным методам, чтобы подавлять шумные сигналы и выделять релевантную информацию. Полностью связанный слой и либо линейный выходной слой для задач регрессии валентно-возбуждения, либо выходной слой Softmax для задач дискретной классификации проецируют слитое представление. Выход каждого энкодера затем поступает в мультимодальный слой слияния, который проводит конкатенацию всех модальных признаков и применяет механизм внимания для выделения более информативных сигналов и маскового шума. Эта операция создаёт общее латентное представление, интегрирующее эмоциональные сигналы по всем модальностям в высокоуровневый плотный вектор.
Слои BiLSTM, применяемые к модально-специфическим последовательным вложениям, напрямую моделируют временную динамику. BiLSTM позволяет контекстуально моделировать изменяющиеся аффективные состояния, фиксируя как прямые, так и обратные временные зависимости в сегментированных физиологических последовательностях. Кроме того, адаптивное взвешивание временных информативных признаков становится возможным благодаря слою слияния на основе внимания, который функционирует над временно закодированными представлениями. Авторы недавно обновили текст, чтобы сделать более очевидным, как построение последовательностей, повторяющееся кодирование и взвешивание внимания работают вместе для поддержки временного моделирования.
Предлагаемый псевдокод 1 показывает общий процесс аффективного моделирования пользовательского опыта с использованием DCCA-MMFN в воспроизводимой форме. Для начала мультимодальные физиологические и поведенческие сигналы подаются в независимый этап предварительной обработки, включающий снижение шума и нормализацию масштабов. Затем эти признаки вводятся в DCCA, где коррелированные признаки совместно изучаются для заданных пар модальности с целью обеспечения надёжного кросс-модального выравнивания. Выровненные признаки впоследствии объединяются в MMFN, состоящий из механизмов гейта и внимания для модуляции специфической для модальности, направленных на продвижение информативных модальностей и подавление шума. Окончательное комбинированное представление признаков используется для обучения классификатора, предназначенного для оценки аффективного и UX-связанного состояния, а общая оценка эффективности проводится на основе стандартных метрик. Пошаговый характер предлагаемого псевдокода обеспечивает прозрачность, осуществимость и простоту воспроизведения другими для всех технически подвешенных лиц, заинтересованных в этом протоколе.
Предлагаемая рамка направлена на прогнозирование состояния аффективного пользовательского опыта (UX) с использованием мультимодальных физиологических и поведенческих сигналов из набора данных AMIGOS на основе следующих шагов: Шаг 1: Входные мультимодальные данные состоят из ЭЭГ, ЭКГ, ЭДА, глаза и мимики. Изначально используется мультимодальный набор данных AMIGOS, и каждая модальность проходит предварительную обработку сигнала, включая фильтрацию шума и нормализацию для обеспечения качества и согласованности данных. Шаг 2: Для поддержания временной однородности между модальностями все сигналы передискретируются до стандартной частоты. Далее проводится модально-специфическое извлечение признаков для получения уникальных представлений признаков, соответствующих каждому типу сигнала. Шаг 3: Для фиксации кроссмодальных отношений выбранные пары модальности (ЭЭГ–ЭКГ, ЭЭГ–ЭДА и ЭЭГ–Лицолицо) обрабатываются с помощью глубокого канонического корреляционного анализа (DCCA). Сети DCCA обучаются изучать коррелированные латентные представления между парными модальностями, что приводит к выровненным вложениям признаков для каждой пары модальности. Эти выровненные представления затем объединяются в единое мультимодальное пространство признаков. Шаг 4: Агрегированные выровненные признаки предоставляются в качестве входных данных для мультимодальной сети синтеза (MMFN), где используются механизмы внимания и стратегии гейт-синтеза для эффективной интеграции дополнительной информации между модальностями. Этот процесс слияния создаёт комплексное аффективное представление. Шаг 5: Полученное представление затем используется для обучения классификатора с мечеными эмоциональными данными для предсказания аффективного UX-состояния. Наконец, производительность модели оценивается с использованием стандартных метрик, включая точность, точность, воспоминание, F1-балл и площадь под кривой (AUC). Предсказанное аффективное UX-состояние возвращается как конечный результат фреймворка.
Моделирование восприятия-эмоций с использованием предлагаемой структуры DCCA-MMFN
В предлагаемой вычислительной структуре аффективного пользовательского опыта (UX) интерактивных выставок модуль моделирования восприятия–эмоций является центральным процессом, связывающим перцептивные реакции пользователя на стимулы окружающей среды с их мультимодальными биофизически выведенными эмоциональными состояниями. Этот модуль основан на общих представлениях физиологических и поведенческих модальний, таких как ЭЭГ, ЭДА, ЭКГ, мимики и движения глаз, полученных DCCA, для фиксации аффективной динамики пользователя. Одновременно метаданные о окружающей выставочной среде — визуальные стимулы, звуковые ландшафты, паттерны интерактивности и окружающие характеристики — используются для кодирования перцептивных сигналов. Используя мультимодальную сеть слияния (MMFN) для объединения этих мультимодальных представлений, модель получает детальные, нелинейные отображения из признаков перцептивных стимулов и эмоциональных меток или измерений (например, валентность, возбуждение, вовлечённость). Такое картирование позволяет системе постоянно отслеживать, как пользователь эмоционально реагирует на различные элементы выставки, а затем корректировать контент или интерфейс соответственно, чтобы повысить вовлечённость, удовлетворение или когнитивный резонанс. Наконец, моделирование восприятия и эмоций способствует эмоционально-осознанной адаптации взаимодействия, что является ядром вычислительного моделирования и систем экспозиции, чувствительных к пользователю.
Сначала модули DCCA были обучены изучению коррелированных латентных представлений для каждой пары модальности. Полученное вложение служит входом для MMFN, который дополнительно обучается последовательно для задачи аффективного предсказания. Для поддержания стабильности тренировки не проводится полная настройка.
| Категория | Параметр | Ценность / Описание |
| Предварительная обработка сигнала | Полосный фильтр ЭЭГ | 4–45 Гц |
| Частота передискретизации | 128 Гц |
| Длина окна | 2 с |
| Перекрытие окон | 50% |
| Нормализация | Нормализация Z-балла |
| Архитектура DCCA | Количество скрытых слоёв | 3 слоя на каждую модальность |
| Количество нейронов на слой | 128–64–32 |
| Размер латентной размерности (n) | 32 |
| Параметр регуляризации | 1 × 10⁻⁵ |
| Оптимизатор | Адам |
| Скорость обучения | 0.001 |
| Размер партии | 32 |
| Максимальные эпохи обучения | 150 |
| Раннее прекращение терпения | 15 эпох |
| Конфигурация MMFN | Тип кодировщика | BiLSTM |
| Скрытые юниты | 64 |
| Процент отсева | 0.3 |
| Стратегия термоядерного синтеза | Гейт-синтез с вниманием |
| Тип внимания | ЭЭГ, ЭКГ, ГСР, Видео |
| Обучение и оценка | Функция потерь | Потеря перекрестной энтропии |
| Разделение поезд–испытание | 5-кратная перекрестная валидация |
| Метрики оценки | Точность, Точность, Отзыв, результат в Формуле-1, Каппа Коэна, AUC–ROC |
| Контрольные точки воспроизводимости | Форма тензора входа ЭЭГ | Каналы × временные сэмплы (например, 14 × 256 за окно) |
| Выходное представление DCCA | 32-мерное общее латентное вложение |
| Выход MMFN | Вероятности класса эмоций (валентно-возбужденные или дискретные классы) |
| Ожидаемая эффективность валидации | Точность классификации 85–90% |
Таблица 2: Параметры предлагаемого алгоритма DCCA–MMFN. Краткое изложение параметров предварительной обработки, архитектуры, слияния, обучения, оценки и воспроизводимости, рассмотренных в предлагаемом фреймворке аффективного UX-моделирования. Сокращения; DCCA = глубокий канонический корреляционный анализ; MMFN = мультимодальная термоядерная сеть; UX = пользовательский опыт.
В Таблице 2 приведён весь набор параметров, используемых в предлагаемой структуре DCCA-MMFN, который учитывает предварительную обработку сигналов, проектирование глубокой архитектуры, технику термоядерного синтеза, а также условия обучения. Физиологические сигналы равномерно переанализировались и нормализованы для синхронизации с соответствующими модальностями. Уровень DCCA был настроен на использование многоуровневых нелинейных преобразований, что помогало в изучении максимально коррелированных латентных пространств, тогда как компонент MMFN использовал сети энкодеров BiLSTM с ограниченными механизмами внимания для динамического взвешивания ценности различных модальностей. Требования к обучению и оценке чётко определены, что обеспечивает справедливое сравнение с существующими вариантами.
Предлагаемая структура призвана служить вычислительной основой для систем, осознанных к аффекту, которые используют поведенческую и физиологическую информацию в нескольких измерениях. Архитектура концептуально адаптируется к реальным средам, таким как интеллектуальные выставочные пространства, адаптивные умные интерфейсы и системы взаимодействия человека и компьютера, осознанные к эффектам, несмотря на то, что текущее исследование подтверждает модель через контролируемые офлайн-эксперименты с использованием общедоступного набора данных AMIGOS. Фреймворк может служить фундаментальным модулем для приложений, требующих надёжного вывода эмоций, предлагая унифицированные методы слияния, кросс-модальное выравнивание и структурированную предобработку. Однако вместо экспериментальных внедрений эти среды описываются в исследовании как возможные контексты развертывания.