Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Двухветвневая сеть перекрестного внимания для электроэнцефалографии и мультимодального распознавания эмоций лица во время просмотра картины

114 просмотров

⸱

DOI:

10.3791/70600

⸱

12 мая 2026 г.

В этой статье

Краткое содержание

Этот протокол описывает синхронизированное получение электроэнцефалографии и лицевых данных в условиях просмотра картины, а также двухветвневую сеть перекрёстного внимания для мультимодального распознавания эмоций, включая предобработку, слияние признаков и классификацию четырёх эмоциональных состояний.

Аннотация

Распознавание эмоций при просмотре картины остаётся сложным, поскольку эстетические реакции динамичны, зависят от контекста и лишь частично наблюдаются через внешнее поведение. Таким образом, унимодальные подходы, основанные только на мимике или физиологических сигналах, часто дают неполные представления о переживании зрителя. В этой статье описывается воспроизводимый метод построения двухветвной сети перекрестного внимания, который интегрирует видео лица с данными электроэнцефалографии (ЭЭГ) для мультимодального распознавания эмоций в контексте живописной выставки. Протокол начинается с создания синхронизированной среды получения информации с использованием 64-канальной системы ЭЭГ и высокоразрешающей камеры для одновременной записи во время просмотра картины. Последующий процесс подробно описывает предварительную обработку сигнала, включая ЭЭГ-фильтрацию, сегментацию и экстракцию признаков дифференциальной энтропии, а также обнаружение лица, выравнивание и подготовку кадров для видеоанализа. Нейронная сеть содержит две модально-специфические ветви. Ветвь ЭЭГ использует сверточную нейронную сеть и двунаправленную сеть долговременной памяти для моделирования пространственно-временных нейронных признаков, тогда как лицовая ветвь использует координатно-усиленную лёгкую сверточную сеть для извлечения визуальных экспрессийных признаков. Модуль многоголового кросс-внимания затем используется для объединения двух потоков путём изучения межмодальной релевантности. В условиях экспериментальных условий, описанных здесь, мультимодальная структура достигла более высокой точности классификации, чем унимодальные модели сравнения в распознавании эмоций в четырёх категориях. Этот метод наиболее подходит для офлайн-анализа в условиях контролируемого приобретения и предоставляет практическую основу для аффективных вычислений, эмпирической эстетики и выставочно-ориентированных исследований взаимодействия человека и компьютера.

Введение

Эмоции — это многомерный психологический и физиологический процесс, формируемый внешними стимулами, внутренней оценкой и постоянной когнитивной регуляцией, поэтому она занимает центральное место в взаимодействии человека и компьютера и когнитивнойнауке 1. В живописных выставочных условиях эмоции также опосредуют отношения между визуальными произведениями искусства и интерпретацией зрителем. По этой причине идентификация эмоциональных состояний зрителя имеет практическую ценность для оценки выставки, пространственного дизайна и эмпирических исследований эстетическогоопыта 2. В то же время измерение эмоций в полуестественных выставочных средах остаётся технически сложным, поскольку реакции тонкие, мимолётные и зависят как от произведения искусства, так и от контекста просмотра.

Исследования распознавания эмоций обычно развивались по двум основным направлениям: поведенческий анализ и физиологический анализ. Поведенческие подходы, особенно анализ мимики на основе компьютерного зрения, широко применяются, поскольку они неинвазивны и относительно просты вприменении 3. Модели глубокого обучения, такие как остаточные сети и легкие сверточные сети, показали высокую эффективность в базовых задачах классификации эмоций лица4. Однако поведение лица при просмотре картины может быть слабым, социально умеренным или намеренно сдерживаемым, что снижает соответствие между видимым выражением и субъективнымчувством 5. Физиологические подходы, особенно основанные на электроэнцефалографии (ЭЭГ), обеспечивают более прямой доступ к нейронной активности, связанной с аффективнойобработкой 6. ЭЭГ широко используется в эмоциональных исследованиях, поскольку временные колебания нейронных сигналов информируют изменения в аффективном состоянии, включая измерения, связанные с валентностью ивозбуждением 7. Тем не менее, ЭЭГ-записи чувствительны к артефактам движения, электромиографическому загрязнению и шуму окружающей среды, и только ЭЭГ часто даёт ограниченную контекстную информацию о том, на что зритель визуально реагирует8.

Эти взаимодополняющие сильные и слабые стороны привлекли к росту интереса к мультимодальному распознаваниюэмоций 9. Основная идея мультимодального слияния заключается в том, что гетерогенные сигналы могут предоставлять взаимоинформативные доказательства и уменьшать неоднозначность, возникающую, когда одна модальность интерпретируется визоляции 10. Например, в задачах по просмотру картины сдержанное поведение лица может совпадать с измеримыми нейронными изменениями, связанными с вниманием или аффективным взаимодействием. Однако существующие мультимодальные системы не всегда эффективно моделируют эту связь. Ранние стратегии слияния, основанные на прямой конкатенации признаков, могут увеличить размерную нагрузку и размыть специфическую для модальности временнуюструктуру 11. Поздние стратегии слияния, основанные на отдельных решениях, легче реализовать, но они могут упускать из виду тонкие взаимодействия между визуальными и физиологическими сигналами во время эмоциональнойобработки 12. Кроме того, многие мультимодальные модели используют фиксированные или слабо адаптивные схемы слияния, которые плохо подходят для колебаний реакций зрителя в выставочныхусловиях 13.

Для устранения этих ограничений настоящий протокол описывает двухветвневую сеть перекрестного внимания для мультимодального распознавания эмоций во время просмотра картины. В рамках этой структуры особенности ЭЭГ обрабатываются с помощью сверточной нейронной сети и двунаправленной модели краткосрочной памяти (CNN-BiLSTM), которая используется для представления пространственно-временной нейродинамики. Функции лица обрабатываются с помощью ветки MobileNetV2 с улучшением координатного внимания, которая используется для захвата сигналов низкой интенсивности при сохранении вычислительной эффективности14. Обе ветви затем интегрируются через многоголовный механизм перекрёстного внимания, который усваивает релевантность между модальностями, а не просто объединяет их результаты15,16. Эта конструкция направлена на сохранение структуры, специфичной для модальности, при одновременном улучшении кроссмодального моделирования взаимодействий.

Метод предназначен преимущественно для офлайн-анализа в условиях контролируемого сбора данных, а не для прямого внедрения в реальном времени в открытых общественных выставочных пространствах. Надёжная реализация требует синхронизации ЭЭГ и видеосъёмки, стабильного освещения, контролируемого размещения камеры, приемлемого электродного импеданса и достаточного количества вычислительных ресурсов для обучения моделей. Результаты также могут зависеть от состава выборки, типа стимула и степени, в которой участники изменяют поведение, потому что знают, что их записывают. Эти операционные ограничения следует учитывать при адаптации протокола к другим выставочным условиям или популяциям.

Представленный здесь протокол охватывает весь экспериментальный конвейер, включая синхронизированное получение от 327 участников, предварительную обработку данных ЭЭГ и видео с лица, извлечение признаков, кроссмодальное слияние и классификацию. Цель — предоставить воспроизводимый рабочий процесс для мультимодального распознавания эмоций в исследованиях выставок живописи. Помимо аффективныхвычислений 17, протокол может также поддерживать количественное исследование в эмпирической эстетике и смежных психологическихисследованиях 18.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Протокол исследования был рассмотрен и утверждён Этическим комитетом по защите человеческих исследований Педагогического университета Синъи Минцзу (Одобрение No 2600AL0621). Письменное информированное согласие было получено от всех участников до их включения в исследование и до начала сбора данных.

1. Набор участников и этическое соблюдение

  1. Получение этического одобрения
    1. Перед началом исследования отправьте полный экспериментальный протокол, форму согласия, информационный лист участников и план защиты данных в институциональный обзорный совет (IRB) или этический комитет.
    2. Получите письменное одобрение и запишите номер одобрения в документацию исследования.
  2. Набор участников
    1. Привлекайте здоровых взрослых участников для мультимодального восприятия эмоций во время просмотра картины. В этом демонстрационном протоколе задействуют 327 участников.
    2. Применяйте следующие критерии включения: возраст 18–35 лет, нормальное или скорректированное зрение, отсутствие самосообщаемой истории неврологических расстройств, отсутствие текущего применения психоактивных препаратов и готовность к электроэнцефалографии (ЭЭГ) и видеозаписи лица.
    3. Применяйте следующие критерии исключения: чрезмерная травма кожи головы или дерматологические заболевания, мешающие установке электрода, невозможность завершить полную сессию записи, сильное движение во время получения или неполные документы о согласии.
    4. Зафиксируйте характеристики участника, включая возраст, пол, владение руками, опыт просмотра искусства и уровень образования. В этом демонстрационном протоколе запишите следующую выборку КРАТКИЙ ДЛИННЫЙ АННОТАЦИЯ: средний возраст 24,8 ± 3,7 года, 165 женщин и 162 мужчины, все участники правши.
    5. Определите демографический баланс оперативно до найма. В этом демонстрационном протоколе используйте этот термин для обозначения примерно сбалансированного распределения полов и возрастного диапазона, концентрированного в ранней взрослой жизни, чтобы снизить возрастную вариацию в ЭЭГ и реакциях на мимику.
  3. Получение информированного согласия
    1. Предоставить каждому участнику письменную форму информированного согласия, описывающую запись ЭЭГ, видеозапись лица, процедуры синхронизации, анонимизацию, хранение данных и право отказаться в любой момент без штрафа.
    2. Объясните, что изображения лица будут использоваться для извлечения признаков, а области глаз будут маскироваться во всех рукописных фигурах для защиты личности участников.
    3. Получите письменное информированное согласие перед началом любой экспериментальной процедуры.
  4. Назначение идентификаторов и анонимизация данных
    1. Каждому участнику присвоите уникальный числовой идентификатор исследования. Храните EEG-файлы, видеофайлы и метаданные, используя только идентификатор исследования.
    2. Храните идентифицируемые формы согласия отдельно от физиологических и изображенных данных. Используйте деидентифицированные лица или результаты, полученные от ориентиров лица, для хранения внутреннего анализа при необходимости местной этической политики.

2. Экспериментальная среда и настройка стимулов

  1. Подготовка окружающей среды для просмотра
    1. Подготовьте тихую внутреннюю комнату, чтобы имитировать контролируемую атмосферу выставки живописи. Поддерживайте температуру окружающей среды 22–24 °C и относительную влажность 45–60%. Контролируйте фоновый шум ниже 40 дБ, где это возможно.
    2. Посадите участника в вертикальное кресло с опорой на спину и расположите стул так, чтобы расстояние просмотра между участником и дисплеем составляло 2,0 м.
    3. Инструктуйте участника оставаться в одиночестве в зоне записи во время презентации стимула. Не позволяйте другим участникам или наблюдателям находиться в непосредственном поле зрения во время сбора данных.
  2. Конфигурация освещения
    1. Установите диффузное кольцо или круговое освещение перед участником, чтобы уменьшить тень на лице. Установите освещение на уровне лицевой панели до стабильного уровня примерно 500 люкс.
    2. Избегайте резких колебаний освещения и прямых бликов на глаза, лоб или щеки. Визуальная контрольная точка: Подтвердите, что полное лицо, включая лоб, брови, глаза, нос, щёки и область рта, видно в предварительном просмотре камеры без переэкспонирования или глубоких теней.
  3. Конфигурация визуального представления стимула
    1. Покажите визуальные стимулы на мониторе или проекционном экране. В этом демонстрационном протоколе используйте 27-дюймовый жидкокристаллический монитор с разрешением 1 920 x 1 080 пикселей и частотой обновления 60 Гц.
    2. Отображать стимулы для просмотра картины в виде или слайд-шоу в соответствии с дизайном исследования. Используйте одинаковые правила яркости, контраста и порядка презентации для всех участников.
    3. Покажите каждый клип для картины на 90–120 секунд. В этом демонстрационном протоколе используйте 6 клипов, каждый длительностью 100 с, с интервалом отдыха между стимулами 20 с.
      ВНИМАНИЕ: Правильно заземляйте всё электрооборудование и разместите усилитель ЭЭГ и силовые кабели подальше от источников с высоким уровнем помех для снижения шума в диапазоне 50/60 Гц.

3. Мультимодальное сбор данных

  1. Получение видео с лицом
    1. Разместите промышленную камеру высокого разрешения прямо перед участником примерно на уровне глаз. Установите расстояние от камеры к лицу на 1,2 м.
    2. Используйте камеру с минимальным разрешением захвата 1 920 x 1 080 пикселей и частотой кадров 30 кадров в секунду.
    3. Устанавливайте экспозицию вручную, чтобы избежать колебаний между кадрами. В этом демонстрационном протоколе используйте ISO 400, выдержку 1/60 с и фиксированный баланс белого.
    4. Сохраняйте видео в формате MP4 или AVI с постоянной частотой кадров. В этом демонстрационном протоколе сохраняйте видео в формате MP4, кодирование H.264, 30 кадров в секунду.
    5. Убедитесь, что всё лицо остаётся в поле зрения на протяжении всей сессии записи. Визуальная контрольная точка: убедитесь, что брови и лоб полностью видны. Немедленно переместите камеру, если лоб, брови или подбородок обрезаны.
      ПРИМЕЧАНИЕ: Используйте 30 кадров в секунду, так как эта частота обеспечивает достаточное временное разрешение для низкоинтенсивной динамики выражения лица, при этом сохраняя управляемую нагрузку на хранение и обработку при синхронизированной мультимодальной записи.
  2. Получение сигналов ЭЭГ
    1. Измерьте окружность головы и выберите правильный размер колпачка для участника. Установите 64-канальный ЭЭГ-лимит согласно международной системе 10–20 или заданной производителем схеме расширения на 64 канала.
    2. Выровняйте крышку с помощью анатомических ориентиров. Разместите Fpz на средней линии над насионом и проверьте симметрию по левому и правому полушариям.
    3. Разделите волосы в каждом месте электрода и нанесите проводящий гель для улучшения контакта электрода и кожи головы.
    4. Аккуратно подготовьте кожу головы в местах с высоким импедансом с помощью ватного тампона или тупого инструмента. Не стирайте кожу слишком сильно.
    5. Подключите конденсатор к усилителю ЭЭГ и проведите измерение импеданса. Уменьшите сопротивление электрода до менее 10 кОм для всех каналов. В этом демонстрационном протоколе стремитесь < 5 кОм для фронтальных и центральных электродов, когда это возможно.
    6. Установите частоту дискретизации на 500 Гц. Установите онлайн-референс в соответствии с конфигурацией усилителя. В этом демонстрационном протоколе используйте связанный сосцевидный референс при получении и выполняйте повторное ссылание на общую среднюю при предварительной обработке.
    7. Разместите электрод земли согласно спецификации усилителя. В этом демонстрационном протоколе разместите землю на AFz. Запишите не менее 60 секунд базового состояния покоя до презентации стимула.
    8. Визуальная контрольная точка: Перед началом эксперимента проверьте живые следы ЭЭГ. Подтвердить стабильную исходную активность, низкий дрейф и отсутствие устойчивых насыщенных каналов или артефактов крупного движения.
  3. Синхронизация ЭЭГ и видеопотоков
    1. Подключите компьютер презентации стимулов к входу триггера усилителя ЭЭГ с помощью триггерного кабеля транзисторно-транзисторной логики (TTL) или триггерной коробки.
    2. Используйте программное обеспечение для презентации, чтобы отправить TTL-триггерный импульс в начале каждого клипа для рисования и второй TTL-импульс на смещении каждого клипа.
    3. Назначайте уникальные триггерные коды каждому типу события. В этом демонстрационном протоколе используйте 11–16 для начала клипа и 21–26 для смещения клипа.
    4. Записывайте поток камеры и ЭЭГ одновременно не менее чем за 5 секунд до первого триггера и не менее чем через 5 секунд после финального триггера. Автоматически зарегистрируйте таблицу временных меток триггера в программном обеспечении стимула.
    5. Валидация синхронизации после получения путём сопоставления временных меток триггера в записи ЭЭГ с индексами видеокадров из журнала презентации. Визуальная контрольная точка: подтвердите, что средняя ошибка выравнивания между временными метками триггера ЭЭГ и временными метками кадров видео составляет в пределах ±33 мс при 30 кадрах в секунду.
      ПРИМЕЧАНИЕ: Если нет аппаратного интерфейса синхронизации с точностью кадров, экспортируйте логи временных меток из обеих систем и выполните коррекцию выравнивания офлайн с помощью согласования с началом триггеров.
  4. Запись экспериментальных данных
    1. Попросите участника смотреть на картины естественно, минимизируя большие движения головы, чрезмерное моргание, разговор и прикосновения к лицу.
    2. Представьте заранее определённые клипы для картины в выбранном порядке. Записывайте синхронизированные ЭЭГ и видео лица непрерывно на протяжении всей сессии просмотра.
    3. Приостановите эксперимент и перепроверьте электроды, если более 5 каналов превышают порог импеданса во время записи. Документируйте перерывания, дискомфорт участников и технические проблемы в журнале сессий.

4. Предварительная обработка ЭЭГ и извлечение признаков

  1. Импорт необработанных данных ЭЭГ
    1. Импортируйте необработанные записи ЭЭГ в среду анализа. В этом демонстрационном протоколе используйте либо MATLAB R2023b с EEGLAB 2024.0, либо Python 3.10 с MNE 1.6.
    2. Импортируйте маркеры событий и проверьте, присутствуют ли все триггеры начала и смещения стимула.
  2. Понижение дискретизации сигналов ЭЭГ
    1. Понизьте дискретизацию сигналов с 500 Гц до 200 Гц и предварительно обработайте их согласно рабочему процессу, показанному на рисунке 1.
    2. Применяйте сглаживание при пересэмплении согласно стандартным или определённым настройкам фильтра программного обеспечения.
  3. Фильтрация сигналов ЭЭГ
    1. Примените полосный фильтр с частотой от 0,5 до 45 Гц. Примените фильтр выреза на локальной частоте мощности, если видимый шум в линии остаётся. В этом демонстрационном протоколе применяйте фильтр выреза с частотой 50 Гц.
  4. Удаление артефактов
    1. Осмотрите непрерывную ЭЭГ вручную и отметьте сегменты артефактами грубого движения.
    2. Проведите независимый анализ компонентов на отфильтрованных данных. Определите компоненты, связанные с морганием, горизонтальными движениями глаз, напряжением челюсти или мышечной активностью, используя карты кожи головы, временные курсы и спектры мощности.
    3. Удалить выявленные компоненты артефакта и восстановить очищенные сигналы ЭЭГ. Отклонять сегменты, которые всё ещё содержат чрезмерные колебания амплитуды после независимого анализа компонентов. В этом демонстрационном протоколе отбрасывайте сегменты, превышающие ±100 мкВ.
  5. Повторное ссылание на данные
    1. Переориентируйте очищенные сигналы ЭЭГ на общее среднее ориентиро.
  6. Сегментирование данных ЭЭГ
    1. Эпоха непрерывного ЭЭГ в зависимости от триггеров начала стимула. Извлекать сегменты, выровненные по стимулам, покрывающие полные окна клипа или фиксированного анализа. В этом демонстрационном протоколе ЭЭГ сегментируется на окна 2.0 с с 50% перекрытием. Исключайте окна с остаточными артефактами после сегментации.
  7. Вычисление признаков дифференциальной энтропии
    1. Разложить каждый сегмент ЭЭГ на следующие частотные диапазоны: дельта (1–4 Гц), тета (4–8 Гц), альфа (8–13 Гц), бета (13–30 Гц) и гамма (30–45 Гц).
    2. Вычислите дифференциальную энтропию каждого частотного диапазона для каждого канала. Используйте следующее уравнение для переменной Гаусса:
      DE = 1/2 ln(2πeσ2), где σ2 — дисперсия сигнала EEG с ограниченной полосой.
    3. Организуйте значения по каналу дифференциальной энтропии в двумерную топографическую матрицу или матрицу признаков канала для входа модели.
    4. В этом демонстрационном протоколе генерируйте карты признаков ЭЭГ с размером входа 128 × 128 x 5 на окно анализа. Визуальная контрольная точка: Постройте репрезентативные отображения дифференциальной энтропии для каждой полосы и подтвердите, что отсутствуют отсутствующие каналы, отображения с постоянными значениями или аномальные коллапсы по полоске.

5. Предварительная обработка видео лица

  1. Извлечение кадров изображений
    1. Декодировать записанное видео в кадры изображения с помощью скриптового конвейера. Извлекайте кадры со скоростью 25 кадров в секунду для ввода модели, сохраняя метаданные синхронизации.
  2. Обнаружение и выравнивание лица
    1. Обнаружить лицо в каждом кадре с помощью проверенного детектора лиц. Определите лицевые ориентиры и выровняйте лицо по центрам глаз или стандартным ориентирам. Отбрасывайте кадры, в которых лицо ненадёжно обнаруживается.
  3. Обрезание и изменение размера лицевой области
    1. Обрежьте грань к обнаруженному ограничивающему раму с небольшим полем, чтобы сохранить информацию о контурах. Уменьшите размер обрезанного лица до 224 x 224 пикселей.
    2. Проверьте репрезентативные обрезанные образцы лица из четырёх целевых категорий эмоций, как показано на рисунке 2, и убедитесь, что лоб, брови, глаза, нос, щеки и рот остаются видимыми после обрезки.
  4. Дополнение обучающих изображений
    1. Применяйте случайное горизонтальное переворачивание с вероятностью 0,5 только к обучающему набору. Применяйте случайное вращение в пределах ±15° только к тренировочному набору.
    2. Не применяйте аугментацию к валидации или тестированию изображений.
  5. Нормализация ввода лица
    1. Нормализуйте значения пикселей в диапазоне [-1, 1] или используйте правило нормализации, специфичное для основания, последовательно во всех разделениях.

6. Построить мультимодальную нейронную сеть

  1. Конфигурирование программной и аппаратной среды
    1. Реализуйте модель в Python 3.10 с помощью PyTorch 2.1. Запустите обучение на Ubuntu 22.04 или другой указанной операционной системе.
    2. Используйте рабочую станцию с не менее 32 ГБ оперативной памяти, один графический процессор с не менее 12 ГБ видеопамяти и достаточным местом для синхронизации EEG-видеоданных. В этом демонстрационном протоколе используйте графический процессор NVIDIA RTX 3080.
    3. Храните обучающий скрипт, файл определения модели, скрипт предварительной обработки и конфигурационный файл в каталоге проектов с контролем версий.
    4. Сообщите о репозитории кода или архивированном пакете скриптов в рукописи, если это разрешено.
  2. Создание лицевой ветви
    1. Постройте общую двухветвневую мультимодальную структуру, как показано на рисунке 3. Инициализуйте магистраль MobileNetV2 для лицевой ветки.
    2. Измените первый слой свёртки с 32 до 24 каналов. Постройте ветку извлечения черт лица согласно рисунку 4 и вставьте модули внимания координат после выбранных инвертированных остаточных блоков, как показано на рисунке 5.
    3. Заменить обозначенные стандартные свёртки на параллельные по глубине свёртки размером ядра 3 x 3 и 5 x 5 для улучшения извлечения многомасштабных признаков.
    4. Экспортировать фиксированно-размерный вектор черт лица для слияния. В этом демонстрационном протоколе используйте размерность признака 256.
  3. Строительство филиала ЭЭГ
    1. Вводите функции дифференциальной энтропии в сверточный нейронный энкодер. Используйте сверточные слои для извлечения пространственных закономерностей из карт признаков ЭЭГ.
    2. Подайте сверточную последовательность вывода в двунаправленный модуль долгосрочной краткосрочной памяти для фиксации временной зависимости между оконами.
    3. Экспортировать вектор признаков ЭЭГ фиксированной размерности. В этом демонстрационном протоколе используйте размерность признака 256.
  4. Создание кроссмодального модуля синтеза
    1. Реализуйте мультимодальный модуль взаимодействия признаков, показанный на рисунке 6. Реализуйте многоголовый блок с перекрестным вниманием и 8 головами.
    2. Используйте последовательность признаков ЭЭГ в качестве запроса и последовательность черт лица как ключ и значение в одном потоке перекрёстного внимания.
    3. Используйте последовательность черт лица в качестве запроса, а последовательность признаков ЭЭГ — как ключ и значение в потоке взаимного перекрёстного внимания.
    4. Объедините выходы из двух потоков перекрёстного внимания. Пропустите конкатенированный объект через слой проекции термоядерного синтеза.
  5. Добавление самоостаточного расширенного модуля свёртки
    1. Уточните слитое представление с самоостаточным слоем свёртки, показанным на рисунке 7.
    2. Постройте слой конкатенации с расширенной свёрткой, используя скорости дилатации 1, 3, 6 и 12. Соедините выходы из четырёх ветвей дилатации.
    3. Добавьте остаточные пропускные соединения для стабилизации градиентного потока и сохранения низкоуровневой информации.
  6. Добавление классификатора
    1. Сравнять или объединить слитое представление. Добавьте один полностью связанный слой и финальный выходной слой softmax. Настройте классы выхода на страх, счастье, спокойствие и грусть.
  7. Определение условий тренировки
    1. Используйте настройки сети и обучения, изложенные в таблице 1. Четыре класса эмоций (страх, счастье, спокойствие и грусть) были оперативно определены с помощью комбинированной процедуры маркировки на основе дизайна стимула и самоотчета участника. Каждый клип с картиной был заранее отобран для выделения целевой категории эмоций, и участники рассказывали о своём доминирующем эмоциональном опыте после просмотра. Окончательные метки присваивались путём согласования предполагаемой категории стимула с самосообщаемыми ответами, а несогласованные выборки исключались для обеспечения надёжности маркировки.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Производительность предлагаемой двойной сети кросс-внимания была оценена с использованием мультимодального набора данных, собранного у 327 участников во время просмотра картин. Основным результатом стала классификация эмоций по четырём классам страха, счастья, спокойствия и грусти. Дополнительные анализы изучали поведение унимодальной модели, мультимодальную конвергенцию, чувствительность к числу голов внимания, сравнительную эффективность распознавания и поведение подсетей лица и электр...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Этот протокол решает практическую проблему аффективных вычислений, а именно — как распознавать эмоциональные состояния в условиях просмотра картины, где видимое выражение и физиологическая реакция могут не совпадать в любой момент. В условиях экспериментальных условий, описанных здесь, двухветвящая структура достигла более высокой классификации, чем унимодальные модели сравнения, что подтверждает ценность сочетания электроэнцефалографии и информации о лицевом выражении в выставочных сред...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы не заявляют о конфликтах интересов.

Благодарности

Мы выражаем искреннюю благодарность волонтёрам из Минцзу Педагогического университета Синъи и Юго-Западного университета за их участие в экспериментах. Мы также благодарим технический персонал Университета Жироны за помощь в сборе данных ЭЭГ и анонимных рецензентов за их содержательные комментарии.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Фреймворк глубокого обученияPyTorchv2.0 / https://pytorch.orgИспользуется для строительства, обучения и оценки моделей
Система получения ЭЭГ (64-канальная)Brain Products GmbHactiCHamp Plus / v1.6Используется для высокоразрешающего захвата ЭЭГ-сигнала во время экспериментов
Колпачок электрода ЭЭГ (10– Система 20)Brain Products GmbHActiCap / 64-канальныйСтандартный международный 10– Размещение 20 электродов
Камера высокого разрешенияКорпорация SonyДатчик IMX327Используется для видеозаписи мимики (≥ 1080p, 30 кадров в секунду)

Ссылки

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

Распознавание эмоций по ЭЭГанализ мимикидифференциальная энтропиясверточная нейронная сетьдвунаправленная LSTMаффективные вычислениячеловеко-машинное взаимодействие