Исследовательская статья

Предварительная валидация алгоритма анализа мимики и движений во время выполнения заданий по вызыванию эмоций у здоровых взрослых людей

DOI:

10.3791/70843

14 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании проводится предварительная валидация FEA — проприетарного алгоритма машинного обучения, предназначенного для обнаружения реакций при выполнении заданий с эмоциональными стимулами. В работе изучается соответствие показателей алгоритма FEA и стандартизированных стимулов лицевых эмоций с использованием системы Navarasa у здоровых взрослых людей, чтобы оценить, насколько надежно система отражает эмоциональные реакции в контролируемых экспериментальных условиях.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Данный протокол был разработан для предварительной валидации Emoscape — проприетарного алгоритма машинного обучения на основе фреймворка Navarasa — путем проверки того, изменяются ли его показатели эмоций согласованно с задачами по стандартизированному вызыванию эмоций у здоровых взрослых людей. После получения письменного информированного согласия в исследовании приняли участие семьдесят два здоровых взрослых добровольца. Участники заполнили Опросник здоровья пациента-9 (PHQ-9) и Опросник генерализованного тревожного расстройства-7 (GAD-7), после чего просматривали стимулы с изображениями эмоций лиц из набора TRENDS и изображения Navarasa, в то время как алгоритм FEA регистрировал микродвижения верхней части тела на протяжении всего задания. Участники также идентифицировали отображаемые эмоции. Анализ изменений показателей алгоритма FEA относительно исходного уровня проводился при воздействии нейтральных стимулов, стимулов счастья, страха и гнева из набора TRENDS, а также при просмотре изображений Navarasa. Для оценки чувствительности и специфичности дискриминации между эмоциональными категориями использовался анализ рабочих характеристик приемника (ROC-анализ). Показатели алгоритма FEA продемонстрировали значимые отклонения от исходного уровня для изображений TRENDS, соотнесенных с соответствующими эмоциями (Neutral — Shanta, Happy — Haasya, Fear — Bhayanaka и Anger — Raudra). Согласованные изменения также наблюдались при просмотре изображений Navarasa, при этом все средние разности были статистически значимыми (p < 0.001). Значения площади под кривой (AUC) варьировались в зависимости от категории. Алгоритм FEA показал умеренную чувствительность для приятных эмоций (70–80%) и неприятных эмоций (60–70%). Эти результаты обеспечивают предварительную поддержку данного протокола и использования алгоритма FEA для оценки эмоциональных реакций во время контролируемых задач по вызыванию эмоций у здоровых взрослых людей.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Распознавание эмоций является важной областью исследований в рамках социальной когнитивной нейробиологии, имеющей потенциал для клинического и исследовательского применения. Существующие методы оценки эмоционального состояния количественно определяют изменения физиологической активности, такие как электроэнцефалография (EEG) или кожно-гальваническая реакция (GSR), для вывода об эмоциональном состоянии. Однако эти методы сложны и инвазивны. Прямые измерения движений лица и тела предоставляют более непосредственный и наблюдаемый индекс аффективного состояния индивидуума1,2,3. Алгоритмы машинного обучения (ML), особенно обученные на больших гетерогенных наборах данных выражений лица, используются для декодирования таких тонких невербальных сигналов и классификации эмоциональных состояний. В то время как традиционные алгоритмы ML, такие как метод опорных векторов (SVM), по-прежнему широко используются, архитектуры глубокого обучения, в первую очередь нейронные сети (NN)4,5, продемонстрировали более высокую эффективность, особенно при обучении на крупномасштабных наборах данных, благодаря их способности к автоматическому извлечению признаков6. Примером традиционной модели в индийском контексте является интерактивный инструмент, который использует размерную модель на основе валентности для определения уровня возбуждения. Системы распознавания эмоций должны учитывать культурный контекст. В индийской культурной среде концепция Навараса предоставляет детальную таксономию девяти основных эмоций, однако она остается в значительной степени неизученной в рамках исследований по распознаванию эмоций на базе ML. Наблюдается относительный дефицит строго валидированных подходов ML, которые напрямую анализируют наблюдаемые поведенческие признаки, такие как микровыражения лица и движения тела7,8. Такие алгоритмы ML, основанные на анализе экспрессии, могут использоваться в режиме реального времени, просты в применении и являются неинвазивными.

Алгоритм анализа мимики и движений (Facial Expression and movement Analysis, далее именуемый алгоритм FEA) представляет собой проприетарный алгоритм на базе машинного обучения, который анализирует микровыражения лица и движения верхней части тела, создавая динамические представления эмоциональных траекторий и совокупные баллы для каждой из девяти рас на основе концепции Навараса. Целью данного исследования была предварительная валидация алгоритма FEA путем изучения соответствия между баллами, полученными с помощью FEA, и реакциями здоровых взрослых добровольцев на стандартизированные стимулы лицевых эмоций.

С этой целью мы опираемся на концепции теории разума (Theory of Mind, ToM) и системы зеркальных нейронов. ToM представляет собой ключевую социально-когнитивную способность, которая позволяет людям делать выводы о ментальных и эмоциональных состояниях других лиц в социальных контекстах и интерпретировать их9. Эмпирические данные свидетельствуют о том, что воздействие эмоциональных стимулов мимики активирует сети зеркальных нейронов, что, в свою очередь, вызывает у наблюдателя соответствующее сопереживающее эмоциональное состояние10. Результирующая модуляция внутреннего субъективного эмоционального состояния индивида в ответ на наблюдение за выражением эмоций на лице, если она будет зафиксирована алгоритмом FEA, может служить предварительным подтверждением валидности данного алгоритма.

Мы предполагаем, что воздействие эмоциональных стимулов мимики, соответствующих определенной категории Навараса, вызовет статистически значимое отклонение от базового уровня в показателе алгоритма FEA для данной эмоции Навараса.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Протокол исследования был одобрен Комитетом по этике больниц Сушрута (Хуббалли, Карнатака, Индия) (регистрационный номер ЭК: ECR/372/INST/KA/2013/RR-19), и до включения в исследование от всех участников было получено письменное информированное согласие.

Алгоритм FEA представляет собой проприетарный метод на основе машинного обучения (ML) для анализа микровыражений лица и движений верхней части тела в режиме реального времени с целью определения эмоциональных состояний с использованием системы Navarasa. Система Navarasa, основанная на классической индийской эстетической теории, выделяет девять основных эмоций: шрингара (любовь), хасья (радость), каруна (печаль/задумчивость), адбхута (удивление), шанта (покой), раудра (гнев), вира (мужество), бхаянака (страх) и вибхитса (отвращение). Алгоритм FEA использует модель машинного обучения, обученную на микровыражениях лица и движениях верхней части тела, извлеченных из изображений актеров, демонстрирующих девять эмоций Navarasa. Алгоритм определяет эмоциональное состояние человека путем анализа тонкой динамики лица и микродвижений на основе визуальных данных, полученных с помощью одной RGB-камеры, и генерирует количественные показатели для каждой из девяти основных эмоций. Такая неинвазивная конфигурация обеспечивает ненавязчивую, естественную оценку эмоций, что делает её подходящей для широкого спектра исследовательских и прикладных задач.

Разработка модели

Алгоритм FEA основан на архитектуре нейронной сети (НС). Обучающий набор данных был собран внутри организации и состоит из нескольких часов записанных видеоданных с участием индийских актеров, изображающих девять эмоций Навараса. Набор данных был получен из контролируемых видеозаписей нескольких актеров/участников, при этом для каждого актера/участника было проведено несколько записей/тестов в различных вызванных эмоциональных состояниях. После предварительной обработки, включавшей определение ориентиров лица, проверку временной согласованности, фильтрацию по качеству и удаление непригодных кадров или кадров с низким уровнем достоверности, было сохранено примерно 25 000 структурированных обучающих выборок. В процессе курирования набора данных записи были стратифицированы по более чем десяти демографическим и связанным с записью параметрам, включая возраст, пол и другие соответствующие атрибуты, и намеренно сбалансированы для обеспечения равного представительства по этим параметрам и минимизации демографической предвзятости. Распределение по полу поддерживалось на уровне примерно 52% мужчин и 48% женщин. Участники в целом охватывали подростковые и взрослые возрастные группы с представительством младших, средних и старших возрастных когорт взрослых. Актеры/участники находились в Индии и представляли различные региональные и культурные особенности Индии, а также несколько международных этнических групп, представленных в Индии. В связи с проприетарными ограничениями точное количество актеров/участников, идентификация на уровне актера/участника, точное количество видео/записей на каждого актера, точное количество кадров и внутренняя методология аннотирования не могут быть раскрыты, так как они являются частью проприетарного набора данных и интеллектуальной собственности по разработке модели компании Nihilent Ltd.; данное ограничение эксплицитно признается в разделе «Обсуждение».

Изображения лиц, извлеченные из этих записей, обрабатывались с использованием методов обработки изображений для получения количественных признаков, которые впоследствии использовались в качестве входных данных для нейронной сети для прогнозирования. Затем эта модель была оценена на целевой популяции, а полученные результаты использовались для итеративного совершенствования последующих версий. Этот цикл разработки, тестирования и улучшения повторялся до стабилизации производительности модели. Итоговая прогностическая модель реализована в виде многослойного перцептрона (MLP), состоящего из входного слоя с примерно 300 выбранными признаками, скрытых слоев и выходного слоя, формирующего девятимерный вектор показателей, соответствующих девяти категориям эмоций Навараса. Первоначально из полученных данных было извлечено более 700 признаков, количество которых впоследствии было сокращено с помощью процедур отбора признаков и оптимизации модели. Затем выходной показатель MLP передается в проприетарные алгоритмы постобработки для получения итоговых агрегированных показателей алгоритма FEA. Дополнительные детали архитектуры, включая точное количество обучаемых параметров и конкретные размеры слоев, являются конфиденциальными и не могут быть раскрыты; это признается ограничением настоящего отчета. Подробное описание разработки модели приведено в дополнительных материалах (Supplementary File 1 и Supplementary Figure 1).

В ходе итеративной разработки эффективность модели оценивали с помощью кросс-валидации на внутреннем наборе данных, в результате чего была достигнута точность классификации 96% по всем девяти категориям Navarasa. Последующая независимая валидация проводилась на видеоданных общей продолжительностью более 15 000 мин. Нормализованная матрица ошибок 9 × 9, обобщающая результаты классификации по всем девяти категориям Navarasa, представлена в дополнительных материалах (Дополнительный файл 1).

После стабилизации модель прошла контролируемую внутреннюю валидацию под наблюдением экспертов. Такой подход делает упор на эмпирическую проверку посредством прямого тестирования на людях, что позволяет оценить применимость модели в реальных условиях и ее устойчивость в различных популяциях. Процесс разработки модели обобщен на Рисунке 1.

Опросник здоровья пациента-9 (PHQ-9) и шкала генерализованного тревожного расстройства-7 (GAD-7): Участники заполняли опросники самоотчета под наблюдением квалифицированного психолога для оценки их текущего эмоционального состояния. Использовались следующие инструменты: Опросник здоровья пациента-9 (PHQ-9) и шкала генерализованного тревожного расстройства-7 (GAD-7). Результат выше 9 баллов по любой из шкал считался клинически значимым.

ТЕНДЕНЦИИ

Инструмент для распознавания эмоций при нейропсихиатрических расстройствах (The Tool for Recognition of Emotions in Neuropsychiatric Disorders, TRENDS) представляет собой культурно валидизированный, экологически чувствительный инструмент, разработанный для оценки способности распознавать эмоции по выражению лица11. Данный инструмент прошел валидацию для использования в индийских популяциях и состоит из 40 фотографий актеров, изображающих универсальные базовые эмоции: нейтральное состояние, счастье, страх, гнев и грусть. Изображения из TRENDS использовались в качестве эталонных стимулов для валидации результатов классификации эмоций алгоритмом FEA.

Дизайн эксперимента

Эксперимент был разработан для вызова алгоритмического отклика на эмоциональные стимулы. Для данного исследования были разработаны и использованы две парадигмы вызывания эмоций.

Парадигма изображений TRENDS

В первой парадигме видеопоследовательность начиналась с отображения пустого экрана в течение 60 s, после чего предъявлялись эмоциональные стимулы. Эмоциональные стимулы были отобраны с помощью инструмента TRENDS. Всего было предъявлено 20 изображений, представляющих нейтральное состояние, счастье, грусть, гнев и страх × два пола × две возрастные группы. Каждый стимул отображался в течение 5 s. Таким образом, общее время предъявления стимулов составило 20 × 5 s, с дополнительным интервалом в 10 s пустого экрана между последовательными изображениями, что в итоге дало общую продолжительность 300 s. Во время каждого 10 s интервала пустого экрана участники должны были определить эмоцию, изображенную на предыдущем снимке, выбрав одну из пяти меток эмоций, отображаемых на экране.

Парадигма Навараса

Второй аналогичный видеопарадигм был разработан на основе системы Навараса, включающей девять рас. Всего было представлено 18 изображений (девять эмоций × два пола). Каждый стимул отображался в течение 5 s, с 10 s пустым экраном между изображениями, что составило общую продолжительность 270 s. Девять эмоций были распределены по категориям: нейтральные (shanta), приятные (haasya, veera, shringara, adbhuta) или неприятные (Krodha, vibhitsa, bhayanaka, karuna). В течение каждого 10 s интервала с пустым экраном участники должны были классифицировать эмоцию, изображенную на предыдущем снимке, выбрав один из трех вариантов на экране: нейтральная, приятная или неприятная. Девять Навараса были сгруппированы в три категории для упрощения регистрации ответов участников при идентификации эмоций.

Участники

Здоровые взрослые добровольцы были набраны из рабочих коллективов и образовательных учреждений. Критерии включения предусматривали лиц в возрасте 18–50 лет любого пола/гендера. Критерии исключения включали наличие в анамнезе диагностированных психических расстройств, неврологических заболеваний, значительных нарушений зрения или физических ограничений, препятствующих движениям головы и шеи.

Процедура

Участники были рассажены таким образом, чтобы камера находилась на уровне глаз на расстоянии 60–70 cm. В исследовании использовался алгоритм FEA. Приложение было запущено на ноутбуке, после чего исследователь ввел идентификатор субъекта. На протяжении всего эксперимента алгоритм FEA непрерывно записывал видеоданные для последующего анализа мимики и микроперемещений. Сначала была получена базовая запись продолжительностью 60 s, в течение которой участникам было предписано расслабиться и воздерживаться от явных экспрессивных проявлений. После получения базовых показателей участникам демонстрировались две видеопарадигмы (изображения TRENDS, затем Navarasa). Все участники просматривали парадигмы в одном и том же фиксированном порядке для минимизации потенциальных искажающих эффектов, связанных с последовательностью представления; однако такой фиксированный порядок мог привести к возникновению эффектов последовательности. Во время сеансов записи исследователь находился за пределами помещения, чтобы не отвлекать участников. Находясь вне комнаты, исследователь удаленно контролировал ход эксперимента с помощью мобильного приложения. Между двумя парадигмами участникам предлагался короткий перерыв (Рисунок 2).

Анализ

Собранные данные были сопоставлены с идентификатором субъекта, введенным в приложение, для обеспечения достоверности данных. Алгоритм FEA использует структурированный сквозной вычислительный конвейер для автоматического вывода эмоций, состоящий из пяти основных этапов: захват видео, детектирование и извлечение признаков, предобработка данных, классификация эмоций и интерпретация результатов. Извлеченные признаки прошли серию операций предобработки, включая шумоподавление, нормализацию по субъектам и условиям освещения, а также интерполяцию пропущенных кадров. Для повышения стабильности сигнала было применено временное сглаживание. Полученные векторы признаков были синхронизированы по времени для последующей подачи в модель классификации. Эти синхронизированные по времени и очищенные от шумов матрицы признаков служили входными данными для компонента классификации эмоций.

Извлечение признаков

Система извлечения признаков использует многостадийный алгоритмический конвейер, который преобразует стандартные потоки 2D-изображений с монокулярного видео в реконструированное 3D-координатное пространство. Вместо того чтобы полагаться на простое отслеживание 2D-пикселей, система картирует локализованные пространственные координаты лица и верхней части тела. Извлекаемые признаки разделены на три основные категории: (i) области лицевых ориентиров, включающие геометрические дескрипторы структуры и динамики лица (в том числе признаки области глаз и корреляты микровыражений лица, основанные на концепции Навараса, которая берет начало в Натьяшастре — старейшей формализованной системе выражения человеческих эмоций, признанной ЮНЕСКО); (ii) информация о положении головы, фиксирующая ориентацию и движение головы; и (iii) признаки движений верхней части тела, фиксирующие результирующее перемещение верхней части корпуса. Конкретные определения признаков, включая точные индексы ориентиров и идентификаторы ключевых точек, являются проприетарными и не могут быть раскрыты полностью; это признано ограничением исследования. Система не использует напрямую метки единиц действия Системы кодирования лицевых движений (FACS); вместо этого она выводит геометрические и временные признаки из движений лица и тела. Эти 3D-пространственные преобразования агрегируются во времени для создания комплексного вектора поведенческого резюме, который служит входными данными для классификатора MLP. В общей сложности из полученных данных изначально было извлечено более 700 потенциальных признаков, количество которых впоследствии было сокращено примерно до 300 отобранных признаков путем отбора признаков и оптимизации модели. Структура конвейера включает этапы от захвата видео, через пространственную реконструкцию из 2D в 3D, временную агрегацию и нормализацию признаков перед этапом классификации.

Модель классификации эмоций

Предварительно обработанные векторы признаков подавались на вход архитектуры нейронной сети многослойного перцептрона (MLP) с обучением под руководством, которая была обучена на внутреннем аннотированном наборе данных, соответствующем девяти эмоциональным категориям Навараса: Śṛṅgāra (любовь), Hāsya (радость), Karuṇā (печаль), Raudra (гнев), Vīra (мужество), Bhayānaka (страх), Bībhatsa (отвращение), Adbhuta (изумление) и Śānta (покой). Модель была специально разработана для захвата пространственно-временных зависимостей в данных об экспрессивном поведении. На каждом временном шаге архитектура формировала вектор прогнозируемой интенсивности эмоций для девяти категорий.

Постпроцессинг выходных данных модели

Необработанные выходные данные модели впоследствии подвергались постобработке для получения стабильных и интерпретируемых показателей эмоций. Были применены три последовательные операции: (i) временное сглаживание для уменьшения краткосрочных колебаний, (ii) нормализация для обеспечения сопоставимости данных во времени и по различным измерениям эмоций, и (iii) агрегация для получения обобщенных показателей за определенные временные интервалы или за весь период последовательности. Процедуры постобработки обеспечивают сопоставимость результатов между испытуемыми и контролируют межиндивидуальные вариации базового уровня.

Интерпретация и визуализация результатов

Алгоритм FEA генерирует количественные и визуальные представления эмоциональной динамики, выведенные на основе видеоданных. Двумя основными формами выходных данных являются временные траектории эмоций. Значения интенсивности эмоций визуализируются в виде графиков временных рядов, показывающих эволюцию каждой эмоции на протяжении всего видео. Такое представление обеспечивает непрерывный обзор аффективных вариаций, облегчая изучение кратковременных изменений, пиковых активаций, а также фаз восстановления или снижения эмоционального возбуждения. Сравнительные показатели эмоций: Агрегированные значения эмоций для каждой из девяти категорий Наварас отображаются в виде графиков сравнительных показателей, иллюстрирующих относительную величину каждой эмоции за анализируемый интервал. Эти сравнительные визуализации позволяют проводить прямое сопоставление различных эмоций и предоставляют краткий обзор общего аффективного профиля. Показатели, полученные с помощью алгоритма FEA на исходном уровне, проверялись на наличие «плоских линий» или отсутствия значимых изменений, что могло бы указывать на ненадлежащую запись.

Статистический анализ

В качестве зависимых переменных рассматривались показатели девяти доменов эмоций Навараса, рассчитанные с помощью алгоритма FEA в течение 10 с интервала после предъявления каждого изображения в парадигме. Показатели алгоритма FEA рассчитывались для каждой секунды s в 10-секундном окне (T0, T1, T2… T9). Показатель алгоритма FEA в момент T0 считался исходным. Максимальный показатель алгоритма FEA среди записей с T1 по T9 определялся как Tmax. Изменение показателя алгоритма FEA относительно исходного уровня (Tmax − T0) вычислялось и использовалось в качестве зависимой переменной при проведении анализа. Изменение показателей алгоритма FEA в течение временного ряда для каждой эмоции представлено на рисунке 3A–D.

Для изображений TRENDS соответствующие целевые категории эмоций были сопоставлены следующим образом: Shanta > нейтральная; Haasya > радость; Krodha > гнев; и Bhayanaka > страх. Для изображений Navarasa баллы алгоритма FEA были сгруппированы и усреднены по трем композитным категориям: нейтральная (Shanta), приятная (Haasya, Veera, Shringara, Adbhuta) и неприятная (Krodha, Vibhitsa, Bhayanaka, Karuna).

Проводился анализ как на групповом, так и на индивидуальном уровнях.

Анализ на групповом уровне: Для каждой из описанных выше категорий эмоций изменение показателя алгоритма FEA от исходного уровня до Tmax сравнивали с помощью парного t-критерия. Значимое изменение показателя алгоритма FEA по сравнению с исходным уровнем указывало бы на хорошую согласованность с распознаванием эмоций. Однако значимая разница не обязательно свидетельствовала бы о высокой точности классификации.

Анализ на уровне субъекта: любое увеличение показателя эмоциональной области по алгоритму FEA по сравнению с базовым значением классифицировалось как положительный эмоциональный ответ. Затем были рассчитаны показатели точности — чувствительность и специфичность. Чувствительность и специфичность количественно определяют вероятность того, что тест будет положительным при наличии целевого состояния (+) и отрицательным при его отсутствии (−), соответственно. Когда оба показателя приближаются к 1, тест демонстрирует высокую диагностическую точность. Оцениваемая чувствительность и специфичность определялись как доли участников с и без референсного состояния (выражения Навараса), соответственно, которые были классифицированы верно.

Испытуемый считался имеющим целевое состояние (+), если он правильно определил не менее 75% изображенных эмоций. Эта классификация была основана на валидационных исследованиях TRENDS, в которых точность 60–80% считалась адекватной дискриминантной валидностью. Для оценки площади под кривой (AUC) и соответствующих значений чувствительности и специфичности был проведен анализ рабочих характеристик приемника (ROC-анализ) для непрерывного предиктора. Чувствительность выше 80% считалась показателем хорошей дискриминационной способности, а ниже 80% — умеренной.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В исследовании изучались вариации показателей алгоритма FEA в ответ на стимулы, вызывающие эмоции, а также оценивалась диагностическая эффективность алгоритма FEA с помощью анализа рабочей характеристики приемника (ROC-анализа). Для участия в исследовании было привлечено семьдесят два здоровых добровольца. Средний возраст (SD) составил 31,9 (11,9) года; в выборку вошли 26 мужчин и 46 женщин. Все участники имели стаж образования не менее 10 лет и принадлежали к индийской этнической группе. Их средние баллы (SD) по шкалам PHQ-9 и GAD-7 составили 4,4 (4,8) и 4,7 (4,5) соответственно.

Изменения показателей алгоритма FEA в ответ на эмоциональные стимулы: показатели, полученные с помощью алгоритма FEA, продемонстрировали статистически значимые изменения от исходного уровня (T0) до Tmax, что было определено с помощью парных t-критериев для обоих условий стимуляции — изображений TRENDS и Navarasa (p < 0.001; Таблица 1, Рисунок 4, Таблица 2 и Рисунок 5).

Диагностическая точность алгоритма FEA: Диагностическая эффективность алгоритма FEA была оценена с помощью анализа кривой рабочей характеристики приемника (ROC), при этом значения площади под кривой (AUC) были рассчитаны для различных эмоциональных состояний (Таблица 3). Самое высокое значение AUC было получено для показателя алгоритма FEA, соответствующего состоянию Shanta в ответ на нейтральные стимулы лицевых эмоций (AUC = 0.665), за которым следовала положительная эмоция радости (AUC = 0.637) (Рисунок 6). Чувствительность для нейтральных и положительных эмоций (радость, приятное состояние) составляла 70–80%, в то время как чувствительность для отрицательных эмоций (гнев, страх, неприятное состояние) составляла 60–70%. Эти значения чувствительности ниже 80% и свидетельствуют об умеренной дискриминационной способности.

Корреляция между показателями FEA-алгоритма и показателями PHQ-9 и GAD-7: Значимых корреляций между любыми из показателей FEA-алгоритма и показателями PHQ-9 или GAD-7 не наблюдалось.

ДОСТУПНОСТЬ ДАННЫХ:

Все исходные данные представлены в Дополнительном файле 2.

figure-results-1
Рисунок 1: Схематическая диаграмма конвейера разработки модели алгоритма FEA. На схеме изображен собственный набор видеоданных с участием индийских актеров обоих полов, проходящий этапы извлечения кадров и извлечения признаков по трем категориям: области лицевых ориентиров (включая признаки микровыражений глаз и лица, основанные на Natyashastra/Navarasa), информация о положении головы и движениях верхней части тела. Эти данные объединяются в единый вектор признаков и передаются в классификатор на базе многослойного перцептрона (MLP). Выходные данные MLP проходят проприетарную постобработку (временное сглаживание, нормализацию и агрегацию; оранжевая пунктирная рамка) перед созданием окончательного результата прогнозирования Navarasa по девяти категориям. Сплошные синие прямоугольники обозначают этапы обработки; закрашенные синие прямоугольники — категории признаков; оранжевая пунктирная рамка обозначает проприетарный этап обработки, внутренние параметры которого не могут быть разглашены. Поскольку это схема процесса, а не график данных, планки погрешностей и масштабные линейки не применяются. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Процедура эксперимента с использованием алгоритма FEA. Блок-схема, описывающая последовательные этапы экспериментального протокола: полуструктурированная клиническая оценка (PHQ-9, GAD-7); размещение участника с камерой, расположенной на уровне глаз на расстоянии 60–70 cm от участника; 60 s базовая запись; парадигма эмоциональных изображений TRENDS (20 изображений в пяти категориях эмоций; 5 s предъявления стимула и 10 s интервал ответа на каждое изображение; всего 300 s); короткий интервал отдыха; и парадигма эмоциональных изображений Navarasa (18 изображений в девяти категориях Navarasa; 5 s предъявления стимула и 10 s интервал ответа на каждое изображение; всего 270 s). Стрелки указывают на временную последовательность процедур от включения в исследование до завершения сбора данных. Поскольку это блок-схема процесса, а не график данных, планки погрешностей и масштабные линейки не применяются. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-3
Рисунок 3: Изменение показателей алгоритма FEA во временной последовательности в ответ на соответствующие эмоциональные изображения TRENDS (T0–T9 с). Четыре панели (A–D>) показывают групповую посекундную траекторию показателя алгоритма FEA (ось y; произвольные единицы оценки, созданные запатентованным алгоритмом подсчета) в течение 10-секундного окна после предъявления стимула (ось x; T0 = оценка в момент прекращения стимула/базовая линия для данного испытания, T1–T9 = каждая последующая секунда) для (A>) домена Shanta после нейтральных изображений, (B>) домена Haasya после изображений счастья, (C>) домена Bhayanaka после изображений страха и (D>) домена Krodha после изображений гнева (n = 72 участника на панель). Точки/линии данных представляют средние групповые значения в каждой временной точке; планки погрешностей/затененные области представляют стандартное отклонение (SD) между участниками. Масштабные линейки неприменимы к данному формату линейного графика временных рядов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 4: Столбчатая диаграмма, показывающая среднее изменение показателей алгоритма FEA в ответ на просмотр эмоциональных изображений TRENDS. Столбцы представляют собой групповое среднее изменение показателя алгоритма FEA (Tmax −T0; ось y, произвольные единицы счета) для каждой из четырех категорий эмоций по классификации TRENDS (Shanta/Нейтральная, Haasya/Счастливая, Krodha/Гнев, Bhayanaka/Страх; ось x) (n = 72). Планки погрешностей представляют стандартное отклонение (SD) изменения показателя в каждой категории. Для всех четырех категорий было выявлено статистически значимое изменение по сравнению с исходным уровнем согласно парному t-критерию (p < 0.001; см. Таблицу 1). Масштабные линейки не применимы к данному формату столбчатой диаграммы. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-5
Рисунок 5: Столбчатая диаграмма, показывающая среднее изменение показателей алгоритма FEA в ответ на просмотр изображений эмоций Навараса. Столбцы представляют собой групповое среднее изменение показателя алгоритма FEA (Tmax − T0; ось y, произвольные единицы показателя) для трех составных категорий Навараса — нейтральной (Шанта), приятной (среднее для Хасья, Вира, Шрингара, Адбхута) и неприятной (среднее для Кродха, Вибхитса, Бхаянака, Каруна) (ось x) (n = 72). Планки погрешностей представляют стандартное отклонение (SD) изменения показателя внутри каждой категории. Для всех трех категорий было выявлено статистически значимое изменение по сравнению с исходным уровнем согласно парному t-критерию (p < 0.001; см. Таблицу 2). Масштабные линейки для данного формата столбчатой диаграммы не применяются. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6: ROC-кривая (кривая рабочих характеристик приемника), демонстрирующая чувствительность при различных пороговых значениях оценки Shanta по алгоритму FEA в ответ на изображения нейтральных эмоций. По оси y отложена чувствительность (доля истинно положительных результатов, %), по оси x — 1 − специфичность (доля ложноположительных результатов, %), построенные в диапазоне возможных пороговых значений оценки Shanta; диагональная контрольная линия соответствует уровню случайного угадывания (AUC = 0.5). Площадь под кривой (AUC) = 0.665 (значения AUC, чувствительности и специфичности для всех категорий эмоций см. в Таблице 3). Планки погрешностей и масштабные линейки для данного формата кривой не применяются. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Эмоции (стимулы TRENDS)Среднее значение T0Среднее значение TmaxСредняя разностьp-значение
Нейтральный – Шанта0.22610.26640.0403<0.001
Счастье — Хасья0.08340.11270.0294<0.001
Страх — Бхаянака0.06480.08480.02<0.001
Гнев — Раудра0.09010.11080.0207<0.001

Таблица 1: Средние значения T0 и Tmax показателей алгоритма FEA в ответ на просмотр эмоциональных стимулов TRENDS. Для каждой категории эмоций по классификации TRENDS (Shanta/Нейтральная, Haasya/Счастливая, Krodha/Гнев, Bhayanaka/Страх) в таблице приведены групповые средние показатели алгоритма FEA (± SD) в исходном состоянии (T0) и при максимальном значении внутри пробы (Tmax), среднее изменение (Tmax − T0) и результат парного t-критерия (p-value) при сравнении T0 и Tmax (n = 72). Все значения представлены в произвольных единицах показателей алгоритма FEA; p < 0,05 считалось статистически значимым.

Категория эмоций (стимулы Навараса)Среднее значение T0Среднее значение TmaxСредняя разностьp-значение
Нейтральный – Шанта0.240.290.047<0.001
Приятные (Хасья, Вира, Шрингара, Адбхута)0.0340.0450.011<0.001
Неприятные (Кродха, Вибхитса, Бхаянака, Каруна)0.0540.0680.014<0.001

Таблица 2: Средние значения T0 и Tmax показателей алгоритма FEA в ответ на просмотр стимулов эмоций Navarasa. Для каждой составной категории Navarasa (нейтральная, приятная, неприятная) в таблице указаны групповые средние показатели алгоритма FEA (± SD) в исходном состоянии (T0) и в момент максимума внутри испытания (Tmax), среднее изменение (Tmax − T0) и результат парного t-критерия (p-значение) при сравнении T0 и Tmax (n = 72). Все значения представлены в произвольных единицах показателей алгоритма FEA; статистически значимым считалось значение p < 0,05.

Панель A: Стимулы TRENDS
Стимулы TRENDSAUC95% ДИПороговое значение Δ Emoscape ScoreЧувствительность (%)Специфичность (%)
Нейтральный – Shanta0.6650.456–0.8730.06582.550
Радость – Haasya0.6370.493–0.7800.034570.746.2
Страх – Bhayanaka0.5830.446–0.7210.01861.254.5
Гнев – Raudra0.5320.374–0.6890.02367.345.5
Панель B: Стимулы Navarasa
Стимулы NavarasaAUC95% ДИПороговое значение Δ Emoscape ScoreЧувствительность (%)Специфичность (%)
Shanta (нейтральный)0.5960.412–0.7790.0385.744.6
Приятные (Haasya, Veera, Shringara, Adbhuta)0.5150.369–0.6600.01270.240
Неприятные (Krodha, Vibhitsa, Bhayanaka, Karuna)0.5650.384–0.7450.00767.838

Таблица 3: Значения площади под кривой (AUC), чувствительности и специфичности для баллов алгоритма FEA по категориям эмоций. Для каждой категории эмоций, оцениваемой с помощью анализа рабочих характеристик приемника (ROC), в таблице указаны AUC, чувствительность (%) и специфичность (%). Чувствительность ≥ 80% была предварительно определена как показатель хорошей дискриминантной способности; значения ниже этого порога классифицировались как умеренные (см. раздел «Статистический анализ»).

Дополнительный рисунок 1: Нормализованная матрица путаницы для модели классификации эмоций Навараса на девять классов. Строки соответствуют истинному (фактическому) классу эмоций, а столбцы — классу эмоций, предсказанному моделью; значения в ячейках указывают долю экземпляров истинного класса, отнесенных к каждому предсказанному классу, нормализованную по шкале 0–1 (цветовая шкала справа). Метки классов (1–9) соответствуют девяти категориям эмоций Навараса; из-за проприетарных ограничений конкретное соответствие номеров эмоциям не раскрывается. Общая перекрестная точность классификации по всем девяти категориям составила 96%. Планки погрешностей к данному формату матрицы не применимы.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 1: Описание разработки модели алгоритма МКЭ (включает показатели внутренней валидации, точность перекрестной проверки и матрицу ошибок Навараса 9 × 9).Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 2: Файл с необработанными данными.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Данное исследование было направлено на предварительную валидацию алгоритма FEA путем изучения соответствия между показателями, полученными с помощью алгоритма FEA, и реакциями здоровых взрослых добровольцев на стандартизированные стимулы лицевых эмоций. Эти предварительные результаты указывают на то, что алгоритм FEA демонстрирует статистически значимые изменения в ответ на вызывающие эмоции визуальные стимулы в различных дискретных эмоциональных категориях, включая нейтральное состояние (shanta), радость (haasya), страх (bhayanaka) и гнев (raudra), а также в более широких классификациях приятных и неприятных состояний. Это свидетельствует о том, что показатели алгоритма FEA согласуются с реакциями на задачи с эмоциональными стимулами.

Было отмечено, что чувствительность алгоритма FEA варьируется от 70% до 80% для нейтральных или положительных эмоций и от 60% до 70% для отрицательных эмоций. Эти значения чувствительности являются умеренными для любого теста, предназначенного для использования в качестве скринингового метода12. Для сравнения, более широкие модели вывода эмоций на основе машинного обучения, использующие нейрофизиологические маркеры, такие как электроэнцефалография (EEG), сообщают о точности классификации до 90%13. Система ансамблевого классификатора для классификации эмоций по данным EEG и GSR для выявления аутизма продемонстрировала точность обнаружения 99,97%14. Однако эти модели, как правило, более требовательны к вычислительным ресурсам и требуют автономной обработки данных. Напротив, заметным преимуществом алгоритма FEA является его ориентация на наблюдаемые признаки лица и тела, что позволяет использовать его в режиме реального времени.

Процедура работы алгоритма FEA зависит от нескольких процедурных факторов, которые имеют решающее значение для качества и достоверности записей, полученных с помощью этого алгоритма. К ним относятся положение камеры и окружающее освещение. Записи, сделанные при непостоянном или слабом освещении, могут значительно ухудшить качество извлечения признаков. Положение головы и тела должно оставаться стабильным на протяжении всего сеанса записи; по этой причине участники с ограниченной подвижностью головы или шеи были исключены из исследования. Важным условием является минимизация поведенческого вмешательства во время записи. Участники находились в помещении одни, без присутствия исследователя, чтобы снизить влияние эффекта социальной желательности и самоконтроля, которые могли бы подавить естественную мимику.

Использование концепции Навараса обеспечивает культурно-специфическую классификацию эмоций. В исследовании применялся подход на основе теории разума (ToM) для оценки изменений показателей алгоритма FEA в ответ на эмоциональные стимулы. ToM представляет собой когнитивную функцию социального взаимодействия высшего порядка, и ее нейробиологические субстраты описаны в литературе15, что подтверждает биологическую обоснованность наблюдаемых изменений показателей алгоритма FEA.

Корреляции между показателями FEA-алгоритма и показателями депрессии или тревожности обнаружено не было, что позволяет предположить, что внутренние эмоциональные состояния участников вряд ли повлияли на записи FEA-алгоритма. Тем не менее, полностью контролировать эмоциональные состояния участников во время эксперимента затруднительно. Кроме того, когнитивные процессы нисходящего регулирования могут подавлять естественные эмоциональные реакции, особенно в ответ на негативные эмоциональные стимулы. В будущих исследованиях следует оценивать субъективный опыт участников при просмотре эмоциональных стимулов, так как это могло бы дополнительно подтвердить, вызывает ли пассивный просмотр субъективное эмоциональное состояние. Умеренная чувствительность одного лишь FEA-алгоритма потенциально может быть повышена за счет дополнительных нейрофизиологических данных, таких как ЭЭГ, вариабельность сердечного ритма (HRV) или кожно-гальваническая реакция (GSR). Это необходимо оценить в будущих валидационных исследованиях. Валидация проводилась на группе здоровых взрослых людей. Полезность FEA-алгоритма для оценки субъективных эмоциональных состояний при таких клинических состояниях, как депрессия и тревожность, требует дальнейшего изучения в ходе исследований типа «случай-контроль».

Необходимо признать ряд ограничений настоящего исследования. Проприетарный характер алгоритма FEA ограничивает прозрачность процесса его обработки. В частности, не могут быть раскрыты точное количество актеров/участников, идентификация на уровне актера/участника, точное количество видеозаписей на каждого актера, точные определения признаков (индексы ориентиров и идентификаторы ключевых точек), а также детальные параметры архитектуры MLP (точные размеры слоев и количество параметров). Метрики внутренней валидации (перекрестная точность 96%; независимая валидация на >15 000 мин видео) приведены в дополнительных материалах. Метки классов, представляющие названия эмоций, анонимизированы в связи с проприетарными ограничениями. Мы признаем, что данные ограничения затрудняют независимое воспроизведение результатов.

В исследовании наблюдалось соответствие стимулов между показателями алгоритма FEA и точностью распознавания эмоций у здоровых взрослых, при этом была отмечена умеренная чувствительность при различении эмоциональных состояний. Это обеспечивает предварительную валидацию алгоритма FEA — проприетарного алгоритма на базе машинного обучения, который анализирует микродвижения верхней части тела и создает динамические представления эмоциональных траекторий и агрегированные показатели для каждой из девяти рас на основе концепции Навараса. Будущие итерации алгоритма должны быть направлены на повышение его дискриминационной способности по всем эмоциональным категориям путем включения дополнительных физиологических или контекстных данных. Валидация на более широких клинических популяциях требует дальнейшего изучения.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Алгоритм FEA является запатентованным алгоритмом компании Nihilent Ltd., которая оказала финансовую поддержку Manoshanti в проведении сбора данных для данного исследования. Компания Nihilent предоставила баллы, полученные с помощью алгоритма FEA. Анализ данных был проведен Manoshanti независимо. Компания Nihilent Ltd. не принимала участия в анализе данных.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы благодарим профессора П. Т. Сивакумара и доктора Шивараму Варамбалли за научное руководство данным исследованием.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
EmoscapeNihilent Ltd, Пуна1Разработчик Emoscape
Центры эмоционального благополучия ManoshantiGNR Health Care Pvt Ltd.2Клинический и исследовательский партнер
Инструмент для распознавания эмоций при нейропсихиатрических расстройствахавторское право принадлежит соответствующему автору исследования3Инструмент, использованный для валидации в исследовании

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Garg N, Garg R, Anand A, Baths V. Decoding the neural signatures of valence and arousal from a portable EEG headset. Front Hum Neurosci. 2022;16:1051463. doi:10.3389/fnhum.2022.1051463.
  2. Wang XW, Nie D, Lu BL. Emotional state classification from EEG data using a machine learning approach. Neurocomputing. 2014;129:94–106.
  3. Giannakaki K, Giannakakis GA, Farmaki C, Sakkalis V. Emotional state recognition using advanced machine learning techniques on EEG data [conference paper]. Presented at: 2017 IEEE 30th International Symposium on Computer-Based Medical Systems; Thessaloniki, Greece; 2017. p. 333–6. Available from: https://ieeexplore.ieee.org/document/8104214
  4. Barzilay R, et al. Predicting affect classification in mental status examination using machine learning face action recognition system. Front Psychiatry. 2019;10:288. doi:10.3389/fpsyt.2019.00288.
  5. Houssein EH, Hammad A, Ali AA. Human emotion recognition from EEG-based brain-computer interface using machine learning. Neural Comput Appl. 2022;34:12527–52.
  6. Awan AW, et al. An ensemble learning method for emotion charting using multimodal physiological signals. Sensors (Basel). 2022;22(23):9480. doi:10.3390/s22239480.
  7. Shetty H, Sampathila N, Kumar GS, Behere R. Interactive self assessment tool for analysis of emotional status. Indian J Sci Technol. 2017;10(16):1–5.
  8. Bazgir O, Mohammadi Z, Habibi SAH. Emotion recognition with machine learning using EEG signals [conference paper]. Presented at: 2018 25th National and 3rd International Iranian Conference on Biomedical Engineering; Qom, Iran; 2018. p. 1–5. Available from: https://ieeexplore.ieee.org/document/8703559
  9. Spunt RP, Adolphs R. The neuroscience of understanding the emotions of others. Neurosci Lett. 2019;693:44–8.
  10. Hawco C, et al. Neural activity while imitating emotional faces is related to both lower and higher-level social cognitive performance. Sci Rep. 2017;7:1244. doi:10.1038/s41598-017-01316-z.
  11. Behere RV, et al. TRENDS: a tool for recognition of emotions in neuropsychiatric disorders. Indian J Psychol Med. 2008;30(1):32–8.
  12. Trevethan R. Sensitivity, specificity, and predictive values: foundations, pliabilities, and pitfalls in research and practice. Front Public Health. 2017;5:307. doi:10.3389/fpubh.2017.00307.
  13. Gkintoni E, Aroutzidis A, Antonopoulou H, Halkiopoulos C. From neural networks to emotional networks: a systematic review of EEG-based emotion recognition in cognitive neuroscience and real-world applications. Brain Sci. 2025;15(3):220. doi:10.3390/brainsci15030220.
  14. Joshi S, Srinivas LNB. An ensemble classifier for emotion classification from EEG and GSR signals for autism detection. Comput Methods Programs Biomed. 2025;270:108921. doi:10.1016/j.cmpb.2025.108921.
  15. Lincoln SH, et al. The neural basis of social cognition in typically developing children and its relationship to social functioning. Front Psychol. 2021;12:714176. doi:10.3389/fpsyg.2021.714176.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Видео скоро будет доступно

Похожие статьи