$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Протокол исследования был одобрен Комитетом по этике больниц Сушрута (Хуббалли, Карнатака, Индия) (регистрационный номер ЭК: ECR/372/INST/KA/2013/RR-19), и до включения в исследование от всех участников было получено письменное информированное согласие.
Алгоритм FEA представляет собой проприетарный метод на основе машинного обучения (ML) для анализа микровыражений лица и движений верхней части тела в режиме реального времени с целью определения эмоциональных состояний с использованием системы Navarasa. Система Navarasa, основанная на классической индийской эстетической теории, выделяет девять основных эмоций: шрингара (любовь), хасья (радость), каруна (печаль/задумчивость), адбхута (удивление), шанта (покой), раудра (гнев), вира (мужество), бхаянака (страх) и вибхитса (отвращение). Алгоритм FEA использует модель машинного обучения, обученную на микровыражениях лица и движениях верхней части тела, извлеченных из изображений актеров, демонстрирующих девять эмоций Navarasa. Алгоритм определяет эмоциональное состояние человека путем анализа тонкой динамики лица и микродвижений на основе визуальных данных, полученных с помощью одной RGB-камеры, и генерирует количественные показатели для каждой из девяти основных эмоций. Такая неинвазивная конфигурация обеспечивает ненавязчивую, естественную оценку эмоций, что делает её подходящей для широкого спектра исследовательских и прикладных задач.
Разработка модели
Алгоритм FEA основан на архитектуре нейронной сети (НС). Обучающий набор данных был собран внутри организации и состоит из нескольких часов записанных видеоданных с участием индийских актеров, изображающих девять эмоций Навараса. Набор данных был получен из контролируемых видеозаписей нескольких актеров/участников, при этом для каждого актера/участника было проведено несколько записей/тестов в различных вызванных эмоциональных состояниях. После предварительной обработки, включавшей определение ориентиров лица, проверку временной согласованности, фильтрацию по качеству и удаление непригодных кадров или кадров с низким уровнем достоверности, было сохранено примерно 25 000 структурированных обучающих выборок. В процессе курирования набора данных записи были стратифицированы по более чем десяти демографическим и связанным с записью параметрам, включая возраст, пол и другие соответствующие атрибуты, и намеренно сбалансированы для обеспечения равного представительства по этим параметрам и минимизации демографической предвзятости. Распределение по полу поддерживалось на уровне примерно 52% мужчин и 48% женщин. Участники в целом охватывали подростковые и взрослые возрастные группы с представительством младших, средних и старших возрастных когорт взрослых. Актеры/участники находились в Индии и представляли различные региональные и культурные особенности Индии, а также несколько международных этнических групп, представленных в Индии. В связи с проприетарными ограничениями точное количество актеров/участников, идентификация на уровне актера/участника, точное количество видео/записей на каждого актера, точное количество кадров и внутренняя методология аннотирования не могут быть раскрыты, так как они являются частью проприетарного набора данных и интеллектуальной собственности по разработке модели компании Nihilent Ltd.; данное ограничение эксплицитно признается в разделе «Обсуждение».
Изображения лиц, извлеченные из этих записей, обрабатывались с использованием методов обработки изображений для получения количественных признаков, которые впоследствии использовались в качестве входных данных для нейронной сети для прогнозирования. Затем эта модель была оценена на целевой популяции, а полученные результаты использовались для итеративного совершенствования последующих версий. Этот цикл разработки, тестирования и улучшения повторялся до стабилизации производительности модели. Итоговая прогностическая модель реализована в виде многослойного перцептрона (MLP), состоящего из входного слоя с примерно 300 выбранными признаками, скрытых слоев и выходного слоя, формирующего девятимерный вектор показателей, соответствующих девяти категориям эмоций Навараса. Первоначально из полученных данных было извлечено более 700 признаков, количество которых впоследствии было сокращено с помощью процедур отбора признаков и оптимизации модели. Затем выходной показатель MLP передается в проприетарные алгоритмы постобработки для получения итоговых агрегированных показателей алгоритма FEA. Дополнительные детали архитектуры, включая точное количество обучаемых параметров и конкретные размеры слоев, являются конфиденциальными и не могут быть раскрыты; это признается ограничением настоящего отчета. Подробное описание разработки модели приведено в дополнительных материалах (Supplementary File 1 и Supplementary Figure 1).
В ходе итеративной разработки эффективность модели оценивали с помощью кросс-валидации на внутреннем наборе данных, в результате чего была достигнута точность классификации 96% по всем девяти категориям Navarasa. Последующая независимая валидация проводилась на видеоданных общей продолжительностью более 15 000 мин. Нормализованная матрица ошибок 9 × 9, обобщающая результаты классификации по всем девяти категориям Navarasa, представлена в дополнительных материалах (Дополнительный файл 1).
После стабилизации модель прошла контролируемую внутреннюю валидацию под наблюдением экспертов. Такой подход делает упор на эмпирическую проверку посредством прямого тестирования на людях, что позволяет оценить применимость модели в реальных условиях и ее устойчивость в различных популяциях. Процесс разработки модели обобщен на Рисунке 1.
Опросник здоровья пациента-9 (PHQ-9) и шкала генерализованного тревожного расстройства-7 (GAD-7): Участники заполняли опросники самоотчета под наблюдением квалифицированного психолога для оценки их текущего эмоционального состояния. Использовались следующие инструменты: Опросник здоровья пациента-9 (PHQ-9) и шкала генерализованного тревожного расстройства-7 (GAD-7). Результат выше 9 баллов по любой из шкал считался клинически значимым.
ТЕНДЕНЦИИ
Инструмент для распознавания эмоций при нейропсихиатрических расстройствах (The Tool for Recognition of Emotions in Neuropsychiatric Disorders, TRENDS) представляет собой культурно валидизированный, экологически чувствительный инструмент, разработанный для оценки способности распознавать эмоции по выражению лица11. Данный инструмент прошел валидацию для использования в индийских популяциях и состоит из 40 фотографий актеров, изображающих универсальные базовые эмоции: нейтральное состояние, счастье, страх, гнев и грусть. Изображения из TRENDS использовались в качестве эталонных стимулов для валидации результатов классификации эмоций алгоритмом FEA.
Дизайн эксперимента
Эксперимент был разработан для вызова алгоритмического отклика на эмоциональные стимулы. Для данного исследования были разработаны и использованы две парадигмы вызывания эмоций.
Парадигма изображений TRENDS
В первой парадигме видеопоследовательность начиналась с отображения пустого экрана в течение 60 s, после чего предъявлялись эмоциональные стимулы. Эмоциональные стимулы были отобраны с помощью инструмента TRENDS. Всего было предъявлено 20 изображений, представляющих нейтральное состояние, счастье, грусть, гнев и страх × два пола × две возрастные группы. Каждый стимул отображался в течение 5 s. Таким образом, общее время предъявления стимулов составило 20 × 5 s, с дополнительным интервалом в 10 s пустого экрана между последовательными изображениями, что в итоге дало общую продолжительность 300 s. Во время каждого 10 s интервала пустого экрана участники должны были определить эмоцию, изображенную на предыдущем снимке, выбрав одну из пяти меток эмоций, отображаемых на экране.
Парадигма Навараса
Второй аналогичный видеопарадигм был разработан на основе системы Навараса, включающей девять рас. Всего было представлено 18 изображений (девять эмоций × два пола). Каждый стимул отображался в течение 5 s, с 10 s пустым экраном между изображениями, что составило общую продолжительность 270 s. Девять эмоций были распределены по категориям: нейтральные (shanta), приятные (haasya, veera, shringara, adbhuta) или неприятные (Krodha, vibhitsa, bhayanaka, karuna). В течение каждого 10 s интервала с пустым экраном участники должны были классифицировать эмоцию, изображенную на предыдущем снимке, выбрав один из трех вариантов на экране: нейтральная, приятная или неприятная. Девять Навараса были сгруппированы в три категории для упрощения регистрации ответов участников при идентификации эмоций.
Участники
Здоровые взрослые добровольцы были набраны из рабочих коллективов и образовательных учреждений. Критерии включения предусматривали лиц в возрасте 18–50 лет любого пола/гендера. Критерии исключения включали наличие в анамнезе диагностированных психических расстройств, неврологических заболеваний, значительных нарушений зрения или физических ограничений, препятствующих движениям головы и шеи.
Процедура
Участники были рассажены таким образом, чтобы камера находилась на уровне глаз на расстоянии 60–70 cm. В исследовании использовался алгоритм FEA. Приложение было запущено на ноутбуке, после чего исследователь ввел идентификатор субъекта. На протяжении всего эксперимента алгоритм FEA непрерывно записывал видеоданные для последующего анализа мимики и микроперемещений. Сначала была получена базовая запись продолжительностью 60 s, в течение которой участникам было предписано расслабиться и воздерживаться от явных экспрессивных проявлений. После получения базовых показателей участникам демонстрировались две видеопарадигмы (изображения TRENDS, затем Navarasa). Все участники просматривали парадигмы в одном и том же фиксированном порядке для минимизации потенциальных искажающих эффектов, связанных с последовательностью представления; однако такой фиксированный порядок мог привести к возникновению эффектов последовательности. Во время сеансов записи исследователь находился за пределами помещения, чтобы не отвлекать участников. Находясь вне комнаты, исследователь удаленно контролировал ход эксперимента с помощью мобильного приложения. Между двумя парадигмами участникам предлагался короткий перерыв (Рисунок 2).
Анализ
Собранные данные были сопоставлены с идентификатором субъекта, введенным в приложение, для обеспечения достоверности данных. Алгоритм FEA использует структурированный сквозной вычислительный конвейер для автоматического вывода эмоций, состоящий из пяти основных этапов: захват видео, детектирование и извлечение признаков, предобработка данных, классификация эмоций и интерпретация результатов. Извлеченные признаки прошли серию операций предобработки, включая шумоподавление, нормализацию по субъектам и условиям освещения, а также интерполяцию пропущенных кадров. Для повышения стабильности сигнала было применено временное сглаживание. Полученные векторы признаков были синхронизированы по времени для последующей подачи в модель классификации. Эти синхронизированные по времени и очищенные от шумов матрицы признаков служили входными данными для компонента классификации эмоций.
Извлечение признаков
Система извлечения признаков использует многостадийный алгоритмический конвейер, который преобразует стандартные потоки 2D-изображений с монокулярного видео в реконструированное 3D-координатное пространство. Вместо того чтобы полагаться на простое отслеживание 2D-пикселей, система картирует локализованные пространственные координаты лица и верхней части тела. Извлекаемые признаки разделены на три основные категории: (i) области лицевых ориентиров, включающие геометрические дескрипторы структуры и динамики лица (в том числе признаки области глаз и корреляты микровыражений лица, основанные на концепции Навараса, которая берет начало в Натьяшастре — старейшей формализованной системе выражения человеческих эмоций, признанной ЮНЕСКО); (ii) информация о положении головы, фиксирующая ориентацию и движение головы; и (iii) признаки движений верхней части тела, фиксирующие результирующее перемещение верхней части корпуса. Конкретные определения признаков, включая точные индексы ориентиров и идентификаторы ключевых точек, являются проприетарными и не могут быть раскрыты полностью; это признано ограничением исследования. Система не использует напрямую метки единиц действия Системы кодирования лицевых движений (FACS); вместо этого она выводит геометрические и временные признаки из движений лица и тела. Эти 3D-пространственные преобразования агрегируются во времени для создания комплексного вектора поведенческого резюме, который служит входными данными для классификатора MLP. В общей сложности из полученных данных изначально было извлечено более 700 потенциальных признаков, количество которых впоследствии было сокращено примерно до 300 отобранных признаков путем отбора признаков и оптимизации модели. Структура конвейера включает этапы от захвата видео, через пространственную реконструкцию из 2D в 3D, временную агрегацию и нормализацию признаков перед этапом классификации.
Модель классификации эмоций
Предварительно обработанные векторы признаков подавались на вход архитектуры нейронной сети многослойного перцептрона (MLP) с обучением под руководством, которая была обучена на внутреннем аннотированном наборе данных, соответствующем девяти эмоциональным категориям Навараса: Śṛṅgāra (любовь), Hāsya (радость), Karuṇā (печаль), Raudra (гнев), Vīra (мужество), Bhayānaka (страх), Bībhatsa (отвращение), Adbhuta (изумление) и Śānta (покой). Модель была специально разработана для захвата пространственно-временных зависимостей в данных об экспрессивном поведении. На каждом временном шаге архитектура формировала вектор прогнозируемой интенсивности эмоций для девяти категорий.
Постпроцессинг выходных данных модели
Необработанные выходные данные модели впоследствии подвергались постобработке для получения стабильных и интерпретируемых показателей эмоций. Были применены три последовательные операции: (i) временное сглаживание для уменьшения краткосрочных колебаний, (ii) нормализация для обеспечения сопоставимости данных во времени и по различным измерениям эмоций, и (iii) агрегация для получения обобщенных показателей за определенные временные интервалы или за весь период последовательности. Процедуры постобработки обеспечивают сопоставимость результатов между испытуемыми и контролируют межиндивидуальные вариации базового уровня.
Интерпретация и визуализация результатов
Алгоритм FEA генерирует количественные и визуальные представления эмоциональной динамики, выведенные на основе видеоданных. Двумя основными формами выходных данных являются временные траектории эмоций. Значения интенсивности эмоций визуализируются в виде графиков временных рядов, показывающих эволюцию каждой эмоции на протяжении всего видео. Такое представление обеспечивает непрерывный обзор аффективных вариаций, облегчая изучение кратковременных изменений, пиковых активаций, а также фаз восстановления или снижения эмоционального возбуждения. Сравнительные показатели эмоций: Агрегированные значения эмоций для каждой из девяти категорий Наварас отображаются в виде графиков сравнительных показателей, иллюстрирующих относительную величину каждой эмоции за анализируемый интервал. Эти сравнительные визуализации позволяют проводить прямое сопоставление различных эмоций и предоставляют краткий обзор общего аффективного профиля. Показатели, полученные с помощью алгоритма FEA на исходном уровне, проверялись на наличие «плоских линий» или отсутствия значимых изменений, что могло бы указывать на ненадлежащую запись.
Статистический анализ
В качестве зависимых переменных рассматривались показатели девяти доменов эмоций Навараса, рассчитанные с помощью алгоритма FEA в течение 10 с интервала после предъявления каждого изображения в парадигме. Показатели алгоритма FEA рассчитывались для каждой секунды s в 10-секундном окне (T0, T1, T2… T9). Показатель алгоритма FEA в момент T0 считался исходным. Максимальный показатель алгоритма FEA среди записей с T1 по T9 определялся как Tmax. Изменение показателя алгоритма FEA относительно исходного уровня (Tmax − T0) вычислялось и использовалось в качестве зависимой переменной при проведении анализа. Изменение показателей алгоритма FEA в течение временного ряда для каждой эмоции представлено на рисунке 3A–D.
Для изображений TRENDS соответствующие целевые категории эмоций были сопоставлены следующим образом: Shanta > нейтральная; Haasya > радость; Krodha > гнев; и Bhayanaka > страх. Для изображений Navarasa баллы алгоритма FEA были сгруппированы и усреднены по трем композитным категориям: нейтральная (Shanta), приятная (Haasya, Veera, Shringara, Adbhuta) и неприятная (Krodha, Vibhitsa, Bhayanaka, Karuna).
Проводился анализ как на групповом, так и на индивидуальном уровнях.
Анализ на групповом уровне: Для каждой из описанных выше категорий эмоций изменение показателя алгоритма FEA от исходного уровня до Tmax сравнивали с помощью парного t-критерия. Значимое изменение показателя алгоритма FEA по сравнению с исходным уровнем указывало бы на хорошую согласованность с распознаванием эмоций. Однако значимая разница не обязательно свидетельствовала бы о высокой точности классификации.
Анализ на уровне субъекта: любое увеличение показателя эмоциональной области по алгоритму FEA по сравнению с базовым значением классифицировалось как положительный эмоциональный ответ. Затем были рассчитаны показатели точности — чувствительность и специфичность. Чувствительность и специфичность количественно определяют вероятность того, что тест будет положительным при наличии целевого состояния (+) и отрицательным при его отсутствии (−), соответственно. Когда оба показателя приближаются к 1, тест демонстрирует высокую диагностическую точность. Оцениваемая чувствительность и специфичность определялись как доли участников с и без референсного состояния (выражения Навараса), соответственно, которые были классифицированы верно.
Испытуемый считался имеющим целевое состояние (+), если он правильно определил не менее 75% изображенных эмоций. Эта классификация была основана на валидационных исследованиях TRENDS, в которых точность 60–80% считалась адекватной дискриминантной валидностью. Для оценки площади под кривой (AUC) и соответствующих значений чувствительности и специфичности был проведен анализ рабочих характеристик приемника (ROC-анализ) для непрерывного предиктора. Чувствительность выше 80% считалась показателем хорошей дискриминационной способности, а ниже 80% — умеренной.