Artículo de investigación

Validación preliminar de un algoritmo de análisis de expresiones faciales y movimiento durante tareas de provocación de emociones en adultos sanos

DOI:

10.3791/70843

14 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio valida preliminarmente el algoritmo FEA, un algoritmo de aprendizaje automático propietario, para detectar respuestas durante tareas con estímulos emocionales. Examina la concordancia entre las puntuaciones del algoritmo FEA y los estímulos faciales estandarizados de emociones utilizando el marco Navarasa en adultos sanos, evaluando si el sistema refleja de manera confiable las respuestas relacionadas con las emociones bajo condiciones experimentales controladas.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo fue diseñado para validar preliminarmente Emoscape, un algoritmo propietario de aprendizaje automático basado en el marco de trabajo Navarasa, probando si sus puntuaciones emocionales cambian de manera concordante con tareas estandarizadas de inducción emocional en adultos sanos. Setenta y dos adultos sanos fueron reclutados tras proporcionar consentimiento informado por escrito. Los participantes completaron el Cuestionario de Salud del Paciente-9 y el Trastorno de Ansiedad Generalizada-7, luego observaron estímulos emocionales faciales del conjunto TRENDS y de imágenes Navarasa, mientras que el algoritmo FEA registraba micro-movimientos del torso superior durante toda la tarea. Los participantes también identificaron las emociones mostradas. Se analizaron los cambios en las puntuaciones del algoritmo FEA desde la línea base durante la exposición a estímulos neutros, felices, de miedo e ira del conjunto TRENDS, así como durante la exposición a imágenes Navarasa. Se utilizó un análisis de la curva característica de operación del receptor para estimar la sensibilidad y especificidad en la discriminación entre categorías emocionales. Las puntuaciones del algoritmo FEA mostraron desviaciones significativas respecto a la línea base para las imágenes TRENDS asociadas a las emociones correspondientes (Neutral–Shanta, Feliz–Haasya, Miedo–Bhayanaka e Ira–Raudra). También se observaron cambios concordantes en las imágenes Navarasa, con todas las diferencias medias estadísticamente significativas (p < 0,001). Los valores del área bajo la curva (AUC) variaron entre categorías. El algoritmo FEA mostró una sensibilidad moderada para emociones agradables (70–80%) y emociones desagradables (60–70%). Estos hallazgos proporcionan apoyo preliminar al protocolo y al uso del algoritmo FEA para evaluar respuestas relacionadas con la emoción durante tareas controladas de inducción emocional en adultos sanos.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El reconocimiento de emociones es un área importante de investigación dentro de la neurociencia cognitiva social, con posibles aplicaciones clínicas e investigativas. Los métodos existentes de evaluación emocional cuantifican alteraciones en la actividad fisiológica, como la electroencefalografía (EEG) o la resistencia eléctrica de la piel (GSR), para inferir estados emocionales. Sin embargo, estos métodos son complejos e invasivos. Las mediciones directas de movimientos faciales y corporales ofrecen un índice más inmediato y observable del estado afectivo de un individuo1,2,3. Los algoritmos de aprendizaje automático (ML), particularmente aquellos entrenados con grandes conjuntos de datos heterogéneos de expresiones faciales, se utilizan para descifrar estas señales no verbales sutiles y clasificar estados emocionales. Aunque los algoritmos convencionales de ML, como las máquinas de vectores de soporte (SVM), siguen siendo ampliamente utilizados, las arquitecturas de aprendizaje profundo, especialmente las redes neuronales (NN)4,5, han demostrado un rendimiento superior, particularmente cuando se entrenan con conjuntos de datos a gran escala, gracias a su capacidad de extracción automática de características6. Un ejemplo de un modelo convencional en el contexto indio es una herramienta interactiva que adopta un modelo dimensional basado en la valencia para determinar el nivel de activación. Los marcos de reconocimiento emocional deben ser sensibles al contexto cultural. En el entorno cultural indio, el marco Navarasa proporciona una taxonomía matizada de nueve emociones primarias, aunque sigue siendo en gran parte inexplorado dentro de la investigación de reconocimiento emocional impulsada por ML. Existe una relativa escasez de enfoques de ML rigurosamente validados que analicen directamente las señales conductuales observables, como microexpresiones faciales y movimientos corporales7,8. Dichos algoritmos basados en expresiones pueden utilizarse en tiempo real, son fáciles de aplicar y no son invasivos.

El algoritmo de Análisis de Expresión y Movimiento Facial [en adelante denominado algoritmo FEA] es un algoritmo propietario basado en aprendizaje automático (ML) que analiza microexpresiones faciales y movimientos del torso superior, y genera representaciones dinámicas de trayectorias emocionales y puntuaciones agregadas para cada uno de los nueve rasas, según el marco del Navarasa. Este estudio tuvo como objetivo realizar una validación preliminar del algoritmo FEA mediante el examen de la concordancia entre las puntuaciones obtenidas mediante FEA y las respuestas a estímulos estandarizados de emociones faciales en voluntarios adultos sanos.

A tal fin, recurrimos a los conceptos de la teoría de la mente (ToM) y del sistema de neuronas espejo. La ToM es una capacidad socio-cognitiva fundamental que permite a los individuos inferir e interpretar los estados mentales y emocionales de los demás en contextos sociales9. Evidencia empírica sugiere que la exposición a estímulos emocionales faciales activa redes de neuronas espejo, las cuales a su vez provocan un estado emocional concordante y vicario en el observador10. La modulación resultante del estado emocional interno y subjetivo de un individuo en respuesta a la visualización de expresiones faciales de emoción, si es capturada por el algoritmo FEA, puede proporcionar una validación preliminar del algoritmo.

Planteamos la hipótesis de que la exposición a estímulos emocionales faciales correspondientes a una categoría específica de Navarasa provocará una desviación estadísticamente significativa respecto a la línea base en la puntuación del algoritmo FEA para esa emoción de Navarasa.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El protocolo del estudio fue aprobado por el Sushruta Hospitals Ethics Committee, Hubballi, Karnataka, India (EC registration number: ECR/372/INST/KA/2013/RR-19), y se obtuvo el consentimiento informado por escrito de todos los participantes antes de su inscripción.

El algoritmo FEA es un método basado en aprendizaje automático (ML) de propiedad exclusiva para el análisis en tiempo real de microexpresiones faciales y movimientos del torso superior, con el fin de inferir estados emocionales utilizando el marco teórico de Navarasa. El marco de Navarasa, derivado de la teoría estética clásica india, define nueve emociones primarias: shringara (amor), haasya (alegría), karuna (tristeza/pena), adbhuta (sorpresa), shanta (paz), raudra (ira), veera (valentía), bhayanaka (miedo) y vibhitsa (asco). El algoritmo FEA utiliza un modelo de aprendizaje automático entrenado con microexpresiones faciales y movimientos del torso superior extraídos de imágenes de actores que representan las nueve emociones de Navarasa. El algoritmo infiere el estado emocional de un individuo analizando dinámicas faciales sutiles y micromovimientos a partir de entradas visuales capturadas por una única cámara RGB, y genera puntuaciones cuantitativas para cada una de las nueve emociones primarias. Esta configuración no invasiva permite una evaluación emocional discreta y naturalista, lo que la hace adecuada para una amplia variedad de entornos de investigación y aplicaciones prácticas.

Desarrollo del modelo

El algoritmo FEA se basa en una arquitectura de red neuronal (NN). El conjunto de datos de entrenamiento fue recopilado internamente y consta de varias horas de datos de video grabados de actores indios representando las nueve emociones Navarasa. El conjunto de datos se derivó de grabaciones en video controladas de varios actores/participantes, con múltiples grabaciones/pruebas realizadas para cada actor/participante en diferentes estados emocionales inducidos. Tras el preprocesamiento, que incluyó la detección de puntos característicos faciales, verificaciones de consistencia temporal, filtrado de calidad y eliminación de fotogramas inutilizables o de baja confianza, se conservaron aproximadamente 25.000 muestras estructuradas para el entrenamiento. Durante la curación del conjunto de datos, las grabaciones se estratificaron según más de diez parámetros demográficos y relacionados con la grabación, incluyendo edad, sexo y otros atributos relevantes, y se equilibraron intencionadamente para lograr una representación equitativa a través de estos parámetros y minimizar el sesgo demográfico. La distribución por sexo se mantuvo aproximadamente en 52 % hombres y 48 % mujeres. Los participantes abarcaron ampliamente los grupos de edad adolescentes y adultos, con representación en los grupos de adultos jóvenes, adultos de mediana edad y adultos mayores. Los actores/participantes residían en la India y representaban diversos orígenes regionales y culturales indios, así como múltiples etnias internacionales presentes en la India. Debido a restricciones de propiedad, no puede revelarse el número exacto de actores/participantes, la identidad a nivel de actor/participante, el número exacto de videos/grabaciones por actor, los recuentos precisos de fotogramas ni la metodología interna de anotación, ya que estos elementos forman parte del conjunto de datos propietario y de la propiedad intelectual del desarrollo de modelos de Nihilent Ltd.; esta limitación se reconoce explícitamente en la sección de Discusión.

Las imágenes faciales extraídas de estas grabaciones se procesaron mediante técnicas de procesamiento de imágenes para derivar características cuantitativas, que posteriormente se utilizaron como entradas para una red neuronal con fines de predicción. Este modelo se evaluó luego en una población objetivo, y las conclusiones obtenidas se emplearon para refinar de forma iterativa las versiones posteriores. Este ciclo de desarrollo, prueba y mejora se repitió hasta que el rendimiento del modelo se estabilizó. El modelo predictivo final se implementa como un perceptrón multicapa (MLP) que consta de una capa de entrada con aproximadamente 300 características seleccionadas, capas ocultas y una capa de salida que produce un vector de puntuación de nueve dimensiones correspondiente a las nueve categorías emocionales de Navarasa. Inicialmente se derivaron más de 700 características a partir de los datos capturados y posteriormente se redujeron mediante procedimientos de selección de características y optimización del modelo. La puntuación de salida del MLP se transmite entonces a algoritmos propietarios de postprocesamiento para obtener las puntuaciones finales agregadas del algoritmo FEA. Otros detalles arquitectónicos, incluido el número exacto de parámetros entrenables y las dimensiones específicas de las capas, son propiedad exclusiva y no pueden divulgarse; esto se reconoce como una limitación del presente informe. En el material suplementario se proporciona una descripción detallada del desarrollo del modelo (Supplementary File 1 y Supplementary Figure 1).

Durante el desarrollo iterativo, se evaluó el rendimiento del modelo mediante validación cruzada en el conjunto de datos interno, alcanzando una precisión de clasificación del 96 % validada mediante cruzada en las nueve categorías de Navarasa. Posteriormente, se realizó una validación independiente con más de 15.000 min de datos de video. En el material suplementario se proporciona una matriz de confusión normalizada de 9 × 9 que resume el rendimiento de clasificación en las nueve categorías de Navarasa (Archivo Suplementario 1).

Tras la estabilización, el modelo fue sometido a una validación interna controlada bajo supervisión experta. Este enfoque destaca la validación empírica mediante pruebas directas en sujetos humanos, lo que permite evaluar la aplicabilidad y robustez en poblaciones diversas. El desarrollo del modelo se resume en la Figura 1.

El Cuestionario de Salud del Paciente-9 (PHQ-9) y la escala del Trastorno de Ansiedad Generalizada-7 (GAD-7): Los participantes completaron cuestionarios de autorreporte bajo la supervisión de un psicólogo capacitado para evaluar sus estados emocionales actuales. Los instrumentos aplicados incluyeron el Cuestionario de Salud del Paciente-9 (PHQ-9) y la escala del Trastorno de Ansiedad Generalizada-7 (GAD-7). Se consideró clínicamente significativo un puntaje superior a 9 en cualquiera de las dos escalas.

TENDENCIAS

La Herramienta para el Reconocimiento de Emociones en Trastornos Neuropsiquiátricos (TRENDS) es un instrumento validado culturalmente y sensible al contexto ecológico, diseñado para evaluar las capacidades de reconocimiento de emociones faciales11. Ha sido validado para su uso en poblaciones indias y consta de 40 fotografías de actores que representan las emociones básicas universales de neutralidad, felicidad, miedo, ira y tristeza. Las imágenes de TRENDS se utilizaron como estímulos de referencia para validar las salidas de clasificación de emociones del algoritmo FEA.

Diseño experimental

El experimento fue diseñado para provocar una respuesta algorítmica ante estímulos emocionales. Se desarrollaron y utilizaron dos paradigmas de inducción emocional para este estudio.

Paradigma de imágenes TRENDS

En el primer paradigma, una secuencia de video presentó inicialmente una pantalla en blanco durante 60 s, seguida por la presentación de estímulos emocionales. Los estímulos emocionales se seleccionaron de la herramienta TRENDS. Se presentaron un total de 20 imágenes, representando neutralidad, felicidad, tristeza, ira y miedo × dos géneros × dos grupos de edad. Cada estímulo se mostró durante 5 s. El tiempo total de presentación de estímulos fue por tanto 20 × 5 s, con un intervalo adicional de 10 s de pantalla en blanco entre imágenes consecutivas, lo que resultó en una duración total de 300 s. Durante cada intervalo de 10 s en blanco, los participantes debían identificar la emoción representada en la imagen anterior seleccionando una de las cinco etiquetas emocionales mostradas en la pantalla.

Paradigma Navarasa

Se construyó un segundo paradigma de video análogo basado en el marco de las nueve rasas de Navarasa. Se presentaron un total de 18 imágenes (nueve emociones × dos géneros). Cada estímulo se mostró durante 5 s, con una pantalla en blanco de 10 s entre imágenes, lo que dio una duración total de 270 s. Las nueve emociones se clasificaron como neutrales (shanta), agradables (haasya, veera, shringara, adbhuta) o desagradables (Krodha, vibhitsa, bhayanaka, karuna). Durante cada intervalo en blanco de 10 s, los participantes debían clasificar la emoción mostrada en la imagen anterior seleccionando una de tres opciones presentadas en la pantalla: neutral, agradable o desagradable. Las nueve Navaras se agruparon en tres categorías para facilitar el registro de las respuestas de los participantes a la identificación emocional.

Participantes

Se reclutaron voluntarios adultos sanos de entornos laborales e instituciones educativas. Los criterios de inclusión comprendieron individuos de entre 18 y 50 años de edad, de cualquier sexo/género. Los criterios de exclusión incluyeron antecedentes de trastornos psiquiátricos diagnosticados, trastornos neurológicos, discapacidad visual significativa o discapacidades físicas que restringieran los movimientos de la cabeza y el cuello.

Procedimiento

Los participantes se sentaron de manera que la cámara quedara a la altura de los ojos y a una distancia de 60–70 cm. En el estudio se utilizó el algoritmo FEA. Se abrió la aplicación en la computadora portátil y el investigador ingresó el ID del sujeto. Durante todo el experimento, el algoritmo FEA grabó continuamente datos de video para permitir el análisis posterior de expresiones faciales y micro-movimientos. Inicialmente, se obtuvo una grabación basal de 60 s, durante la cual se instruyó a los participantes a relajarse y abstenerse de comportamientos expresivos evidentes. Tras la adquisición del registro basal, los participantes fueron expuestos a los dos paradigmas de video (imágenes de TRENDS seguidas por Navarasa). Todos los participantes vieron los paradigmas en el mismo orden fijo para minimizar posibles efectos de confusión relacionados con la secuencia de presentación; sin embargo, este orden fijo podría haber introducido efectos de orden. Durante las sesiones de grabación, el investigador permaneció fuera de la habitación para reducir distracciones. El investigador supervisó el experimento de forma remota mediante una aplicación móvil mientras estaba fuera de la habitación. Se ofreció a los participantes un breve intervalo de descanso entre los dos paradigmas (Figura 2).

Análisis

Los datos recopilados se asociaron al ID del sujeto ingresado en la aplicación para garantizar la fidelidad de los datos. El algoritmo de FEA utiliza una canalización computacional estructurada y de extremo a extremo para la inferencia automática de emociones, compuesta por cinco etapas principales: adquisición de video, detección y extracción de características, preprocesamiento de datos, clasificación de emociones e interpretación de resultados. Las características extraídas pasaron por una serie de operaciones de preprocesamiento, incluida la reducción de ruido, la normalización entre sujetos y condiciones de iluminación, y la interpolación de fotogramas faltantes. Se aplicó un suavizado temporal para mejorar la estabilidad de la señal. Los vectores de características resultantes se alinearon temporalmente para su posterior procesamiento por parte del modelo de clasificación. Estas matrices de características alineadas en el tiempo y libres de ruido sirvieron como entradas para el componente de clasificación de emociones.

Extracción de características

El marco de extracción emplea una tubería algorítmica de múltiples etapas de extracción de características que traduce secuencias de imágenes estándar en video monocular 2D a un espacio de coordenadas 3D reconstruido. En lugar de basarse en el seguimiento directo de píxeles 2D, el sistema mapea coordenadas espaciales localizadas a través del rostro y la parte superior del cuerpo. Las características derivadas se dividen en tres categorías amplias: (i) regiones de puntos característicos faciales, que comprenden descriptores geométricos de la estructura y dinámica facial (incluyendo indicadores de la zona ocular y correlatos de microexpresiones faciales extraídos del marco Navarasa, basado en el Natyashastra, el marco formalizado más antiguo de la expresión emocional humana, reconocido por la UNESCO); (ii) información de la postura de la cabeza, que capta la orientación y el movimiento del cráneo; y (iii) características del movimiento de la parte superior del cuerpo, que registran el movimiento resultante de la región torácica. Las definiciones específicas de las características, incluyendo índices precisos de puntos característicos e identificadores clave, son propiedad exclusiva y no pueden revelarse completamente; esta limitación se reconoce expresamente. El sistema no utiliza directamente las etiquetas de unidades de acción del Sistema de Codificación de Acciones Faciales (FACS); en cambio, deriva características geométricas y temporales a partir del movimiento facial y corporal. Estas transformaciones espaciales 3D se agrupan a lo largo del tiempo para generar un vector resumen conductual integral, que sirve como entrada al clasificador MLP. En total, inicialmente se derivaron más de 700 características candidatas a partir de los datos capturados, que posteriormente se redujeron a aproximadamente 300 características seleccionadas mediante selección de características y optimización del modelo. La tubería estructural avanza desde la adquisición de video hasta la reconstrucción espacial 2D-a-3D, la agregación temporal y la normalización de características antes de la clasificación.

Modelo de clasificación de emociones

Los vectores de características preprocesados se proporcionaron a una arquitectura de red neuronal perceptrón multicapa (MLP) supervisada, entrenada con el conjunto de datos anotado internamente que corresponde a las nueve categorías emocionales de Navarasa: Śṛṅgāra (amor), Hāsya (alegría), Karuṇā (tristeza), Raudra (ira), Vīra (valentía), Bhayānaka (miedo), Bībhatsa (asco), Adbhuta (asombro) y Śānta (paz). El modelo fue diseñado explícitamente para capturar dependencias espacio-temporales en los datos conductuales expresivos. En cada paso temporal, la arquitectura generó un vector de intensidades emocionales predichas para las nueve categorías.

Postprocesamiento de las salidas del modelo

Las salidas brutas del modelo se procesaron posteriormente para producir puntuaciones de emoción estables e interpretables. Se aplicaron tres operaciones secuenciales: (i) suavizado temporal para reducir las fluctuaciones a corto plazo, (ii) normalización para garantizar la comparabilidad a lo largo del tiempo y entre dimensiones emocionales, y (iii) agregación para derivar medidas resumidas en ventanas temporales específicas o en secuencias completas. Los procedimientos de postprocesamiento aseguran la comparabilidad entre sujetos y controlan la variación basal interindividual.

Interpretación y visualización de los resultados

El algoritmo FEA genera representaciones cuantitativas y visuales de las dinámicas emocionales inferidas a partir de datos de video. Las dos formas principales de salida son las trayectorias emocionales temporales. Los valores de intensidad emocional se visualizan como gráficos de series temporales que muestran la evolución de cada emoción a lo largo del video. Esta representación ofrece una vista continua de la variación afectiva, facilitando el examen de cambios transitorios, activaciones máximas y fases de recuperación o desescalamiento en la activación emocional. Puntuaciones emocionales comparativas: Los valores agregados de emoción para cada una de las nueve categorías Navarasa se muestran como gráficos de puntuaciones comparativas, que ilustran la magnitud relativa de cada emoción a lo largo del intervalo analizado. Estas visualizaciones comparativas permiten comparaciones directas entre emociones y proporcionan un resumen conciso del perfil afectivo general. Las puntuaciones del algoritmo FEA generadas en la línea base se examinaron en busca de trazos planos o ausencia de cambios significativos, lo cual indicaría una grabación inadecuada.

Análisis estadístico

Los puntajes para los nueve dominios emocionales de Navarasa, generados por el algoritmo FEA durante el intervalo de 10 s posterior a cada presentación de imagen en el paradigma, se consideraron variables de resultado. El algoritmo FEA generó puntajes para cada s en la ventana de 10 s (T0, T1, T2… T9). El puntaje del algoritmo FEA en T0 se consideró el puntaje basal. El puntaje más alto del algoritmo FEA entre las grabaciones de T1–T9 se definió como Tmax. Se calculó el cambio en el puntaje del algoritmo FEA respecto al valor basal (Tmax − T0) y se utilizó como variable de resultado en los análisis. El cambio en los puntajes del algoritmo FEA a lo largo de la serie temporal para cada emoción se muestra en Figura 3A–D.

Para las imágenes de TRENDS, las categorías correspondientes de emociones objetivo se asignaron de la siguiente manera: Shanta > Neutral; Haasya > Feliz; Krodha > Ira; y Bhayanaka > Miedo. Para las imágenes de Navarasa, las puntuaciones del algoritmo FEA se agruparon y promediaron en tres categorías compuestas: neutral (Shanta), agradable (Haasya, Veera, Shringara, Adbhuta) y desagradable (Krodha, Vibhitsa, Bhayanaka, Karuna).

Se realizaron análisis a nivel del grupo y a nivel individual.

Análisis a nivel de grupo: Para cada categoría emocional descrita anteriormente, se comparó el cambio en la puntuación del algoritmo FEA desde la línea base hasta Tmax utilizando pruebas t pareadas. Un cambio significativo desde la línea base en la puntuación del algoritmo FEA indicaría una buena concordancia con el reconocimiento de emociones. Sin embargo, una diferencia significativa no indicaría necesariamente una alta precisión en la clasificación.

Análisis a nivel del sujeto: Cualquier aumento en la puntuación del dominio emocional de un algoritmo FEA por encima del valor basal se clasificó como una respuesta emocional positiva. Luego se calcularon índices de precisión: sensibilidad y especificidad. La sensibilidad y la especificidad cuantifican, respectivamente, la probabilidad de que la prueba sea positiva cuando la condición objetivo está presente (+) y negativa cuando está ausente (−). Cuando ambas estimaciones se acercan a 1, la prueba tiene un buen desempeño en términos de precisión diagnóstica. La sensibilidad y especificidad estimadas se definieron como las proporciones de participantes con y sin la condición de referencia (expresiones Navarasa), respectivamente, que fueron clasificados correctamente.

Se consideró que un sujeto presentaba la condición objetivo (+) si identificaba correctamente al menos el 75 % de las emociones representadas. Esta clasificación se basó en estudios de validación de TRENDS, en los cuales una precisión del 60 % al 80 % se consideró una validez discriminante adecuada. Se realizó un análisis de característica operativa del receptor (ROC) para un predictor continuo con el fin de estimar el área bajo la curva (AUC) y los valores correspondientes de sensibilidad y especificidad. Una sensibilidad superior al 80 % se consideró una buena capacidad discriminativa, y por debajo del 80 % se consideró moderada.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio examinó las variaciones en las puntuaciones del algoritmo FEA en respuesta a estímulos que provocan emociones y evaluó el rendimiento diagnóstico del algoritmo FEA mediante un análisis de característica operativa del receptor (ROC). Se reclutaron setenta y dos voluntarios sanos para el estudio. La edad media (DE) fue de 31,9 (11,9) años, y la muestra incluyó 26 hombres y 46 mujeres. Todos los participantes tenían al menos 10 años de educación y todos eran de etnia india. Sus puntuaciones medias (DE) en el PHQ-9 y el GAD-7 fueron 4,4 (4,8) y 4,7 (4,5), respectivamente.

Cambios en las puntuaciones del algoritmo FEA en respuesta a estímulos emocionales: Las medidas derivadas del algoritmo FEA mostraron cambios estadísticamente significativos desde la línea base (T0) hasta Tmax, según se determinó mediante pruebas t pareadas para ambas condiciones de estímulo: imágenes TRENDS y Navarasa (p < 0,001; Tabla 1, Figura 4, Tabla 2 y Figura 5).

Precisión diagnóstica del algoritmo FEA: El desempeño diagnóstico del algoritmo FEA se evaluó mediante análisis de la curva característica de operación del receptor (ROC), con valores del área bajo la curva (AUC) calculados para estados emocionales distintos (Tabla 3). El valor más alto de AUC se obtuvo para la puntuación del algoritmo FEA correspondiente al estado Shanta en respuesta a estímulos faciales neutros (AUC = 0,665), seguido por la emoción positiva de felicidad (AUC = 0,637) (Figura 6). La sensibilidad para emociones neutras y positivas (feliz, agradable) fue del 70–80 %, mientras que la sensibilidad para emociones negativas (ira, miedo, desagradable) fue del 60–70 %. Estos valores de sensibilidad son inferiores al 80 % y representan un desempeño discriminatorio modesto.

Correlación entre las puntuaciones del algoritmo de AEF y las puntuaciones del PHQ-9 y del GAD-7: No se observaron correlaciones significativas entre ninguna de las puntuaciones del algoritmo de AEF y las puntuaciones del PHQ-9 o del GAD-7.

DISPONIBILIDAD DE LOS DATOS:

Todos los datos brutos se proporcionan en el Archivo Suplementario 2.

figure-results-1
Figura 1: Diagrama esquemático del proceso de desarrollo del modelo del algoritmo de FEA. El esquema muestra el conjunto de datos de video interno de actores indios de ambos sexos sometidos a extracción de fotogramas y extracción de características en tres categorías: regiones de puntos faciales (incluyendo señales microexpresivas faciales y oculares derivadas de Natyashastra/Navarasa), información de la orientación de la cabeza y movimientos del torso superior, que se agrupan en un único vector de características y se transmiten a un clasificador de perceptrón multicapa (MLP). La salida del MLP se somete a un posprocesamiento exclusivo (suavizado temporal, normalización y agregación; cuadro naranja discontinuo) antes de generar la salida final de predicción de nueve categorías de Navarasa. Los cuadros azules sólidos indican pasos de procesamiento; los cuadros azules sombreados indican categorías de características; el cuadro naranja discontinuo indica un paso de procesamiento exclusivo cuyos parámetros internos no pueden revelarse. Dado que este es un esquema de proceso y no un gráfico de datos, las barras de error y las barras de escala no son aplicables. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Procedimiento del experimento con el algoritmo FEA. Diagrama de flujo que muestra las etapas secuenciales del protocolo experimental: evaluación clínica semiestructurada (PHQ-9, GAD-7); colocación del participante frente a la cámara, posicionada a la altura de los ojos y a una distancia de 60–70 cm del participante; grabación de una línea base de 60 s; el paradigma de imágenes emocionales TRENDS (20 imágenes distribuidas en cinco categorías emocionales; presentación del estímulo de 5 s e intervalo de respuesta de 10 s por imagen; 300 s en total); un breve período de descanso; y el paradigma de imágenes emocionales Navarasa (18 imágenes distribuidas en nueve categorías Navarasa; presentación del estímulo de 5 s e intervalo de respuesta de 10 s por imagen; 270 s en total). Las flechas indican la secuencia temporal de los procedimientos, desde la inscripción hasta la finalización de la adquisición de datos. Dado que se trata de un diagrama de flujo del proceso y no de una representación gráfica de datos, las barras de error y las barras de escala no son aplicables. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Cambio en series temporales de los puntajes del algoritmo FEA en respuesta a las imágenes emocionales correspondientes de TRENDS (T0 a T9 s). Cuatro paneles (A–D) muestran la trayectoria a nivel grupal, segundo a segundo, del puntaje del algoritmo FEA (eje y; unidades arbitrarias de puntaje generadas por el algoritmo de puntuación propietario) durante la ventana de 10 s posteriores al estímulo (eje x; T0 = puntaje en el momento de finalización del estímulo/línea base para ese ensayo, T1–T9 = cada segundo subsiguiente), para (A) el dominio Shanta tras imágenes neutras, (B) el dominio Haasya tras imágenes felices, (C) el dominio Bhayanaka tras imágenes de miedo y (D) el dominio Krodha tras imágenes de ira (n = 72 participantes por panel). Los puntos de datos/líneas representan las medias grupales en cada punto temporal; las barras de error/bandas sombreadas representan la desviación estándar (SD) entre los participantes. Las barras de escala no son aplicables a este formato de gráfico de líneas en series temporales. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 4: Gráfico de barras que muestra el cambio promedio en las puntuaciones del algoritmo FEA en respuesta a la visualización de imágenes emocionales TRENDS. Las barras representan el cambio promedio grupal en la puntuación del algoritmo FEA (Tmax −T0; eje y, unidades arbitrarias de puntuación) para cada una de las cuatro categorías emocionales mapeadas por TRENDS (Shanta/Neutral, Haasya/Alegre, Krodha/Ira, Bhayanaka/Miedo; eje x) (n = 72). Las barras de error representan la desviación estándar (DE) del puntaje de cambio dentro de cada categoría. Las cuatro categorías mostraron un cambio estadísticamente significativo respecto a la línea base mediante la prueba t pareada (p < 0,001; véase Tabla 1). Las barras de escala no son aplicables a este formato de gráfico de barras. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-5
Figura 5: Gráfico de barras que muestra el cambio promedio en las puntuaciones del algoritmo FEA en respuesta a la visualización de imágenes de emociones Navarasa. Las barras representan el cambio promedio grupal en la puntuación del algoritmo FEA (Tmax − T0; eje y, unidades de puntuación arbitrarias) para las tres categorías compuestas de Navarasa: neutral (Shanta), agradable (media de Haasya, Veera, Shringara, Adbhuta) y desagradable (media de Krodha, Vibhitsa, Bhayanaka, Karuna) (eje x) (n = 72). Las barras de error representan la desviación estándar (SD) del puntaje de cambio dentro de cada categoría. Las tres categorías mostraron un cambio estadísticamente significativo respecto a la línea base según la prueba t pareada (p < 0.001; véase Tabla 2). Las barras de escala no son aplicables a este formato de gráfico de barras. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-6
Figura 6: Curva característica de operación del receptor (ROC) que muestra la sensibilidad en diversos puntos de corte del puntaje Shanta del algoritmo FEA en respuesta a imágenes de emociones neutras. El eje Y representa la sensibilidad (tasa de verdaderos positivos, %) y el eje X representa 1 − especificidad (tasa de falsos positivos, %), graficados a lo largo del rango de valores posibles de corte del puntaje Shanta; la línea diagonal de referencia representa la discriminación al azar (AUC = 0,5). El área bajo la curva (AUC) = 0,665 (véase Tabla 3 para los valores de AUC, sensibilidad y especificidad de todas las categorías emocionales). Las barras de error y las barras de escala no son aplicables a este formato de curva. Haga clic aquí para ver una versión más grande de esta figura.

Emoción (estímulos TRENDS)Media T0Media TmaxDiferencia mediavalor p
Neutral – Shanta0.22610.26640.0403<0.001
Felicidad – Haasya0.08340.11270.0294<0.001
Miedo – Bhayanaka0.06480.08480.02<0.001
Ira – Raudra0.09010.11080.0207<0.001

Tabla 1: Valores medios de T0 y Tmax de las puntuaciones del algoritmo FEA en respuesta a la visualización de estímulos emocionales TRENDS. Para cada categoría emocional mapeada por TRENDS (Shanta/Neutral, Haasya/Alegre, Krodha/Ira, Bhayanaka/Miedo), la tabla muestra las puntuaciones medias del algoritmo FEA (± DE) en la línea base (T0) y en el máximo dentro del ensayo (Tmax), el cambio medio (Tmax − T0) y el resultado de la prueba t pareada (valor p) al comparar T0 y Tmax (n = 72). Todos los valores se reportan en unidades arbitrarias de puntuación del algoritmo FEA; se consideró estadísticamente significativo un p < 0,05.

Categoría emocional (estímulos Navarasa)Media T0Media TmaxDiferencia mediavalor p
Neutral – Shanta0.240.290.047<0.001
Agradable (Haasya, Veera, Shringara, Adbhuta)0.0340.0450.011<0.001
Desagradable (Krodha, Vibhitsa, Bhayanaka, Karuna)0.0540.0680.014<0.001

Tabla 2: Valores medios de T0 y Tmax de las puntuaciones del algoritmo FEA en respuesta a la presentación de estímulos emocionales Navarasa. Para cada categoría compuesta de Navarasa (neutral, agradable, desagradable), la tabla muestra las puntuaciones medias del algoritmo FEA (± DE) en el estado basal (T0) y en el máximo dentro del ensayo (Tmax), el cambio medio (Tmax − T0) y el resultado de la prueba t pareada (p-valor) que compara T0 y Tmax (n = 72). Todos los valores se expresan en unidades arbitrarias de puntuación del algoritmo FEA; se consideró estadísticamente significativo un p < 0,05.

Panel A: Estímulos TRENDS
Estímulos TRENDSAUCIC 95%Puntuación de corte Δ EmoscapeSensibilidad (%)Especificidad (%)
Neutral – Shanta0.6650.456–0.8730.06582.550
Felicidad – Haasya0.6370.493–0.7800.034570.746.2
Miedo – Bhayanaka0.5830.446–0.7210.01861.254.5
Ira – Raudra0.5320.374–0.6890.02367.345.5
Panel B: Estímulos Navarasa
Estímulos NavarasaAUCIC 95%Puntuación de corte Δ EmoscapeSensibilidad (%)Especificidad (%)
Shanta (Neutral)0.5960.412–0.7790.0385.744.6
Agradables (Haasya, Veera, Shringara, Adbhuta)0.5150.369–0.6600.01270.240
Desagradables (Krodha, Vibhitsa, Bhayanaka, Karuna)0.5650.384–0.7450.00767.838

Tabla 3: Área bajo la curva (AUC), sensibilidad y valores de especificidad para las puntuaciones del algoritmo FEA según categoría emocional. Para cada categoría emocional evaluada mediante análisis de característica operativa del receptor (ROC), la tabla muestra el AUC, la sensibilidad (%) y la especificidad (%). Se estableció previamente que una sensibilidad ≥ 80 % indicaba una buena capacidad discriminante; los valores por debajo de este umbral se clasificaron como moderados (véase Análisis estadístico).

Figura suplementaria 1: Matriz de confusión normalizada para el modelo de clasificación de emociones Navarasa de nueve clases. Las filas representan la clase de emoción verdadera (real) y las columnas representan la clase de emoción predicha por el modelo; los valores de las celdas indican la proporción de instancias de la clase real asignadas a cada clase predicha, normalizada a una escala de 0 a 1 (barra de color, derecha). Las etiquetas de clase (1–9) corresponden a las nueve categorías de emociones Navarasa; debido a restricciones de propiedad, no se divulga la correspondencia específica entre números y emociones. La precisión general de clasificación validada mediante validación cruzada en las nueve categorías fue del 96 %. Las barras de error no son aplicables a este formato de matriz.Haga clic aquí para descargar este archivo.

Archivo suplementario 1: Descripción del desarrollo del modelo del algoritmo de FEA (incluye métricas de validación interna, precisión con validación cruzada y matriz de confusión de los 9 × 9 Navarasa).Haga clic aquí para descargar este archivo.

Archivo suplementario 2: Archivo que contiene los datos brutos.Haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio buscó proporcionar una validación preliminar del algoritmo FEA mediante el examen de la concordancia entre las puntuaciones derivadas del algoritmo FEA y las respuestas a estímulos faciales estandarizados de emociones en voluntarios adultos sanos. Estos hallazgos iniciales indican que el algoritmo FEA muestra cambios estadísticamente detectables en respuesta a estímulos visuales que inducen emociones en diversas categorías emocionales discretas, incluyendo neutral (shanta), felicidad (haasya), miedo (bhayanaka) y enojo (raudra), así como clasificaciones más amplias de estados agradables y desagradables. Esto sugiere que las puntuaciones del algoritmo FEA son concordantes con las respuestas a tareas con estímulos emocionales.

Se observó que la sensibilidad del algoritmo FEA oscilaba entre el 70 % y el 80 % para emociones neutras o positivas y entre el 60 % y el 70 % para emociones negativas. Estos valores de sensibilidad son modestos para cualquier prueba destinada a utilizarse como medida de cribado12. En comparación, modelos más amplios basados en aprendizaje automático para la inferencia de emociones que utilizan marcadores neurofisiológicos, como la electroencefalografía (EEG), informan de exactitudes de clasificación de hasta el 90 %13. Un sistema de clasificación conjunta para la clasificación de emociones a partir de EEG y GSR en la detección del autismo ha mostrado una exactitud de detección del 99,97 %14. Sin embargo, estos modelos suelen ser más intensivos computacionalmente y requieren procesamiento fuera de línea. En contraste, una ventaja notable del algoritmo FEA radica en su enfoque en señales faciales y corporales observables, lo que permite su funcionamiento en tiempo real.

El procedimiento del algoritmo de AEF depende de varios factores operativos fundamentales para la calidad y fiabilidad de las grabaciones del algoritmo de AEF. Estos incluyen la posición de la cámara y la iluminación ambiental. Las grabaciones realizadas bajo iluminación ambiental inconsistente o baja pueden degradar significativamente la calidad de la extracción de características. La posición de la cabeza y del cuerpo debe mantenerse estable durante toda la sesión de grabación; por ello, se excluyeron a los participantes con movilidad restringida de cabeza o cuello. Es esencial minimizar la interferencia conductual durante la grabación. Los participantes se sentaron solos, con el investigador ausente de la habitación, para reducir los efectos de deseabilidad social y la autorregulación que podrían suprimir expresiones faciales naturalistas.

La incorporación del marco de trabajo Navarasa proporciona una clasificación culturalmente sensible de las emociones. El estudio aplicó un enfoque de teoría de la mente (ToM) para evaluar los cambios en las puntuaciones del algoritmo FEA en respuesta a estímulos emocionales. ToM representa una función cognitiva social de orden superior, y sus sustratos neurobiológicos han sido documentados en la literatura15, lo que respalda la viabilidad biológica de los cambios observados en las puntuaciones del algoritmo FEA.

No se encontró correlación entre las puntuaciones del algoritmo de AEF y las puntuaciones de depresión o ansiedad, lo que sugiere que los estados emocionales internos de los participantes probablemente no influyeron en las mediciones del algoritmo de AEF. Sin embargo, es difícil controlar completamente los estados emocionales de los participantes durante el experimento. Además, el procesamiento cognitivo descendente podría inhibir las respuestas emocionales naturales, particularmente en reacción a estímulos emocionales negativos. En estudios futuros se debería evaluar la experiencia subjetiva de los participantes al observar estímulos emocionales, ya que esto podría validar aún más si la observación pasiva induce efectivamente un estado emocional subjetivo. La sensibilidad moderada del algoritmo de AEF por sí solo podría potenciarse con datos neurofisiológicos adicionales, como el EEG, la variabilidad de la frecuencia cardíaca (HRV) o la respuesta galvánica de la piel (GSR). Esto debería evaluarse en futuros estudios de validación. La validación se realizó en una población adulta sana. La utilidad del algoritmo de AEF para evaluar estados emocionales subjetivos en condiciones clínicas como la depresión y la ansiedad requiere más investigación mediante estudios de casos y controles.

Varias limitaciones del presente estudio requieren reconocimiento. La naturaleza propietaria del algoritmo de FEA limita la transparencia de su canal de procesamiento. Específicamente, no puede revelarse el número exacto de actores/participantes, la identidad a nivel de actor/participante, los recuentos exactos de videos/grabaciones por actor, las definiciones exactas de características (índices de puntos de referencia e identificadores de puntos clave) ni los parámetros arquitectónicos detallados de la MLP (dimensiones precisas de las capas y recuentos de parámetros). Las métricas de validación interna (exactitud con validación cruzada del 96 %; validación independiente en >15.000 minutos de video) se informan en el material suplementario. Las etiquetas de clase que representan los nombres de emociones se han anonimizado debido a restricciones propietarias. Reconocemos que estas limitaciones dificultan la replicación independiente.

El estudio observó una concordancia entre el estímulo y los puntajes del algoritmo FEA y la precisión en el reconocimiento de emociones en adultos sanos, con una sensibilidad moderada para discriminar entre estados emocionales. Esto proporciona una validación preliminar del algoritmo FEA, un algoritmo propietario basado en aprendizaje automático (ML) que analiza micro-movimientos del torso superior y genera representaciones dinámicas de las trayectorias emocionales y puntajes agregados para cada uno de los nueve rasas, según el marco de Navarasa. Las futuras versiones del algoritmo deberían buscar mejorar su poder discriminatorio en todas las categorías emocionales mediante la incorporación de datos fisiológicos o contextuales adicionales. Se requiere más investigación para validar su uso en poblaciones clínicas más amplias.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El El algoritmo FEA es un algoritmo propietario de Nihilent Ltd., que proporcionó apoyo financiero a Manoshanti para realizar la recolección de datos de este estudio. Nihilent proporcionó las puntuaciones del algoritmo FEA. El análisis de los datos fue realizado independientemente por Manoshanti. Nihilent Ltd. no participó en el análisis de los datos.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Agradecemos a los profesores P. T. Sivakumar y al Dr. Shivarama Varambally por proporcionar supervisión científica para este estudio.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
EmoscapeNihilent Ltd, Pune1Desarrollador de Emoscape
Centros Manoshanti para el Bienestar EmocionalGNR Health Care Pvt Ltd.2Socio clínico e investigador
Herramienta para el reconocimiento de emociones en trastornos neuropsiquiátricoscopyright con el autor correspondiente del estudio3Herramienta utilizada para la validación en el estudio

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Garg N, Garg R, Anand A, Baths V. Decoding the neural signatures of valence and arousal from a portable EEG headset. Front Hum Neurosci. 2022;16:1051463. doi:10.3389/fnhum.2022.1051463.
  2. Wang XW, Nie D, Lu BL. Emotional state classification from EEG data using a machine learning approach. Neurocomputing. 2014;129:94–106.
  3. Giannakaki K, Giannakakis GA, Farmaki C, Sakkalis V. Emotional state recognition using advanced machine learning techniques on EEG data [conference paper]. Presented at: 2017 IEEE 30th International Symposium on Computer-Based Medical Systems; Thessaloniki, Greece; 2017. p. 333–6. Available from: https://ieeexplore.ieee.org/document/8104214
  4. Barzilay R, et al. Predicting affect classification in mental status examination using machine learning face action recognition system. Front Psychiatry. 2019;10:288. doi:10.3389/fpsyt.2019.00288.
  5. Houssein EH, Hammad A, Ali AA. Human emotion recognition from EEG-based brain-computer interface using machine learning. Neural Comput Appl. 2022;34:12527–52.
  6. Awan AW, et al. An ensemble learning method for emotion charting using multimodal physiological signals. Sensors (Basel). 2022;22(23):9480. doi:10.3390/s22239480.
  7. Shetty H, Sampathila N, Kumar GS, Behere R. Interactive self assessment tool for analysis of emotional status. Indian J Sci Technol. 2017;10(16):1–5.
  8. Bazgir O, Mohammadi Z, Habibi SAH. Emotion recognition with machine learning using EEG signals [conference paper]. Presented at: 2018 25th National and 3rd International Iranian Conference on Biomedical Engineering; Qom, Iran; 2018. p. 1–5. Available from: https://ieeexplore.ieee.org/document/8703559
  9. Spunt RP, Adolphs R. The neuroscience of understanding the emotions of others. Neurosci Lett. 2019;693:44–8.
  10. Hawco C, et al. Neural activity while imitating emotional faces is related to both lower and higher-level social cognitive performance. Sci Rep. 2017;7:1244. doi:10.1038/s41598-017-01316-z.
  11. Behere RV, et al. TRENDS: a tool for recognition of emotions in neuropsychiatric disorders. Indian J Psychol Med. 2008;30(1):32–8.
  12. Trevethan R. Sensitivity, specificity, and predictive values: foundations, pliabilities, and pitfalls in research and practice. Front Public Health. 2017;5:307. doi:10.3389/fpubh.2017.00307.
  13. Gkintoni E, Aroutzidis A, Antonopoulou H, Halkiopoulos C. From neural networks to emotional networks: a systematic review of EEG-based emotion recognition in cognitive neuroscience and real-world applications. Brain Sci. 2025;15(3):220. doi:10.3390/brainsci15030220.
  14. Joshi S, Srinivas LNB. An ensemble classifier for emotion classification from EEG and GSR signals for autism detection. Comput Methods Programs Biomed. 2025;270:108921. doi:10.1016/j.cmpb.2025.108921.
  15. Lincoln SH, et al. The neural basis of social cognition in typically developing children and its relationship to social functioning. Front Psychol. 2021;12:714176. doi:10.3389/fpsyg.2021.714176.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

An lisis de expresiones facialesAlgoritmo de aprendizaje autom ticoMarco de trabajo NavarasaReconocimiento de emocionesAn lisis de micromovimientosCurva caracter stica operativa del receptorEst mulos emocionalesSensibilidad y especificidad
Video próximamente

Artículos relacionados