$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El protocolo del estudio fue aprobado por el Sushruta Hospitals Ethics Committee, Hubballi, Karnataka, India (EC registration number: ECR/372/INST/KA/2013/RR-19), y se obtuvo el consentimiento informado por escrito de todos los participantes antes de su inscripción.
El algoritmo FEA es un método basado en aprendizaje automático (ML) de propiedad exclusiva para el análisis en tiempo real de microexpresiones faciales y movimientos del torso superior, con el fin de inferir estados emocionales utilizando el marco teórico de Navarasa. El marco de Navarasa, derivado de la teoría estética clásica india, define nueve emociones primarias: shringara (amor), haasya (alegría), karuna (tristeza/pena), adbhuta (sorpresa), shanta (paz), raudra (ira), veera (valentía), bhayanaka (miedo) y vibhitsa (asco). El algoritmo FEA utiliza un modelo de aprendizaje automático entrenado con microexpresiones faciales y movimientos del torso superior extraídos de imágenes de actores que representan las nueve emociones de Navarasa. El algoritmo infiere el estado emocional de un individuo analizando dinámicas faciales sutiles y micromovimientos a partir de entradas visuales capturadas por una única cámara RGB, y genera puntuaciones cuantitativas para cada una de las nueve emociones primarias. Esta configuración no invasiva permite una evaluación emocional discreta y naturalista, lo que la hace adecuada para una amplia variedad de entornos de investigación y aplicaciones prácticas.
Desarrollo del modelo
El algoritmo FEA se basa en una arquitectura de red neuronal (NN). El conjunto de datos de entrenamiento fue recopilado internamente y consta de varias horas de datos de video grabados de actores indios representando las nueve emociones Navarasa. El conjunto de datos se derivó de grabaciones en video controladas de varios actores/participantes, con múltiples grabaciones/pruebas realizadas para cada actor/participante en diferentes estados emocionales inducidos. Tras el preprocesamiento, que incluyó la detección de puntos característicos faciales, verificaciones de consistencia temporal, filtrado de calidad y eliminación de fotogramas inutilizables o de baja confianza, se conservaron aproximadamente 25.000 muestras estructuradas para el entrenamiento. Durante la curación del conjunto de datos, las grabaciones se estratificaron según más de diez parámetros demográficos y relacionados con la grabación, incluyendo edad, sexo y otros atributos relevantes, y se equilibraron intencionadamente para lograr una representación equitativa a través de estos parámetros y minimizar el sesgo demográfico. La distribución por sexo se mantuvo aproximadamente en 52 % hombres y 48 % mujeres. Los participantes abarcaron ampliamente los grupos de edad adolescentes y adultos, con representación en los grupos de adultos jóvenes, adultos de mediana edad y adultos mayores. Los actores/participantes residían en la India y representaban diversos orígenes regionales y culturales indios, así como múltiples etnias internacionales presentes en la India. Debido a restricciones de propiedad, no puede revelarse el número exacto de actores/participantes, la identidad a nivel de actor/participante, el número exacto de videos/grabaciones por actor, los recuentos precisos de fotogramas ni la metodología interna de anotación, ya que estos elementos forman parte del conjunto de datos propietario y de la propiedad intelectual del desarrollo de modelos de Nihilent Ltd.; esta limitación se reconoce explícitamente en la sección de Discusión.
Las imágenes faciales extraídas de estas grabaciones se procesaron mediante técnicas de procesamiento de imágenes para derivar características cuantitativas, que posteriormente se utilizaron como entradas para una red neuronal con fines de predicción. Este modelo se evaluó luego en una población objetivo, y las conclusiones obtenidas se emplearon para refinar de forma iterativa las versiones posteriores. Este ciclo de desarrollo, prueba y mejora se repitió hasta que el rendimiento del modelo se estabilizó. El modelo predictivo final se implementa como un perceptrón multicapa (MLP) que consta de una capa de entrada con aproximadamente 300 características seleccionadas, capas ocultas y una capa de salida que produce un vector de puntuación de nueve dimensiones correspondiente a las nueve categorías emocionales de Navarasa. Inicialmente se derivaron más de 700 características a partir de los datos capturados y posteriormente se redujeron mediante procedimientos de selección de características y optimización del modelo. La puntuación de salida del MLP se transmite entonces a algoritmos propietarios de postprocesamiento para obtener las puntuaciones finales agregadas del algoritmo FEA. Otros detalles arquitectónicos, incluido el número exacto de parámetros entrenables y las dimensiones específicas de las capas, son propiedad exclusiva y no pueden divulgarse; esto se reconoce como una limitación del presente informe. En el material suplementario se proporciona una descripción detallada del desarrollo del modelo (Supplementary File 1 y Supplementary Figure 1).
Durante el desarrollo iterativo, se evaluó el rendimiento del modelo mediante validación cruzada en el conjunto de datos interno, alcanzando una precisión de clasificación del 96 % validada mediante cruzada en las nueve categorías de Navarasa. Posteriormente, se realizó una validación independiente con más de 15.000 min de datos de video. En el material suplementario se proporciona una matriz de confusión normalizada de 9 × 9 que resume el rendimiento de clasificación en las nueve categorías de Navarasa (Archivo Suplementario 1).
Tras la estabilización, el modelo fue sometido a una validación interna controlada bajo supervisión experta. Este enfoque destaca la validación empírica mediante pruebas directas en sujetos humanos, lo que permite evaluar la aplicabilidad y robustez en poblaciones diversas. El desarrollo del modelo se resume en la Figura 1.
El Cuestionario de Salud del Paciente-9 (PHQ-9) y la escala del Trastorno de Ansiedad Generalizada-7 (GAD-7): Los participantes completaron cuestionarios de autorreporte bajo la supervisión de un psicólogo capacitado para evaluar sus estados emocionales actuales. Los instrumentos aplicados incluyeron el Cuestionario de Salud del Paciente-9 (PHQ-9) y la escala del Trastorno de Ansiedad Generalizada-7 (GAD-7). Se consideró clínicamente significativo un puntaje superior a 9 en cualquiera de las dos escalas.
TENDENCIAS
La Herramienta para el Reconocimiento de Emociones en Trastornos Neuropsiquiátricos (TRENDS) es un instrumento validado culturalmente y sensible al contexto ecológico, diseñado para evaluar las capacidades de reconocimiento de emociones faciales11. Ha sido validado para su uso en poblaciones indias y consta de 40 fotografías de actores que representan las emociones básicas universales de neutralidad, felicidad, miedo, ira y tristeza. Las imágenes de TRENDS se utilizaron como estímulos de referencia para validar las salidas de clasificación de emociones del algoritmo FEA.
Diseño experimental
El experimento fue diseñado para provocar una respuesta algorítmica ante estímulos emocionales. Se desarrollaron y utilizaron dos paradigmas de inducción emocional para este estudio.
Paradigma de imágenes TRENDS
En el primer paradigma, una secuencia de video presentó inicialmente una pantalla en blanco durante 60 s, seguida por la presentación de estímulos emocionales. Los estímulos emocionales se seleccionaron de la herramienta TRENDS. Se presentaron un total de 20 imágenes, representando neutralidad, felicidad, tristeza, ira y miedo × dos géneros × dos grupos de edad. Cada estímulo se mostró durante 5 s. El tiempo total de presentación de estímulos fue por tanto 20 × 5 s, con un intervalo adicional de 10 s de pantalla en blanco entre imágenes consecutivas, lo que resultó en una duración total de 300 s. Durante cada intervalo de 10 s en blanco, los participantes debían identificar la emoción representada en la imagen anterior seleccionando una de las cinco etiquetas emocionales mostradas en la pantalla.
Paradigma Navarasa
Se construyó un segundo paradigma de video análogo basado en el marco de las nueve rasas de Navarasa. Se presentaron un total de 18 imágenes (nueve emociones × dos géneros). Cada estímulo se mostró durante 5 s, con una pantalla en blanco de 10 s entre imágenes, lo que dio una duración total de 270 s. Las nueve emociones se clasificaron como neutrales (shanta), agradables (haasya, veera, shringara, adbhuta) o desagradables (Krodha, vibhitsa, bhayanaka, karuna). Durante cada intervalo en blanco de 10 s, los participantes debían clasificar la emoción mostrada en la imagen anterior seleccionando una de tres opciones presentadas en la pantalla: neutral, agradable o desagradable. Las nueve Navaras se agruparon en tres categorías para facilitar el registro de las respuestas de los participantes a la identificación emocional.
Participantes
Se reclutaron voluntarios adultos sanos de entornos laborales e instituciones educativas. Los criterios de inclusión comprendieron individuos de entre 18 y 50 años de edad, de cualquier sexo/género. Los criterios de exclusión incluyeron antecedentes de trastornos psiquiátricos diagnosticados, trastornos neurológicos, discapacidad visual significativa o discapacidades físicas que restringieran los movimientos de la cabeza y el cuello.
Procedimiento
Los participantes se sentaron de manera que la cámara quedara a la altura de los ojos y a una distancia de 60–70 cm. En el estudio se utilizó el algoritmo FEA. Se abrió la aplicación en la computadora portátil y el investigador ingresó el ID del sujeto. Durante todo el experimento, el algoritmo FEA grabó continuamente datos de video para permitir el análisis posterior de expresiones faciales y micro-movimientos. Inicialmente, se obtuvo una grabación basal de 60 s, durante la cual se instruyó a los participantes a relajarse y abstenerse de comportamientos expresivos evidentes. Tras la adquisición del registro basal, los participantes fueron expuestos a los dos paradigmas de video (imágenes de TRENDS seguidas por Navarasa). Todos los participantes vieron los paradigmas en el mismo orden fijo para minimizar posibles efectos de confusión relacionados con la secuencia de presentación; sin embargo, este orden fijo podría haber introducido efectos de orden. Durante las sesiones de grabación, el investigador permaneció fuera de la habitación para reducir distracciones. El investigador supervisó el experimento de forma remota mediante una aplicación móvil mientras estaba fuera de la habitación. Se ofreció a los participantes un breve intervalo de descanso entre los dos paradigmas (Figura 2).
Análisis
Los datos recopilados se asociaron al ID del sujeto ingresado en la aplicación para garantizar la fidelidad de los datos. El algoritmo de FEA utiliza una canalización computacional estructurada y de extremo a extremo para la inferencia automática de emociones, compuesta por cinco etapas principales: adquisición de video, detección y extracción de características, preprocesamiento de datos, clasificación de emociones e interpretación de resultados. Las características extraídas pasaron por una serie de operaciones de preprocesamiento, incluida la reducción de ruido, la normalización entre sujetos y condiciones de iluminación, y la interpolación de fotogramas faltantes. Se aplicó un suavizado temporal para mejorar la estabilidad de la señal. Los vectores de características resultantes se alinearon temporalmente para su posterior procesamiento por parte del modelo de clasificación. Estas matrices de características alineadas en el tiempo y libres de ruido sirvieron como entradas para el componente de clasificación de emociones.
Extracción de características
El marco de extracción emplea una tubería algorítmica de múltiples etapas de extracción de características que traduce secuencias de imágenes estándar en video monocular 2D a un espacio de coordenadas 3D reconstruido. En lugar de basarse en el seguimiento directo de píxeles 2D, el sistema mapea coordenadas espaciales localizadas a través del rostro y la parte superior del cuerpo. Las características derivadas se dividen en tres categorías amplias: (i) regiones de puntos característicos faciales, que comprenden descriptores geométricos de la estructura y dinámica facial (incluyendo indicadores de la zona ocular y correlatos de microexpresiones faciales extraídos del marco Navarasa, basado en el Natyashastra, el marco formalizado más antiguo de la expresión emocional humana, reconocido por la UNESCO); (ii) información de la postura de la cabeza, que capta la orientación y el movimiento del cráneo; y (iii) características del movimiento de la parte superior del cuerpo, que registran el movimiento resultante de la región torácica. Las definiciones específicas de las características, incluyendo índices precisos de puntos característicos e identificadores clave, son propiedad exclusiva y no pueden revelarse completamente; esta limitación se reconoce expresamente. El sistema no utiliza directamente las etiquetas de unidades de acción del Sistema de Codificación de Acciones Faciales (FACS); en cambio, deriva características geométricas y temporales a partir del movimiento facial y corporal. Estas transformaciones espaciales 3D se agrupan a lo largo del tiempo para generar un vector resumen conductual integral, que sirve como entrada al clasificador MLP. En total, inicialmente se derivaron más de 700 características candidatas a partir de los datos capturados, que posteriormente se redujeron a aproximadamente 300 características seleccionadas mediante selección de características y optimización del modelo. La tubería estructural avanza desde la adquisición de video hasta la reconstrucción espacial 2D-a-3D, la agregación temporal y la normalización de características antes de la clasificación.
Modelo de clasificación de emociones
Los vectores de características preprocesados se proporcionaron a una arquitectura de red neuronal perceptrón multicapa (MLP) supervisada, entrenada con el conjunto de datos anotado internamente que corresponde a las nueve categorías emocionales de Navarasa: Śṛṅgāra (amor), Hāsya (alegría), Karuṇā (tristeza), Raudra (ira), Vīra (valentía), Bhayānaka (miedo), Bībhatsa (asco), Adbhuta (asombro) y Śānta (paz). El modelo fue diseñado explícitamente para capturar dependencias espacio-temporales en los datos conductuales expresivos. En cada paso temporal, la arquitectura generó un vector de intensidades emocionales predichas para las nueve categorías.
Postprocesamiento de las salidas del modelo
Las salidas brutas del modelo se procesaron posteriormente para producir puntuaciones de emoción estables e interpretables. Se aplicaron tres operaciones secuenciales: (i) suavizado temporal para reducir las fluctuaciones a corto plazo, (ii) normalización para garantizar la comparabilidad a lo largo del tiempo y entre dimensiones emocionales, y (iii) agregación para derivar medidas resumidas en ventanas temporales específicas o en secuencias completas. Los procedimientos de postprocesamiento aseguran la comparabilidad entre sujetos y controlan la variación basal interindividual.
Interpretación y visualización de los resultados
El algoritmo FEA genera representaciones cuantitativas y visuales de las dinámicas emocionales inferidas a partir de datos de video. Las dos formas principales de salida son las trayectorias emocionales temporales. Los valores de intensidad emocional se visualizan como gráficos de series temporales que muestran la evolución de cada emoción a lo largo del video. Esta representación ofrece una vista continua de la variación afectiva, facilitando el examen de cambios transitorios, activaciones máximas y fases de recuperación o desescalamiento en la activación emocional. Puntuaciones emocionales comparativas: Los valores agregados de emoción para cada una de las nueve categorías Navarasa se muestran como gráficos de puntuaciones comparativas, que ilustran la magnitud relativa de cada emoción a lo largo del intervalo analizado. Estas visualizaciones comparativas permiten comparaciones directas entre emociones y proporcionan un resumen conciso del perfil afectivo general. Las puntuaciones del algoritmo FEA generadas en la línea base se examinaron en busca de trazos planos o ausencia de cambios significativos, lo cual indicaría una grabación inadecuada.
Análisis estadístico
Los puntajes para los nueve dominios emocionales de Navarasa, generados por el algoritmo FEA durante el intervalo de 10 s posterior a cada presentación de imagen en el paradigma, se consideraron variables de resultado. El algoritmo FEA generó puntajes para cada s en la ventana de 10 s (T0, T1, T2… T9). El puntaje del algoritmo FEA en T0 se consideró el puntaje basal. El puntaje más alto del algoritmo FEA entre las grabaciones de T1–T9 se definió como Tmax. Se calculó el cambio en el puntaje del algoritmo FEA respecto al valor basal (Tmax − T0) y se utilizó como variable de resultado en los análisis. El cambio en los puntajes del algoritmo FEA a lo largo de la serie temporal para cada emoción se muestra en Figura 3A–D.
Para las imágenes de TRENDS, las categorías correspondientes de emociones objetivo se asignaron de la siguiente manera: Shanta > Neutral; Haasya > Feliz; Krodha > Ira; y Bhayanaka > Miedo. Para las imágenes de Navarasa, las puntuaciones del algoritmo FEA se agruparon y promediaron en tres categorías compuestas: neutral (Shanta), agradable (Haasya, Veera, Shringara, Adbhuta) y desagradable (Krodha, Vibhitsa, Bhayanaka, Karuna).
Se realizaron análisis a nivel del grupo y a nivel individual.
Análisis a nivel de grupo: Para cada categoría emocional descrita anteriormente, se comparó el cambio en la puntuación del algoritmo FEA desde la línea base hasta Tmax utilizando pruebas t pareadas. Un cambio significativo desde la línea base en la puntuación del algoritmo FEA indicaría una buena concordancia con el reconocimiento de emociones. Sin embargo, una diferencia significativa no indicaría necesariamente una alta precisión en la clasificación.
Análisis a nivel del sujeto: Cualquier aumento en la puntuación del dominio emocional de un algoritmo FEA por encima del valor basal se clasificó como una respuesta emocional positiva. Luego se calcularon índices de precisión: sensibilidad y especificidad. La sensibilidad y la especificidad cuantifican, respectivamente, la probabilidad de que la prueba sea positiva cuando la condición objetivo está presente (+) y negativa cuando está ausente (−). Cuando ambas estimaciones se acercan a 1, la prueba tiene un buen desempeño en términos de precisión diagnóstica. La sensibilidad y especificidad estimadas se definieron como las proporciones de participantes con y sin la condición de referencia (expresiones Navarasa), respectivamente, que fueron clasificados correctamente.
Se consideró que un sujeto presentaba la condición objetivo (+) si identificaba correctamente al menos el 75 % de las emociones representadas. Esta clasificación se basó en estudios de validación de TRENDS, en los cuales una precisión del 60 % al 80 % se consideró una validez discriminante adecuada. Se realizó un análisis de característica operativa del receptor (ROC) para un predictor continuo con el fin de estimar el área bajo la curva (AUC) y los valores correspondientes de sensibilidad y especificidad. Una sensibilidad superior al 80 % se consideró una buena capacidad discriminativa, y por debajo del 80 % se consideró moderada.