$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il lavoro proposto mira a migliorare la progettazione dell'interazione intelligente offrendo un framework interpretabile per la mappatura visiva di caratteristiche emotive multimodali. I database CH-SIMS e CMU-MOSEI, accessibili al pubblico, sono stati utilizzati in questo lavoro. Entrambi i dataset sono stati ottenuti dalle loro fonti ufficiali e impiegati nel rispetto delle linee guida d'uso, degli standard di ricerca e dei termini di licenza stabiliti dai rispettivi creatori. Il contenuto multimodale dei dataset, comprensivo di dati testuali, audio e video, è stato inizialmente raccolto e annotato dai fornitori dei dataset secondo le autorizzazioni rilasciate dai partecipanti e i protocolli di raccolta dati. Non è stata prevista alcuna interazione diretta con esseri umani, né il reclutamento di nuovi partecipanti, né la raccolta di informazioni personalmente identificabili in questo studio. Tutte le analisi sono state condotte utilizzando dataset di ricerca pubblicamente disponibili. Di conseguenza, la nostra analisi secondaria dei dati non ha richiesto ulteriore approvazione etica né revisione da parte di un comitato etico istituzionale (IRB). Lo studio è stato condotto nel rispetto delle norme istituzionali appropriate che regolano l'uso di dataset pubblicamente disponibili, le procedure di ricerca etica e le politiche applicabili in materia di utilizzo dei dati.
È stato impiegato un meccanismo di attenzione cross-modale basato su grafi per apprendere caratterizzazioni emotive attraverso diverse modalità, utilizzando caratteristiche specifiche per l'emozione o per la modalità al fine di migliorare la comprensione. Un componente di mappatura visiva multivista viene utilizzato per potenziare la progettazione interattiva in tempo reale sensibile alle emozioni, e la sua efficienza viene stimata per il riconoscimento emotivo. I risultati mostrano che il metodo proposto migliora sia l'interpretabilità che l'efficienza per interfacce utente intelligenti sensibili alle emozioni nel mondo reale. Figura 1 mostra il flusso architetturale del lavoro proposto. Figura 1 illustra il flusso di lavoro completo del framework di mappatura visiva suggerito per l'apprendimento di caratteristiche emotive multimodali nel contesto di sistemi di interazione intelligente. Il flusso inizia con tre modalità di ingresso sincronizzate, ovvero testo, audio e video, che acquisiscono informazioni emotive complementari rispettivamente dalle modalità linguistica, prosodica ed espressione facciale. Un codificatore transformer specifico per ciascuna modalità elabora ogni segnale per ottenere rappresentazioni di alto livello dei dati grezzi in ingresso. Le rappresentazioni vengono quindi inviate a un modulo di apprendimento di rappresentazioni disinnescate, nel quale gli embedding specifici per l'emozione vengono separati dalle caratteristiche specifiche della modalità, garantendo coerenza nelle emozioni apprese attraverso fonti di dati eterogenee. Gli embedding specifici per l'emozione di ciascuna modalità vengono quindi aggregati da una rete di attenzione cross-modale basata su grafi, che modella le dipendenze emotive inter-modalità e assegna pesi dinamici di importanza a ciascuna modalità in base al contesto d'interazione. Infine, il framework fornisce sia output di classificazione emotiva sia informazioni sull'interazione, facilitando decisioni trasparenti sensibili alle emozioni e una progettazione adattiva di interazioni intelligenti.
Acquisizione di dati multimodali
I dataset CH-SIMS e CMU-MOSEI sono due dataset multimodali esistenti di pubblico dominio che hanno raccolto informazioni multimodali, come video, audio e testo sincronizzati. Il dataset CH-SIMS comprende esami multimodali di persone cinesi, inclusi 2.281 segmenti video, derivati da numerosi segmenti provenienti da film, serie televisive e programmi di varietà. L'aggiunta di audio e testo corrispondenti a questi segmenti video rende più interessanti e fattibili gli studi sull'analisi multimodale delle emozioni utilizzando dati multimodali. Tuttavia, uno dei più grandi dataset multimodali per l'esame di opinioni, sentimenti ed emozioni è il dataset CMU-MOSEI, raccolto da oltre 23.000 clip video di frasi pronunciate da oltre 1.000 oratori su una varietà di argomenti. Il dataset è stato suddiviso casualmente in sottoinsiemi di training (70%), validazione (15%) e test (15%), preservando la distribuzione delle classi.
Trascrizioni testuali, segnali audio e fotogrammi video vengono acquisiti e allineati temporalmente in modo da corrispondere a un livello temporale fine. L'integrazione a livello di fotogramma garantisce che i meccanismi proposti di apprendimento della rappresentazione e di fusione basata su grafi possano modellare e sfruttare congiuntamente il contenuto emotivo derivante da espressioni visive, toni vocali e contenuti linguistici. L'estrazione efficace delle dinamiche emotive intermodali è resa possibile da questa tipologia di tecnica di acquisizione multimodale, fondamentale per la progettazione di interazioni intelligenti e per una mappatura visiva comprensibile.
Tabella 1 presenta le strutture principali dei dataset multimodali sulle emozioni utilizzati nel metodo proposto. Per ottenere un ventaglio più ampio di sentimenti correlati, come parole parlate, intonazioni vocali ed espressioni facciali, CH-SIMS e CMU-MOSEI integrano modalità video, audio e testo provenienti da questi dataset. Inoltre, il numero di campioni disponibili in CH-SIMS è limitato, consentendo un'analisi approfondita delle interazioni tra le modalità e delle variazioni emotive in ambito cinese. D'altra parte, il dataset CMU-MOSEI riveste un'importanza maggiore per la valutazione della robustezza degli algoritmi di apprendimento delle rappresentazioni e delle tecniche di visualizzazione trattati in questo lavoro, poiché comprende una grande quantità di dati in diverse lingue, soggetti e livelli emotivi annotati. In aggiunta, rispetto alle ricerche precedenti, riduce le difficoltà nella selezione delle informazioni durante i test dei modelli.
Preelaborazione e sincronizzazione multimodali
Le annotazioni temporali provenienti dai dataset CH-SIMS e CMU-MOSEI sono state utilizzate per sincronizzare le modalità testuale, uditiva e visiva, garantendo un apprendimento coerente della rappresentazione multimodale. Ogni enunciato ha funzionato come unità fondamentale di analisi ed è stato associato ai corrispondenti segmenti audio e video appartenenti allo stesso intervallo temporale. L'allineamento è stato effettuato a livello di enunciato. La trascrizione è stata suddivisa in segmenti in base ai timestamp di inizio e fine di ciascun enunciato. La corrispondenza tra trascrizione, audio e video è stata stabilita estraendo i fotogrammi video e i segnali audio compresi nello stesso intervallo temporale. Mentre i segmenti audio sono stati elaborati utilizzando Wav2Vec 2.0 per produrre rappresentazioni acustiche, i fotogrammi visivi del segmento video sono stati campionati a una frequenza predeterminata ed elaborati tramite il Vision Transformer (ViT). L'encoder RoBERTa è stato impiegato per generare embedding testuali a partire dalle trascrizioni degli enunciati. La sincronizzazione temporale è stata ottenuta allineando tutte le caratteristiche delle modalità a un unico confine dell'enunciato, poiché le tre modalità generavano sequenze di caratteristiche di lunghezza diversa. È stato adottato un formato di lunghezza fissa per normalizzare le sequenze di lunghezza variabile. Le sequenze più lunghe sono state troncate alla lunghezza massima consentita, mentre quelle più brevi sono state completate con zeri (zero-padded). Durante l'addestramento, sono state utilizzate maschere di attenzione per distinguere gli elementi aggiunti tramite padding dalle posizioni effettive delle caratteristiche. Gli embedding specifici per ogni modalità sono stati proiettati in uno spazio latente comune prima della fusione, al fine di superare le differenze di lunghezza delle sequenze tra le modalità. Ciò ha garantito coerenza dimensionale e ha permesso al meccanismo di attenzione basato su grafi di favorire un efficace apprendimento dell'interazione incrociata tra modalità. Per preservare la qualità dei dati e l'integrità della sincronizzazione, sono stati esclusi dagli studi i campioni contenenti file corrotti, annotazioni mancanti o informazioni incomplete per una o più modalità.
Estrazione di caratteristiche basata su Transformer
Un metodo di deep learning viene utilizzato per apprendere rappresentazioni di caratteristiche di alto livello consapevoli delle emozioni a partire da informazioni provenienti da più modalità, come visione, audio e testo, in modo end-to-end, dopo l'allineamento dei dati multimodali e ogni preelaborazione necessaria. Utilizzando un encoder transformer per apprendere rappresentazioni di caratteristiche intrinsecamente discriminative direttamente dai dati multimodali grezzi, il metodo proposto elimina la necessità di ingegneria delle caratteristiche. Per favorire la coerenza tra i diversi dataset utilizzati nell'approccio proposto, viene appresa un'incorporazione (embedding) di dimensione fissa per ciascuna modalità. Ad esempio, vengono appresi embedding caratteristici di dimensione 768 per ciascuna delle singole modalità, inclusa l'immagine, l'audio e il testo, formando complessivamente uno spazio unificato di caratteristiche utilizzato in tutto l'approccio, in particolare un approccio di estrazione delle caratteristiche applicato al dataset CH-SIMS proposto e al dataset CMU-MOSEI per apprendere caratteristiche di alto livello da dati di dimensioni variabili.
Modalità visiva: Vision transformer per incorporamenti di frame consapevoli delle emozioni
È stato utilizzato un modello Vision Transformer (ViT-Base) per estrarre informazioni visive dai fotogrammi video al fine di ottenere rappresentazioni spaziali rilevanti per le emozioni. Prima dell'estrazione delle caratteristiche, i fotogrammi di ciascun segmento video sono stati ridimensionati a (224 × 224) pixel e campionati a intervalli temporali regolari. Utilizzando una dimensione di patch di 16 × 16 pixel, l'architettura ViT-Base produce una serie di token visivi che vengono elaborati da 12 strati encoder transformer. Le rappresentazioni a livello di fotogramma recuperate sono state proiettate in uno spazio di embedding a 768 dimensioni mediante un modello ViT preaddestrato utilizzato come backbone visivo. Gli embedding a livello di fotogramma sono stati aggregati mediante mean pooling per creare la rappresentazione visiva finale di ciascun segmento. Durante l'addestramento, sono state applicate normalizzazione delle immagini e comuni tecniche di aumento, come il ritaglio casuale e il ribaltamento orizzontale, per migliorare la capacità di generalizzazione. Successivamente, il framework proposto di fusione multimodale è stato utilizzato per combinare questi embedding visivi con rappresentazioni testuali e uditive.
Per mantenere la dinamica temporale delle emozioni, i campioni video dei dataset CH-SIMS e CMU-MOSEI verranno sottoposti a campionamento uniforme per la modalità visiva. I fotogrammi di ciascun video,
, possono essere suddivisi in N sezioni di dimensione fissa, che vengono quindi appiattite e trasferite inversamente in uno spazio di incorporamento latente con dimensione
. Viene creata una serie aggiungendo incorporamenti posizionali e un token di raggruppamento apprendibile:
(1)
dove
rappresenta la codifica posizionale e
è la matrice di incorporamento delle patch.
Vengono utilizzati strati di encoder transformer sovrapposti, composti da reti feed-forward e da auto-attenzione multi-testa, per elaborare la sequenza di patch incorporata. La trasformazione allo strato l è descritta come:
(2)
(3)
Per ottenere il vettore di caratteristiche visive consapevole delle emozioni, l'output equivalente al token di classe viene estratto come vettore di caratteristiche
. Per affrontare rappresentazioni visive delle emozioni coerenti nonostante le differenze linguistiche e di contenuto tra i diversi dataset, gli embedding a livello di fotogramma di ciascun segmento video vengono combinati per catturare le espressioni facciali e l'evoluzione delle emozioni.
Modalità audio utilizzando Wav2Vec 2.0 per embedding acustici prosodici e semantici Gli embedding vocali contestualizzati sono stati prodotti utilizzando un codificatore Wav2Vec 2.0 preaddestrato come base acustica. Un vettore di caratteristiche acustiche di lunghezza fissa per ogni frase è stato ottenuto aggregando le rappresentazioni nascoste in uscita mediante media pooling. Il modello Wav2Vec 2.0 è stato utilizzato per estrarre rappresentazioni acustiche dai segnali audio al fine di catturare caratteristiche vocali contestuali e rilevanti per l'emozione. Prima dell'estrazione delle caratteristiche, le registrazioni audio sono state normalizzate e ricampionate a 16 kHz. Per garantire la sincronizzazione tra le modalità testuale e visiva, ogni segmento audio a livello di enunciato è stato isolato utilizzando i limiti temporali forniti dalle annotazioni del dataset. Il codificatore acustico preaddestrato è stato adattato durante l'addestramento del modello per migliorare l'adattamento specifico al compito, consentendo alle rappresentazioni derivate di rappresentare in modo più accurato gli aspetti emotivi dei segnali vocali. Successivamente, sono state eseguite la fusione dell'attenzione multimodale basata su grafi e l'apprendimento di rappresentazioni disincagliate utilizzando gli embedding audio finali.
Nella modalità audio, Wav2Vec-2.0 viene utilizzato per modellare i segnali vocali derivati dalle informazioni vocali iniziali nei dataset CH-SIMS e CMU-MOSEI, estraendo direttamente caratteristiche audio relative all'emozione. È presente una codifica delle caratteristiche convoluzionali per ogni segnale vocale in ingresso
:
(4)
dove Z indica tratti prosodici di basso livello come melodia, tono ed energia. Una rete contestuale basata su transformer è utile per le strutture sopra menzionate, in quanto rappresenta dipendenze temporali a lungo raggio:
(5)
I dati acustici prosodici e semantici, essenziali per esprimere le emozioni, sono inclusi in queste rappresentazioni acustiche contestuali. Un'incorporazione audio di lunghezza specifica viene creata eseguendo una procedura di pooling temporale:
(6)
La progettazione evita l'uso di caratteristiche acustiche come gli MFCC e raggiunge robustezza estraendo semplicemente rappresentazioni dalle forme d'onda, utilizzando dati vocali in inglese da CMU-MOSEI e dati vocali in cinese da CH-SIMS.
Modalità testuale mediante RoBERTa per incorporamenti contestuali delle emozioni
Per la modalità testuale, il trasformatore bidirezionale profondo RoBERTa viene applicato alle trascrizioni vocali dei due set di dati per generare semantica contestuale e significato affettivo. Gli encoder trasformatori basati su RoBERTa sono stati utilizzati per estrarre rappresentazioni testuali dai dati delle trascrizioni al fine di catturare informazioni semantiche contestuali ed emozionali. È stato utilizzato un modello RoBERTa preaddestrato per il dataset CMU-MOSEI in lingua inglese, mentre per il dataset cinese CH-SIMS è stata impiegata una variante cinese di RoBERTa, per tenere meglio conto delle caratteristiche linguistiche specifiche della lingua. La pre-elaborazione del testo ha incluso la tokenizzazione mediante il tokenizer RoBERTa appropriato per ciascuna lingua e la normalizzazione del testo. Per garantire un'elaborazione coerente per batch, le sequenze di input sono state convertite in embedding di token e successivamente riempite o tagliate fino a una lunghezza massima predeterminata. In conformità con il formato di input di RoBERTa, sono stati introdotti token speciali di classificazione e di separazione. Un embedding testuale di lunghezza fissa è stato ottenuto aggregando le rappresentazioni contestualizzate dei token prodotte dall'encoder trasformatore, utilizzando la rappresentazione finale della frase equivalente al [CLS]. Per adattare le rappresentazioni apprese al compito di riconoscimento delle emozioni, gli encoder RoBERTa preaddestrati sono stati perfezionati attraverso un addestramento multimodale. Successivamente, il framework proposto di fusione multimodale è stato utilizzato per unire gli embedding testuali con le caratteristiche audio e visive.
Gli embedding dei token e le codifiche posizionali possono essere combinati per ogni input suddiviso in token,
, al fine di creare la rappresentazione dell'input nella tecnica di trasformazione profonda bidirezionale nota come
(7)
Questa forma è rappresentata attraverso i livelli del trasformatore L, che utilizza l'auto-attenzione per scoprire le dipendenze contestuali tra le parole:
(8)
L'incorporamento contestuale dell'emozione si ottiene utilizzando lo stato nascosto finale del token di classificazione:
(9)
Polarità del sentiment, emozioni intense e implicazioni associate sono esempi di caratteristiche linguistiche relative alle emozioni che verranno rappresentate da questo embedding. RoBERTa semplifica la modellizzazione indipendente dal linguaggio. Ciò consente al sistema di utilizzare la stessa dimensione dell'embedding sia per testi in inglese provenienti dal dataset CMU-MOSEI che per testi in cinese provenienti dal dataset CH-SIMS.
Vengono estratti tre vettori caratteristici specifici per modalità di 768 dimensioni, ciascuno relativo alle modalità visiva fv, audio fa e testuale ft , mediante il passaggio proposto di apprendimento della rappresentazione delle caratteristiche profonde. Nella progettazione dell'interazione intelligente, queste rappresentazioni apprese creano uno spazio unificato di caratteristiche multimodali che costituisce la base per la mappatura visiva a livello di caratteristiche, la fusione multimodale basata su grafi e l'apprendimento di rappresentazioni disaccoppiate.
Apprendimento della rappresentazione disaccoppiata
Dopo aver appreso una rappresentazione basata su caratteristiche profonde, un'ulteriore elaborazione dei vettori caratteristici multimodali provenienti dalle modalità visiva, uditiva e testuale può produrre una descrizione emotiva disgiunta. Se le incorporazioni caratteristiche specifiche per modalità uditiva, visiva e testuale utilizzate nel passaggio precedente sono rappresentate rispettivamente da fv, fa e ft, in modo tale che
e
, l'obiettivo di questo passaggio è fattorizzare tutte le caratteristiche modali in due rappresentazioni latenti distinte, che comprendono le rappresentazioni emotive tenendo conto della semantica precedente di ciascuna delle diverse modalità.
Questo viene realizzato alimentando ogni caratteristica modale, fm , in due reti di proiezione parallele: un codificatore emotivo
e un codificatore modale
, dove vengono prodotte le due codifiche.
(10)
Dove
la caratteristica latente associata all'emozione è rappresentata da
rappresenta una caratteristica latente specifica di una modalità. Ciò consente agli embedding specifici dell'emozione di comunicare con uno spazio in modo ripetuto attraverso più ingressi, inclusi audio, video e testo, mantenendo contemporaneamente i dati strutturali unici associati a ciascuna modalità.
Una separazione efficace è ottenuta ricostruendo con vincoli di indipendenza. La ricostruzione della caratteristica modale originale è data da:
(11)
dove
è una rete decoder. La perdita di ricostruzione preserva i seguenti dati:
(12)
Inoltre, l'ortogonalità, o la decorrelazione, tra emozione e rappresentazioni specifiche della modalità limita spesso il sovrapporsi delle informazioni:
(13)
Raggiungendo questi obiettivi, il modello potrebbe apprendere rappresentazioni delle emozioni affidabili, comprensibili e resistenti alla variabilità delle modalità sensoriali. Successive fusioni intermodali basate su grafi e caratteristiche di mappatura visiva, specialmente per la progettazione di interazioni intelligenti, dipendono fortemente da rappresentazioni emotive strutturate e interpretabili.
Coincidenza delle emozioni tra diverse modalità
L'aggiunta della coerenza emotiva migliora chiaramente l'efficacia della fusione tra le modalità. Questo perché le strategie di fusione non devono tenere conto di ampie differenze tra le due rappresentazioni, poiché gli embedding emotivi specifici per modalità condividono uno spazio latente. L'illustrazione combinata delle due emozioni è descritta come segue
. La fusione pesata sarà più stabile quando le rappresentazioni specifiche per emozione sono coerenti, poiché le variazioni tra i segnali provenienti da diverse modalità non avranno più impatto sul risultato.
(14)
Imponendo l'allineamento semantico delle informazioni emotive, questo obiettivo riduce al minimo le discrepanze tra le diverse modalità e garantisce che la percezione delle emozioni rimanga coerente indipendentemente dalla modalità utilizzata per esprimerla. Di conseguenza, viene creato uno spazio rappresentativo coeso ed affettivo proiettando gli indizi emotivi ottenuti dai segnali vocali, dalle espressioni facciali e dal contenuto linguistico.
Impatto sulla fusione multimodale
La fusione multimodale diventa più efficace quando viene introdotta una coerenza emotiva tra le diverse modalità. I meccanismi di fusione non devono più compensare ampie differenze nelle rappresentazioni inter-modali, poiché gli embedding specifici per l'emozione sono allineati in uno spazio latente comune. La rappresentazione emotiva fusa è definita come segue:
(15)
Dove αm rappresenta il peso dell'attenzione assegnato alla modalità m. La fusione pesata diventa più stabile e comprensibile quando le rappresentazioni specifiche per l'emozione sono coerenti, poiché il risultato della fusione mostra evidenze emotive complementari piuttosto che segnali di modalità contraddittori.
Matematicamente, ridurre
la varianza tra i vari tipi di rappresentazione specifici per l'emozione in relazione a
equivale a:
(16)
dove
rappresenta l'espressione media dell'emozione. Una varianza ridotta fa sì che le modalità di ingresso vengano pesate in base alla loro precisa rilevanza emotiva piuttosto che al rumore della modalità, garantendo una migliore convergenza della rete e una valutazione dell'attenzione più accurata.
L'obiettivo finale dell'apprendimento delle visualizzazioni emotive disincagliate è combinare frammentazione, ricostruzione e uniformità emotiva:
(17)
in cui due iperparametri, λ1 e λ2, controllano la relazione tra affidabilità emotiva intermodale e dissociazione. Il modello proposto acquisisce rappresentazioni emotive invarianti rispetto alla modalità, interpretabili e fusibili, per raggiungere questo obiettivo, con un'enfasi particolare nel fornire una base solida per la successiva fusione basata su grafi e per la rappresentazione a livello di caratteristiche nella progettazione di interfacce intelligenti.
Fusione dell'attenzione cross-modale basata su grafi
È stata utilizzata una rete grafica basata sull'attenzione cross-modale per simulare relazioni emotive finemente dettagliate tra le diverse modalità. Per facilitare il flusso di informazioni tra le modalità, è stato costruito un grafo multimodale completamente connesso, in cui ogni embedding specifico per modalità (testo, audio e video) è rappresentato come un nodo del grafo. Le relazioni tra le modalità sono state utilizzate per definire la matrice di adiacenza del grafo, successivamente migliorata mediante un metodo di attenzione apprendibile. Uno spazio latente condiviso è stato creato concatenando e proiettando gli output di diversi head di attenzione. Una rappresentazione unificata dell'emozione multimodale è stata quindi prodotta aggregando le rappresentazioni dei nodi attraverso un pooling pesato sull'attenzione. Tale rappresentazione fusa è stata poi inviata ai moduli di previsione e visualizzazione per l'analisi consapevole delle interazioni e il riconoscimento delle emozioni. Il modulo di fusione grafica aveva una dimensione della rappresentazione nascosta pari a 256 e due livelli di attenzione grafica, ciascuno con otto head di attenzione. Per determinare l'importanza relativa delle modalità adiacenti, i coefficienti di attenzione tra i nodi connessi sono stati calcolati e normalizzati utilizzando la funzione softmax. Ogni livello di attenzione grafica è stato seguito da una normalizzazione del livello, connessioni residue e un tasso di dropout pari a 0,2, al fine di aumentare la stabilità dell'addestramento e ridurre l'overfitting. Dopo aver concatenato e proiettato gli output di diversi head di attenzione in uno spazio latente comune, le rappresentazioni dei nodi sono state combinate in un unico embedding emotivo multimodale mediante pooling pesato sull'attenzione. Successivamente, la rappresentazione fusa è stata utilizzata per il mapping visivo multi-vista e la previsione emotiva.
Diverse interazioni multimodali sono state catturate utilizzando un'attenzione grafica multi-testa. La funzione softmax è stata utilizzata per normalizzare i coefficienti di attenzione tra i nodi collegati per ogni nodo. Per aumentare la stabilità dell'addestramento ed evitare l'overfitting, ai livelli di attenzione grafica sovrapposti nel modulo di fusione grafica sono stati aggiunti collegamenti residui, normalizzazione del livello e regolarizzazione con dropout.
Consideriamo che i termini
rappresentino singolarmente le rappresentazioni corrispondenti alle emozioni specifiche raccolte attraverso le modalità visiva, audio e testuale; ciascun componente risiede nello spazio latente condiviso
. I modelli per i nodi delle modalità utilizzano una notazione per il grafo
, con i nodi dell'insieme
che corrispondono direttamente ai tre nodi di modalità, al fine di rafforzare esplicitamente le dipendenze emotive condivise tra le diverse rappresentazioni modali.
Dopo aver assegnato un vettore di caratteristiche specifico per l'emozione a ciascun nodo nel grafico, abbiamo:
(18)
A differenza dei metodi di fusione tradizionali, che utilizzano pesi di fusione predeterminati o fissi, il metodo proposto apprende pesi adattivi per i collegamenti in base alla loro rilevanza e interdipendenze, sia tra canali che tra situazioni emotive.
Una rete di attenzione basata sui grafi (GAT) viene utilizzata per la fusione cross-modale. Un coefficiente di attenzione viene calcolato per ciascun nodo i e per i suoi nodi adiacenti, ovvero il nodo j:
(19)
L'effetto emotivo del passaggio dalla modalità j alla modalità i è misurato dai pesi normalizzati αij.
Successivamente, l'aspetto fuso di ciascun nodo modale viene calcolato come un raggruppamento pesato dei suoi vicini:
(20)
dove la funzione di attivazione
è non lineare. Infine, le caratteristiche aggiornate di ogni nodo vengono combinate per ottenere una rappresentazione globale fusa dell'emozione:
(21)
È una tecnica utile per la modellizzazione interpretabile delle emozioni e la successiva mappatura visiva poiché cattura informazioni complementari da diverse modalità preservando al contempo le complesse relazioni inter-modali.
L’algoritmo 1 (File Supplementare 1) fornisce lo schema generale per eseguire la fusione cross-modale basata su grafo. Inizialmente, viene creato un grafo con le caratteristiche specifiche dell'emozione associate a ciascuna delle modalità visiva, audio e testuale. Successivamente, vengono calcolati i punteggi di attenzione per ogni coppia di nodi del grafo, che rappresentano la combinazione della dipendenza emotiva. I punteggi di attenzione vengono quindi normalizzati per indicare il contributo relativo di ciascuna modalità al contesto emotivo specificato, consentendo l'apprendimento dei pesi di attenzione. L'embedding generale dell'emozione viene prodotto nell'ultima fase aggregando le caratteristiche associate ai nodi del grafo. In questo senso, la fusione generale dell'algoritmo delle caratteristiche multimodali legate alle emozioni specificate mostra potenzialità in termini di adattabilità, interpretabilità e intelligenza contestuale.
Figura 2 mostra la struttura e il funzionamento della rete proposta con attenzione cross-modale per la fusione del sentiment multimodale. Gli embedding specifici per l'emozione, derivati in modo indipendente per le modalità testuale, uditiva e video, vengono inizialmente elaborati da meccanismi di attenzione a livello modale che apprendono l'importanza relativa delle informazioni linguistiche, vocali e facciali in un dato contesto emotivo. Le rappresentazioni pesate mediante attenzione delle modalità vengono quindi combinate per formare un embedding emotivo unificato, nel quale la matrice di attenzione cattura le dipendenze inter-modali e l'intensità delle interazioni. La matrice di attenzione appresa dalla rete modula dinamicamente il contributo delle modalità, consentendole di concentrarsi sulla modalità più informativa mentre ignora quelle rumorose o meno significative. La rappresentazione emotiva fusa permette un riconoscimento accurato delle emozioni e un'analisi fine degli stati emotivi come neutro, affetto e preoccupazione.
Modulo di mappatura visiva
Con l'aiuto della sezione di mappatura visiva, creata appositamente per questo scopo, un progettista intelligente di interazioni può convertire la rappresentazione unificata dello stato emotivo in una forma visiva comprensibile e facilmente fruibile dopo il processo di fusione multimodale, basandosi sul grafico.
Per facilitare la comprensione delle rappresentazioni emotive latenti, sono state utilizzate tecniche di riduzione della dimensionalità per visualizzare gli embedding multimodali emotivi appresi. Dopo aver ridotto la dimensionalità delle caratteristiche mantenendo la maggior parte della varianza mediante l'analisi delle componenti principali (PCA), gli embedding sono stati proiettati in uno spazio bidimensionale per la visualizzazione, usando l'incorporamento stocastico di vicini distribuiti in modo t (t-SNE). Per t-SNE sono stati utilizzati un valore di perplessità pari a 30, un tasso di apprendimento di 200 e 1.000 iterazioni di ottimizzazione. Sono stati visualizzati cluster specifici per emozione e le relazioni tra modalità mediante le proiezioni ottenute. I pesi normalizzati dell'attenzione incrociata ottenuti dalla rete attentiva basata su grafi sono stati utilizzati per creare mappe termiche di attenzione. Queste mappe termiche mostrano i contributi relativi delle modalità testuale, audio e visiva durante la previsione dell'emozione. I coefficienti di attenzione appresi sono stati utilizzati come pesi degli archi per creare grafi di interazione incrociata, consentendo un'analisi visiva delle relazioni intermodali e del flusso informativo all'interno del framework di fusione. Sono stati creati grafici delle traiettorie emotive monitorando l'evoluzione degli embedding emotivi latenti attraverso utterance successive, per esaminare la dinamica emotiva temporale. Queste traiettorie forniscono informazioni su come gli stati emotivi e i contributi delle modalità evolvono nel tempo. Tutte le visualizzazioni sono state create utilizzando pacchetti Python come Matplotlib e Scikit-learn. Per valutare l'interpretabilità, la formazione dei cluster, i contributi delle modalità e la dinamica temporale delle emozioni, sono state condotte analisi qualitative delle visualizzazioni degli embedding, dei grafi di interazione e delle mappe termiche di attenzione.
Sia
la rappresentazione fusa dello stato emotivo ottenuta mediante la funzione della rete di attenzione su grafi. A differenza della visualizzazione a livello di output dei grafici dello stato emotivo, l'obiettivo principale del modulo consiste nel convertire le rappresentazioni dello stato emotivo e i pesi corrispondenti del meccanismo di attenzione in una forma visiva comprensibile.
Utilizzando i valori di αji appresi, viene creata una mappa termica di attenzione per esaminare visivamente il contributo di ciascuna modalità. I pesi di attenzione in ingresso vengono quindi sommati per determinare un punteggio di importanza complessivo per ogni modalità:
(22)
dove si rappresenta il contributo emotivo relativo della modalità I. Per facilitare la creazione di una mappa termica dell'attenzione, i valori ottenuti vengono normalizzati e associati a una scala cromatica che consente all'utente di identificare facilmente la modalità predominante in diversi passaggi temporali o stati interattivi. Attraverso varie modalità di input visive, uditive o testuali, un'interfaccia di questo tipo aiuta l'utente a comprendere il funzionamento del meccanismo di attenzione del sistema.
Il grafo appreso è modellato specificamente come un "grafo delle interazioni pesato" per rappresentare la dipendenza intermodale delle emozioni umane. La modalità stessa è rappresentata da ciascun nodo del grafo, mentre l'intensità delle interazioni relative alle emozioni umane è rappresentata dai pesi in forma di αji sugli archi che li collegano. Il grafo pesato sopra illustra l'intensità delle interazioni emotive umane. La definizione di i e j è:
(23)
Lo spessore o la trasparenza delle linee nella visualizzazione del grafo sono mostrati correttamente grazie a questi pesi. Ciò rende più semplice comprendere come interagiscono le diverse modalità. Il progettista può comprendere meglio come gli indicatori emotivi interagiscono durante il processo di fusione, con l'ausilio dei grafi di interazione cross-modale.
Gli embedding emotivi fusi
in diversi passi temporali vengono ridotti a uno spazio di dimensione inferiore mediante un algoritmo di riduzione della dimensionalità, come PCA o t-SNE, al fine di visualizzare l'evoluzione delle emozioni nel tempo:
(24)
dove la funzione di proiezione è rappresentata da
. L'emergere di traiettorie emotive 2D/3D, che mostrano transizioni emotive, intensità e stabilità nelle interazioni, può essere interpretato come una rappresentazione intuitiva dell'evoluzione degli stati emotivi nel tempo. Questi aspetti possono essere utilizzati per l'interazione intelligente, il processo decisionale e il monitoraggio in tempo reale.
A differenza dei tradizionali sistemi emotivi che si limitano a fornire associazioni a specifiche classi o punteggi, questo sistema si concentra sulla dimostrazione di come le emozioni umane si formano al suo interno. Rivela il proprio processo decisionale offrendo visualizzazioni di caratteristiche intermedie, inclusi i fattori di ponderazione, le interazioni tra i modelli e i percorsi corrispondenti. Ciò consente all'utente di comprendere come ciascun fattore—visivo, vocale o linguistico—influisca sulla produzione delle risposte alle emozioni umane.
La rappresentazione visiva delle emozioni in forme comprensibili può pertanto colmare il divario tra l'analisi delle emozioni mediante metodi di deep learning e la loro integrazione nella progettazione di interfacce intelligenti. I dati raccolti da entrambi gli approcci possono quindi essere utilizzati per creare interfacce utente più precise. Di conseguenza, l'approccio proposto può fornire ai progettisti di interazioni informazioni fondamentali per sviluppare interfacce utente più accurate. In altri termini, la comprensione delle emozioni diventa una componente estremamente attiva nella progettazione delle interazioni. L'accuratezza può aumentare soltanto quando la comprensione delle emozioni viene attivamente integrata nel processo di progettazione delle interazioni.
Il modulo di mappatura visiva consente la spiegabilità in diversi modi interconnessi ma distinti: la spiegabilità a livello di caratteristica rivela le rappresentazioni sottostanti delle emozioni create dalla rete neurale profonda (DNN), permettendoci di comprendere la semantica utilizzata per descrivere ogni caratteristica relativa all'emozione; la spiegabilità a livello di modalità sfrutta i dati provenienti dai grafi di interazione e dalle mappe termiche di attenzione visiva per descrivere come ciascuna modalità — visiva, audio o testuale — contribuisca alle decisioni prese per esprimere le emozioni; infine, le traiettorie risultanti dall'incorporamento emotivo ci permettono di comprendere come ciascuna modalità visiva e testuale cambi nel tempo dal punto di vista di un'interazione dinamica. Si rimanda all'Algoritmo 2 (Supplementary File 1).
Le caratteristiche emotive multimodali fuse vengono mappate in rappresentazioni visivamente significative per la progettazione di interazioni intelligenti, utilizzando l'algoritmo visivo di mappatura proposto, Algoritmo 2. I pesi di attenzione multimodali basati su grafi vengono utilizzati per quantificare le differenze tra gli elementi visivi, audio e testuali in ingresso a ogni passo temporale. Queste differenze vengono quindi mappate in rappresentazioni visive al fine di evidenziare le principali fonti che influenzano le emozioni, mediante elementi visivi a mappa termica. Per fornire una visione approfondita dell'interazione tra gli elementi in ingresso e trasmettere l'evoluzione emotiva generata dagli elementi in ingresso multimodali, vengono quindi calcolate le intensità di interazione a coppie per creare i pesi di interazione multimodali. Nel frattempo, viene creata una rappresentazione dell'evoluzione emotiva mappando gli elementi emotivi fusi, raccolti nel tempo, in uno spazio a bassa dimensionalità per produrre un'evoluzione continua degli elementi emotivi.
Previsione delle emozioni e feedback dell'interazione
Il risultato della rappresentazione emotiva fusa, indicato come
, viene quindi utilizzato come funzione sia per il feedback dell'interazione che per la previsione dell'emozione. Inoltre, la previsione dell'emozione è descritta come un modello multitasking costituito da un'attività di regressione per il riconoscimento dell'intensità emotiva continua e da un'attività di classificazione per il riconoscimento delle emozioni discrete. Per il riconoscimento delle emozioni discrete si utilizza il seguente modello di classificazione basato sul softmax:
(25)
dove
rappresenta le probabilità attese per le classi emotive e Wc e bc sono vincoli apprendibili. La funzione di perdita di cross-entropia viene utilizzata per migliorare l'obiettivo di classificazione:
(26)
dove yk è l'etichetta reale e K è il numero di classi emotive. Un ramo di regressione viene utilizzato per stimare l'intensità emotiva in parallelo, producendo una previsione di diversi attributi affettivi continui, inclusi valenza e arousal. Assegnagli la seguente definizione:
(27)
dove il punteggio di intensità emotiva atteso è indicato da
. Viene utilizzata la perdita del quadrato medio degli errori per migliorare l'attività di regressione:
(28)
In generale, le due attività sono combinate nell'obiettivo di previsione:
(29)
dove gli obiettivi della regressione e della classificazione sono bilanciati da λ. Si propone una modifica dinamica del modulo di visualizzazione in base allo stato emotivo identificato, al fine di consentire questo tipo di retroazione sensibile all'interazione. Il contesto di interazione in un determinato istante t è rappresentato da ct. La risposta del modulo di visualizzazione è fornita da:
(30)
dove la funzione di adattamento della visualizzazione è rappresentata da
. Ciò rende possibile aggiustare in tempo reale le mappe termiche delle modalità, i grafici di interazione e le traiettorie emotive in base ai cambiamenti e alle emozioni previsti. Questo indica che il sistema fornisce un sostegno significativo per il feedback, oltre a prestare bene nella previsione dello stato emotivo.