Research Article

Computergestützte Modellierung der affektiven Nutzererfahrung unter Verwendung multimodaler physiologischer und verhaltensbezogener Signale

DOI:

10.3791/69823

April 7th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieses Protokoll beschreibt einen rechnergestützten Rahmen, der die affektive Nutzererfahrung modelliert, indem physiologische und verhaltensbezogene Signale multimodal integriert werden, wobei Techniken für korrelationsbasiertes Merkmalslernen und multimodale Fusion verwendet werden. Dieses Protokoll schlägt ein Framework für multimodale affektive Modellierung auf dem AMIGOS-Benchmark-Datensatz vor und testet es.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit schlägt ein reproduzierbares rechnergestütztes Protokoll für multimodale affektive Modellierung vor, das physiologische Signale nutzt. Ziel des Protokolls ist es, die Offline-Emotionserkennung zu ermöglichen, indem mehrere Biosignale mithilfe eines einheitlichen Deep-Learning-Frameworks integriert werden. Die vorgeschlagene Arbeit besteht aus fünf Schritten: Datenerhebung, Vorverarbeitung, Merkmalausrichtung, multimodale Fusion und Evaluation. EEG-, EKG- und GSR-Signale aus öffentlich zugänglichen AMIGOS-Daten wurden als experimentelle Basis in dieser Arbeit verwendet. Biosignale wurden vorverarbeitet und normalisiert, um modalitätsspezifische Merkmale zu extrahieren. Heterogene Merkmalsräume wurden mittels Deep Canonical Correlation Analysis über verschiedene Modalitäten ausgerichtet, gefolgt von einem multimodalen Fusionsnetzwerk zur Klassifikation eines affektiven Zustands. Das Protokoll wurde mit Offline-Experimenten evaluiert und mit herkömmlichen Fusions- und Klassifikationsmodellen unter Verwendung von Standardleistungsmetriken wie Genauigkeit, Präzision, Rückruf, F1-Score und AUC verglichen. Diese Studie konzentriert sich auf die Entwicklung und Validierung eines rechnergestützten Rahmens für multimodale affektive Nutzererfahrungsmodellierung, anstatt auf den Einsatz eines Echtzeit-interaktiven Systems. Mit 92,1 % Genauigkeit für die UX-affektive Zustandsvorhersage und 94,2 % F1-Wert für die Valenz-Erregungsklassifikation übertroffen die Ergebnisse konsequent die Basismodelle auf emotionalen Dimensionen. Diese Ergebnisse bestätigten die Wirksamkeit des vorgeschlagenen multimodalen Fusions-Workflows für die rechnergestützte affektive Modellierung durch Benchmarking physiologischer Daten.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das komplexe Zusammenspiel von Denken, Fühlen und Handeln prägt, wie Menschen denken und handeln. Affektives Rechnen ist die Untersuchung dieser Zusammenhänge, indem interdisziplinäres Wissen aus Neurowissenschaften, Psychologie und künstlicher Intelligenz genutzt wird, um Systeme zu entwickeln, die in der Lage sind, menschliche Emotionen zu analysieren, zu verstehen und darauf zu reagieren. Dieser Bereich wird zunehmend auf die Mensch-Technologie-Kommunikation angewandt, indem expressives Bewusstsein in reaktionsfähige KI-Strukturen integriert wird, wodurch Technologie nicht nur mit intellektuellen, sondern auch mit emotionalen Bedingungen interagiert und so zu individuellerem und emotionsbewussterem Nutzerwissen führt. Eine Emotion, ein komplexer mentaler Prozess, spiegelt menschliche Wahrnehmungen wider und spielt eine bedeutende Rolle in menschlichen Interaktionen1. Heute gibt es zahlreiche Anwendungen der Mensch-Computer-Interaktion (HCI), die Forschung zur Emotionserkennungerfordern. Die HCI-Systemumgebung ist dynamisch und komplex. In den meisten Fällen muss es seine Funktionalitäten mit den Beklagten synchronisieren; Daher kann sich ein Kontext mit emotionaler Intelligenz besser an diese Art von Atmosphäre anpassen. Daher wird in dieser Studie die computergestützte Modellierung der affektiven Nutzererfahrung anhand multimodaler physiologischer und verhaltensbezogener Signale untersucht3. Anstatt in der Praxis ein interaktives System zu entwickeln oder zu validieren, ist das Werk eher dazu geneigt, methodische Beiträge zur multimodalen Signalintegration zu leisten oder Affektinferenz mit Anwendungskontexten der Immersion oder ausstellungsbasierten Settings zu beeinflussen. Um sich von der Breite der Konzepte fernzuhalten, konzentriert sich diese Arbeit auf zwei Hauptkonzepte: die Implementierung eines multimodalen affektiven Modellierungsrahmens mit rechnergestützten Ansätzen und multimodaler Datenfusionstechniken zur Kombination physiologischer und verhaltensbezogener Daten. Alle anderen Themen, die im Manuskript auftauchen, werden zum Kontext hinsichtlich der Relevanz der entwickelten Modelle referenziert.

Jede Emotionsform vermittelt unterschiedliche Informationen über das Gefühl einer Person, die aus einem anderen Sinnessystem nicht abgeleitet werden können. Die Extraktion von Emotionen aus der Körperbewegung, die ein gesamtes Körperbewegungsmuster beinhaltet, hat den Vorteil, die nonverbalen Gefühle einer Person zu identifizieren4. Sprache und Gesichtsausdruck können Material vermitteln, das bei Körperbewegungen und menschlichen Körpersignalen nicht verfügbar ist. Menschen nutzen verschiedene Emotionsmodalitäten parallel und in Kombination. Jede Methode ist begrenzt und hat ihre Stärken. Um ein Gefühl korrekt zu erkennen, bieten multimodale Emotionserkennungsmethoden möglicherweise eine höhere Erkennungsleistung als die unimodale Emotionserkennung. Dennoch neigen im Falle eines emotionalen Wandels Gesichtsausdrücke, Biosignale/physiologische Signale und Sprachsignale dazu, früher zu erscheinen als andere Signale. Daher befasst sich die auf Computer-Vision basierende Emotionserkennung hauptsächlich mit emotionalen Gesichtsausdrücken5.

Affektives Rechnen wurde umfassend in der Kind-Roboter-Interaktion (CRI) untersucht; Emotionsbewusste Systeme verändern ihre Reaktion basierend auf den physiologischen und verhaltensbezogenen Signalen der Nutzer. Diese Arbeiten veranschaulichen die Machbarkeit biophysischer Emotionserkennung und adaptiver Interaktion. Allerdings sind die entworfenen CRI-Systeme meist nur für strukturierte, aufgabenorientierte und teilnehmende Kontexte geeignet. Folglich haben CRI-Systeme eine begrenzte Verallgemeinerbarkeit auf dynamische, öffentliche Umgebungen wie interaktive Ausstellungen. Ihre Arbeit verweist auf emotionsbewusste Roboter als unerlässlich, um die Motivation zu steigern, und behandelt neben einigen Themen wie Personalisierung. Beteiligung ist ein Schlüsselelement für die affektive Kind-Roboter-Interaktion, da emotional reaktive Roboter reichhaltigere und effektivere Lernerfahrungen bieten. Der Autor6 präsentiert einen Rahmen zur Erkennung der Nutzerbeteiligung anhand von Aufgaben- und sozialen Interaktionsmerkmalen. Sie beweisen durch ihre Ergebnisse, dass das Erkennen affektiver Hinweise, einschließlich Gesichtsausdrücken und sozialem Verhalten, es Robotern ermöglicht, ihre Reaktionen dynamisch anzupassen, um die Interaktion und das Engagement der Nutzer zu verbessern. Die affektive Anpassung bei der Langzeit-CRI ist eine fortwährende Herausforderung. Die Autoren in7 präsentieren die Emotionen der Kinder über einen bestimmten Zeitraum hinweg und betonen, dass Roboter sich an persönliche Gefühlsmuster und Lernstile anpassen müssen.

Es hat zudem aufgrund seiner hohen zeitlichen Auflösung und Empfindlichkeit gegenüber affektiven Zuständen eine starke Leistung durch EEG erzielt. Aktuelle Arbeiten 8,9,10 mit Deep-Learning-Ansätzen verbesserten die interdisziplinäre Robustheit durch Einführung von spatiotemporaler Modellierung und graphbasierten Aufmerksamkeitsmechanismen. Die meisten Studien bleiben jedoch unimodal, und nur wenige berücksichtigen Wahrnehmungs-Emotionen-Interaktionen über mehrere sensorische Kanäle; daher sind sie in immersiven UX-Szenarien weniger anwendbar 11,12,13. Das Modell wurde auf dem Datensatz ausgewertet, der eine verbesserte Leistung im Vergleich zu den aktuellen Techniken zeigte. Der emotionsabhängige kritische Selektionsalgorithmus wurde von denAutoren in 14 vorgeschlagen, und die Stärke, der Clusteringkoeffizient sowie die Eigenvektorzentralität der funktionalen Konnektivitätsnetzwerkmerkmale des EEG wurden untersucht. Die Autoren von15 erforschten ein tiefes, einfaches Rekurrentennetzwerk, um die zeitlichen Merkmale von EEG-Signalen zu erfassen, und die experimentellen Ergebnisse übertrafen verwandte Arbeiten in derLiteratur 16,17,18,19. Es ist nahezu unmöglich, einen großen Datensatz von EEG-Signalen zu erfassen, aber man kann auch andere Ansätze wie den Querschnittsansatz ausprobieren.

Jüngste Studien20,21 haben bedeutende Fortschritte bei der Verwendung von extrem fortschrittlichen räumlich-zeitlichen Modellierungsalgorithmen gemacht, um das Problem der interdisziplinären Emotionsklassifikation auf Basis von EEG-Signalen zu adressieren. Dazu gehört ein raum-zeitliches Hybridnetzwerk mit verbesserter Domänenanpassung und dynamischer Graphenaufmerksamkeit zur Behandlung der Intersubjektvariabilität in der Emotionsklassifikation aus EEG-Signalen22. Insbesondere durch den Einsatz zeitlicher Modellierungsmechanismen und räumlicher Gehirnbeziehungsmodellierung mit dynamischer Aufmerksamkeit steigerten sie die Leistung der subjektunabhängigen Emotionsklassifikation signifikant. Ein weiteres Forschungsprojekt zu diesem Problem umfasst ein spatiotemporales isomorphes Interaktionsnetzwerk zwischen Gehirnregionen23. In dieser Forschung wird größerer Wert auf die Modellierung räumlich-zeitlicher Invarianten gelegt, um die intersubjektive Robustheit für die Emotionsklassifikation anhand von EEG-Signalen signifikant zu verbessern. Obwohl diese beiden Forschungsbeiträge erfolgreich herausragende Leistungen bei der Emotionsklassifikation aus rein neuronalen Signalen dokumentiert haben, beschränken sie sich auf monomodale Signale und es fehlt an der Erforschung multimodaler P-E-Interaktionen. Im Gegenteil, die aktuelle Forschung orientiert sich an erweiterten unimodalen Signalmodellen durch den Einsatz von Deep-Learning-Lösungen, die mehrere P/E-Modalitäten durch Deep Correlation Learning verbinden und so eine reichhaltigere affektive UX-Modellierungslösung bieten.

Obwohl aktuelle Forschungen, darunter das Projekt zur expressiv bewussten Kind-Roboter-Schnittstelle unter Verwendung biophysikalischer Informationen, das Potenzial bestätigt haben, multimodale physiologische Signale zur Verbesserung der Affekterkennung zu nutzen, sind sie dennoch durch domänenbezogene Einschränkungen begrenzt. Insbesondere sind diese Systeme weitgehend für strukturierte, aufgabenorientierte Interaktion mit Kindern optimiert und nicht auf komplexere, dynamische Umgebungen wie interaktive Ausstellungen verallgemeinerbar. Darüber hinaus sind die im Basisverfahren verwendeten Feature-Fusion-Techniken nicht skalierbar und greifen meist auf flache Fusionsansätze zurück, die die komplexe Wahrnehmungs-Emotion-Interaktion, die in multisensorischen UX-Umgebungen existiert, nicht effektiv erfassen. Außerdem nutzt die Basisstudie keine modernen Deep-Learning-Techniken, die hochdimensionale multimodale Datenströme wie EEG, Gesichtsausdrücke und Eye-Tracking unter verschiedenen Umwelteinflüssen ausrichten und fusionieren können. Dies offenbart eine grundlegende Wissenslücke bei der Schaffung eines leistungsstarken Rechenparadigmas, das nicht nur unterschiedliche Zielgruppendemografien und Reizkontexte berücksichtigt, sondern auch Wahrnehmungs-Emotions-Interaktion durch tiefgründige kanonische Korrelationsanalyse (DCCA) und multimodale Fusionsnetzwerk-(MMFN)-Architekturen erfasst. Diese Lücke zu überbrücken, kann das Verständnis der Nutzererfahrung (UX) erheblich beeinflussen.

Das Hauptziel dieser Arbeit ist es, ein rechnergestütztes System zu schaffen, das eine emotional adaptive Nutzererfahrung innerhalb interaktiver Ausstellungskontexte durch multimodale biophysikalische und verhaltensbezogene Wahrnehmung ermöglicht. Aufbauend auf den Grundprinzipien der Emotionsmodellierung aus der Forschung zur Kinder-Roboter-Interaktion und dem affektiven Computing zielt dieses Framework darauf ab, Interaktionen zwischen Nutzerwahrnehmung und Emotion anhand heterogener physiologischer und verhaltensbezogener Hinweise wie EEG, EKG, EDA, Gesichtsausdrücke und Eye-Tracking zu modellieren und aufzuzeichnen. Durch die Integration der tiefen kanonischen Korrelationsanalyse (DCCA) mit einem multimodalen Fusionsnetzwerk (MMFN) versucht das System, gemeinsame latente emotionale Repräsentationen über verschiedene Modalitäten hinweg zu erlernen und diese Repräsentationen auf affektive Nutzererfahrungszustände (UX) zu projizieren. Die Architektur hat die Aufgabe, die Nachteile von flacher Merkmalsfusion und altersbeschränkten emotionalen Modellen zu überwinden, indem kontextbewusste Emotionsinferenz und multisensorische Integration in dynamischen, öffentlichen Umgebungen unterstützt werden. Abschließend zielt dieses Werk darauf ab, fortschrittlichere intelligente und affektiv sensible Ausstellungssysteme zu entwickeln, die auf die aktuellen affektiven Rückmeldungen und Interaktionsmodi der Nutzer reagieren und so das Engagement, die Zufriedenheit sowie die kognitiv-emotionale Resonanz in digitalen kulturellen Erlebnissen weiter steigern.

Dieser Artikel trägt in folgender Weise zur Literatur bei: Ein rechnergestütztes Rahmenwerk für multimodale affektive Modellierung, das sowohl physiologische als auch Verhaltensdaten berücksichtigt. Ein multimodaler Fusionsansatz, der das effektive Lernen von Wahrnehmungs- und Emotionsrepräsentation aus mehreren Datenquellen ermöglicht. Diese vorgeschlagene Arbeit führt ein neues rechnergestütztes Paradigma ein, um die affektive Nutzererfahrung (UX) durch KI-basierte multimodale Sensorik und multisensorische Integrationspipeline-Modellierung der Wahrnehmungs-Emotion-Interaktion zu ergänzen. Der Hauptbeitrag ist die Verschmelzung von DCCA mit MMFN, um eine starke Merkmalsausrichtung und ein hochrangiges Repräsentationslernen über heterogene Modalitäten wie EEG, EKG, EDA, Gesichtsausdrücke und Eye-Tracking hinweg zu ermöglichen. Dies ermöglicht es, eine genaue Offline-Bewertung der sensorischen Wahrnehmung auf emotionale Zustände wie Interesse, Engagement, Überraschung oder Langeweile zu modellieren. Die experimentelle Validierung mit dem öffentlich verfügbaren AMIGOS-Datensatz zeigt, dass das entwickelte DCCA+MMFN-Modell besser abschneidet als Basismodelle (z. B. 1D-CNN, CNN-ResNet und LSTM-CNN) mit einer durchschnittlichen Klassifikationsgenauigkeit von 89,4 % für Valenz-Erregungs-Emotionszustände und 87,1 % für diskrete Emotionsklassen.

Im Gegensatz zu früheren Studien, die entweder Teilnehmer betonten, aufgabenorientierte Situationen oder oberflächliche Feature-Fusion-Techniken verwendeten, bringt der vorgeschlagene Ansatz einen Deep-Learning-Rahmen, der speziell für dynamische reale Ausstellungsumgebungen entwickelt wurde. Durch die Integration von DCCA und einem MMFN bietet diese Arbeit eine erweiterbare und rauschrobuste Methode, die in der Lage ist, kontinuierliche Wahrnehmungs-Emotionsverschiebungen in heterogenen Nutzergruppen zu verstehen. Diese klare Verschmelzung hochdimensionaler physiologischer, verhaltensbezogener und umweltbezogener Signale ist eine zentrale Innovation für die affektive UX-Modellierung. Dieses Papier präsentiert einen KI-gesteuerten Rahmen zur Modellierung affektiver Nutzererfahrungen in interaktiven Ausstellungen mittels multimodaler Sensorik und multisensorischer Integration. Das vorgeschlagene Framework erreicht eine robuste Ausrichtung und Verschmelzung heterogener Modalitäten wie EEG, EKG, EDA, Gesichtsausdrücke und Eye-Tracking durch die Kombination von DCCA und MMFN. Im Gegensatz zu früheren Studien, die sich auf Benutzer- oder aufgabenzentrierte Settings beschränkten, unterstützt der vorgeschlagene Ansatz kontinuierliche Wahrnehmungs-Emotionsmodellierung in dynamischen öffentlichen Umgebungen und stellt damit einen wichtigen Fortschritt in der affektiven UX-Forschung dar.

Die Entwicklung eines systematischen, wiederholbaren multimodalen rechnergestützten Ansatzes zur physiologischen Affektmodellierung, der die Alignment heterogener Merkmale vor der Fusion methodisch behandelt, ist die Hauptneuheit dieser Arbeit. Der vorgeschlagene Rahmen erzwingt korreliertes Repräsentationslernen über EEG-, EKG- und GSR-Signale hinweg, indem eine intermodale Phase der latenten Ausrichtung mit DCCA eingeführt wird, im Gegensatz zu traditionellen multimodalen Emotionserkennungsstudien, die auf direkter Merkmalsverkettung oder Entscheidungsebene basieren. Durch die Gewährleistung von Modalitätskonsistenz vor der Klassifikation erhöht dieser alignment-getriebene Fusionsansatz die Generalisierbarkeit und Robustheit über affektive Dimensionen hinweg. Der Beitrag ist ein benchmark-orientierter, End-to-End-Workflow, der Vorverarbeitung, Repräsentationsausrichtung, multimodale Fusion und Evaluation innerhalb einer einzigen Deep-Learning-Architektur standardisiert und so wiederholbare und aufgabenunabhängige physiologische Emotionsmodellierung ermöglicht, anstatt nur eine einzelne algorithmische Änderung vorzuschlagen. Der vorgeschlagene Rahmen dieser Studie dient als Machbarkeits- und konzeptionelle Demonstration multimodaler affektiver Modellierung für ausstellungsähnliche Erlebnisse. Anstatt reale multisensorische Ausstellungsumgebungen direkt zu modellieren, wird der AMIGOS-Datensatz als Benchmark-Proxy verwendet, um den Modellierungsansatz in einer kontrollierten Umgebung zu validieren.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Der in dieser Studie verwendete AMIGOS-Datensatz ist öffentlich verfügbar und wurde mit vorheriger Genehmigung des Prüfungsausschusses und informierter Einwilligung erhoben, wie in der ursprünglichen Veröffentlichung berichtet. Diese Studie beinhaltet nur eine sekundäre Analyse des Datensatzes, und es war keine zusätzliche ethische Genehmigung erforderlich.

Die vorliegende Methode verwendet Feature-Alignment- und multimodale Fusionsansätze, um multimodale physiologische und Verhaltensdaten zu verarbeiten, um Wahrnehmungs-Emotions-Korrelationen zu beschreiben. Diese Studie schlägt ein rechnergestütztes Modell für die affektive Nutzererfahrung (UX) in interaktiven Ausstellungen vor, das multimodale biophysikalische Wahrnehmung und KI-basierte Emotionsmodellierung nutzt. Basierend auf biophysikalischen Datenerkenntnissen aus dem Basisartikel digitalisiert diese Methodik computergestützte Modellierung von Nutzerzuständen aus synchronisiertem EEG, EKG, EDA, Eye-Tracking, Gesichtsausdrücken und Umwelteingaben. Der Begriff "räumlich-zeitliche Modellierung" im Manuskript bezieht sich auf die räumliche multikanalige physiologische Merkmalsrepräsentation und die intermodale Korrelationsausrichtung mittels DCCA. Temporal: sequentielle Codierung durch BiLSTM und temporale Abhängigkeitserhaltung innerhalb segmentierter Fenster. Diese vielfältigen Signale werden zunächst vorverarbeitet und normalisiert, um zeitliche und räumliche Korrelationen zwischen Modalitäten zu berücksichtigen. Merkmalsvektoren werden unabhängig für jede Modalität gelernt und erfassen emotionsbezogene Muster wie Erregung, Aufmerksamkeit und Engagement. Um erfolgreich aus gemeinsamen emotionalen Repräsentationen über heterogene Datenströme hinweg zu lernen, wird DCCA verwendet. DCCA projiziert jede Modalität in einen latenten gemeinsamen Teilraum, in dem korrelierte Merkmale maximiert werden, während modalitätsspezifische Informationen durch erweiterte intermodale Relevanz erhalten bleiben. Diese modalitätsausgerichteten latenten Einbettungen werden dann an ein Multimodales Fusionsnetzwerk (MMFN) weitergeleitet, das zeitliche und kontextuelle Informationen über ein hybrides BiLSTM und Aufmerksamkeitsschichten kombiniert. Diese Verschmelzung ermöglicht es dem System, hochstufige affektive Zustände zu erzeugen, die in Nutzererfahrungsindikatoren (z. B. Langeweile, Interesse, Unbehagen) übersetzt werden. Schließlich schätzt ein Klassifikationsmodul den affektiven UX-Zustand und gibt Rückmeldung für die Anpassung an die Ausstellung, z. B. durch die Anpassung visueller oder akustischer Reize in der computergestützten Modellierung. Abbildung 1 zeigt die Architektur der vorgeschlagenen Methode.

Abbildung 1
Abbildung 1: Architektur der vorgeschlagenen Methode. Struktur des vorgeschlagenen UX-Modellierungsrahmens, der multimodale Eingaben wie EEG, ECG, EDA, Gesichtsausdrücke und Augenblick unter Verwendung von DCCA und MMFN fusioniert. Abkürzungen; UX = Benutzererfahrung; EEG = Elektroenzephalographie; EKG = Elektrokardiographie; EDA = Elektrodermale Aktivität; DCCA = Tiefe Kanonische Korrelationsanalyse; MMFN = Multimodales Fusionsnetzwerk. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Die vorgeschlagene Architektur in Abbildung 1 zeigt ein End-to-End-System für affektive Nutzererfahrung (UX), das Deep Canonical Correlation Analysis (DCCA) und ein Multimodal Fusion Network (MMFN) für die Modellierung von Wahrnehmungs-Emotionsinteraktion in interaktiven Ausstellungen nutzt. Das System beginnt mit der Aufnahme von rohen multimodalen Eingaben wie EEG, EKG und EDA-physiologischen Signalen; Gesichtsausdrücke und Verhaltenssignale des Augenblicks; und kontextuelle Eingaben wie audiovisuelle und Umweltinformationen. Diese Signale werden dann in ein Vorverarbeitungs- und Merkmalsextraktionsmodul eingespeist, in dem signalspezifische Verarbeitung (z. B. Rauschbeseitigung, Normalisierung, Merkmalsberechnung) ausgeführt wird, um für jede Modalität sinnvolle Deskriptoren zu erzeugen. Zweitens projiziert das DCCA-Modulmodul Paare von Modalitäten in einen gemeinsamen latenten Raum und lernt maximal korrelierte Einbettungen, die intrinsische emotionale Muster über verschiedene Modalitäten kodieren. Die hochkorrelierten Funktionen dieser mehreren DCCA-Module werden anschließend vom Multimodal Fusion Network (MMFN) verschmolzen, das die erlernten Merkmale hierarchisch mit Deep-Learning-Schichten, möglicherweise BiLSTM, Aufmerksamkeitsmechanismen oder Transformatoren verschmilzt, um eine kompakte und hochstufige affektive Darstellung zu schaffen. Diese integrierte Darstellung wird dann in die Klassifikationsschicht von Emotionen und UX-Zuständen eingespeist, in der das Modell affektive Ergebnisse wie Valenz, Erregung oder kognitive/emotionale Zustände wie Engagement, Langeweile oder Überlastung vorhersagt. Eine adaptive UX-Rückkopplungsschleife wird optional am Pipeline-Termin bereitgestellt, sodass das System interaktiv auf die Zustände des Nutzers reagieren kann, indem es Reize oder Inhalte im Ausstellungskontext adaptiert. Diese skalierbare und modulare Architektur garantiert eine starke Emotionsmodellierung durch korrelationsbewusstes Repräsentationslernen und tiefe multimodale Integration, was sich hervorragend für die computergestützte Modellierung affektiver Informatik in interaktiven oder erfahrungsbasierten Umgebungen eignet.

Die Auswahl der Fusion von DCCA mit MMFN basiert auf den aktuellen Einschränkungen der standardmäßigen unimodalen und flachen Fusionsmodelle. Obwohl CNN-ResNet und LSTM-CNN zeitliche oder räumliche Merkmale extrahieren, sind sie schlecht darin, heterogene Modalitäten wie EEG, EDA und Gesichtsausdrücke unter unterschiedlichen Umweltstimulationen auszubalancieren. DCCA maximiert die intermodale Korrelation, um gemeinsame latente Repräsentationen sicherzustellen, während MMFN hierarchische Fusions- und Aufmerksamkeitsmechanismen nutzt, um die informativsten Signale dynamisch hervorzuheben. In Kombination bieten diese Module einen zuverlässigeren, verständlicheren und breit anwendbaren affektiven UX-Modellierungsansatz für interaktive multisensorische Umgebungen.

Datenerfassung
Im vorgeschlagenen Modellrahmen der Wahrnehmungs-Emotion-Interaktion für interaktive Ausstellungen wird der öffentlich verfügbare AMIGOS-Datensatz24 als Grundlage für multimodale affektive Daten verwendet. Der AMIGOS-Datensatz bietet eine umfassende Sammlung physiologischer und verhaltensbezogener Messungen von menschlichen Teilnehmern, die affektauslösende Reize wie Videoclips durchlaufen. Diese Daten enthalten synchronisierte EEG-, EKG- und GSR-Signale, Gesichtsvideoaufnahmen sowie selbstberichtete emotionale Labels in diskreten (z. B. glücklichen, traurigen) und dimensionalen (Valenz/Erregung) Formen. Diese Modalitäten passen gut zu den Bedürfnissen des hier vorgeschlagenen Systems, das darauf abzielt, affektive Nutzererfahrungszustände (UX) während immersiver, multisensorischer Ausstellungsinteraktionen zu erschließen. Der Datensatz enthält Aufnahmen von 40 Proben, die jeweils kurzen (Videoclips <150 s) und langen (Filme >14 min) emotionsauslösenden Reizen ausgesetzt waren, unter Umständen, die reale Medieninteraktionen simulieren. Für den Umfang dieser vorgeschlagenen Arbeit wird ein vorverarbeiteter Teilsatz des Datensatzes verwendet: Aufzeichnungen von 30 Probanden mit artefakfreien, hochwertigen EEG-, EKG- und GSR-Signalen sowie vollständige Gesichtsvideo- und Annotationsdateien. Dies sind ausgewählte Samples, um multimodale emotionale Dynamiken während ausstellungsbasierter Situationen nachzuahmen. Der gelernte Datensatz bildet eine Trainings- und Benchmarking-Basis für die DCCA + Multimodal Fusion Network (MMFN)-Pipeline, wobei affektive Zustände wie Engagement, Langeweile, Verwirrung und Erregung als Reaktionen auf visuelle, auditive und räumliche Reize in einer simulierten Ausstellungsumgebung untersucht werden. Tabelle 1 zeigt die Datensatzbeschreibung der vorgeschlagenen Methode.

ParameterDetails
Name des DatensatzesAMIGOS (Ein Datensatz für Affekt-, Persönlichkeits- und Stimmungsforschung)
Nein. der TeilnehmerInsgesamt 40 (30 in vorgeschlagenen Arbeiten mit vollständigen multimodalen Daten verwendet)
Stimuli-TypKurze und lange Videoclips (emotional kommentiert)
EEG-Kanäle14-Kanal-Emotiv EPOC EEG-Headset
EKGHerzfrequenzsensor (für HRV und Erregung)
GSRHautleitfähigkeitssensor (Messung der sympathischen Aktivität)
GesichtsvideoHochauflösendes frontales Gesichtsvideo zur Ausdrucksanalyse
EmotionsetikettenSelbsteingeschätzte Valenz, Erregung, Dominanz (Skala 1–9) sowie diskrete Labels
StichprobenrateEEG: 128Hz, EKG/GSR: 1000Hz
Datenformat.mat-Dateien und synchronisierte Zeitstempelprotokolle
ModalitätssynchronisationJa – Synchronisiert über alle Sensoren und das Video hinweg
Dauer pro SitzungKurze Clips (<150 S) und lange Filme (>14 Min.)
AnwendungsanpassungAffektive UX-Modellierung, multimodale Fusion, Echtzeit-Wahrnehmungs-Emotions-Mapping

Tabelle 1: Beschreibung des AMIGOS-Datensatzes. Beschreibung des AMIGOS-Datensatzes, der im vorgeschlagenen Rahmen verwendet wurde, einschließlich Teilnehmerinformationen, Modalitäten, Stichprobenraten und experimentelles Design. Abkürzungen; AMIGOS = Ein Datensatz für Affekt-, Persönlichkeits- und Stimmungsforschung an Individuen und Gruppen.

Der öffentlich verfügbare AMIGOS-Datensatz, der im vorgeschlagenen Rahmen angewandt wird, besteht aus multimodalen Verhaltens- und physiologischen Daten, die von 40 Teilnehmern gesammelt wurden, von denen 33 aufgrund der Exzellenz und Vollständigkeit der Aufzeichnungen für diese Studie ausgewählt wurden. Der Datensatz zeichnet emotionale Reaktionen auf kurze und lange Videoclips auf und enthält Signale wie EEG (von einem 14-Kanal-Emotive-Headset), EKG für Herzfrequenzvariabilität, GSR für Hautleitfähigkeit und hochauflösendes Gesichtsvideo für Ausdrucksmessung. Emotionale Zustände werden sowohl in dimensionalen (Valenz, Erregung, Dominanz) als auch in diskreten Kategorien selbstberichtet. Die Daten sind in den Modalitäten gut aufeinander abgestimmt und entsprechend abgetastet – 128 Hz für EEG, 1000 Hz für EKG und GSR. Eine solche Konfiguration macht den Datensatz ideal, um die Nutzererfahrung (UX) in interaktiven Ausstellungen zu modellieren, sodass Wahrnehmungs-Emotionen-Interaktionen präzise mittels KI-basierter multimodaler Sensorik verfolgt werden können.

Datenvorverarbeitung
Alle Vorverarbeitungsschritte, Modelltraining und Bewertungen wurden einzeln in individuell geschriebenen Python-Skripten (Python 3.10, PyTorch 2.0) implementiert, wobei jedes Modul für Signalvorverarbeitung, DCCA-basierte Ausrichtung, MMFN-Training und Leistungsbewertung diente; Die Einstellung der Schlüsselparameter und einige wesentliche Rechenkonfigurationen sind in Tabelle 1 zusammengefasst. Um den öffentlich verfügbaren AMIGOS-Datensatz für affektive UX-Modellierung interaktiver Ausstellungen zu verarbeiten, implementieren Sie zunächst eine systematische Datenvorverarbeitungspipeline zu physiologischen und verhaltensbezogenen Modalitäten wie EEG, EKG, GSR und Gesichtsvideos. Standardisieren und synchronisieren Sie zunächst jede Modalität und führen dann modalitätsspezifische Vorverarbeitung durch. Derzeit werden kontextuelle Informationen nur noch durch intrinsische audiovisuelle Hinweise innerhalb der Videostimuli gewonnen, wie zum Beispiel Gesichtsausdrücke, visuelle Bewegungsmuster und akustische Merkmale wie Sprachprosodie und Hintergrundton.

Signalnormalisierung und Resampling
Rohe physiologische Signale x(t) aus allen Modalitäten werden auf eine gemeinsame Frequenz fs=128 Hz neu abgetastet, um zeitlich ausgerichtet zu sein:

Gleichung 1(1)

Das Resampling erfolgte mit einer Standardfunktion der Signalverarbeitungsbibliothek und nicht mit einem speziell entwickelten Algorithmus. Konkret wurde die Implementierung mit dem im Python-Signalverarbeitungsökosystem (SciPy) verfügbaren Resampling-Utility durchgeführt, das auf Fourier-Methode basierende Interpolation anwendet, um Signale in die Ziel-Abtastfrequenz umzuwandeln. Die Zielstichprobenrate fs wurde gewählt, um eine einheitliche zeitliche Auflösung zwischen verschiedenen Modalitäten vor Segmentierung und Merkmalextraktion sicherzustellen. Jedes Signal wird anschließend mit dem Z-Score normalisiert, um die Intersubjektvariabilität zu eliminieren:

Gleichung 2(2)

wobei μx und σx der Mittelwert des Testfensters und die Standardabweichung des Signals sind.

EEG-Vorverarbeitung
Die EEG-Signale, die von 14 Kanälen erfasst werden, werden mit der Wahl von 4–45 Hz Bandpass-gefiltert, um kognitiv verwandte Frequenzen zu erhalten:

Gleichung 3(3)

Das Leistungsspektrum wird verwendet, um Frequenzmuster in Signalen zu bestimmen, und dies kann je nach Art der Emotion im Fall des Gehirnsignals unterschiedlich sein und kann nützliche Informationen über das Signal liefern. Welchs Technik ist eine überlegene Methode der Periodogramm-Gleichung 3, die eine Schätzung der spektralen Dichte liefert und zur Gewinnung von Spektrogrammen verwendet werden kann. Welchs Technik segmentiert das Zeitdomänensignal in diskrete Zeitintervalle und Konstrukte. Ein Spektrogramm für jedes Segment, dann werden alle Spektrogramme gemittelt, wie in Gleichung 4 gezeigt. Dieser Prozess ist im Vergleich zum vollständigen FFT-Ansatz flüssiger und holt daher die maximale Leistung aus den Signalen heraus. Schließlich wird die Leistungsspektraldichte (PSD)19 mit Welchs Technik berechnet, um die Eigenschaften des Frequenzbereichs zu erfassen:

Gleichung 4(4)

PSD-Merkmale werden über fünf Bänder summiert: Theta (4–8 Hz), Alpha (8–13 Hz), Beta (13–30 Hz), Low Gamma (30–45 Hz).

Videobasierte Gesichtszüge
Durch das Extrahieren von Facial Action Units (AUs) und Augenbeobachtungsvektoren für jeden Videoframe mit einem Multikanal-EEG-Datensatz oder ähnlicher Software werden diese anschließend als temporale Sequenzen kombiniert:

Gleichung 5(5)

Emotionslabel-Mapping
Sowohl Valenz-Erregungswerte als auch diskrete Emotionsmarkierungen werden von AMIGOS vergeben. Die kontinuierlichen Bewertungen werden auf [0,1] normalisiert:

Gleichung 6(6)

Dabei ist V der tatsächlich beobachtete Wert vor der Normierung, Vmin der kleinste Wert der Variablen im Datensatz, Vmax der größte Wert der Variablen im Datensatz und V' der normalisierte Wert im Bereich 0 bis 1. Diese Bezeichnungen werden als Grundwahrheit für überwachte Affektmodellierung angewendet. Diese Bezeichnungen werden als Grundwahrheit für überwachte Affektmodellierung angewendet.

Synchronisation über verschiedene Modalitäten hinweg
Alle Modalitäten werden bei Bedarf mittels Zeitstempelausrichtung oder dynamischer Zeitverzug (DTW) synchronisiert:

Gleichung 7(7)

Die vorverarbeiteten, funktionsreichen Daten werden dann in das Deep Canonical Correlation Analysis (DCCA)-Modul eingegeben, das die maximal korrelierten Darstellungen zwischen Modalitäten lernt.

Merkmalsextraktion mittels DCCA
Im vorgesehenen Rahmen der affektiven UX-Modellierung für interaktive Ausstellungen wird DCCA genutzt, um verwandte latente Merkmale in heterogenen Modalitäten wie EEG, EKG, EDA, Gesichtsausdrücke und Eye-Tracking-Daten zu erlernen. Ziel ist es, einen gemeinsamen Repräsentationsraum zu erlernen, in dem Signale aus verschiedenen Modalitäten, wenn auch einzeln rauschig oder modalitätsspezifisch, maximal korreliert und semantisch konsistent in Bezug auf wahrgenommene emotionale Zustände sind. In dieser Arbeit wurde DCCA auf folgende Modalitätspaare angewendet: i) EEG–EKG, ii) EEG–GSR und iii) EEG–Gesichtsmerkmale-Darstellungen. Diese Paare wurden ausgewählt, um komplementäre neuronale-physiologische und neuronale-verhaltensbezogene Korrelationen zu erfassen, die für die affektive Beteiligung relevant sind. Um DCCA auf ein multimodales Setting auszuweiten, wurden die paarweisen DCCA-Einbettungen für jedes Modalitätspaar berechnet und anschließend mit dem vorgeschlagenen MMFN fusioniert, das eine effiziente Integration von mehr als zwei Modalitäten ermöglicht, ohne die Kernformulierung von DCCA zu verändern.

Durch die Durchführung korrelationsgetriebener latenter Ausrichtung vor der Fusion trennt DCCA strukturell Repräsentationsalignierung von Entscheidungsfusion, im Gegensatz zu Cross-Modal Attention oder Tensor-Fusion-Netzwerken, die direkt an möglicherweise fehlgeleiteten Darstellungen arbeiten. Die Redundanz wird verringert, und die Repräsentationskohärenz wird durch diese zweistufige Architektur verbessert. Darüber hinaus optimiert DCCA direkt die intermodale statistische Abhängigkeit, anstatt sich nur auf gemeinsame Verlustfunktionen zu verlassen, was für heterogene physiologische Daten besser geeignet ist als für Multitask-Lernframeworks. Erstens werden DCCA20 verwendet, um Darstellungen einer Reihe von Modalitäten zu berechnen, indem sie sequentiell durch mehrere gestapelte Schichten nichtlinearer Transformationen behandelt werden. Abbildung 2 veranschaulicht den Aufbau des DCCA, der in dieser Forschungsarbeit eingesetzt wurde. Eine Grid-Search-Methode wurde von uns verwendet, um optimale Hyperparameter für die Architektur des Deep-Learning-Modells für den DCCA-Ansatz zu bestimmen. Nach einer gründlichen experimentellen Analyse wählten die Autoren einen stochastischen Gradientenabstiegsoptimierer, einen Kreuzentropieverlust und einen regulierenden Parameter von 1e5 aus. Anschließend wählten die Autoren 15 Optimierungsschritte aus, bei denen der Biasvektor ausschließlich Nullen, das Validierungsset als frühzeitiges Stoppkriterium und der Xavier-Initialisierer als Gewichtungsinitialisierer diente. Abbildung 2 zeigt den Arbeitsprozess der DCCA.

Abbildung 2
Abbildung 2: Arbeitsprozess der DCCA. Prozessworkflow von DCCA, der die Abbildung von Eigenschaften aus verschiedenen Modalitäten in einen gemeinsamen latenten Raum zeigt, um die Korrelation zu maximieren.
Abkürzungen; DCCA = Tiefe Kanonische Korrelationsanalyse. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 2 zeigt visuell den internen Arbeitsrahmen der Deep Canonical Correlation Analysis (DCCA) für gemeinsames Repräsentationslernen zwischen zwei verschiedenen Modalitäten, EEG (Modalität A) und EDA (Modalität B). Beide Modalitäten werden in ihre jeweiligen tiefen Feature-Extractor-Netzwerke (Feature Extractor A und B) eingespeist, die mehrere versteckte Schichten besitzen, die abstrakte, modalitätsspezifische Merkmale erlernen. Vor der Fusion wird die crossmodale latente Ausrichtung mittels Deep Canonical Correlation Analysis (DCCA) durchgeführt. Für jedes Modalitätspaar werden zwei parallele Tiefprojektionsnetzwerke gebaut (EEG–ECG, EEG–EDA und EEG–Facial). Mit ReLU-Aktivierung besteht jedes Projektionsnetzwerk aus drei vollständig verbundenen Schichten mit Dimensionen [256, 128, 64]. Für den gemeinsamen latenten Raum ist 64 die ultimative Einbettungsdimension. Mit einem L2-Regularisierungskoeffizienten von 1e-5 zur Garantie der numerischen Stabilität maximiert die Zielfunktion die kanonische Korrelation zwischen den projizierten Modalitätseinbettungen. Biasvektoren werden auf null initialisiert, und Gewichte werden über Xavier-Initialisierung initialisiert. Um das Ausrichtungslernen zu stabilisieren, werden die DCCA-Module vor dem MMFN-Training separat trainiert. Um die Ausrichtungskonsistenz zu gewährleisten, gibt es keine End-to-End-Feinabstimmung zwischen DCCA und MMFN. Diese Pipelines von neuronalen Netzen nehmen die Eingabedatenströme parallel, aber isoliert auf. Die Feature-Extractor-Ausgabe von jedem von ihnen wird dann in den gemeinsamen latenten Raum projiziert, wo die Merkmale beider Modalitäten so abgebildet werden, dass sie strukturell vergleichbar werden. Die Projektionen werden gemäß dem Ziel von DCCA optimiert, nämlich die Korrelation zwischen den entsprechenden latenten Darstellungen von EEG und EDA zu maximieren. Durch den Erwerb dieses maximal korrelierten Subraums garantiert DCCA, dass die Ausgabe-Einbettungen komplementäre und semantisch signifikante Muster aus beiden Modalitäten behalten, die für nachgelagerte Anwendungen wie Emotionserkennung oder affektives Rechnen unerlässlich sind.

In dieser Arbeit werden die Merkmale mittels DCCA umgewandelt und anschließend zur Kategorisierung integriert. Das in Abbildung 2 gezeigte DCCA-Modell verwendet ein Deep-Learning-Modell für die Feature-Transformation. Die CCA-Schicht berechnet die Korrelation, die dann für die Kombination und Klassifizierung von Merkmalen verwendet wird. Angenommen, die Matrix Gleichung 8 speichert Versuche der EEG-Modalität, und die Matrix Gleichung 9 enthält Gesichtsvideo-Modalitätsexperimente. In diesem Fall werden die Dimensionen der Merkmale in den EEG-Studien und Gesichtsvideoclips durch n1 bzw . n2 dargestellt, während die Gesamtzahl der Versuche durch MA angegeben wird. Für jede Modalität haben die Autoren folgendes tiefes neuronales Netzwerk erstellt, um die Eingabeeigenschaften auf nichtlineare Weise neu zu ordnen:

Gleichung 10(8)

wobei die Parameter der nichtlinearen Transformation als HT1 und HT2 dargestellt werden; die nachfolgenden Eigenschaften jedes neuronalen Netzwerks werden als Gleichung 11 und Gleichung 12 sowie die Messung der Charakteristik von DCCA als n dargestellt. Rekursiv erlernte Parameter HT1 und HT2, erzeugt aus DCCA, haben die Korrelation zwischen ON1 und ON2 so weit wie möglich gesteigert:

Gleichung 13(9)

Gegenseitig gelernte Parameter wie HT1 und HT2 wurden durch den Backpropagation-Algorithmus trainiert. Um die beabsichtigte Antwort zu erhalten, wurden die Gradienten der Zielfunktion wie vorgeschlagen angenähert. Die veränderten Merkmale ON1 und ON2 ∈ SP befinden sich im kombinierten Hyperraum-SP, nachdem die beiden neuronalen Netzwerke trainiert wurden. Die Autoren von DCCA mainly20 erwähnten nicht ausdrücklich die Verwendung veränderter Merkmale. Die veränderten Funktionen können so genutzt werden, dass sie der Anwendung des Nutzers am besten dient. In diesem Werk erhielten die Autoren die folgenden verschmolzenen Merkmale aus veränderten Merkmalen:

Gleichung 14(10)

wobei α und β Gewichte darstellen, die α + β = 1 halten. Die mit DCCA integrierten Eigenschaften ON werden in den SoftMax-Klassifikator eingegeben. Emotionserkennungsaufgaben werden verwendet, um den Klassifikator zu trainieren. Wie bereits erwähnt, hat der Aufbau von DCCA für Datenfusionen über verschiedene Formate hinweg einige Vorteile. Um beispielsweise die Eigenschaften und Korrelation modalitätszentrierter Transformationen zu beobachten, erhält DCCA explizit ON1 und ON2 für jede Modalität bei der Merkmals-Fusion. Darüber hinaus können emotionsbasierte Daten durch die Steuerung der nichtlinearen Abbildungsfunktionen f1(·) und f2(·) erhalten werden. Darüber hinaus verwenden die Autoren für jede Modalität in der gewichteten Summenfusion äquivalente Gewichte. Ein Multimodales Fusionsnetzwerk (MMFN), das Nutzererfahrungszustände vorhersagt, erhält diesen kombinierten Speicher. Für die multimodale Ausrichtung wird ein hierarchischer Ansatz verwendet, bei dem die Rohsignale zunächst zeitlich mit Neubeschaffung und Zeitstempelausrichtung ausgerichtet werden und die Ausrichtung der semantisch reichen Signale aus verschiedenen Modalitäten mittels Deep Canonical Correlation Analysis (DCCA) erreicht wird. Dies stellt sicher, dass die modalitätsbewussten Repräsentationen vor dem aufmerksamkeitsbasierten Fusionsprozess im MMFN in einen gemeinsamen latenten Raum umgewandelt werden.

Multimodales Fusionsnetzwerk (MMFN) für affektive UX-Modellierung
Das MMFN kodiert jede Modalität separat und fusioniert sie dann mit einem Fusionsgatter und einem Aufmerksamkeitsmechanismus, um eine integrierte Darstellung zur Emotionsvorhersage zu erzeugen.

Modalitätsspezifische Codierung
Sei x(i)Rdi der Charakteristikavektor für die i-te Modalität (z. B. EEG, EDA). Jede Modalität ist mit einem neuronalen Encoder codiert:

Gleichung 15(11)

Gated Fusion-Mechanismus
Um den Informationsfluss aus jeder Modalität zu steuern, wird ein Fusions-Gate verwendet:

Gleichung 16(12)

Gleichung 17(13)

σ ist die Aktivierungsfunktion des Sigma. ⊙charakterisiert elementweise Entwicklung. Dies ermöglicht es dem Netzwerk, verrauschte Modalitäten dynamisch zu reduzieren oder nützliche Funktionen zu erhöhen.

Crossmodalitäts-Aufmerksamkeitsfusion
Eine Aufmerksamkeitsschicht lernt, wie viel Gewicht auf die Darstellung jeder Modalität gelegt werden soll:

Gleichung 18(14)

Gleichung 19(15)

α(i) sind AufmerksamkeitsgewichteGleichung 21für die verschmolzene Enddarstellung.

Affektive Zustandsvorhersage
Der fusionierte Vektor wird in eine Ausgabeschicht eingegeben, um Vorhersagen von Valenz-/Erregungs- oder UX-Zuständen zu treffen:

Gleichung 2222(16)

Wo Gleichung 23 verwendet werden kann, um Diskrete Emotionsklasse (glücklich, neutral, traurig), kontinuierliche Skala (Valenz/Erregung) und UX-Kategorien (engagiert, abgelenkt, überladen) darzustellen.

Abbildung 3
Abbildung 3: Struktur des MMFN. Struktur des MMFN mit modalitätsspezifischen Encodern, gated fusion und aufmerksamkeitsbasierter Integration zur affektiven Zustandsvorhersage.
Abkürzungen; MMFN = Multimodales Fusionsnetzwerk. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3 zeigt den Arbeitsprozess eines Multimodal Fusion Network (MMFN), das in einem affektiven Rechenrahmen zur Vorhersage von Emotionen und Benutzererfahrung (UX) eingesetzt wird. Modalitätsspezifische Encoder, geschlossene Fusionsschichten, ein aufmerksamkeitsbasiertes Integrationsmodul und ein finaler Klassifikationskopf bilden die hierarchische Fusionsarchitektur des MMFN. Es zeigt, wie verschiedene heterogene Eingabemodalitäten wie EEG (Modalität A), EDA (Modalität B) und Gesichtsausdrücke (Modalität C) mit eigenen spezialisierten Encodernetzwerken (Encoder A, B und C) verarbeitet werden. Ein unabhängiger Encoder, bestehend aus zwei vollständig verbundenen Schichten mit ReLU-Aktivierungsprozessen, die jede Modalität (EEG, ECG, EDA und Gesichtsmerkmale) abarbeitet, bevor eine bidirektionale Langzeitgedächtnisschicht (BiLSTM) zeitliche Abhängigkeiten erfasst. Jeder Encoder lernt eine modalitätsspezifische Merkmalsrepräsentation, die bedeutende emotionale oder physiologische Merkmale aus dem entsprechenden Datenstrom beibehält. Jede Richtung im BiLSTM hat 128 versteckte Einheiten, was jeder Modalität eine 256-dimensionale kontextuelle Einbettung verleiht. Um Überanpassungen zu vermeiden, wird nach der BiLSTM-Schicht Dropout (Rate = 0,5) durchgeführt. Ein Gated Fusion-Ansatz, der die Sigmoid-Aktivierung nutzt, um Modalitätsbeiträge dynamisch zu steuern, wird dann auf die codierten Modalitätsrepräsentationen angewendet. Eine Selbstaufmerksamkeitsschicht berechnet dann Aufmerksamkeitsgewichte über verschiedene Modalitäten hinweg, um verrauschte Signale zu unterdrücken und relevante Informationen hervorzuheben. Eine vollständig verbundene Schicht und entweder eine lineare Ausgabeschicht für Valenz-Arousal-Regressionsaufgaben oder eine Softmax-Ausgabeschicht für diskrete Klassifikationsaufgaben projizieren die fusionierte Darstellung. Die Ausgabe jedes Encoders wird dann einer Multimodalen Fusionsschicht zugeführt, die alle Modalitätsmerkmale verkettet und einen Aufmerksamkeitsmechanismus anwendet, um informativere Signale und Maskenrauschen hervorzuheben. Diese Operation erzeugt eine gemeinsame latente Repräsentation, die emotionale Signale über alle Modalitäten hinweg in einen hochstufigen dichten Vektor integriert.

Die BiLSTM-Schichten, die auf modalitätsspezifische sequentielle Einbettungen angewendet werden, modellieren die temporale Dynamik direkt. Das BiLSTM ermöglicht kontextuelle Modellierung sich verändernder affektiver Zustände, indem sowohl vorwärts- als auch rückwärtszeitliche Abhängigkeiten innerhalb segmentierter physiologischer Sequenzen erfasst werden. Darüber hinaus wird die adaptive Gewichtung zeitrelevanter Merkmale durch die folgende aufmerksamkeitsbasierte Fusionsschicht ermöglicht, die über zeitlich codierte Darstellungen funktioniert. Die Autoren haben den Text kürzlich aktualisiert, um deutlicher zu machen, wie Sequenzaufbau, rekurrentes Codieren und Aufmerksamkeitsgewichtung zusammenwirken, um temporale Modellierung zu unterstützen.

Der vorgeschlagene Pseudocode 1 zeigt den gesamten Prozess der affektiven Nutzererfahrungsmodellierung mit DCCA-MMFN in reproduzierbarer Form. Zunächst werden multimodale physiologische und verhaltensbezogene Signale in einen unabhängigen Vorverarbeitungsschritt eingespeist, der Rauschreduktion und Normalisierung von Skalen umfasst. Die Features werden dann in DCCA eingespeist, wobei korrelierte Features gemeinsam für bestimmte Modalitätspaare erlernt werden, mit dem Ziel einer robusten intermodalen Ausrichtung. Die ausgerichteten Merkmale werden anschließend in einem MMFN kombiniert, das aus gesperrten und Aufmerksamkeitsmechanismen für modalitätsspezifische Modulation besteht, die darauf abzielen, informative Modalitäten zu fördern und Rauschen zu unterdrücken. Die endgültige kombinierte Merkmalsrepräsentation wird verwendet, um einen Klassifikator für die affektive und UX-bezogene Zustandsschätzung zu trainieren, und die Gesamtleistungsbewertung erfolgt auf Basis von Standardkennzahlen. Die Schritt-für-Schritt-Natur dieses vorgeschlagenen Pseudocodes gewährleistet Transparenz, Machbarkeit und eine einfache Vervielfältigung durch andere für alle technisch informierten Personen, die sich für dieses vorgeschlagene Protokoll interessieren.

Der vorgeschlagene Rahmen zielt darauf ab, den Zustand der affektiven Nutzererfahrung (UX) anhand multimodaler physiologischer und verhaltensbezogener Signale aus dem AMIGOS-Datensatz anhand folgender Schritte vorherzusagen: Schritt 1: Die eingegebenen multimodalen Daten bestehen aus EEG, EKG, EDA, Blick- und Gesichtsausdruckssignalen. Zunächst wird auf den multimodalen AMIGOS-Datensatz zugegriffen, und jede Modalität wird einer Signalvorverarbeitung unterzogen, einschließlich Rauschfilterung und Normalisierung, um Datenqualität und -konsistenz sicherzustellen. Schritt 2: Um zeitliche Gleichmäßigkeit zwischen den Modalitäten zu gewährleisten, werden alle Signale auf eine Standardfrequenz umgesamplt. Anschließend wird modalitätsspezifische Merkmalsextraktion durchgeführt, um charakteristische Merkmalsrepräsentationen zu erhalten, die zu jedem Signaltyp passen. Schritt 3: Um intermodale Beziehungen zu erfassen, werden ausgewählte Modalitätspaare (EEG–ECG, EEG–EDA und EEG–Facial) mittels Deep Canonical Correlation Analysis (DCCA) verarbeitet. Die DCCA-Netzwerke werden darauf trainiert, korrelierte latente Darstellungen zwischen gepaarten Modalitäten zu lernen, was zu ausgerichteten Merkmalseinbettungen für jedes Modalitätspaar führt. Diese ausgerichteten Darstellungen werden dann kombiniert, um einen einheitlichen multimodalen Merkmalraum zu bilden. Schritt 4: Die aggregierten ausgerichteten Merkmale werden als Eingabe für ein Multimodales Fusionsnetzwerk (MMFN) bereitgestellt, in dem Aufmerksamkeitsmechanismen und Gated-Fusion-Strategien eingesetzt werden, um komplementäre Informationen über verschiedene Modalitäten hinweg effektiv zu integrieren. Dieser Fusionsprozess erzeugt eine umfassende affektive Darstellung. Schritt 5: Die resultierende Darstellung wird anschließend verwendet, um einen Klassifikator mit beschrifteten Emotionsdaten zu trainieren, der den affektiven UX-Zustand vorhersagt. Abschließend wird die Modellleistung anhand von Standardkennzahlen bewertet, darunter Genauigkeit, Präzision, Rückruf, F1-Wert und Area Under the Curve (AUC). Der vorhergesagte affektive UX-Zustand wird als endgültiges Ergebnis des Frameworks zurückgegeben.

Wahrnehmungs-Emotionsmodellierung mit dem vorgeschlagenen DCCA-MMFN-Rahmen
Im vorgeschlagenen rechnergestützten Rahmen der affektiven Nutzererfahrung (UX) interaktiver Ausstellungen ist das Modul Perception–Emotion Modeling der zentrale Prozess, der die Wahrnehmungsreaktionen des Nutzers auf Umweltreize mit seinen multimodalen, biophysikalisch abgeleiteten emotionalen Zuständen verbindet. Dieses Modul basiert auf den von DCCA gewonnenen gängigen Darstellungen physiologischer und verhaltensbezogener Modalitäten wie EEG, EDA, EKG, Gesichtsausdrücke und Augenbewegungen, um die affektiven Dynamiken des Nutzers aufzuzeichnen. Gleichzeitig werden Metadaten über die umgebende Ausstellungsumgebung – visuelle Reize, Klanglandschaften, Muster der Interaktivität und Umgebungsmerkmale – verwendet, um Wahrnehmungshinweise zu kodieren. Mit einem Multimodal Fusion Network (MMFN) zur Kombination dieser multimodalen Darstellungen erhält das Modell detaillierte, nichtlineare Abbildungen von Wahrnehmungsreizmerkmalen und Emotionslabels oder -dimensionen (z. B. Valenz, Erregung, Engagement). Dieses Mapping ermöglicht es dem System, ständig zu wissen, wie ein Nutzer emotional auf verschiedene Ausstellungselemente reagiert, und dann den Inhalt oder die Benutzeroberfläche entsprechend anzupassen, um das Engagement, die Zufriedenheit oder die kognitive Resonanz zu steigern. Schließlich erleichtert die Wahrnehmungs-Emotion-Modellierung eine emotionsbewusste Anpassung der Interaktion, die den Kern der rechnergestützten Modellierung und nutzersensibler Präsentationssysteme bildet.

Zunächst wurden DCCA-Module darauf trainiert, korrelierte latente Repräsentationen für jedes Modalitätspaar zu lernen. Die resultierende Einbettung dient als Eingabe für das MMFN und wird sequentiell für die affektive Vorhersageaufgabe weiter trainiert. Es wird kein End-to-End-Feinabstimmung durchgeführt, um die Stabilität des Trainings aufrechtzuerhalten.

KategorieParameterWert / Beschreibung
SignalvorverarbeitungEEG-Bandpassfilter4–45 Hz
Resampling-Frequenz128 Hz
Fensterlänge2 s
Fensterüberlappung50%
NormalisierungZ-Score-Normalisierung
DCCA-ArchitekturAnzahl der versteckten Schichten3 Schichten pro Modalität
Neuronen pro Schicht128–64–32
Latente Dimensionsgröße (n)32
Regularisierungsparameter1 × 10⁻⁵
OptimiererAdam
Lernrate0.001
Chargengröße32
Epochen der maximalen Ausbildung150
Frühes Stoppen von Geduld15 Epochen
MMFN-KonfigurationEncoder-TypBiLSTM
Versteckte Einheiten64
Abbrecherquote0.3
FusionsstrategieGated Fusion mit Aufmerksamkeit
AufmerksamkeitstypEEG, EKG, GSR, Video
Ausbildung und BewertungVerlustfunktionKreuzentropieverlust
Zug-Test-Aufteilung5-fache Kreuzvalidierung
BewertungsmetrikenGenauigkeit, Präzision, Rückruf, F1-Wertung, Cohens Kappa, AUC–ROC
ReproduzierbarkeitskontrollpunkteEEG-EingangstensorformKanäle × Zeitproben (z. B. 14 × 256 pro Fenster)
DCCA-Ausgabedarstellung32-dimensionale geteilte latente Einbettung
MMFN-AusgabeWahrscheinlichkeiten der Emotionsklassen (Valenz-Erregungs- oder diskrete Klassen)
Erwartete Validierungsleistung85–90 % Klassifikationsgenauigkeit

Tabelle 2: Parameter des vorgeschlagenen DCCA–MMFN-Algorithmus. Zusammenfassung der Vorverarbeitungs-, Architektur-, Fusions-, Trainings-, Evaluierungs- und Reproduzierbarkeitsparameter, die im vorgeschlagenen Rahmen für affektive UX-Modellierung berücksichtigt wurden. Abkürzungen; DCCA = Tiefe Kanonische Korrelationsanalyse; MMFN = Multimodales Fusionsnetzwerk; UX = User Experience.

In Tabelle 2 wird der gesamte Parametersatz des vorgeschlagenen DCCA-MMFN-Rahmens dargestellt, der Signalvorverarbeitung, Tiefarchitekturdesign, Fusionstechnik sowie Trainingsbedingungen berücksichtigt. Physiologische Signale wurden einheitlich neu betastet und normalisiert, um sie in Bezug auf ihre jeweiligen Modalitäten zu synchronisieren. Die DCCA-Schicht war so konfiguriert, dass sie mehrschichtige nichtlineare Transformationen verwendete, was das Erlernen maximal korrelierter latenter Räume erleichterte, während die MMFN-Komponente BiLSTM-Encodernetzwerke mit Gated Attention-Mechanismen nutzte, um den Wert verschiedener Modalitäten dynamisch zu bewerten. Die Anforderungen an Ausbildung und Bewertung sind explizit definiert, um einen fairen Vergleich mit bestehenden Optionen zu gewährleisten.

Der vorgeschlagene Rahmen soll als rechnergestützte Grundlage für affektbewusste Systeme dienen, die Verhaltens- und physiologische Informationen in mehreren Dimensionen nutzen. Die Architektur ist konzeptionell an reale Umgebungen wie intelligente Ausstellungsräume, adaptive intelligente Schnittstellen und affektbewusste Mensch-Computer-Interaktionssysteme anpassbar, obwohl die aktuelle Studie das Modell durch kontrollierte Offline-Experimente mit dem öffentlich verfügbaren AMIGOS-Datensatz validiert. Das Framework kann als grundlegendes Modul für Anwendungen dienen, die eine zuverlässige Emotionsinferenz benötigen, indem es einheitliche Fusionstechniken, intermodale Ausrichtung und strukturierte Vorverarbeitung bietet. Anstatt jedoch experimentell eingesetzte Systeme zu sein, werden diese Umgebungen in dieser Studie als mögliche Einsatzkontexte beschrieben.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bewertung des vorgeschlagenen Systems
Zur Bewertung des vorgeschlagenen Systems führte es Experimente mit dem öffentlich verfügbaren AMIGOS-Datensatz durch, der synchronisierte Messungen von EEG, EKG, GSR, Video und Audio von 40 Nutzern liefert, die emotional anstrengenden Reizen ausgesetzt waren. Für diese Forschung verwendeten die Autoren Daten von 33 Teilnehmern (nach Vorbearbeitung und Entfernung unvollständiger Studien), was zu 1.320 gültigen Proben in den Dimensionen Valenz und Erregung führte. ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Räumliche, umweltbezogene und physische Interaktionskontexte, wie räumliche Anordnung, Menschenmengendichte oder Umweltbedingungen, sind im AMIGOS-Datensatz ausdrücklich nicht angegeben. Daher werden solche Faktoren in den aktuellen Experimenten ebenfalls nicht direkt modelliert. Der vorgeschlagene rechnergestützte Rahmen für die Modellierung der affektiven Nutzererfahrung (UX) geht weit über die grundlegenden Konzepte der Grundarbeit hinaus, die sich mit der benutzerorientierten Kind-Ro...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben keine Interessenkonflikte.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren würdigen die Unterstützung der School of Space Design und der School of Industrial Design an der Hongik Universität. Die Autoren danken auch den Ausstellungspartnern und Teilnehmern für ihre Beiträge zur Studie.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
DatensatzAMIGOS-Datensatz40 Teilnehmer; EEG (128 Hz), EKG (1000 Hz), GSR (1000 Hz), Gesichtsvideo, selbstberichtete Valenz-/ErregungsetikettenMultimodale Grundwahrheitsdaten für affektive Zustandsmodellierung
Physiologische SensorenEEG-HeadsetEmotiv EPOC+ (14 Kanäle, 128 Hz)Erfassen der Gehirnaktivität im Zusammenhang mit Aufmerksamkeit, Erregung und Engagement
EKG-SensorBiopac MP150 oder äquivalent (1000 Hz)Herzfrequenzvariabilität und Erregung
GSR/EDA-SensorShimmer GSR+ oder äquivalent (1000 Hz)Hautleitfähigkeit als Maß für Erregung
VerhaltenssensorenAugenverfolgungsgerätTobii Pro X2-60 oder gleichwertigAufzeichnung von Blickfixierung und Sakkaden
GesichtsausdrucksaufnahmeHochauflösende Videokamera; analysiert mit OpenFace (AUs, Blickvektoren)Extraktion von Gesichtsaktionseinheiten (AUs) und Blickhinweisen
UmwelteinflüsseAudiovisuelle AufnahmeeinrichtungMikrofon + Kamera (synchronisiert mit Reizen)Erfassung kontextueller Reize während der Ausstellung
Software / ToolkitsOpenFaceOpen-Source-Toolkit zur Analyse von GesichtsverhaltenExtraktion von Einsatzeinheiten (AUs), Blickrichtung
MATLAB / Python (NumPy, SciPy, scikit-learn)Signalvorverarbeitung (Resampling, Z-Score-Normalisierung, PSD-Berechnung)Datenvorverarbeitung und Feature-Extraktion
TensorFlowv2.13 / PyTorchv2.0Deep-Learning-Framework für DCCA und MMFNModellimplementierung und Schulung
Algorithmen / ModelleTiefe Kanonische Korrelationsanalyse (DCCA)Methode der nichtlinearen MerkmalsausrichtungLernen korrelierter latenter Repräsentationen über verschiedene Modalitäten hinweg
Multimodales Fusionsnetzwerk (MMFN)BiLSTM + Aufmerksamkeitsbasierte FusionsschichtenHierarchische Verschmelzung heterogener Modalitäten zur UX-Zustandsklassifikation
BewertungsmetrikenGenauigkeit, Präzision, Rückruf, F1-Score, Cohen' s Kappa, AUC-ROC, VerwirrungsmatrixImplementierung mit scikit-learn / TensorFlow-MetrikenModellleistungsbewertung
Computing-HardwareWorkstation-/GPU-ClusterNVIDIA RTX 3080 (10GB) oder äquivalent, 32 GB RAM, Intel i9 ProzessorModelltraining und Simulation

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Affective ModelingMultimodal FusionPhysiological SignalsEmotion RecognitionDeep Learning FrameworkEEG SignalsECG SignalsGSR SignalsFeature AlignmentOffline Experiments

Related Articles