Artykuł badawczy

Projektowanie adaptacyjnych ram interakcji multimodalnych w celu zwiększenia współpracy człowieka z AI

DOI:

10.3791/69830

24 lutego 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Praca ta proponuje mechanizm hierarchicznego wyrównania oparty na dynamicznym zakrzywieniu czasu (DTW) z adaptacją online i wielomodalną fuzją sterowaną uwagą, umożliwiającą niezawodne przewidywanie intencji w długim horyzoncie i śledzenie zadań. Moduł lekkiej wyjaśnialności poprawia interpretowalność, budując zaufanie do współpracy człowieka i AI. Podejście to uogólnia się zarówno na systemy robotyczne, jak i wirtualne interaktywne.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Osiągnięcie skutecznej i naturalnej współpracy człowieka z AI pozostaje poważnym wyzwaniem, zwłaszcza w dynamicznych, rzeczywistych środowiskach. Istniejące ramy często są ograniczone przez sztywne jednomodalne wejścia lub wielosystemową fuzję opartą na regułach, co ogranicza ich odporność, personalizację i elastyczność. Niniejsze badanie wprowadza adaptacyjne ramy interakcji multimodalnej, które integrują estymację pozycji opartą na wzroku oraz rozumienie komend oparte na mowie w hierarchicznym modelu prognozowania intencji człowieka. Ramy wykorzystują modele sekwencji oparte na Transformerach do przewidywania działań oraz dynamiczne zakrzywianie czasu, aby dostosować ludzkie zachowania do strukturalnych wykresów zadań w celu długoterminowego planowania. W przeciwieństwie do wcześniejszych podejść opartych na statycznym przełączaniu modalności, nasza architektura stosuje mechanizm fuzji oparty na uwadze, aby dynamicznie ważyć najbardziej informacyjne wejścia. Ponadto moduł adaptacji online umożliwia dostosowywanie zachowań użytkowników w czasie rzeczywistym, uzupełniony przez lekką warstwę wyjaśnienia, która buduje zaufanie użytkowników. Eksperymentalna ocena w zadaniu zespołowym wykazuje znaczące postępy w wydajności zadania (do 24%), dokładności przewidywania intencji (do 18%) oraz satysfakcji użytkownika. Wyniki te podkreślają skuteczność i wszechstronność adaptacyjnych ram interakcji multimodalnej, wspierając ich potencjał do rozwoju inteligencji współpracy w kierunku bardziej niezawodnych, przejrzystych i zorientowanych na człowieka systemów AI.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Współpraca człowiek-robot (HRC) jest jednym z ważnych obszarów badań, zwłaszcza że roboty są coraz częściej wdrażane w środowiskach skoncentrowanych na człowieku. Podczas gdy ramy i technologie dla krótkoterminowego HRC znacznie się poprawiły 1,2, długoterminowe HRC nie jest jeszcze tak dojrzałe3. W zastosowaniach przemysłowych eksploatacja długoterminowego HRC może prowadzić do znaczącego wzrostu produktywności i zdolności adaptacyjnej w złożonych procesach produkcyjnych4. Środowiska domowe, roboty jako towarzysze lub osoby opieki nad osobami starszymi mają potencjał poprawy jakości życia dzięki długoterminowemu HRC5. Funkcje medyczne w maszynach społecznościowych jako zastępstwo dla gospodarstwa domowego i opiekunów, obejmując opiekę nad osobami dotkniętymi demencją, autyzmem oraz innymi chorobami fizycznymi lub psychicznymi6. Jednocześnie domeny podróży i przyjazności wykorzystują roboty przemysłowe do poszerzania wiedzy użytkowników7. W inżynierii inteligentnej celem jest udział w AI w sposób skoncentrowany na człowieku, aby odzyskać kompetencje i tworzyć spersonalizowane uprawy, etap znany jako Industry 5.0. Systemy współpracy człowiek-AI oraz człowiek-robot zostały zbadane w różnych dziedzinach zastosowań 8,9,10; Jednak ostatnie badania coraz częściej koncentrują się na współpracujących warunkach robotów, które wymagają wiarygodnego przewidywania intencji i długoterminowego zrozumienia zadań.

AI jest już głęboko zakorzeniona w codziennym życiu, a jej samorządne lub półautonomiczne zastosowania coraz bardziej widoczne są w wielu obszarach biznesu. Oznacza to po prostu, że dobrze działające funkcje biznesowe obecnie wymagają systemów zdolnych do adaptacji do zmian technologicznych i reagowania na wyzwania organizacyjne11. W związku z tym konieczność poprawy ludzkiego działania poprzez hybrydyzację, w procesie wdrażania i wdrażania AI, pomaga pokonywać niektóre bariery. W konsekwencji systemy hybrydowe łączą sztuczną i ludzką inteligencję, aby wspólnie realizować złożone zadania, osiągać lepsze wyniki i rozwijać swoje umiejętności dzięki uczeniu się od współpracowników. Dlatego rozszerzone koncepcje, takie jak hybrydowe systemy inteligentne12, współpraca oraz wzmocniona inteligencja, nieformalnie kształtują badania i zrozumienie wzmacniania współpracy poprzez integrację różnorodnych modalności AI.

Termin "Zaufanie" pochodzi z badań nad relacjami interpersonalnymi, definiując więź emocjonalną w relacjach międzyludzkich. Na przykład autor13 wskazał, że poziom zaufania technicznie determinuje aspekty uczuć, domniemanego apelu i etyki stron współpracujących. Socjologicznie, różnice w zaufaniu międzyludzkim mają głęboki wpływ na oddzielne dobrostany, interakcje społeczne, wzrost społeczno-ekonomiczny oraz praktyczne zachowania 14,15,16. HRI w istocie jest próbą połączenia proceduralnych rozmów między pracownikami socjalnymi a sprytnymi automatami, przekraczając konwencjonalne przeszkody językowe automatów17. Taka interakcja łączy mocne strony obliczeniowe systemów autonomicznych z ludzką intuicją, umożliwiając skuteczną współpracę w różnych środowiskach aplikacji. Stosowanie automatów niesie ze sobą realne korzyści: znaczące obniżenie kosztów finansowych, mniejszy ślad ekologiczny oraz znacznie mniejsze ryzyko dla człowieka10. Jednak wśród osiągnięć zaufanie człowieka do robotów jest filarem, zwłaszcza przy ocenie ogólnej jakości interakcji18,19.

Poziom ludzkiego zaufania okazywanego robotom odzwierciedla ich znaczenie i kluczową rolę w wielu obszarach. W zdrowiu zaufanie robotów wpływa na dystrybucję zasobów medycznych zgodnie z HRI oraz na skuteczność tłumienia chorób zakaźnych 20,21,22. W zastosowaniach żołnierzy poziom społecznego przekonania do automatów kontroluje poziom kompetencji operacyjnej strategii urządzeń śledczych oraz poziom dokładności transportów bojowych23,24. Dodatkowo, wiara w maszyny wpływa na uległość i wykorzystanie mechanizmów standaryzacji aktywnych przekonań AI w spekulatywnym polityce żołnierza25. Nawet w badaniach środowiskowych, np. wysokopoziomowych badań ruchów ciała, racjonalność wyników zależy od stopnia wiary w HRI26. Ważnym ostrzeżeniem jest jednak, że rosnące trudności decyzyjne mogą osłabić to zaufanie, zagrażając interakcji27. Tabela 1 opisuje porównawczy przegląd kilku badań.

Artykuł (rok, źródło)Główne celeKluczowe metody i metodyWnioski
Xie & Park (2021, arXiv) [28]Dostosuj interakcje robotów z emocjonalnymi robotami społecznymiPolityka uczenia się ze wzmocnieniem oparta zarówno na wskazówkach werbalnych, jak i niewerbalnych (pozycja ciała, mowa i mimika)Zachowanie robota wytrenowanego w RL zmienia się w odpowiedzi na ludzkie emocje, co zwiększa prostotę i zaangażowanie.
Li i in. (2022, IEEE T-IE) [29]Ułatwić proaktywne wsparcie montażu produkcyjnegoPrzewidywanie intencji, uczenie transferowe oraz uczenie multimodalne (wzrokowe + szkieletowe)Poprawiona proaktywność robotów w porównaniu do wartości wyjściowych; szybsza i dokładniejsza prognoza działania podczas montażu
Abdelrahman i in. (2022, dostęp IEEE) [30]Szacowanie zaangażowania w czasie rzeczywistym w grupowym HRIKlasyfikacja oparta na regułach połączona z głębokim uczeniem i postawą wzroku i głowy≥90% ocena F; zarządza kilkoma użytkownikami jednocześnie w konfiguracjach fizycznych
Chiossi i in. (2025, arXiv) [31]Struktura multimodalnego, dynamicznego przekazywania intencji w środowiskach produkcyjnychTeoretyczny układ wieloaspektowy: warstwy przezroczystości SAT; tryby haptyczne, słuchowe i wizualneUstanawia ramy koncepcyjne oraz wyjaśnia medium, planowanie i intencje środowiska projektowego.
McGrath i in. (2024, arXiv) [32]Modeluj rozwój pewności siebie w relacjach człowiek-AI, które są elastyczne.Fazy zespołu plus poprzedniki zaufania; dynamiczny model zaufania, który nie zależy od konkretnych modalnościZapewnia zasady projektowania uwzględniające zaufanie na wszystkie etapy interakcji i czasu.
Fragiadakis i in. (2024, arXiv) [33]Standaryzuj ocenę współpracy między ludźmi a AI.Metryki wybierane przez drzewo decyzyjne zgodnie z trybem HAIC; Metryki metod mieszanychRamy te pomagają w wyborze odpowiednich wskaźników dla symbiotycznych modalności interakcji skoncentrowanych na AI/człowieku.
Younis i in. (2023, MDPI) [34]HRI, które dostosowuje się do kontekstu poprzez wnioskowanie demograficzneWiek i płeć są szacowane na podstawie modeli wzroku i dźwięku, a zachowanie robotów jest odpowiednio dostosowywane.Badanie podsumowuje podejścia i podkreśla znaczenie dostosowanej adaptacji w HRI.

Tabela 1: Porównawczy przegląd najnowszych badań w dziedzinie współpracy człowiek-AI, który podkreśla kluczowe cele, metodologie i wyniki każdego badania. Zbiory danych użyte w badaniu, ich specyfikacje, rozmiar, modalności oraz rozkład uczestników.

Chociaż obecne ramy hierarchicznej i multimodalnej współpracy człowiek-robot (HRC) wykazują imponujące postępy w wykorzystaniu modalności wizualnych i audio do długoterminowej współpracy, wciąż istnieje wiele luk badawczych, które utrudniają jego zastosowanie w bardziej ogólnych środowiskach współpracy człowiek-AI. Po pierwsze, obecne ramy są głównie stosowane do fizycznej robotyki (np. ramię KINOVA GEN3) i nie są przenośne do agentów AI nieembofikowanych lub wirtualnych, którzy istnieją w różnych środowiskach cyfrowych28. Po drugie, podczas gdy multimodalność jest adresowana przez wzrok i mowę, system implementuje z góry zdefiniowaną strategię przełączania modalności zamiast dynamicznej, zależnej od kontekstu fuzji według stanu użytkownika lub trudności zadania29. Po trzecie, podejście to kładzie nacisk na efektywność zadań i odporność, ale nie modeluje wprost zaufania użytkownika, obciążenia poznawczego ani stanu afektywnego, które są niezbędne dla długoterminowej współpracy i wyjaśnienia systemu. Ponadto ludzka interpretowalność i pewność co do adaptacyjnego zachowania systemu są ograniczone, gdy procesy wyjaśnialności są nieobecne w podejmowaniu decyzji. Na koniec, ocena jest ograniczona do jednej dziedziny (montaż samochodzików zabawkowych) bez wielodomenowej weryfikacji, co reprezentuje zmienność w rzeczywistym świecie30. Takie luki wymagają opracowania uogólnionego, adaptacyjnego i skoncentrowanego na człowieku ram interakcji multimodalnych, które dynamicznie łączą heterogeniczne kanały wejściowe i modelują ludzkie intencje, zaufanie i kontekst w czasie rzeczywistym, aby wspierać współpracę człowieka z AI.

Głównym celem tego badania jest maksymalizacja współpracy człowieka z AI poprzez zaprojektowanie adaptacyjnego systemu interakcji multimodalnej, który łączy modalności wzroku i mowy z modelowaniem użytkownika w czasie rzeczywistym. Opierając się na solidnych fundamentach trwałej długoterminowej współpracy człowiek-robot, prace te uogólnią architekturę multimodalną na ogólne systemy AI poza robotyką, takie jak wirtualni agenci i inteligentne interfejsy. Główny nacisk kładzie się na dynamiczne przewidywanie intencji za pomocą hierarchicznych mechanizmów planowania, które integrują niskopoziomowe rozumienie działań oraz śledzenie postępów w zadaniach na wysokim poziomie. W przeciwieństwie do systemów opartych na regułach, przedstawione tutaj ramy będą wykorzystywać adaptacyjne metody uczenia się, w tym aktualizacje modeli specyficzne dla użytkownika oraz kontekstową fuzję modalności, aby dynamicznie dostosowywać zachowania interakcji do preferencji użytkownika, stanu poznawczego i dynamiki środowiskowej. Ponadto ramy mają na celu zwiększenie przejrzystości i zaufania dzięki wyjaśnialnemu rozumowaniu interakcji, co pozwala użytkownikom zrozumieć wybory AI i udzielać informacji zwrotnej. Wreszcie, badania te mają na celu poprawę płynności interakcji, efektywności zadań oraz długoterminowej satysfakcji użytkowników w różnych kontekstach współpracy.

Niniejszy artykuł wprowadza nowy Adaptacyjny Ramy Interakcji Multimodalnej, mające na celu promowanie współpracy człowieka z AI poprzez dynamiczne łączenie modalności wizualnych i audio. System "unimodalny" odnosi się do modelu, który wykorzystuje tylko jedną modalność wejściową (np. wizualną lub mowę) do wykonywania zadań i przewidywania zamiaru, bez integrowania informacji przez wiele kanałów. System "nieadaptacyjny" odnosi się do systemu opartego na regułach lub stałej strategii, który nie dostosowuje swojego zachowania na podstawie działań użytkownika lub kontekstu, na przykład bazowy system przełączania opartego na regułach. Te punkty odniesienia stanowią punkty odniesienia do oceny zalet percepcji multimodalnej oraz strategii adaptacyjnej interakcji zaimplementowanych w naszym proponowanym modelu fuzji Transformer z uwagą kierowaną. Opierając się na wcześniejszych hierarchicznych paradygmatach HRC31, nasza metoda wprowadza kilka ważnych innowacji:

Praca ta przedstawia mechanizm wyrównania oparty na dynamicznym zakrzywieniu czasu (DTW), który mapuje oczekiwane niskopoziomowe działania człowieka na węzły w hierarchicznym grafie zadań, w przeciwieństwie do wcześniejszych systemów interakcji multimodalnych, które koncentrowały się głównie na krótkoterminowym rozpoznawaniu działań32. W obliczu nieprzewidywalności czasowej i hałaśliwych wejść multimodalnych pozwala to na niezawodne przewidywanie intencji w długim horyzoncie oraz śledzenie postępów w zadaniach.

Do sugerowanego systemu włączono internetowy moduł adaptacyjny, który nieustannie aktualizuje modele intencji, wnioskowania i przewidywania działań podczas interakcji. To przezwycięża wady statycznych lub offline trenowanych modeli multimodalnych, umożliwiając systemowi dynamiczną adaptację do unikalnych zachowań, preferencji i zmian kontekstowych użytkowników.

Metody wizualne i słuchowe są dynamicznie ważone w zależności od ich kontekstowego znaczenia w każdym kroku czasowym, stosując unikalną technikę fuzji opartą na uwagi. To podejście oparte na danych zwiększa odporność w różnych środowiskach interakcji i zastępuje przełączanie modalności oparte na regułach.

Badanie to zawiera lekki moduł wyjaśnialności, który przekształca hierarchiczne planowanie i decyzje fuzyjne w zrozumiałe uzasadnienia, aby zmniejszyć lukę w interpretowalności w adaptacyjnych systemach człowiek-AI. To podnosi jakość długoterminowej współpracy i sprzyja właściwemu kalibrowaniu zaufania.

Sugerowane podejście ma na celu uogólnienie poza ucieleśnione roboty na wirtualnych agentów i inteligentne interfejsy, rozszerzając jego użyteczność na wiele obszarów współpracy człowiek-AI, mimo że zostało to udowodnione w rzeczywistej aktywności zespołu zespołowego z wykorzystaniem platformy robotycznej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponowana architektura wspierająca współpracę międzyludzko-AI wykorzystuje adaptacyjny wielomodalny pipeline interakcji łączący modalności wzroku i mowy w dynamicznym, hierarchicznym systemie rozumowania. Badanie to wykorzystało publicznie dostępne dane z wcześniej opublikowanych eksperymentów. Nie zaangażowano nowych ludzi i nie wymagano dodatkowej zgody etycznej.

Proponowana adaptacyjna architektura interakcji multimodalnych

Zasadniczo system zaczyna się od modułów percepcji, takich jak strumień wizualny rejestruje pozę i ruch użytkownika za pomocą czujników RGB-D, a strumień audio analizuje sygnały mowy za pomocą lekkiego silnika ASR (Automatic Speech Recognition). Takie surowe dane wejściowe są wprowadzane do modułu przewidywania działań opartego na Transformerze, który koduje zależności czasowe w sekwencjach pozycji i poleceń, aby rozumować na temat niskopoziomowych działań człowieka. Następnie, aby umożliwić planowanie współpracy na wysokim poziomie, mechanizm Dynamic Time Warping (DTW) dorównuje wykrytym działaniom z węzłami z wcześniej zdefiniowanego grafu zadań, aby przewidywać cele użytkownika i kolejne działania. Nowy moduł fuzji oparty na uwadze decyduje, w każdym kroku czasowym, która modalność (audio lub obrazowa) dostarcza najbardziej istotne kontekstowo informacje i dynamicznie dostosowuje wagi wejściowe. Aby indywidualizować interakcje, system obejmuje adaptację modeli online, dostosowując predyktory akcji w czasie rzeczywistym do zmieniającego się zachowania użytkownika. Moduł wyjaśnialności w lekkim zakresie tworzy także przyjazne użytkownikowi podsumowania przewidywanych intencji i decyzji AI, aby zwiększyć przejrzystość i zaufanie. Cały system jest testowany w symulowanym, ale rzeczywistym środowisku kooperacji montażowej, co pozwala na porównanie między środowiskami unimodalnymi i adaptacyjnymi-multimodalnymi. Takie podejście umożliwia bardziej adaptacyjną, intuicyjną i bardziej niezawodną współpracę z agentami AI we wszystkich obszarach.

Rysunek 1 przedstawia architekturę opisanego Adaptive Multimodal Interaction Framework, mającego na celu poprawę współpracy człowieka z AI. Zaczyna się od fazy akwizycji wejściowej, która opiera się na dwóch głównych urządzeniach sensorycznych: kamerze RGB-D do obserwacji informacji wzrokowych z podwyższoną głębią (np. postawa i ruch człowieka) oraz mikrofonie kierunkowym do zbierania poleceń mowych. Surowe sygnały są następnie przetwarzane przez moduł Pre-Processing, który przetwarza dane audiowizualne do dalszej analizy poprzez czyszczenie, normalizację i formatowanie strumieni wejściowych. Następnie potok przechodzi do fazy ekstrakcji cech, gdzie dane dzielą się na dwa strumienie: strumień wizualny, który izoluje cechy pozycji i ruchu za pomocą algorytmów estymacji pozycji, oraz strumień audio, który transkrybuje mowę na interpretowalne osadzenia poleceń. Multimodalny enkoder Transformer, który wykorzystuje wielogłowicową samouwagę i kodowanie położeniowe czasowe, aby wyrazić długodystansową współzależność między sekwencjami interakcji, następnie przetwarza spójną reprezentację. Aktualny stan celu użytkownika jest szacowany przez predyktor intencji i postępu zadania o długim horyzoncie, a niskopoziomowe działania są mapowane na węzły w hierarchicznym grafie zadań dla wiarygodnego śledzenia zadań przez moduł wyrównania oparty na DTW. Wagi fuzji i parametry predykcji są nieustannie aktualizowane za pomocą internetowej pętli adaptacji modelu w odpowiedzi na sprzężenie zwrotne z interakcji, a moduł wyjaśnialności dostarcza jasnych wyjaśnień, aby promować otwartość i pewność siebie. Cały pipeline pozwala systemowi na adaptacyjną i efektywną współpracę z użytkownikami przy dynamicznych zadaniach i środowiskach.

figure-protocol-1
Rysunek 1: Przegląd proponowanego ramowego systemu interakcji multimodalnej opartego na transformatorach.Stosuje się technikę ukierunkowaną na uwagę, aby kodować i dynamicznie integrować dane wizualne i słuchowe. Moduł Transformer, który integruje hierarchiczne modelowanie zadań i adaptację online, przetwarza zintegrowaną reprezentację do przewidywania intencji w długim horyzoncie oraz szacowania postępów zadań. . Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Sugerowany system zawiera lekki moduł wyjaśnialności, który współpracuje z komponentami multimodalnej fuzji i planowania hierarchicznego, aby zwiększyć przejrzystość i zaufanie użytkowników. Moduł wyprowadza interpretowalne wskazówki z wyrównania grafu zadań opartego na DTW (np. aktualny postęp zadania i przewidywana kolejna akcja) oraz warstwy fuzji opartej na uwadze (np. wagi ważenia modalności). Te sygnały są przekształcane w zrozumiałe wyjaśnienia dla ludzi, takie jak to, czy wypowiedziane polecenia czy gesty wizualne miały wpływ na wybór systemu oraz jak oczekiwana akcja wpisuje się w szerszy plan pracy. Użytkownicy otrzymują wyjaśnienia w formie zwięzłych pisemnych lub wizualnych informacji zwrotnej, które pomagają im zrozumieć, przewidzieć i, jeśli zajdzie taka potrzeba, poprawić zachowanie systemu. Poprawa zadowolenia użytkownika, płynność interakcji oraz wskaźniki zaufania wskazane w ocenie są pośrednimi wskaźnikami postrzegania przez użytkowników jako wyjaśnialności. Wyniki sugerują, że w długoterminowej interakcji człowiek-AI przejrzyste rozumowanie przy podejmowaniu decyzji AI zwiększa pewność użytkowników, ułatwia współpracę i zwiększa akceptację adaptacyjnego zachowania systemu.

Dane wejściowe

Pozyskiwanie danych wejściowych w ramach przewidywanej współpracy człowiek-AI odbywa się za pomocą ustrukturyzowanego mechanizmu multimodalnego wykrywania, który łączy zarówno modalności wzroku, jak i słuchu, aby skutecznie realizować działania i intencje człowieka. Obraz jest rejestrowany kamerą RGB-D, która rejestruje w czasie rzeczywistym informacje o pozach ludzi, położeniu przestrzennym oraz kontekście otoczenia. Dane wizualne są przetwarzane za pomocą pretrenowanych modeli, takich jak BlazePose, aby uzyskać kluczowe punkty zainteresowania górnej części ciała dla zadań interakcji. Jednocześnie informacje słuchowe są pozyskiwane z mikrofonu kierunkowego i interpretowane przez wcześniej wytrenowany model DeepSpeech, aby zidentyfikować polecenia mowy rozstrzygające lub dostarczające dodatkowe niepewne sygnały wizualne. W warunkach współpracy system z podwójnym wejściem oferuje dynamiczną adaptację i percepcję kontekstową. Zbiór danych treningowych i ewaluacyjnych obejmuje ponad 5 000 multimodalnych trajektorii ruchu człowieka1 dla różnych działań interakcji, takich jak zachowania związane z montażem i przekazaniem, zebranych od czterech użytkowników w kontrolowanych i półstrukturyzowanych warunkach. Aby zwiększyć uogólnienie, system umożliwia adaptację modelu online podczas wdrożenia, co pozwala modelowi aktualizować swoje prognozy w czasie rzeczywistym w zależności od zmieniającego się zachowania użytkownika i dynamiki środowiskowej.

Opis zbioru danych

Zestaw danych treningowych i ewaluacyjnych dla proponowanego ramowego systemu został uzyskany z rzeczywistych eksperymentów współpracy człowiek-robot w ramach zadania montażu samochodzików zabawkowych z użyciem robotaKINOVA GEN3 1. Środowisko eksperymentalne miało na celu naśladowanie długoterminowych działań współpracujących obejmujących interakcje multimodalne, obejmujące zarówno modalności wzrokowe, jak i słuchowe. W szczególności zbiór treningowy składa się z 3 003 sekwencji trajektorii od dwóch użytkowników, a testowy zbiór zawiera 2 088 sekwencji, w tym dane od dwóch nowych użytkowników do oceny uogólnień modeli. Każda trajektoria rejestruje 5-stopniową sekwencję kluczowych punktów pozycji górnej części ciała pobranych za pomocą BlazePose, wraz z odpowiadającymi mu poleceniami mowy przepisanymi przez DeepSpeech33. Zebrane dane pokazują naturalne zmienności człowieka w wyrażaniu gestów i poleceń w działaniach takich jak dostarczanie przedmiotów, używanie narzędzi oraz działania kooperacyjne. Zbiór danych multimodalny stanowi podstawę nadzorowanego uczenia modeli prognozowania akcji i trajektorii DLinear oraz stanowi centralny punkt odniesienia w badaniach użytkowników prowadzonych w warunkach wyłącznie wzrokowych, audio- i multimodalnych. Uwzględnienie różnych typów użytkowników i realistycznych warunków hałasu gwarantuje testy odporności i adaptacji dla stałych systemów HRC. Tabela 2 przedstawia szczegółowy opis zbioru danych.

AtrybutySzczegóły
Nazwa zbioru danychZestaw Montażu Samochodzików Zabawkowych (zebrany wewnętrznie)
Środowisko kolekcjiRzeczywisty eksperyment HRC z ramieniem KINOVA GEN3
Liczba użytkowników (szkolenie)2 użytkowników
Liczba użytkowników (testowanie)4 użytkowników (2 z zestawu treningowego, 2 niewidocznych)
Całkowite trajektorie (szkolenie)3 003 trajektorie
Całkowite trajektorie (testy)2 088 trajektorii
Zdobyte metodyWizualne (RGB-D dla pozy), Audio (polecenia mowe)
Format danychPunkty kluczowe pozycji (z BlazePose), polecenia zamiany mowy na tekst
Rozdzielczość czasowaKażda trajektoria obejmuje 5 etapów czasowych
Zakres zadań3 główne zadania: Pick-and-place, rotacja obiektów, składanie zespołowe
ZastosowanieNadzorowane trenowanie modeli predykcji działania/trajektorii; Badanie użytkownika

Tabela 2: Opis zbioru danych. Informacje o środowisku symulacji, w tym frameworku programistycznym, ustawieniach sprzętu oraz środowisku ewaluacji.

Wstępne przetwarzanie zbioru danych

Aby umożliwić adaptacyjną interakcję multimodalną we współpracy człowiek-AI, surowy zbiór danych, taki jak wizualne (obrazy RGB i głębi), dźwiękowe (polecenia mowe) oraz zachowanie czasowe (kluczowe punkty pozycji), poddawany jest strukturyzowanemu wstępnemu przetwarzaniu. Dane wizualne są najpierw wyodrębniane przez model estymacjipozycji f, zwykle wyprowadzany z BlazePose lub OpenPose. Dla ramy t wektor pozycji człowieka definiuje się jako:

figure-protocol-2   (1)

Gdzie k to liczba punktów kluczowych, a każdy punkt kluczowy zawiera współrzędne 2D. Sekwencje są normalizowane według długości tułowia i wygładzane z czasem filtrem Savitzky'ego-Golaya:

figure-protocol-3   (2)

gdzie w to rozmiar okna filtrowania. Po drugie, surowe strumienie audio At są dzielone na segmenty za pomocą detektora aktywności głosowej (VAD). Wiarygodne segmenty są wprowadzane do modelu rozpoznawania mowy w modeluf (np. DeepSpeech), aby wyciągnąć tokeny poleceń:

figure-protocol-4   (3)

gdzie V to słownictwo uznanych komend. Dla integracji tokeny poleceń dla wszystkich są wyrównane czasowo do wizualnych znaczników czasowych pozycji za pomocą funkcji wyrównania opartej na interpolacji τ:

figure-protocol-5   (4)

Po trzecie, aby utworzyć sekwencje figure-protocol-6treningu temporalnych intencji , definiujemy sekwencje trajektorii , wraz z powiązanymi poleceniami figure-protocol-7mowy . Są one okienkowane na segmenty o stałej długości za pomocą okien przesuwanych o rozmiarze l:

figure-protocol-8   (5)

figure-protocol-9   (6)

Na koniec dane wejściowe są znormalizowane do zera średniej i wariancji jednostkowej na wymiar punktu kluczowego dla zbieżności w modelach predykcyjnych opartych na trajektorii:

figure-protocol-10   (7)

gdzie μj, σj to średnia i odchylenie standardowe punktu kluczowego j wypełnionego zbioru treningowego.

Ekstrakcja cech

W przedstawionym paradygmatze adaptacyjnej interakcji multimodalnej silna i w czasie rzeczywistym umożliwia połączenie funkcji zadań wizualnych, dźwiękowych i kontekstowych. Pipeline extraction feature rozpoczyna się od równoczesnego pozyskiwania danych z dwóch głównych modalności: sygnałów figure-protocol-11 wizualnych i audio figure-protocol-12, indeksowanych w kroku czasowym t. Obserwacje te są przekazywane przez odpowiadające moduły percepcji, aby uzyskać wysokiego poziomu cechy semantyczne dotyczące ludzkiego zachowania, intencji i komendacji mowy.

Wyodrębnianie cech wizualnych

Surowe dane wizualne figure-protocol-13 z kamer RGB-D są przekazywane przez estymator pozycji człowieka (np. BlazePose), zapewniając przestrzenny wektor figure-protocol-14punktów kluczowych , gdzie k oznacza wykrytą liczbę punktów kluczowych, a każdy zawiera współrzędne 3D:

figure-protocol-15   (8)

Te kluczowe punkty figure-protocol-16są osadzone w czasie w trajektorii pozycji , z której wyodrębnia dynamikę ruchu poprzez rozkład trend-sezonowy:

figure-protocol-17   (9)

gdzie ∈_t oznacza szum resztkowy.

Ekstrakcja funkcji audio

Wejście figure-protocol-18 audio jest przetwarzane przez wstępnie wytrenowany model rozpoznawania mowy (np. DeepSpeech) i generuje tokenizowaną reprezentację figure-protocol-19poleceń , gdzie n to długość tokena:

figure-protocol-20   (10)

Fuzja multimodalna

Aby skonstruować jednolity kontekst interakcji, łączymy cechy poprzez uwagę ważoną pewnością, opartą na pewności i wzajemnej informacji:

figure-protocol-21   (11)

gdzieφ V i φA są funkcjami projekcji dla cech wizualnych i słuchowych do wspólnej przestrzeni ukrytej, aα t∈[0,1] to dynamiczny składnik ważenia modalności obliczany na podstawie entropii:

figure-protocol-22   (12)

Tutaj figure-protocol-23 i są figure-protocol-24 wzajemną informacją pomiędzy stanem docelowym g a obserwowanymi modalnościami.

Planowanie z wykorzystaniem kontekstowego osadzania

Ostatni multimodalny wektor cech Ft jest wzbogacony o kontekst zadania i postęp Pt i staje się wejściem stanu do modułu planowania adaptacyjnego:

figure-protocol-25   (13)

Wyodrębniona cecha xt jest wykorzystywana jako dane wejściowe do modeli przewidywania intencji i planowania ruchu w dalszej fazie, wspierając adaptacyjną i solidną współpracę człowiek-AI w dynamicznych i niepewnych warunkach.

Przewidywanie działań i planów za pomocą wyrównania grafów zadań

Po procesie ekstrakcji cech multimodalnych, w którym integrowane są dane dotyczące intencji mowy (audio), trajektorii pozycji (wizualnej) oraz kontekstowych (np. dzienniki zadań lub emocji) w dalszym przetwarzaniu, dalsze przetwarzanie obejmuje adaptacyjne przewidywanie działań ludzkich oraz wnioskowanie planowe z wykorzystaniem hierarchicznego dopasowania grafów zadań.

Niech zintegrowany wielomodalny wektor cech w kroku czasowym t będzie przedstawiony jako:

figure-protocol-26   (14)

System początkowo prognozuje niskopoziomowe działanie człowieka za pomocą aktu funkcji f, który często jest reprezentowany jako enkoder-dekoder lub transformator rekurencyjny:

figure-protocol-27   (15)

gdzie F(t-k:t) oznacza sekwencję fuzji cech w ostatnich k krokach czasowych, a figure-protocol-28 jest prognozowaną akcją z zestawu akcji A. Moduł jest dostrojony online poprzez adaptacyjne straty:

figure-protocol-29   (16)

Tutaj CE to strata krzyżowa entropii przez klasyfikację akcji, a drugi wyraz przesuwa dobrą prognozę trajektorii przyszłości.

Dla przewidywania planów na wysokim poziomie określamy zadanie jako progresję wzdłuż hierarchicznego grafu zadań G = (N, E), gdzie każdy węzeł ni ∈N oznacza podzadanie lub cel pośredni. Celem jest dopasowanie obserwowanej sekwencji akcji do ścieżki zadania referencyjnego R*∈G poprzez zmniejszenie odległości:

figure-protocol-30   (17)

Gdzie Pt oznacza bieżący ślad postępu, a d(⋅) oznacza metrykę Dynamic Time Warping (DTW) lub miękkie wyrównanie.

Ostateczna intencja figure-protocol-31 na poziomie planu jest następnie wyprowadzana, projektując przewidywane działanie a ̂_t na najbardziej prawdopodobny następny krok na wyrównanej ścieżce figure-protocol-32:

figure-protocol-33   (18)

To hierarchiczne dekodowanie gwarantuje, że nawet przy niejasnych lub głośnych bodźcach sensorycznych system wybiera najbardziej kontekstowo istotny intencję na wysokim poziomie, zgodną z aktualną sekwencją zadań. To predykcyjne planowanie nie tylko zwiększa efektywność współpracy, ale także zwiększa przewidywanie i elastyczność w wieloturowej interakcji człowiek-AI.

Mechanizm fuzji multimodalnej (oparty na uwadze)

W adaptacyjnej współpracy człowiek-AI niezbędna jest wielomodalna integracja kilku modalności sensorycznych (np. wzrok: pozycja człowieka, trajektoria; dźwiękowa: polecenia mowy) dla właściwej interpretacji intencji użytkownika. Podejście oparte na regułach lub statycznej fuzji nie radzi sobie z rzeczywistymi, dynamicznymi interakcjami międzyludzkimi. W tym celu przedstawiono tutaj mechanizm fuzji oparty na uwadze, który dynamicznie waży każdą modalność zgodnie z jej kontekstowym znaczeniem w każdym kroku czasowym.

Oznaczmy wyodrębnione wektory cech z modalności wizualnej i dźwiękowej odpowiednio jako figure-protocol-34 i figure-protocol-35, odpowiednio. Wektory te kodują informacje semantyczne uzyskane z wcześniejszych procesów przetwarzania, np. cechy wizualne mogą wynikać z estymacji pozycji i przewidywania działań, natomiast cechy audio mogą być wyprowadzane z osadzeń mowy przy użyciu modeli takich jak DeepSpeech czy wav2vec.

Celem fuzji opartej na uwadze jest obliczenie wag uwagi specyficznych dla modalności, które oddają względne znaczenie każdej z nich. Odbywa się to za pomocą mechanizmu miękkiej uwagi.

Obliczenia z uwagą uwagi

W pierwszym kroku oba wektory są przekształcane w wspólną przestrzeń uwagi poprzez transformację przyswajalną do nauki. To znaczy, dla każdej modalności i∈{V,A} wskaźnik uwagi średniozaawansowany oblicza się jako:

figure-protocol-36   (19)

gdzie figure-protocol-37 i figure-protocol-38 są parametrami przyswajalnymi do sieci uwagi, a tanh jest nieliniową funkcją aktywacji. Ta konwersja pozwala modelowi wyodrębnić korelacje wysokiego poziomu i kontekstową istotność każdej modalności.

Te nieznormalizowane wyniki uwagi e, V i αA , są następnie normalizowane za pomocą funkcji softmax, tak że sumują się do 1

figure-protocol-39   (20)

Tutaj αV i αA to wagi uwagi nad modalnościami wizualnymi i audio. Wagi są adaptacyjne, a następnie aktualizowane w zależności od istniejącego kontekstu zadania, jakości sygnału i aktywności użytkownika.

figure-protocol-40   (21)

Uzyskana jest złożona reprezentacja figure-protocol-41 jako ważona kombinacja wektorów modalności wejściowej:

Ten połączony wektor koduje wspólną semantykę informacji wizualnych i słuchowych w sposób aktywnie podkreślający najbardziej informacyjny struń. Następnie jest on przekazywany do kolejnych modułów, takich jak dopasowanie grafów zadań, przewidywanie intencji czy silnik planowania ruchu robotów.

Algorytm 1: Fuzja oparta na uwadze multimodalnej

Wektor cech wizualnych to hV∈Rd, Wektor cech audio to hA∈Rd

Parametry do nauczenia: W∈Rk*d, w∈Rk i b∈Rk

Wyjście: fuzowana reprezentacja hfuzowana∈Rd.

Krok 1: Określ reprezentacje pośrednie poprzez obliczenia za pomocą równania 19

Krok 2: Użyj Softmax, aby normalizować wyniki uwagi za pomocą równania 20

Krok 3: Oblicz wektor fuzjonowany za pomocą równania 21

Krok 4: Zwróćz bezpiecznikiem

Algorytm Attention-Based Multimodal Fusion umożliwia inteligentne łączenie cech różnych modalności wejściowych, takich jak strumienie wizualne i audio, w sposób świadomy kontekstowo. Fuzja jest niezbędna w systemach, w których każda modalność dostarcza uzupełniające, ale zróżnicowane informacje, na przykład w środowiskach współpracy człowiek-AI, gdzie obraz rejestruje gesty lub pozycję ciała, a dźwięk rejestruje polecenia mowy lub sygnały głosowe.

Algorytm 1 rozpoczyna się od określenia reprezentacji pośrednich dla każdej modalności. Aby obliczyć oba te modele, eV dla przepływu wizualnego i eA dla strumienia audio, wspólna warstwa sieci neuronowej najpierw wykonuje nieliniową transformację odpowiadających im wektorów cech. Następnie wagi uwagi αV i αA oblicza się, wykonując funkcję miękkiego maksymalnego na punktach pośrednich. To sprawia, że wagi są dodatnie i sumują się do 1, zasadniczo normalizując wkłady z każdej modalności. Im bardziej informacyjna jest dana metoda, jak jest modelowana, tym większa jest jej waga uwagi.

Ostatecznie algorytm oblicza fuzjonowane przedstawienieh poprzez ważoną kombinację wektorów cech graficznych i audio, znormalizowane z ich odpowiednimi wagami uwagi. Ten wektor fuzjonowany łączy obie metody w sposób oparty na danych, kontekstowo wrażliwy i służy do zadań kolejnych, takich jak rozpoznawanie intencji, podejmowanie decyzji czy planowanie ruchu robotów. Ogólnie rzecz biorąc, algorytm ten pozwala systemowi dynamicznie skupić się na najbardziej istotnej modalności lub kombinacji modalności w konkretnym momencie, zamiast stosować stałe lub regułowe podejścia fuzyjne. Dzięki temu ramy są silniejsze, bardziej elastyczne i responsywne w dynamicznych sytuacjach interakcji człowiek-AI.

Rysunek 2 ilustruje sposób pracy mechanizmu fuzji multimodalnej opartej na uwagi, który działa w kontekstowej integracji bodźców wzrokowych i słuchowych. Ekstrakcja cech wizualnych, pierwszy krok w procesie, polega na wyodrębnianiu cech przestrzennych lub pozowych z obrazów wejściowych lub wideo (takich jak kamery RGB-D). Następnie są one wprowadzane do modułu Uwagi Wzrokowej, który uczy się podkreślać najbardziej pouczające treści informacji wizualnych. Równolegle moduły Audio Attention przetwarzają osadzenia mowy lub tokeny audio z wypowiedzianych poleceń, przypisując kontekstowe znaczenie różnym sygnałom słuchowym. Powstałe cechy ważone uwagą są integrowane przez warstwę fuzyjną opartą na uwadze i przekazywane do sieci feedforward według pozycji z resztkowymi połączeniami i normalizacją warstw, tworząc standardowy blok enkodera transformatora. Wyjściem jest zintegrowane osadzenie multimodalne, które wspiera solidne przewidywanie intencji w długim horyzoncie oraz adaptacyjne podejmowanie decyzji w różnych warunkach interakcji. Taka konstrukcja pozwala systemowi selektywnie koncentrować się na bardziej odpornej metodzie w dowolnym momencie, poprawiając odporność i interpretowalność w czasie rzeczywistym interakcji człowiek-AI.

figure-protocol-42
Rysunek 2: Szczegółowa konstrukcja modułu fuzji multimodalnej kierowanej uwagą. Aby wygenerować kontekstowo świadomą reprezentację fuzyjną w każdym kroku czasowym, kodery specyficzne dla modalności zbierają cechy ze strumieni wizualnych i słuchowych. Te cechy są następnie dynamicznie ważone za pomocą mechanizmu uwagi opartego na danych. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Adaptacja modeli online

Aby zapewnić wysoką jakość współpracy człowieka z AI w różnych zachowaniach i kontekstach użytkowników, nasz framework wykorzystuje mechanizm adaptacji modeli online, który stopniowo optymalizuje modele specyficzne dla użytkownika podczas interakcji. Moduł śledzi sygnały behawioralne w czasie rzeczywistym (np. pozę, trajektorie gestów, ton mowy) i aktualizuje podstawowe modele predykcyjne za pomocą algorytmów uczenia się inkrementalnego. W szczególności modele przewidywania trajektorii i rozpoznawania intencji są dopracowywane na podstawie ostatnich danych wejściowych poprzez precyzyjne dostrajanie oparte na gradientach lub adaptację niskiego rangu (LoRA), tak aby system był w stanie dostosować się do zmieniającego się zachowania użytkownika lub wymagań specyficznych dla konkretnych zadań bez konieczności pełnego ponownego trenowania.

Warstwa sprzężenia zwrotnego działa harmonijnie wraz z adaptacją zarówno poprzez ukryte sprzężenie zwrotne (np. korekty, wahania, opóźnienia), jak i jawne polecenia (np. mowy lub interfejs graficzny). Ma dwa cele: adaptacyjne kalibrowanie znaczenia sygnałów multimodalnych oraz przekazywanie miar zaufania/pewności do modułów decyzyjnej i sterujących.

Cykl informacji zwrotnej umożliwia płynniejszą wydajność zadań i reakcje zorientowane na użytkownika. Aby pielęgnować zaufanie i przejrzystość, ramy integrują moduł wyjaśnialności, który przekłada decyzje niskopoziomowe na modele na zrozumiałe dla człowieka uzasadnienia. Wykorzystuje mapy racjonalne z multimodalnego transformatora fuzyjnego, uzupełnione śledzeniem logicznym przez graf zadania. Może opcjonalnie przedstawić to uzasadnienie za pomocą interfejsu graficznego lub pomocy słuchowej, aby umożliwić użytkownikom zrozumienie, a być może nawet korygowanie zachowania systemu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Adaptacyjny model interakcji multimodalnej zaproponowany tutaj odpowiada na te problemy i znacznie wzmacnia współpracę człowieka z AI, płynnie łącząc modalności widzenia i mowy z procesami adaptacji użytkownika w czasie rzeczywistym. W przeciwieństwie do bazowego hierarchicznego systemu multimodalnego, nasze podejście obejmuje spersonalizowaną pętlę sprzężenia zwrotnego oraz adaptację świadomą obciążenia poznawczego, która zapewnia bardziej intuicyjną, kontekstowo świadomą interakcję. Podczas eksperymentalnych testów w s...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki jednoznacznie dowodzą efektywności sugerowanej adaptacyjnej bazy interakcji multimodalnej w celu zwiększenia współpracy człowieka z AI.

Oprócz standardowych wyników oceny, takich jak Time Completion Task (TCT), Human Intention Prediction Accuracy (HIPA), Multimodal Fusion Efficiency (MFE), Error Recovery Rate (ERR), User Satisfaction Score (USS) oraz Interaction Smoothness Index (ISI), można dodać dodatkowe metryki skoncentrowane na użytkowniku do dogłębnej analizy adaptacyjnych ram mul...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają konfliktu interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy z wdzięcznością doceniają wsparcie ze strony Szkoły Projektowania Uniwersytetu Jiangnan w Wuxi, Chiny.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Aparat RGB-D (Intel RealSense D435)Intel CorporationD435Rozdzielczość głębokości 1280 razy; 720 px @ 30 fps; rozdzielczość RGB 1920 i razy; 1080 px @ 30 fps; Używany do rejestrowania pozycji użytkownika, ruchów ciała i kontekstu przestrzennego
Mikrofon kierunkowyGeneryki / Wielu dostawcówNie maMikrofon szerokopasmowy, z redukcją szumów (16 kHz i dash; 44,1 kHz); Używany do zbierania poleceń mówionych
BlazePose (model pretrenowany)Googlehttps://developers.google.com/mediapipe/solutions/vision/poseModel estymacji pozycji z 33 punktami kluczowymi; Ekstrakcja ludzkiej pozycji w czasie rzeczywistym
OpenPose (model wstępnie wytrenowany)Laboratorium Obliczeń Percepcyjnych CMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeWieloosobowy framework do estymacji pozycji używany do wydobywania trajektorii ruchu
Silnik ASR DeepSpeechMozillav0.9.3Prewytrenowany model automatycznego rozpoznawania mowy do transkrypcji mowy na tekst
silnik wav2vec 2.0 ASRMeta AIhttps://github.com/facebookresearch/fairseqModel samodzielnie nadzorowanej reprezentacji mowy dla przetwarzania mowy w czasie rzeczywistym
Model przewidywania działań oparty na transformatorze (DLinear / Seq2Seq)Implementacja niestandardowaNie maArchitektura enkodera-dekodera temporalnego ze szczególnym uwzględnieniem krótkoterminowego prognozowania działań
Moduł Dynamicznego Zakrzywiania Czasu (DTW)Oparty na niestandardowych / SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlMiękki algorytm wyrównania do dopasowywania działań użytkownika do zdefiniowanych grafów zadań
Multimodalna sieć fuzji oparta na uwadzeImplementacja niestandardowaNie maMechanizm uwagi ważony przez pewność do łączenia wzroku i bodźców mowy
Moduł adaptacji online (LoRA / oparty na gradientach)Implementacja niestandardowahttps://github.com/microsoft/LoRALekkie, parametrycznie efektywne dostrojenie do dostosowywania się do zachowań użytkowników
Moduł wyjaśnialności (oparty na regułach + mapy uwagi)Implementacja niestandardowaNie maDostarcza interpretowalne uzasadnienie decyzyjne za pomocą reguł i wizualizacji uwagi
Ramię robotyczne KINOVA Gen3KINOVA RoboticsGen3manipulator robotyczny 7-DOF z wbudowanymi czujnikami momentu obrotowego; Wykorzystywane do wspólnego składania samochodzików zabawkowych
Środowisko symulacji zespołu kooperacyjnegoŚrodowisko niestandardoweNie maRzeczywiste składanie samochodzików wykorzystywane do multimodalnych testów kolaboracyjnych
Metryki ewaluacji (TCT, HIPA, MFE, OPÓŹNIENIA, ERR, USS, ISI)Niestandardowe definicjeNie maIlościowe i skoncentrowane na użytkowniku metryki oceniające efektywność, dokładność i zaufanie współpracy,

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Adaptive FrameworksPose EstimationSpeech Command UnderstandingIntention ForecastingTransformer ModelsAttention FusionDynamic Time WarpingExplainable AI

Powiązane artykuły