Opracowaliśmy prostą, konfigurowalną i efektywną metodę rejestrowania ilościowych danych procesowych z interaktywnych zadań przestrzennych i mapowania tych danych rotacji za pomocą danych śledzenia wzroku.
Artykuł metodologiczny
Opracowaliśmy prostą, konfigurowalną i efektywną metodę rejestrowania ilościowych danych procesowych z interaktywnych zadań przestrzennych i mapowania tych danych rotacji za pomocą danych śledzenia wzroku.
Prezentujemy metodę rejestrowania interakcji człowieka z trójwymiarowymi (3D) wirtualnymi obiektami w czasie rzeczywistym. Podejście to polega na powiązaniu danych o rotacji manipulowanego obiektu z pomiarami behawioralnymi, takimi jak śledzenie ruchu gałek ocznych, w celu uzyskania lepszych wniosków na temat leżących u podstaw procesów poznawczych.
Zadanie polega na wyświetleniu dwóch identycznych modeli tego samego obiektu 3D (cząsteczki), prezentowanych na ekranie komputera: obracającego się, interaktywnego obiektu (iObj) i statycznego, docelowego obiektu (tObj). Uczestnicy muszą obracać iObj za pomocą myszy, dopóki nie uznają, że jego orientacja jest identyczna z tObj. Komputer śledzi wszystkie dane dotyczące interakcji w czasie rzeczywistym. Dane dotyczące spojrzenia uczestnika są również rejestrowane za pomocą urządzenia do śledzenia ruchu gałek ocznych. Częstotliwość pomiaru wynosi 10 Hz na komputerze i 60 Hz na monitorze ruchu gałek ocznych.
Dane dotyczące orientacji iObj względem tObj są zapisywane w kwaternionach rotacji. Dane spojrzenia są synchronizowane z orientacją iObj i przywoływane za pomocą tego samego systemu. Metoda ta pozwala na uzyskanie następujących wizualizacji procesu interakcji człowieka z iObj i tObj: (1) rozbieżność kątowa zsynchronizowana z innymi danymi zależnymi od czasu; (2) Trajektoria rotacji 3D wewnątrz tego, co zdecydowaliśmy się nazwać "kulą obrotów"; (3) Mapa cieplna fiksacji 3D. Wszystkie kroki protokołu korzystały z wolnego oprogramowania, takiego jak GNU Octave i Jmol, a wszystkie skrypty są dostępne jako materiał dodatkowy.
Dzięki takiemu podejściu, możemy przeprowadzić szczegółowe badania ilościowe procesu rozwiązywania zadań obejmującego rotacje mentalne lub fizyczne, a nie tylko osiągnięty wynik. Możliwe jest dokładne zmierzenie, jak ważna jest każda część modeli 3D dla uczestnika w rozwiązywaniu zadań, a tym samym odniesienie modeli do odpowiednich zmiennych, takich jak charakterystyka obiektów, zdolności poznawcze osób oraz charakterystyka interfejsu człowiek-maszyna.
Rotacja mentalna (MR) to zdolność poznawcza, która umożliwia jednostkom mentalne manipulowanie i obracanie obiektów, ułatwiając lepsze zrozumienie ich cech i relacji przestrzennych. Jest to jedna ze zdolności wzrokowo-przestrzennych, podstawowa grupa poznawcza, która była badana już w 1890 roku1. Zdolności wzrokowo-przestrzenne są ważnym składnikiem repertuaru poznawczego jednostki, na który wpływają zarówno czynniki dziedziczone, jak i środowiskowe2,3,4,5. Zainteresowanie zdolnościami wzrokowo-przestrzennymi wzrosło w XX wieku ze względu na coraz liczniejsze dowody na ich znaczenie w kluczowych dziedzinach, takich jak starzenie się6 i rozwój7, wyniki w naukach ścisłych, technologii, inżynierii i matematyce (STEM)8,9, creativity10 oraz cechy ewolucyjne11.
Współczesna idea MR wywodzi się z pionierskiej pracy opublikowanej przez Sheparda i Metzlera (SM) w 1971 roku12. Opracowali oni metodę chronometryczną wykorzystującą serię "takich samych lub różnych" zadań, prezentując dwie projekcje abstrakcyjnych obiektów 3D wyświetlanych obok siebie. Uczestnicy musieli w myślach obrócić obiekty wokół jakiejś osi i zdecydować, czy te projekcje przedstawiały ten sam obiekt obrócony inaczej, czy też odrębne obiekty. Badanie wykazało dodatnią korelację liniową między czasem odpowiedzi (RT) a rozbieżnością kątową (AD) między reprezentacjami tego samego obiektu. Ta korelacja jest znana jako efekt rozbieżności kątów (ADE). ADE jest uważane za behawioralną manifestację MR i stało się wszechobecne w kilku wpływowych późniejszych badaniach w tej dziedzinie13,14,15,16,17,18,19,20,21, 22,23,24,25. Obiekty 3D wykorzystane w badaniu SM składały się z 10 sąsiadujących ze sobą sześcianów wygenerowanych przez pioniera grafów komputerowych Michaela Nolla z Bell Laboratories26. Są one określane jako figury SM i są szeroko stosowane w badaniach MR.
Dwa postępy były bardzo ważne w przełomowej pracy Sheparda i Metzlera; po pierwsze, biorąc pod uwagę wkład w dziedzinie oceny MR. W 1978 roku Vanderberg i Kuze27 opracowali psychometryczny 20-punktowy test ołówkiem i papierem oparty na "tych samych lub różnych" figurach SM, który stał się znany jako test rotacji mentalnej (VKMRT). Każdy element testowy przedstawia bodziec docelowy. Uczestnicy muszą wybrać spośród czterech bodźców, które reprezentują ten sam obiekt przedstawiony w bodźcu docelowym, a które nie. VKMRT został wykorzystany do zbadania korelacji między zdolnością MR a różnymi innymi czynnikami, takimi jak różnice związane z płcią6,21,24,28,29,30, starzenie się i development6,31,32, wyniki w nauce8,33, oraz umiejętności muzyczne i sportowe34. W 1995 roku Peters i in. opublikowali badanie z przerysowanymi rysunkami dla klasy VKMRT35,36. Podobnie, zgodnie z "tym samym lub innym" projektem zadania, wykorzystano wiele innych bibliotek bodźców generowanych komputerowo do badania procesów MR i oceny zdolności MR (wersje 3D oryginalnych bodźców SM 19,22,23,37,38, ludzkie ciało naśladujące postacie SM25,39,40, płaskie wielokąty do obrotu 2D41,42, anatomia i narządy43, kształty organiczne44, molekuły45,46, między innymi21). Test Wizualizacji Przestrzennej Purdue (PSVT) zaproponowany przez Guaya w 1976 roku47 jest również istotny. Pociąga to za sobą szereg testów, w tym MR (PSVT:R). Wykorzystując inne bodźce niż te w VKMRT, PSVT:R wymaga od uczestników zidentyfikowania operacji rotacji w bodźcu modelowym i mentalnego zastosowania jej do innego. PSVT:R jest również szeroko stosowany, szczególnie w badaniach badających rolę MR w osiągnięciach STEM48,49,50.
Drugim ważnym osiągnięciem w przełomowej pracy Sheparda i Metzlera jest wkład w zrozumienie procesu MR, w szczególności za pomocą urządzeń śledzących ruch gałek ocznych. W 1976 roku Just i Carpenter14 użyli analogowego sprzętu do śledzenia ruchu gałek ocznych opartego na wideo, aby przeprowadzić badanie oparte na eksperymencie ADE Sheparda i Metzlera. Na podstawie wyników badań nad sakkadowymi ruchami gałek ocznych i RT zaproponowali model procesów MR składający się z trzech faz: 1) fazy poszukiwania, w której rozpoznawane są podobne części figur; 2) faza transformacji i porównania, w której jedna ze zidentyfikowanych części zostaje mentalnie obrócona; 3) faza potwierdzenia, w której podejmuje się decyzję, czy liczby są takie same, czy nie. Fazy są powtarzane rekurencyjnie, aż będzie można podjąć decyzję. Każdy krok odpowiada specyficznym sakkadowym i fiksacyjnym wzorcom ruchu gałek ocznych w ścisłym związku z obserwowanymi ADE. W ten sposób, korelując aktywność oczu z danymi chronometrycznymi, Just i Carpenter dostarczyli sygnaturę kognitywną do badania procesów MR. Do tej pory model ten, choć z adaptacjami, został przyjęty w kilku badaniach15,42,46,51,52,53.
Podążając tą ścieżką, kilka kolejnych badań monitorujących zachowanie18,19,22,23,25,34,40,54,55 i aktywność mózgu20,22,56,57 funkcji podczas rotacji bodźców. Ich odkrycia wskazują na kooperatywną rolę między rezonansem magnetycznym a procesami motorycznymi. Co więcej, rośnie zainteresowanie badaniem strategii rozwiązywania problemów z udziałem MR w odniesieniu do różnic indywidualnych 15,41,46,51,58.
Ogólnie rzecz biorąc, można uznać, że projekt badań mających na celu zrozumienie procesów MR opiera się na przedstawieniu zadania za pomocą bodźców wizualnych, które wymagają od uczestników wykonania operacji MR, która z kolei pociąga za sobą reakcję motoryczną. Jeśli ta reakcja pozwala na rotację bodźców, często nazywa się to rotacją fizyczną (PR). W zależności od szczegółowych celów każdego badania, do pozyskiwania i analizy danych MR i PR zastosowano różne strategie i urządzenia. Na etapie prezentacji bodźca zadaniowego możliwa jest zmiana rodzajów bodźców (tj. wcześniej przytoczonych przykładów); Projekcja (obrazy generowane komputerowo na tradycyjnych wyświetlaczach22,23,25,29,40,41,59, a także w stereoscopes19 i virtual60 i mixed43 środowiska rzeczywistości); oraz interaktywność bodźców (obrazy statyczne12,27,36, animacje61, oraz interaktywne obiekty wirtualne19,22,23,43,53,59).
MR jest zwykle wnioskowane na podstawie pomiarów RTs (ADE), a także aktywności oczu i mózgu25,46,62. Aktywność oka jest mierzona za pomocą danych śledzenia wzroku składających się z ruchów sakkadowych i fiksacji14,15,42,51,52,54,58,60, a także pupillometry40. Dane RT zazwyczaj pochodzą z danych reakcji silnika zarejestrowanych podczas obsługi różnych urządzeń, takich jak dźwignie13, przyciski i przełączniki14,53, pedals53, pokrętła19, joysticks37, keyboard61 i mouse29,58,60, koła napędowe53, czujniki bezwładnościowe22,23, ekrany dotykowe52,59, oraz mikrofony22. Aby zmierzyć PR, oprócz RT, projekt badania będzie również obejmował rejestrowanie ręcznych rotacji interaktywnych bodźców podczas wykonywania przez uczestników zadania MR 22,23,52,53.
W 1998 roku Wohlschläger i Wohlschläger19 używali "tych samych lub różnych" zadań z interaktywnymi wirtualnymi bodźcami SM manipulowanymi za pomocą pokrętła, z obrotami ograniczonymi do jednej osi na zadanie. Zmierzyli RT i skumulowany zapis fizycznych rotacji wykonanych podczas zadań. Porównując sytuacje z rzeczywistą rotacją interaktywnych bodźców i bez niej, doszli do wniosku, że MR i PR mają wspólny proces zarówno dla wyobrażonych, jak i faktycznie wykonywanych rotacji.
W 2014 roku przeprowadzono dwa badania wykorzystujące ten sam typ zadań z wirtualnymi interaktywnymi bodźcami22,23. Obiektami manipulowano jednak za pomocą czujników inercyjnych, które rejestrowały ruch w przestrzeni 3D. W obu przypadkach, oprócz RT, zarejestrowano trajektorie rotacji – ewolucję różnic rotacyjnych między bodźcami referencyjnymi a interaktywnymi podczas zadań. Z tych trajektorii możliwe było wydobycie zarówno informacji skumulowanych (tj. całkowitej liczby obrotów w jednostkach czwartorzędowych), jak i szczegółowych informacji o strategiach rozwiązań. Adams i wsp.23 badali efekt współpracy między MR i PR. Oprócz RT wykorzystali całkę trajektorii rotacji jako parametr dokładności i obiektywności rozdzielczości. Profile krzywych zostały zinterpretowane zgodnie z trzyetapowym modelem63 (planowanie, główny obrót, dokładna regulacja). Wyniki wskazują, że MR i PR niekoniecznie mają jeden, wspólny czynnik. Gardony et al.22 zebrali dane na temat RT, dokładności i rotacji w czasie rzeczywistym. Oprócz potwierdzenia związku między MR i PR, analiza trajektorii rotacji ujawniła, że uczestnicy manipulowali liczbami, dopóki nie byli w stanie określić, czy są one różne, czy nie. Jeśli były takie same, uczestnicy obracali je, aż wyglądały tak samo.
Kontynuując tę strategię, w 2018 roku Wetzel i Bertel52 również wykorzystali interaktywne figurki SM w "tych samych lub różnych" zadaniach, używając tabletów z ekranem dotykowym jako interfejsu. Ponadto wykorzystali urządzenie śledzące ruch gałek ocznych, aby uzyskać skumulowane dane na temat czasu fiksacji i amplitudy sakkady jako parametrów obciążenia poznawczego związanego z rozwiązywaniem zadań MR. Autorzy potwierdzili wcześniejsze badania omówione powyżej dotyczące relacji między MR i PR a procesami rozwiązywania zadań. Jednak w tym badaniu nie wykorzystali mapowania fiksacji i danych sakkad dla bodźców.
Metodologiczne podejścia do mapowania danych śledzenia wzroku na wirtualnych obiektach 3D zostały zaproponowane i stale ulepszane, zwykle przez badaczy zainteresowanych badaniem czynników związanych z uwagą wzrokową w środowiskach wirtualnych64. Chociaż są one przystępne cenowo i wykorzystują podobne urządzenia do śledzenia ruchu gałek ocznych, najwyraźniej metody te nie zostały skutecznie zintegrowane z repertuarem eksperymentalnym stosowanym w badaniach rotacji umysłowej z interaktywnymi obiektami 3D, takimi jak te wcześniej wspomniane. Z drugiej strony, nie znaleźliśmy żadnych badań w literaturze opisujących mapowanie w czasie rzeczywistym danych dotyczących ruchu fiksacji i sakad na interaktywnych obiektach 3D. Wydaje się, że nie ma wygodnej metody łatwej integracji danych o aktywności oczu z trajektoriami rotacji. W tym badaniu staramy się przyczynić do wypełnienia tej luki. Procedura jest szczegółowo przedstawiona, od akwizycji danych do graficznego generowania danych wyjściowych.
W tym artykule szczegółowo opisujemy metodę badania procesów rotacji mentalnej za pomocą wirtualnych interaktywnych obiektów 3D. Podkreślono następujące postępy. Po pierwsze, integruje ilościowy silnik behawioralny (ręczne obracanie obiektów za pomocą interfejsu komputerowego) i gromadzenie danych ocznych (śledzenie oczu) podczas sesji interakcji z wirtualnymi modelami 3D. Po drugie, wymaga jedynie konwencjonalnego sprzętu komputerowego i urządzeń śledzących ruch gałek ocznych do wizualnego projektowania zadań, akwizycji, nagrywania i przetwarzania danych. Po trzecie, z łatwością generuje dane graficzne, aby ułatwić analizę danych - rozbieżności kątowych, rotacji fizycznej, trajektorii rotacji czwartorzędowej i mapowania trafień danych śledzenia wzroku nad wirtualnymi obiektami 3D. Wreszcie, metoda wymaga tylko wolnego oprogramowania. Cały opracowany kod i skrypty są dostępne bezpłatnie (https://github.com/rodrigocnstest/rodrigocnstest.github.io).
1. Przygotowanie narzędzi do zbierania danych
2. Zbieranie danych
3. Przetwarzanie i analiza danych
4. Personalizacja zadań
UWAGA: Cała ta sekcja jest opcjonalna i zalecana tylko dla tych, którzy lubią eksperymentować lub rozumieją, jak kodować. Poniżej znajdziesz niektóre z wielu dostępnych opcji, które można dostosować, a więcej opcji stanie się dostępnych w miarę dalszego rozwoju metod.
Ewolucja dysproporcji kątowej i innych zmiennych
Jak przedstawiono w kroku 3.3.1 w Supplemental File 2, na ekranie monitora wideo wyświetlane są dwa obszary robocze, przedstawiające kopie tego samego wirtualnego obiektu 3D w różnych orientacjach. Na lewym obszarze obiekt docelowy (tObj) pozostaje statyczny i służy jako pozycja docelowa lub pozycja tObj. Na prawym obszarze wyświetlany jest obiekt interaktywny (iObj) w innej pozycji, który uczestnik może przemieszczać w czasie wokół stałego środka obrotu za pomocą myszy (dozwolone są tylko rotacje; translacje są wyłączone). Zadanie polega na dostosowaniu iObj tak, aby jak najdokładniej odpowiadał tObj, w oparciu o ocenę uczestnika. Trzy wykorzystane obiekty 3D można zobaczyć na Rysunku 1. Proces rozwiązywania, choć złożony, może być skrupulatnie rejestrowany do późniejszej analizy. Rejestracja ta wykracza poza zwykłe nagranie wideo, ponieważ każda pozycja w czasie jest przechwytywana w stałych odstępach 0,1 s jako kwaternion, tworząc szereg czasowy, który umożliwia pełną rekonstrukcję całego procesu. Dla każdej pozycji istnieje unikalny obrót wokół określonej osi, w zakresie od 0° do 180°, który bezpośrednio przekształca pozycję tObj w pozycję iObj. Choć obrót ten jest abstrakcyjny i niezwiązany z PR uczestnika podczas wykonywania zadania, precyzyjnie wskazuje dokładną pozycję iObj względem tObj. AD to kąt tego obrotu, który można obliczyć z odpowiedniego kwaternionu. W miarę jak pozycja iObj zbliża się do pozycji tObj, wartość ta dąży do zera.
Po kroku 3.1.6 sekcji Przetwarzanie i analiza danych utworzone zostały dwa pliki: output merge X Y.xlsx oraz output jmol console X Y.xlsx, gdzie X to wartość sessionID, a Y to wartość taskID. W przypadku pozostawienia pustych pól wejściowych i użycia wartości domyślnych, pliki powinny nazywać się output merge 1682707472090 bolaBastao_c.xlsx oraz output jmol console 1682707472090 bolaBastao_c.xlsx. Pliki output merge X Y.xlsx zawierają wybrane dane z eyetrackera scalone z danymi iRT, wyrównane według czasu UNIX Epoch, podobnie jak na Rysunku 2A, jeśli wszystko przebiegło prawidłowo, lub na Rysunku 2B w przypadku wystąpienia problemów.
Pliki output jmol console X Y.xlsx zawierają do pięciu kart wypełnionych poleceniami konsoli Jmol, które po wklejeniu do konsoli Jmol odtworzą ruchy uczestnika podczas rozwiązywania zadania: rotation replay odtwarza rotacje iObj wykonane przez uczestnika; gaze replay int odtwarza rotacje iObj z dodatkową mapą ciepła fiksacji na obiekcie w czasie, z wykorzystaniem skali przezroczystości/nieprzezroczystości; gaze replay tgt pokazuje jedynie trójwymiarową mapę ciepła fiksacji tObj podczas zadania; gaze frame int oraz gaze frame tgt przedstawiają ogólne mapowanie fiksacji całego procesu dla iObj oraz tObj. Wszystkie one są zilustrowane na Rycynie 3A-F. Jmol i JSmol są w zasadzie identyczne; Jmol jest wtyczką opartą na języku programowania Java, a JSmol na języku JavaScript, oba posiadają te same funkcjonalności i mogą być stosowane zamiennie.
Rysunek 4 przedstawia ewolucję dysproporcji kątowej w funkcji czasu dla sześciu różnych scenariuszy z udziałem dwóch uczestników i trzech obiektów. Czas trwania procesu może znacznie się różnić w zależności od wyników uczestnika w interaktywnym zadaniu z obiektem. W każdym zadaniu wykonanym prawidłowo przez uczestnika, AD dąży do zera na końcu. Jeśli na danym wykresie nie występuje takie zachowanie, oznacza to, że uczestnik nie był w stanie ukończyć zadania z powodu rezygnacji lub przekroczenia limitu czasu na zadanie (około 5 min), albo wystąpił błąd w przetwarzaniu danych.
Połączone wyniki zapisów iObj PR oraz dane uzyskane z pomiarów okulograficznych przedstawiono na rycinie 5. Zmiana dysproporcji kątowej między obiektem docelowym a obiektami bezwładnymi w funkcji czasu wskazuje na trzy odrębne etapy procesu rozwiązywania danego zadania: wstępną obserwację modeli, balistyczny obrót modelu interaktywnego oraz precyzyjne dostrojenie obrotu modelu interaktywnego. Rycina 5A pokazuje naprzemienne kierowanie wzroku między modelami w fazie początkowej, a dokładniej, w fazie dostrajania. Rycina 5B wykazuje, że źrenica pozostaje bardziej rozszerzona w fazach początkowej i dostrajania. W fazie dostrajania długi okres fiksacji na modelu interaktywnym (40-47 s na rycinie 5A) odpowiada plateau średnicy źrenicy (40-47 s, rycina 5B).
Wyniki te sugerują, że dane uzyskane za pomocą zaproponowanej tutaj metody są zgodne z modelem rozwiązywania problemów rotacji mentalnej zaproponowanym na podstawie danych o fiksacjach wzroku dla modeli statycznych14,66 oraz dla modeli interaktywnych23. Taki model obejmowałby trzy etapy: poszukiwanie, transformację i porównanie oraz potwierdzenie zgodności lub niezgodności modeli. Ponadto naprzemienne fiksacje między modelem docelowym a interaktywnym na etapach porównania, zaobserwowane na Ryc. 5A, są zgodne z wynikami uzyskanymi w testach typu Shepparda i Metzlera z wykorzystaniem obrazów statycznych42,66. Jednak w przypadku modeli interaktywnych prawdopodobne jest, że etapy poszukiwania, transformacji, porównania i potwierdzenia następują sukcesywnie poprzez interakcję i zmiana położenia modelu interaktywnego.
Trajektorie rotacji 3D
Każdą rotację w przestrzeni 3D od 0° do 180° można przełożyć na punkt wewnątrz kuli (rozumianej jako objętość wewnątrz sfery) o promieniu równym 180°. Rysunek 6 przedstawia tę odpowiedniość na trzech przykładach rotacji. Odległość punktu od środka kuli stanowi różnicę kątową iObj względem pozycji tObj, a wektor prowadzący ze środka kuli do punktu określa kierunek rotacji, przy czym rotacja odbywa się zgodnie z ruchem wskazówek zegara, patrząc od środka. Taka translacja rotacji na punkty w kuli pozwala na bezpośrednią wizualizację całego przebiegu rotacji wykonanych przez uczestnika w zadaniu na jednym rysunku 3D. Rysunek ten nazywamy trajektorią rotacji 3D.
Analogicznie do pomiaru AD, w przypadku każdego zadania poprawnie wykonanego przez uczestnika, trajektoria powinna ostatecznie zbliżać się do środka kuli. Jeśli trajektoria osiągnie granicę sfery przy obrocie o 180°, zostanie ona przeniesiona na punkt antypodalny sfery. Rycina 7 przedstawia trajektorię obrotu dwóch wspomnianych wcześniej uczestników wykonujących trzecie zadanie (C1 i C2 na Rycini 4), widzianą zarówno w perspektywie, jak i w rzutach na trzy płaszczyzny współrzędnych. Z rysunku wynika wyraźnie, że mimo stosunkowo małego początkowego AD bliskiego 45°, uczestnik 1 początkowo odbiegał od pozycji docelowej, zanim znalazł definitywną drogę do rozwiązania, w przeciwieństwie do uczestnika 2, który wykonał zadanie szybciej.
Mapa ciepła fiksacji 3D
W procesie rozwiązywania problemu uczestnik przełącza wzrok między tObj a iObj, jednocześnie wchodząc w interakcję z iObj. Na podstawie danych z eyetrackingu możemy wyodrębnić pozycję spojrzenia uczestnika i stworzyć mapę ciepła obszarów ekranu, które w dowolnym przedziale czasowym przyciągnęły najwięcej i najmniej uwagi uczestnika. Idąc dalej, dzięki synchronizacji danych eyetrackingu oraz danych kwaternionowych iRT, możemy jednocześnie mapować w przestrzeni 3D i czasie, jak dużą uwagę otrzymują poszczególne wierzchołki obiektów, nawet w przypadku obiektów rotujących w czasie.
Na Rysunku 3 uwaga poświęcona obiektowi jest reprezentowana przez poziom przezroczystości każdego wierzchołka. Im bliżej znajduje się on punktu fiksacji wzroku uczestnika i im dłużej pozostaje w jego pobliżu, tym większą uwagę otrzymuje, co skutkuje wyższą nieprzezroczystością w tym regionie obiektu. Przestrzenny spadek uwagi jest modelowany za pomocą dwuwymiarowej jednorodnej funkcji Gaussa dla pozycji spojrzenia oraz prostej jednorodnej funkcji Gaussa zastosowanej dla upływu czasu. Odchylenie standardowe tych funkcji Gaussa wybrano przy założeniu kąta widzenia wynoszącego 2 stopnie67 oraz wizualnej pamięci krótkotrwałej wynoszącej 10 s68. Aby zapobiec powstawaniu artefaktów wizualnych przy tej metodzie, dane o bliskości spojrzenia są ustawiane na zero, gdy wzrok znajduje się poza obszarem obiektu (iObj nie otrzymuje uwagi rezydualnej, gdy spojrzenie znajduje się w obszarze tObj lub poza obydwoma). Rysunek 3 przedstawia pojedynczą klatkę z każdego obiektu z całej animacji odtworzenia oraz te same klatki z 3D mapą ciepła fiksacji. Możliwe porównanie tObj i iObj przez uczestnika podczas procesu rozwiązywania można zaobserwować (Rysunek 3C,D) w miarę zbliżania się zadania do końca (czas = 6,3 s). Cały proces można obejrzeć w formie wideo w Suplementarnym Wideo S1. Raportujemy wyniki komputerowo wspomaganej rotacji modeli 3D przedstawionych uczestnikom jako zadania wykonanego w zwykłych warunkach.

Rycina 1: Wykorzystane obiekty docelowe. Obraz modeli 3D użytych w zadaniach na stronie internetowej. (A) Cząsteczka w reprezentacji kulkowo-prętowej; (B) Ta sama cząsteczka z wypełnionymi wielokątami, bez wodorów i przedstawiona wyłącznie za pomocą prętów; (C) polikostka podobna do jednej z figur Shepard i Metzler13, pochodząca z biblioteki bodźców Peters i Battista36. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 2: Porównanie arkuszy. (A,B) Obrazy pochodzą z arkusza kalkulacyjnego output merge 1682707472090 bolaBastao_c.xlsx. Kolumny A-G zawierają wartości danych iRT, natomiast kolumny H-N zawierają wartości danych z eyetrackera. W przypadku (A) wszystko jest poprawne, natomiast w (B), w kolumnach eyetrackera wszystkie wartości są stałe i nie zgadzają się z wartościami czasu systemu iRT. Jeżeli wystąpi jakikolwiek problem z procesem synchronizacji danych, prawdopodobnie pojawi się ten błąd. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Mapa ciepła fiksacji. Mapa ciepła fiksacji na obiekcie 3D z wykorzystaniem skali nieprzezroczystości, gdzie większa nieprzezroczystość koreluje z dłuższym czasem spędzonym w pobliżu punktu spojrzenia uczestnika. (A,B) Obrazy tObj i iObj zadania rozwiązywanego przez uczestnika w 6,3 s. (C,D) Te same obrazy co w (A,B) w tym samym momencie, z dodaną skalą nieprzezroczystości mapy ciepła. (E,F) Obrazy mapy ciepła fiksacji obejmujące cały okres, w którym uczestnik widział obiekty. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 4siatka AD Wykres siatki dysproporcji kątowej dla dwóch uczestników i trzech zadań. Kolumny reprezentują uczestników 1 i 2, a wiersze zadania rozwiązane przez uczestników przy użyciu trzech obiektów przedstawionych w Rysunek 3Należy zauważyć, że chociaż AD różni się pomiędzy 0° i 180°zakres czasu nie jest stały i zmienia się w zależności od wyników uczestnika oraz jego własnej decyzji o zakończeniu procesu. W miarę jak uczestnik obraca iObj, AD między tObj a iObj zmienia się wraz z upływem czasu, aż w końcu uczestnik uzna aktualną orientację iObj za najbliższą tObj. W 1Proszę podać tekst źródłowy, który należy przetłumaczyć. oraz 2nd zadania, obaj uczestnicy wydawali się robić postępy w podobny sposób, jednak uczestnik 1 potrzebował połowy czasu, który poświęcił uczestnik 2. A w 3Błąd przekazu / Błąd odczytu (w zależności od kontekstu technicznego) zadanie, mimo że uczestnik 2 poświęcił mniej czasu na jego wykonanie, uczestnik 1 rozwiązał zadanie już przed 20. sekundą i nadal wprowadzał niewielkie korekty, aby lepiej dopasować iObj do tObj. Skrót: AD = dysproporcja kątowa. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 5: AD z danymi eye-trackingowymi. Ewolucja dysproporcji kątowej połączona z danymi z eye-trackera. (A) Dysproporcja kątowa i pozycja spojrzenia, ewolucja dysproporcji kątowej między tObj a iObj, wraz z regionalnymi danymi o fiksacjach dla każdego modelu. Wykres pokazuje, w którym regionie znajduje się spojrzenie uczestnika: czerwony, gdy znajduje się w obszarze iObj, niebieski, gdy w obszarze tObj i szary, gdy znajduje się poza obydwoma, patrząc na inny element ekranu lub poza niego. (B) Dysproporcja kątowa i średnica źrenicy. Dysproporcja kątowa (kolor niebieski) wraz z danymi o średnicy źrenicy (kolor pomarańczowy). Średnica źrenicy to średnia wartość źrenicy lewej i prawej w każdym punkcie czasowym. Skrót: AD = angular disparity (dysproporcja kątowa). Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 6: Kula rotacji. Na tym rysunku przedstawiono, w jaki sposób każdą możliwą pozycję rotacyjną obiektu względem pozycji referencyjnej można reprezentować jako punkt w kuli o promieniu 180°, co pozwala na pełną reprezentację położenia rotacyjnego obiektu w trzech osiach. W tym kontekście kulę rozumie się jako objętość ograniczoną sferą. (A) Obiektem użytym jako przykład jest asymetryczna struktura złożona z siedmiu sześcianów, przedstawiona u góry po lewej stronie. Do obiektu tego zastosowano trzy proste rotacje oznaczone jako I, II i III, pokazane po prawej stronie. Są to odpowiednio: +90° wokół osi x, -60° wokół osi z oraz 180° wokół osi znajdującej się między +x a -y, pod kątem 45° względem obu tych osi. (B) Przedstawiono kulę rotacji z punktami odpowiadającymi rotacjom I, II i III. Odległość od środka kuli oznacza różnicę kątową. Ponieważ rotacja III osiąga maksymalny kąt obrotu (180°), jest ona reprezentowana również w punkcie antypodalnym, gdyż są one w zasadzie tożsame. Rotacja II, będąca obrotem przeciwnym do ruchu wskazówek zegara względem dodatniego kierunku osi z, znajduje się po stronie ujemnej. Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

Rysunek 7: Trajektoria rotacji 3D. Trajektoria rotacji wewnątrz kuli rotacji wykonana przez dwóch uczestników w trzecim zadaniu, przedstawiona zarówno w perspektywie (A), jak i w rzutach na płaszczyzny współrzędnych (B-D). Grubość linii zmniejsza się w czasie. Każda kolumna odpowiada jednemu uczestnikowi (v1 i v2). W miarę jak trajektorie zbliżają się do środka kuli, uczestnicy są bliżsi rozwiązania zadania. „0” oznacza pozycję początkową zadania. Kolejne numery wskazują punkty, w których trajektoria osiąga krawędź kuli i kontynuuje ruch przez punkt antypodalny po przeciwnej stronie (od 1 do 2, od 2 do 3, od 3 do 4 itd.). Aby wyświetlić większą wersję tego rysunku, kliknij tutaj.
Tabela uzupełniająca S1: Nagłówki arkusza. Lista nagłówków w sklonowanym pliku arkusza. Każdy nagłówek odpowiada nazwie zmiennej i będzie zawierał dane z tej zmiennej, tworząc kolumnę wartości wykorzystywanych w przetwarzaniu i analizie naszych danych. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 1: Przewodnik po kroku 1 protokołu.Lista zrzutów ekranu prowadząca przez etapy metody protokołu „1. Przygotowanie narzędzi do zbierania danych”. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 2: Przewodnik po kroku 3 protokołu. Lista zrzutów ekranu prowadząca przez etapy metody protokołu „3. Przetwarzanie i analiza danych”. Aby pobrać ten plik, kliknij tutaj.
Film uzupełniający 1: Odtwarzanie mapowania fiksacji. Przykład animowanych powtórek mapowania uwagi czasowej w 3D z iObj i tObj jednocześnie. Nagrano przy użyciu OBS Studios i zmontowano w programie OpenShot Video Editor. Kliknij tutaj, aby pobrać ten plik.
Jak wspomniano wcześniej, niniejszy artykuł ma na celu przedstawienie szczegółowej procedury mapowania w czasie rzeczywistym danych ruchu fiksacji i sakad na interaktywnych obiektach 3D, która jest łatwo konfigurowalna i wykorzystuje tylko oprogramowanie dostępne za darmo, dostarczając instrukcje krok po kroku, aby wszystko działało.
Chociaż ta eksperymentalna konfiguracja obejmowała wysoce interaktywne zadanie, takie jak przesuwanie obiektu 3D w celu dopasowania orientacji innego obiektu do PR w dwóch z trzech możliwych osi, zadbaliśmy o dokładną dokumentację naszych skryptów poprzez odpowiednie komentarze, aby ułatwić wszelkie dostosowania. Można zaprojektować różne inne rodzaje eksperymentów, przy czym urządzenie śledzące ruch gałek ocznych jest tylko jednym z wielu innych możliwych urządzeń używanych do pozyskiwania danych czasowych.
Nagłówki w skopiowanym pliku z kroku 1.1.3.3 definiują zawartość i miejsce, w którym dane będą zbierane online. Tabela uzupełniająca S1 zawiera listę nazw zmiennych (we wszystkich rozróżniana jest wielkość liter) i ich znaczenie. Te zmienne odzwierciedlają zmienne znajdujące się w plikach JavaScript w repozytorium GitHub. Rodzaj i różnorodność danych oraz nazw zmiennych, zarówno z tego arkusza, jak i plików JavaScript, powinny być zmieniane zgodnie z zakresem i wymaganiami badania.
Zapis danych rotacyjnych w kwaternionach pozwala badaczowi odtworzyć te same ruchy wykonywane przez uczestników podczas zadań, ułatwiając analizę procesu i znacznie efektywniej wykorzystując przestrzeń dyskową w porównaniu ze zrzutem ekranu. Bardziej szczegółowa analiza, taka jak trajektoria obrotu 3D, pokazana na rysunku 7 przy użyciu kuli obrotów, jest możliwa tylko dzięki wewnętrznym danym kwaternionowym interaktywnych obiektów. Ten nowy typ wykresu, rozwijający się z wykresu AD w czasie przez Gardony22 i Adams23, dostarcza bardziej szczegółowych informacji, z rzeczywistymi współrzędnymi obrotu 3D w czasie.
Kolejną zaletą jest użycie standardowej miary czasu do synchronizacji wszystkich źródeł danych. Łączenie z tym różnych warstw informacji zależnych od czasu staje się znacznie łatwiejsze, na przykład nakładanie wykresów z wieloma źródłami danych, jak na rysunku 5B z pomiarem rozszerzenia źrenicy lub na rysunku 5A z kolorowymi pionowymi pasami, oznaczającymi możliwe wzorce w procesie rozwiązywania przez uczestników, nawet jeśli w iObj prawie nie zachodził obrót. Mapa cieplna fiksacji 3D pokazana na rysunku 3 jest możliwa tylko na podstawie danych kwaternionów i synchronizacji danych.
Bardzo ważne jest, aby korzystać z synchronizacji za pomocą standardowej miary czasu, aby zapewnić jakąkolwiek integrację danych czasowych. Standardem czasowym wybranym dla naszego projektu była epoka UNIX, która jest używana w JavaScript i większości innych języków programowania. Dla każdego zestawu danych musi być używany pewien typ znanego standardu czasu, nawet jeśli inny standard, który może być później przekonwertowany na epokę systemu UNIX. Dane czasowe, które nie korzystają z żadnych standardów, z całą pewnością nie będą w stanie się zsynchronizować i stracą swoją użyteczność.
Kolejnym ograniczeniem jest stosunkowo niska częstotliwość 10 Hz stosowana w testach iRT w stosunku do częstotliwości śledzenia ruchu gałek ocznych wynoszącej 60 Hz. Dzieje się tak częściowo z powodu ograniczeń w przetwarzaniu i przesyłaniu danych w przeglądarce, ponieważ każda wyższa częstotliwość proporcjonalnie skróciłaby maksymalny limit czasu każdego zadania, który obecnie wynosi 327 s. Dodatkowo, płynne renderowanie złożonych animacji w Jmol przy tej liczbie klatek na sekundę już stanowiło wyzwanie. Dodatkowe wideo S1 to nagranie wideo, na którym Jmol renderuje powtórkę ze zmianą krycia w czasie, odwzorowując stopień skupienia otrzymanego przez każdy wierzchołek. Podczas gdy czas trwania filmu wynosi prawie 2 minuty, rzeczywiste zadanie zostało wykonane w 63 s. Przyszłe prace nad oprogramowaniem, które skupiałyby się specjalnie na takich funkcjach, zamiast dostosowywać istniejące, mogłyby wyeliminować te ograniczenia i zwiększyć możliwości gromadzenia i analizy danych.
Autorzy nie mają do ujawnienia żadnych konfliktów interesów.
Autorzy są wdzięczni Koordynacji na rzecz Doskonalenia Kadr Szkolnictwa Wyższego (CAPES) - Kod Finansowy 001 oraz Uniwersytetowi Federalnemu ABC (UFABC). João R. Sato otrzymał wsparcie finansowe od Fundacji Badawczej São Paulo (FAPESP, granty nr 2018/21934-5, 2018/04654-9 i 2023/02538-0).
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Firefox | Mozilla Foundation (Open Source) | Każda zaktualizowana nowoczesna przeglądarka, która jest kompatybilna z WebGL (https://caniuse.com/webgl), a z kolei z Jmol, może być używana | |
| GNU Octave | Open Source | https://octave.org/ | |
| Google Apps Script | Google LLC | script.google.com | |
| Arkusze Google | LLC | https://www.google.com/sheets/about/ | |
| Laptop | Dowolny komputer, na którym można uruchomić oprogramowanie systemu śledzenia ruchu gałek ocznych. | ||
| Pakiet oprogramowania Mangold Mangold | Interfejs oprogramowania używany w urządzeniu śledzącym ruch gałek ocznych. Można użyć dowolnego oprogramowania, które wyprowadza dane z wartościami czasu systemowego. | ||
| Mysz | Każda mysz zdolna do klikania i przeciągania prostymi ruchami powinna być kompatybilna. Interfejsy człowieka analogiczne do myszy o tych samych możliwościach, takie jak ekran dotykowy lub wskaźnik, powinny być kompatybilne, ale mogą zachowywać się inaczej. | ||
| Vt3mini | cyfrowe EyeTech | 60 Hz. Każde działające urządzenie do śledzenia ruchu gałek ocznych powinno być kompatybilne. |