W chirurgii wizualizacja 3D może być wykorzystywana w edukacji, diagnostyce, planowaniu przedoperacyjnym oraz ocenie pooperacyjnej1,2. Realistyczne postrzeganie głębi może usprawnić zrozumienie3,4,5,6 anatomii prawidłowej i patologicznej. Proste nagrania wideo 2D z procedur chirurgicznych stanowią dobry punkt wyjścia. Jednak brak postrzegania głębi może utrudnić osobom niebędącym chirurgami pełne zrozumienie relacji przednio-tylnych między różnymi strukturami anatomicznymi, co może również prowadzić do ryzyka błędnej interpretacji anatomii7,8,9,10.
Na doświadczenie widzenia 3D wpływa pięć czynników: (1) konfiguracja kamer, która może być równoległa lub zbieżna, jak pokazano na Rysunku 1, (2) odległość bazowa (odstęp między kamerami), (3) odległość do badanego obiektu oraz inne cechy sceny, takie jak tło, (4) charakterystyka urządzeń do wyświetlania, np. rozmiar ekranu i pozycja widza1,11,12,13, (5) indywidualne preferencje widzów14,15.
Projektowanie konfiguracji kamery 3D rozpoczyna się od przechwytywania filmów testowych, nagranych przy różnych odległościach między osiami kamer oraz w różnych konfiguracjach, które posłużą do oceny subiektywnej lub automatycznej16,17,18,19,20. Odległość kamery od pola operacyjnego musi pozostać stała, aby uzyskać ostre obrazy. Preferowane jest stałe ustawienie ostrości, ponieważ autofokus może dostosować się do dłoni, instrumentów lub głów, które mogą pojawić się w polu widzenia. Jest to jednak trudne do osiągnięcia, gdy obszarem zainteresowania jest pole operacyjne. Sale operacyjne są obszarami o ograniczonym dostępie, ponieważ placówki te muszą być utrzymywane w czystości i sterylności. Sprzęt techniczny, chirurdzy i pielęgniarki operacyjne często gromadzą się blisko pacjenta, aby zapewnić dobry przegląd wizualny i efektywny przebieg pracy. Aby porównać i ocenić wpływ pozycji kamer na wrażenia z oglądania 3D, pełen zakres testowy pozycji kamer powinien rejestrować tę samą scenę, ponieważ charakterystyka obiektu, taka jak kształt, rozmiar i kolor, może wpływać na odbiór obrazu 3D21.
Z tego samego powodu pełne zakresy testowe pozycji kamery powinny zostać powtórzone w różnych procedurach chirurgicznych. Cała sekwencja pozycji musi zostać powtórzona z wysoką dokładnością. W warunkach chirurgicznych istniejące metody, które wymagają albo ręcznej regulacji odległości bazowej22, albo zastosowania różnych par kamer o stałych odległościach bazowych23, są niewykonalne ze względu na ograniczenia przestrzenne i czasowe. Aby rozwiązać ten problem, zaprojektowano niniejsze rozwiązanie zrobotyzowane.
Dane zostały zebrane przy użyciu dwuręcznego kolaboracyjnego robota przemysłowego zamontowanego w suficie sali operacyjnej. Kamery przymocowano do nadgarstków robota, które poruszały się wzdłuż trajektorii w kształcie łuku z rosnącą odległością bazową, jak pokazano na Rysunku 2.
Aby zademonstrować przyjęte podejście, zarejestrowano 10 serii testowych u 4 różnych pacjentów z 4 różnymi wrodzonymi wadami serca. Sceny wybierano w momentach, gdy możliwa była przerwa w operacji: przy bijącym sercu bezpośrednio przed i po korekcji chirurgicznej. Serie wykonano również w stanie zatrzymania akcji serca. Operacje wstrzymano na 3 min 20 s, aby zebrać czterdzieści 5-sekundowych sekwencji z różnymi odległościami konwergencji kamer i odległościami bazy w celu uchwycenia sceny. Nagrania wideo zostały następnie poddane postprocesowaniu i wyświetlone w 3D zespołowi klinicznemu, który ocenił realizm wideo 3D w skali od 0 do 5.
Punkt zbieżności dla skierowanych do wewnątrz kamer stereo to miejsce, w którym spotykają się punkty centralne obu obrazów. Punkt zbieżności może, w zależności od zasady, znajdować się przed, w obrębie lub za obiektem, patrz Rysunek 1A-C. Gdy punkt zbieżności znajduje się przed obiektem, obiekt zostanie zarejestrowany i wyświetlony po lewej stronie linii środkowej w obrazie z lewej kamery oraz po prawej stronie linii środkowej w obrazie z prawej kamery (Rysunek 1A). Odwrotna sytuacja ma miejsce, gdy punkt zbieżności znajduje się za obiektem (Rysunek 1B). Gdy punkt zbieżności znajduje się na obiekcie, obiekt pojawi się również w linii środkowej obrazów z kamer (Rysunek 1C), co prawdopodobnie zapewni najbardziej komfortowy odbiór, ponieważ nie jest wymagane mrużenie oczu w celu scalenia obrazów. Aby uzyskać komfortowe wideo stereo 3D, punkt zbieżności musi znajdować się na obiekcie zainteresowania lub nieco za nim, w przeciwnym razie widz musi świadomie mrużyć oczy na zewnątrz (egzotropia).
Dane zostały zebrane przy użyciu dwuramiennego kolaboracyjnego robota przemysłowego do pozycjonowania kamer (Rysunek 2A-B). Robot waży 38 kg bez wyposażenia. Robot jest bezpieczny z natury; w przypadku wykrycia nieoczekiwanego uderzenia zatrzymuje on swój ruch. Robot został zaprogramowany tak, aby pozycjonować kamery 5 Megapiksel z obiektywami z mocowaniem C wzdłuż trajektorii w kształcie łuku, zatrzymując się w określonych odległościach bazowych (Rysunek 2C). Kamery zostały przymocowane do chwytaków robota za pomocą płyt adaptacyjnych, jak pokazano na Rysunku 3. Każda kamera rejestrowała obraz z częstotliwością 25 klatek na sekundę. Obiektywy ustawiono na przysłonę f/8 z ostrością ustawioną na interesujący obiekt (przybliżony geometryczny środek serca). Każda klatka obrazu posiadała znacznik czasu, który służył do synchronizacji dwóch strumieni wideo.
Przeprowadzono kalibrację przesunięć pomiędzy nadgarstkiem robota a kamerą. Można to osiągnąć poprzez wyrównanie krzyżyków na obrazach z kamer, jak pokazano na Rysunku 4. W tej konfiguracji całkowite przesunięcie translacyjne od punktu montażowego na nadgarstku robota do centrum czujnika obrazu kamery wynosiło 55,3 mm w kierunku X oraz 21,2 mm w kierunku Z, co przedstawiono na Rysunku 5. Przesunięcia rotacyjne skalibrowano przy odległości zbieżności 1100 mm i odległości bazowej 50 mm, a następnie dostosowano ręcznie za pomocą joysticka na panelu sterowania robotem. Robot wykorzystany w tej badaniu charakteryzował się określoną dokładnością 0,02 mm w przestrzeni kartezjańskiej oraz rozdzielczością rotacyjną 0,01 stopnia24. Przy promieniu 1100 m różnica kąta o 0,01 stopnia przesuwa punkt centralny o 0,2 mm. Podczas pełnego ruchu robota przy separacji od 50 do 240 mm krzyżyk każdej kamery znajdował się w odległości nieprzekraczającej 2 mm od idealnego centrum zbieżności.
Odległość bazową zwiększano stopniowo poprzez symetryczne rozsuwanie kamer wokół centrum pola widzenia w przyrostach 10 mm, w zakresie od 50-240 mm (Rysunek 2). Kamery pozostawały w bezruchu przez 5 s w każdej pozycji i były przemieszczane między pozycjami z prędkością 50 mm/s. Punkt konwergencji można było regulować w kierunkach X i Z za pomocą graficznego interfejsu użytkownika (Rysunek 6). Robot poruszał się odpowiednio w ramach swojego zakresu roboczego.
Dokładność punktu zbieżności oszacowano przy użyciu jednakowych trójkątów i nazw zmiennych przedstawionych na Ryc. 7A i B. Wysokość 'z' obliczono z odległości zbieżności 'R' przy użyciu twierdzenia Pitagorasa jako

Gdy rzeczywisty punkt zbieżności znajdował się bliżej niż punkt pożądany, jak pokazano na Rysunku 7A, odległość błędu 'f1' obliczano według wzoru

Analogicznie, gdy punkt zbieżności znajdował się dystalnie względem punktu docelowego, odległość błędu 'f2' obliczano jako

W tym przypadku 'e' oznaczało maksymalny rozstaw linii celownika, wynoszący maksymalnie 2 mm przy maksymalnym rozstawie bazy podczas kalibracji (D = 240 mm). Dla R = 1100 mm (z = 1093 mm) błąd wynosił mniej niż ± 9,2 mm. Dla R = 1400 mm (z = 1395 mm) błąd wynosił ± 11,7 mm. Oznacza to, że błąd wyznaczenia punktu konwergencji mieścił się w granicach 1% wartości pożądanej. Dwie testowe odległości 1100 mm i 1400 mm były zatem wyraźnie od siebie oddzielone.