Wszystkie metody z udziałem ludzi zostały przeprowadzone zgodnie z wytycznymi instytucjonalnymi i zostały zatwierdzone przez instytucjonalną komisję rewizyjną (IRB) lub komisję etyki badań z udziałem ludzi Uniwersytetu Normalnego w Hanshan. Przed rozpoczęciem eksperymentu od wszystkich uczestników uzyskano świadomą zgodę.
Ramy koncepcyjne i projekt badawczy
W niniejszym badaniu zastosowano projekt badawczy typu proces–produkt z pomocniczą warstwą dyskursywną, aby zbadać, w jaki sposób generowane przez widzów komentarze danmu wpływają na tłumaczenie napisów. Ramy analityczne zintegrowano z cechami tekstowymi, wskaźnikami procesu tłumaczenia oraz wynikami jakości tłumaczenia. W szczególności zbadano, czy uwaga widzów, odzwierciedlona w gęstości danmu, kierowała zasoby poznawcze tłumaczy na konkretne cechy tekstu oraz czy taki rozdział uwagi wpływał następnie na jakość tłumaczenia.
Aby zoperacjonalizować te ramy, w badaniu najpierw ustalono cechy tekstowe na poziomie segmentu w oparciu o cztery wymiary: ładunek kulturowy, gęstość ocenną, kompresję narracyjną oraz istotność danmu. Ładunek kulturowy odnosił się do obecności odniesień specyficznych kulturowo, które wymagały adaptacji lub wyjaśnienia. Gęstość ocenna mierzyła stężenie języka nacechowanego emocjonalnie lub postawowo w obrębie segmentu. Kompresja narracyjna oddawała stopień, w jakim treść semantyczna została skondensowana ze względu na ograniczenia napisów. Istotność danmu reprezentowała stopień uwagi widzów skierowanej na każdy segment napisów, kwantyfikowany przez liczbę zsynchronizowanych komentarzy danmu. W przeciwieństwie do konwencjonalnych miar trudności przekładu, istotność danmu odzwierciedlała społecznie rozproszoną uwagę, a nie wewnętrzną złożoność tekstu. Segment wywołujący duże zaangażowanie widzów niekoniecznie był trudniejszy do przetłumaczenia; zamiast tego reprezentował punkt o zwiększonym znaczeniu komunikacyjnym w ramach doświadczenia z oglądania.
Ramy analityczne składały się z trzech powiązanych ze sobą zbiorów danych. Zbiór danych na poziomie uczestnika obejmował indywidualne cechy demograficzne oraz doświadczenie w tłumaczeniu. Zbiór danych proces–produkt łączył każdy segment napisu z wskaźnikami behawioralnymi wyodrębnionymi z rejestracji naciśnięć klawiszy (keystroke logging) wraz z eksperckimi ocenami jakości tłumaczenia. Zbiór danych danmu zawierał zsynchronizowane komentarze widzów dopasowane do czasu wyświetlania napisów, na podstawie których obliczono wartości istotności (salience) danmu. Zbiory te zostały powiązane za pomocą identyfikatorów uczestników i segmentów, co umożliwiło jednoczesną analizę każdego przetłumaczonego segmentu napisu w relacji do cech tłumacza, behawioralnego przetwarzania poznawczego, uwagi widzów oraz wyników tłumaczenia. Końcowa zintegrowana baza danych obejmowała 216 pełnych sesji tłumaczenia i 3 168 obserwacji typu uczestnik–tekst–segment, stanowiąc podstawę empiryczną dla późniejszych analiz proces–produkt.
Przesiew uczestników i profilowanie tła
Próba składała się z 72 studentów filologii angielskiej zrekrutowanych z publicznego uniwersytetu w południowych Chinach, równomiernie rozdzielonych pomiędzy drugi, trzeci i czwarty rok studiów licencjackich (po 24 uczestników z każdego roku). Wszyscy uczestnicy byli rodzimymi użytkownikami języka chińskiego, przechodzącymi formalną naukę pisania i tłumaczenia w języku angielskim. Aby zapewnić porównywalność w populacji tłumaczy w trakcie szkolenia, wykluczono osoby, które mieszkały w kraju anglojęzycznym dłużej niż 6 miesięcy lub posiadały certyfikat tłumacza zawodowego. Uczestnicy nie zostali podzieleni na osobne grupy eksperymentalne ze względu na doświadczenie w tłumaczeniu, znajomość kultury lub poziom biegłości w drugim języku. Zamiast tego zarejestrowano rok studiów, wyniki z ostatnich testów biegłości języka angielskiego, ukończone kursy tłumaczenia, samoocenę znajomości zagadnień kulturowych związanych z Chinami oraz średni tygodniowy czas poświęcony na praktykę dwujęzyczną, a następnie uwzględniono je jako współzmienne na poziomie uczestnika w modelach statystycznych. Wyjaśnienie to rozwiązuje również kwestię niespójności w liczbie uczestników podniesioną podczas recenzji: zarówno rękopis, jak i zestaw danych do replikacji obejmują 72 uczestników, 216 sesji zadań oraz 3 168 obserwacji na poziomie segmentu.
Wybór tekstu źródłowego i konstruowanie zadań
Materiały do tłumaczenia składały się z trzech współczesnych tekstów narracyjnych dotyczących Chin, opracowanych specjalnie na potrzeby niniejszego badania, aby odzwierciedlały autentyczny dyskurs publiczny i uniknąć powielania materiałów chronionych prawem autorskim. Każdy tekst zawierał od 205 do 225 znaków chińskich, lecz różniły się one systematycznie pod względem charakterystyki wewnętrznej. Tekst A przedstawia narrację o powrocie do domu z okazji Święta Wiosny, charakteryzującą się umiarkowanym obciążeniem kulturowym i stosunkowo prostą składnią. Tekst B opisuje wspomnienia z Festiwalu Smoczych Łodzi i zawiera większe zagęszczenie wyrażeń specyficznych kulturowo oraz niejawnej wiedzy kontekstowej. Tekst C opisuje narrację dotyczącą wiejskiego livestreamingu i e-handlu, charakteryzującą się gęstym językiem wartościującym i skondensowaną pozycją narracyjną.
Teksty zostały systematycznie podzielone z wykorzystaniem granic zdań składowych, a następnie granic jednostek znaczeniowych, co pozwoliło na uzyskanie 44 jednostek analitycznych w trzech zadaniach przekładowych (Tabela 1). Przed formalnym kodowaniem opracowano instrukcję kodowania, w której zdefiniowano obciążenie kulturowe, gęstość ewaluatywną oraz kompresję narracyjną przy użyciu skal porządkowych od 1 do 5. Badanie pilotażowe z udziałem 12 studentów, którzy nie brali udziału w głównym eksperymencie, potwierdziło zamierzoną kalibrację trudności, jasność instrukcji zadań oraz stabilność granic segmentów pod kątem dopasowania uderzeń w klawisze.
Konstrukcja korpusu pomocniczego i mapowanie istotności
W celu zidentyfikowania publicznie istotnych wskazówek narracyjnych opracowano pomocniczy korpus danmu na podstawie 24 filmów z serwisu Bilibili, przesłanych między styczniem 2023 a grudniem 2025 roku. Do analizy włączono wyłącznie filmy, które odpowiadały jednej z trzech domen semantycznych reprezentowanych w tekstach źródłowych, zgromadziły ponad 50 000 wyświetleń, zawierały gęstą interakcję danmu oraz umożliwiały eksport i mapowanie tematyczne komentarzy zsynchronizowanych czasowo. Po usunięciu duplikatów oraz odfiltrowaniu emotikon, wypełniaczy onomatopeicznych i nieistotnych fragmentów, końcowy korpus objął 18 642 komentarze.
Słowa treściowe zostały ustandaryzowane i zgrupowane przy użyciu kotwic słów kluczowych powiązanych z tekstem źródłowym. Następnie każdemu segmentowi tekstu źródłowego przypisano ciągły wskaźnik istotności danmu, oparty na ważonej kompozycji znormalizowanej częstotliwości klastrów słów kluczowych, koncentracji komentarzy w odpowiadającym im klastrze tematycznym oraz średniej intensywności oceny. Procedura ta umożliwia porównanie wysiłku przetwarzania tłumacza z istotnością dla odbiorcy na poziomie klastrów semantycznych, a nie poprzez bezpośrednie dopasowanie leksykalne. Ponieważ danmu odzwierciedla reakcje odbiorców na filmy internetowe, a nie samo eksperymentalne zadanie tłumaczeniowe, istotność danmu jest interpretowana jako zewnętrzny wskaźnik zaangażowania widzów, a nie bezpośredni dowód na trudność językową segmentu źródłowego.
Procedura eksperymentalna i rejestracja danych
Sesje tłumaczeniowe przeprowadzono indywidualnie w kontrolowanym laboratorium komputerowym w zestandaryzowanych warunkach sprzętowych, programowych i w zakresie dostępu do Internetu (Rycina 2). Po pięciominutowym wprowadzeniu, w którym podkreślono konieczność tworzenia czytelnego tekstu w języku angielskim dla międzynarodowego odbiorcy, uczestnicy wykonali trzy minutowe ćwiczenie rozgrzewkowe z pisania po angielsku, aby zminimalizować wpływ aklimatyzacji do klawiatury. Trzy zadania tłumaczeniowe realizowano sekwencyjnie przy użyciu Translog-II, przy czym kolejność zadań zrównoważono zgodnie z modelem kwadratu łacińskiego, aby równomiernie rozłożyć potencjalne zmęczenie i efekty kolejności pomiędzy uczestnikami. Na każdy tekst przeznaczono uczestnikom maksymalnie 20 minut, z pięciominutowymi przerwami odpoczynkowymi pomiędzy nimi.
Choć dopuszczalne było korzystanie z wbudowanego słownika dwujęzycznego, zakazano używania systemów tłumaczenia maszynowego oraz zewnętrznych wyszukiwarek. Wszystkie naciśnięcia klawiszy, przerwy i ruchy kursora były rejestrowane automatycznie, a zapisy te uzupełniano synchronicznymi nagraniami ekranu w celu weryfikacji epizodów nielinearnej rewizji. Po zakończeniu każdego zadania uczestnicy wypełnili kwestionariusz samooceny trudności, który służył wyłącznie do pomocy w interpretacji przypadków granicznych podczas kodowania.
Pomiar procesu i kodowanie zmiennych
Zapisy uderzeń klawiszy zostały dopasowane do zdefiniowanej wcześniej struktury segmentów. Epizod dopasowania rozpoczynał się od pierwszego uderzenia klawisza w języku docelowym odpowiadającego danemu segmentowi i kończył się w momencie, gdy uczestnik definitywnie przeszedł do następnego segmentu. Nakładające się poprawki zostały ponownie przypisane przy użyciu zapisów śledzenia kursora z sygnaturą czasową.
Zachowania związane z podejmowaniem decyzji ilościowo określono za pomocą pięciu wskaźników: czasu trwania pierwszej pauzy przed rozpoczęciem tłumaczenia segmentu, średniego czasu trwania pauz wewnątrz segmentu, częstotliwości występowania pauz przekraczających dwie sekundy, liczby konsultacji ze słownikiem oraz liczby przerwań związanych z ruchem kursora, wskazujących na odejście od linearnego procesu redagowania (Table 2). Zachowania związane z rewizją zaklasyfikowano według dwóch wymiarów: czasu i funkcji. Wymiar czasu pozwolił odróżnić natychmiastowe rewizje lokalne od rewizji odroczonych, przeprowadzanych po przejściu do kolejnych segmentów. Kodowanie funkcjonalne zaklasyfikowało rewizje jako rewizje powierzchniowe (poprawki na poziomie formy bez zmiany semantycznej), rewizje znaczeniowe (modyfikacje leksykalne lub syntaktyczne), rewizje na poziomie dyskursu (korekty relacji między klauzulami lub spójności) oraz rewizje adaptacji kulturowej (reformulacje zorientowane na odbiorcę docelowego). Dwóch przeszkolonych koderów niezależnie analizowało każdy epizod rewizji przed rozstrzygnięciem i przypisywało pojedynczą główną kategorię funkcjonalną do każdego zdarzenia. Niezawodność między sędziami była wysoka dla wszystkich kodowanych miar. Kappa Cohena wskazała na istotną zgodność w przypadku kodowania kategorycznego funkcji rewizji (ĸ = 0.84, p < 0.001). Dla porządkowych zmiennych na poziomie tekstu, współczynniki korelacji wewnątrzklasowej (ICC, dwukierunkowy model mieszany, zgodność absolutna) wykazały wysoką niezawodność w odniesieniu do obciążenia kulturowego (ICC = 0.86), gęstości ewaluatywnej (ICC = 0.78) oraz kompresji narracyjnej (ICC = 0.82). Wszelkie wstępne rozbieżności w kodowaniu zostały następnie rozwiązane w drodze wspólnego rozstrzygnięcia.
Ocena jakości translokacji
Jakość tłumaczenia została oceniona niezależnie od danych procesowych przez dwóch recenzentów z wykształceniem doktoranckim i rozległym doświadczeniem w nauczaniu tłumaczeń. Nie znając tożsamości uczestników ani miar procesowych, recenzenci zastosowali 100-punktową rubrykę, rozdzieloną równomiernie na pięć wymiarów: dokładność semantyczną, biegłość językową, spójność narracyjną, oddanie kulturowe oraz odpowiedniość rejestru (Tabela 3). Rozbieżności w punktacji przekraczające osiem punktów inicjowały wspólną weryfikację i uzgodnienie oceny, a wypracowana średnia została przyjęta jako ostateczny wynik jakości tłumaczenia. Rejestry ocen sprzed weryfikacji zostały zachowane, aby umożliwić przejrzyste raportowanie niezawodności między sędziami w materiałach do replikacji.
Modelowanie statystyczne
Analizy przeprowadzono w trzech następujących po sobie etapach. W pierwszym etapie obliczono statystyki opisowe w celu podsumowania wszystkich zmiennych w podziale na grupy rocznikowe i typy tekstów. W drugim etapie przeanalizowano nakład pracy na poziomie segmentu, wykorzystując modele regresji z efektami mieszanymi, aby uwzględnić zagnieżdżoną strukturę segmentów w tekstach oraz powtarzane obserwacje od poszczególnych uczestników. Zmienne zależne, w tym czas trwania pierwszej pauzy i częstotliwość poprawek, modelowano jako funkcje obciążenia kulturowego, gęstości oceniającej, kompresji narracyjnej oraz istotności danmu, kontrolując jednocześnie poziom biegłości uczestników. W celu zwiększenia przejrzystości statystycznej uwzględniono korelacje predyktorów, diagnostykę wskaźnika inflacji wariancji (VIF), 95% przedziały ufności, szacunki wielkości efektu oraz wskaźniki dopasowania modelu.
W końcu wymodelowano jakość tłumaczenia, aby ocenić wkład predykcyjny momentu dokonania poprawki oraz funkcji poprawki w stosunku do ogólnej częstotliwości poprawek. Nakładanie się segmentów istotnych dla danmu i segmentów tłumaczenia wymagających dużego nakładu pracy oceniono z wykorzystaniem górnego kwintyla każdego rozkładu, ustandaryzowanego złożonego wskaźnika nakładu pracy oraz analizy prawdopodobieństwa nakładania się. Nie przeprowadzono eksploracyjnej analizy czynnikowej ani modelowania równań strukturalnych. W związku z tym towarzyszące im ryciny przedstawiono wyłącznie jako podsumowania koncepcyjne, opisowe lub oparte na regresji.