Alle Methoden an menschlichen Versuchspersonen wurden gemäß den institutionellen Richtlinien durchgeführt und von der institutionellen Prüfkommission (IRB) oder dem Ethikkomitee für Humorforschung der Hanshan Normal University genehmigt. Von allen Teilnehmern wurde vor Beginn des Experiments eine informierte Einwilligung eingeholt.
Konzeptioneller Rahmen und Forschungsdesign
Diese Studie verwendete ein Prozess-Produkt-Forschungsdesign mit einer zusätzlichen Diskursebene, um zu untersuchen, wie vom Publikum erzeugte Danmu-Kommentare die Untertitelübersetzung beeinflussen. Der analytische Rahmen integrierte textliche Merkmale, Indikatoren des Übersetzungsprozesses und Ergebnisse zur Übersetzungsqualität. Insbesondere wurde untersucht, ob die Aufmerksamkeit des Publikums, wie sie sich in der Danmu-Dichte widerspiegelt, die kognitiven Ressourcen der Übersetzer auf bestimmte textliche Merkmale lenkt und ob diese Verteilung der Aufmerksamkeit anschließend die Übersetzungsqualität beeinflusst.
Um diesen Rahmen anzuwenden, wurden zunächst textuelle Merkmale auf Segmentebene basierend auf vier Dimensionen etabliert: kulturelle Belastung, evaluative Dichte, narrative Verdichtung und Danmu-Salienz. Kulturelle Belastung bezog sich auf das Vorhandensein kulturspezifischer Anspielungen, die eine Anpassung oder Erklärung erforderten. Die evaluative Dichte maß die Konzentration emotional oder attitudinal aufgeladener Sprache innerhalb eines Segments. Die narrative Verdichtung erfasste, inwieweit semantische Inhalte unter den Beschränkungen der Untertitelung verdichtet wurden. Die Danmu-Salienz repräsentierte das Ausmaß an Zuschauer-Aufmerksamkeit, das jedem Untertitelsegment galt, quantifiziert durch das Volumen synchronisierter Danmu-Kommentare. Im Gegensatz zu herkömmlichen Maßen für Übersetzungsschwierigkeiten spiegelte die Danmu-Salienz eine sozial verteilte Aufmerksamkeit wider, nicht die intrinsische textliche Komplexität. Ein Segment, das umfangreiche Zuschauerbeteiligung erhielt, war nicht notwendigerweise schwieriger zu übersetzen; stattdessen markierte es einen Punkt erhöhter kommunikativer Bedeutung innerhalb des Seherlebnisses.
Der analytische Rahmen umfasste drei miteinander verbundene Datensätze. Der Teilnehmer-Datensatz enthielt individuelle demografische Merkmale und Informationen zur Übersetzungskompetenz. Der Prozess-Produkt-Datensatz verknüpfte jeden Untertitelabschnitt mit aus Tastenanschlag-Protokollen extrahierten Verhaltensindikatoren sowie mit qualifizierten Bewertungen der Übersetzungsqualität durch Experten. Der Danmu-Datensatz enthielt synchronisierte Zuschauerkommentare, die zeitlich mit den Untertiteln abgestimmt waren und anhand derer Salienzwerte für Danmu berechnet wurden. Diese Datensätze wurden über Identifikatoren für Teilnehmer und Abschnitte verknüpft, wodurch eine simultane Analyse jedes übersetzten Untertitelabschnitts in Bezug auf Übersetzermerkmale, kognitives Verarbeitungsverhalten, Zuschauerwahrnehmung und Übersetzungsergebnisse ermöglicht wurde. Die endgültige integrierte Datenbank umfasste 216 vollständige Übersetzungssitzungen und 3.168 Beobachtungen auf Ebene von Teilnehmer–Text–Abschnitt und bildete die empirische Grundlage für die anschließenden Prozess-Produkt-Analysen.
Teilnehmer-Screening und Hintergrundprofil
Die Stichprobe umfasste 72 Studierende der englischen Sprachwissenschaft, die an einer öffentlichen Universität in Südchina rekrutiert wurden und gleichmäßig auf das zweite, dritte und vierte Jahr des Bachelorstudiums verteilt waren (24 Teilnehmer pro Jahrgang). Alle Teilnehmer waren muttersprachliche Sprecher des Chinesischen, die eine formale Ausbildung im englischen Schreiben und Übersetzen erhielten. Um die Vergleichbarkeit innerhalb der Population von angehenden Übersetzern sicherzustellen, wurden Personen ausgeschlossen, die länger als sechs Monate in einem englischsprachigen Land gelebt hatten oder über eine professionelle Übersetzerzertifizierung verfügten. Die Teilnehmer wurden nicht in separate Versuchsgruppen anhand von Übersetzungserfahrung, kultureller Vertrautheit oder Kompetenz in der Zweitsprache eingeteilt. Stattdessen wurden das Studienjahr, aktuelle Ergebnisse aus Englisch-Kompetenztests, frühere Übersetzungslehrgänge, die eigene Einschätzung der Vertrautheit mit kulturspezifischen Themen Chinas sowie die durchschnittliche wöchentliche Beschäftigung mit zweisprachiger Praxis erfasst und als individuelle Kovariaten der Teilnehmer in die statistischen Modelle einbezogen. Diese Klarstellung löst auch die während des Peer-Review-Prozesses angesprochene Diskrepanz bezüglich der Teilnehmerzahl: Sowohl das Manuskript als auch der Replikationsdatensatz enthalten 72 Teilnehmer, 216 Aufgabensitzungen und 3.168 Segment-bezogene Beobachtungen.
Auswahl des Quelltexts und Aufbau der Aufgabe
Die Übersetzungsmaterialien bestanden aus drei zeitgenössischen, auf China bezogenen erzählenden Texten, die speziell für diese Studie entwickelt wurden, um authentische öffentliche Diskurse widerzuspiegeln und urheberrechtlich geschütztes Material zu vermeiden. Jeder Text enthielt 205–225 chinesische Schriftzeichen, unterschied sich jedoch systematisch in seinen internen Merkmalen. Text A präsentiert einen Erzählstrang zum Frühlingsfest-Heimkehrthema mit moderater kultureller Belastung und relativ einfacher Syntax. Text B schildert eine Erinnerung an das Drachenbootfest und enthält eine höhere Dichte kulturspezifischer Ausdrücke sowie implizites Hintergrundwissen. Text C beschreibt einen Erzählkontext über Livestreaming und E-Commerce auf dem Land, der durch dichte evaluative Sprache und komprimierte narrative Positionierung gekennzeichnet ist.
Die Texte wurden systematisch anhand von Satzgrenzen und anschließend anhand von Bedeutungseinheiten unterteilt, wodurch insgesamt 44 analysierbare Einheiten über die drei Übersetzungsaufgaben hinweg entstanden (Tabelle 1). Vor der eigentlichen Kodierung wurde anhand eines Kodierhandbuchs die kulturelle Belastung, die evaluative Dichte und die narrative Verdichtung mithilfe von ordinalen Skalen von 1 bis 5 definiert. Eine Pilotstudie mit 12 Studierenden, die nicht an der Hauptstudie teilnahmen, bestätigte die gewünschte Schwierigkeitskalibrierung, die Klarheit der Aufgabenanweisungen sowie die Stabilität der Segmentgrenzen für die Zuordnung der Tastenanschläge.
Aufbau eines Hilfskorpus und Abbildung der Salienz
Um öffentlich relevante narrative Hinweise zu identifizieren, wurde ein zusätzliches Danmu-Korpus aus 24 auf Bilibili zwischen Januar 2023 und Dezember 2025 hochgeladenen Videos zusammengestellt. Videos wurden nur dann einbezogen, wenn sie einer der drei semantischen Bereiche entsprachen, die in den Quelltexten vertreten sind, mehr als 50.000 Aufrufe erreicht hatten, eine dichte Danmu-Interaktion aufwiesen und den Export sowie die thematische Zuordnung zeitlich synchronisierter Kommentare zuließen. Nach Entfernung von Duplikaten sowie Filterung von Emojis, onomatopoetischen Füllwörtern und irrelevanten Textfragmenten umfasste das endgültige Korpus 18.642 Kommentare.
Inhaltswörter wurden standardisiert und mithilfe von schlüsselwortbezogenen Ankerbegriffen aus dem Quelltext gruppiert. Jedes Segment des Quelltexts erhielt anschließend einen kontinuierlichen Salienz-Score für Danmu, der auf einer gewichteten Kombination aus normalisierter Häufigkeit der Schlüsselwortgruppen, Kommentarkonzentration innerhalb des entsprechenden thematischen Clusters und durchschnittlicher evaluativer Intensität basiert. Dieses Vorgehen ermöglicht den Vergleich des Übersetzungsaufwands mit der Salienz der Zuschauer auf Ebene semantischer Cluster, anstatt durch direkte lexikalische Übereinstimmung. Da Danmu die Reaktionen des Publikums auf Online-Videos widerspiegelt und nicht die experimentelle Übersetzungsaufgabe selbst, wird die Danmu-Salienz als externer Indikator für das Zuschauerengagement und nicht als direkter Beleg für die sprachliche Schwierigkeit eines Quellsegments interpretiert.
Experimentelle Vorgehensweise und Datenerfassung
Die Übersetzungssitzungen wurden einzeln in einem kontrollierten Computerraum unter standardisierten Bedingungen bezüglich Hardware, Software und Internetzugang durchgeführt (Abbildung 2). Nach einer fünfminütigen Einführung, in der die Erstellung eines gut lesbaren Englisch für ein internationales Publikum betont wurde, absolvierten die Teilnehmer eine dreiminütige Eingewöhnungsphase mit englischem Tippen, um Effekte der Gewöhnung an die Tastatur zu minimieren. Die drei Übersetzungsaufgaben wurden nacheinander mit Translog-II durchgeführt, wobei die Reihenfolge der Aufgaben nach einem lateinischen Quadrat-Design gegengebalanciert wurde, um potenzielle Ermüdungs- und Reihenfolgeneffekte gleichmäßig über alle Teilnehmer zu verteilen. Den Teilnehmern stand für jeden Text maximal eine Bearbeitungszeit von 20 Minuten zur Verfügung, getrennt durch fünfminütige Ruhepausen.
Obwohl das integrierte zweisprachige Wörterbuch erlaubt war, waren maschinelle Übersetzungssysteme und externe Suchmaschinen untersagt. Alle Tasteneingaben, Pausen und Mausbewegungen wurden automatisch protokolliert und durch synchrone Bildschirmaufzeichnungen ergänzt, um nichtlineare Überarbeitungsepisoden zu überprüfen. Nach Abschluss jeder Aufgabe füllten die Teilnehmer eine selbstberichtete Schwierigkeitsbewertung aus, die ausschließlich zur Unterstützung bei der Interpretation von Grenzfall-Kodierungen diente.
Prozessmessung und Variablencodierung
Tastatureingaben wurden mit der vorgegebenen Segmentstruktur synchronisiert. Ein Synchronisierungsabschnitt begann mit der ersten Eingabe in der Zielsprache, die einem Segment entsprach, und endete, sobald der Teilnehmer endgültig zum nächsten Segment überging. Überlappende Überarbeitungen wurden mithilfe zeitgestempelter Mauszeiger-Tracking-Daten neu zugeordnet.
Das Entscheidungsverhalten wurde anhand von fünf Indikatoren quantifiziert: Dauer der ersten Pause vor der Übersetzung des ersten Segments, mittlere Pausendauer innerhalb eines Segments, Häufigkeit von Pausen, die zwei Sekunden überschreiten, Anzahl der Konsultationen eines Wörterbuchs sowie Anzahl der cursorbasierten Unterbrechungen, die Abweichungen von der linearen Texterstellung anzeigen (Tabelle 2). Das Überarbeitungsverhalten wurde entlang zweier Dimensionen klassifiziert: Zeitpunkt und Funktion. Der Zeitpunkt unterschied zwischen unmittelbaren lokalen Korrekturen und verzögerten Überarbeitungen, die vorgenommen wurden, nachdem die Texterstellung bereits über das aktuelle Segment hinaus fortgeschritten war. Die funktionale Kategorisierung unterteilte die Überarbeitungen in Oberflächenrevisionen (formale Korrekturen ohne semantische Veränderung), Bedeutungsrevisionen (lexikalische oder syntaktische Änderungen), diskursbezogene Revisionen (Anpassungen der Satzbeziehungen oder Kohärenz) sowie kulturelle Anpassungsrevisionen (umformuliert zur besseren Orientierung am Zielpublikum). Zwei geschulte Kodierer analysierten unabhängig voneinander jeden Überarbeitungsabschnitt, besprachen anschließend Uneinigkeiten und wiesen jedem Ereignis eine einzige primäre Funktionskategorie zu. Die Übereinstimmung zwischen den Ratern war bei allen kodierten Maßen hoch. Cohens ĸ zeigte eine hohe Übereinstimmung bei der kategorialen Kodierung der Überarbeitungsfunktionen (ĸ = 0.84, p < 0,001). Für die ordinalen textbezogenen Variablen zeigten die Intraklassen-Korrelationskoeffizienten (ICC, zweifaktorielles gemischtes Modell, absolute Übereinstimmung) eine hohe Zuverlässigkeit hinsichtlich kultureller Belastung (ICC = 0,86), evaluativer Dichte (ICC = 0,78) und narrativer Verdichtung (ICC = 0,82). Eventuelle anfängliche Diskrepanzen in der Kodierung wurden anschließend durch gemeinsame Besprechung und Konsensentscheidung aufgelöst.
Bewertung der Übersetzungsqualität
Die Übersetzungsqualität wurde unabhängig von den Prozessdaten durch zwei Bewertende mit Promotion und umfangreicher Erfahrung in der Übersetzungslehre evaluiert. Die Bewertenden, die weder über die Identitäten der Teilnehmenden noch über die Prozessmaße informiert waren, wandten einen 100-Punkte-Raster an, der gleichmäßig auf fünf Dimensionen verteilt war: semantische Genauigkeit, sprachliche Flüssigkeit, narrative Kohärenz, kulturelle Wiedergabe und Angemessenheit des Registers (Tabelle 3). Bewertungsunterschiede, die mehr als acht Punkte betrugen, führten zu einer gemeinsamen Überprüfung und einer erneuten Konsensbewertung, wobei der entschiedene Durchschnitt als endgültige Bewertung der Übersetzungsqualität verwendet wurde. Die Aufzeichnungen der Bewertungen vor der Entscheidung wurden aufbewahrt, um eine transparente Berichterstattung über die Inter-Rater-Reliabilität in den Replikationsmaterialien zu ermöglichen.
Statistische Modellierung
Die Analysen erfolgten in drei sequenziellen Stufen. Zunächst wurden deskriptive Statistiken berechnet, um alle Variablen über die Jahrgangsgruppen und Texttypen hinweg zusammenzufassen. Anschließend wurde der segmentbasierte Bearbeitungsaufwand mithilfe gemischter Regressionsmodelle mit Zufallseffekten analysiert, um die hierarchische Struktur der Segmente innerhalb der Texte sowie wiederholte Messungen einzelner Teilnehmer zu berücksichtigen. Abhängige Variablen wie die Dauer der ersten Pause und die Häufigkeit von Überarbeitungen wurden als Funktion der kulturellen Belastung, der evaluativen Dichte, der narrativen Verdichtung und der Danmu-Auffälligkeit modelliert, wobei die Sprachkompetenz der Teilnehmer als Kontrollvariable berücksichtigt wurde. Zur Verbesserung der statistischen Transparenz wurden Prädiktor-Korrelationen, Diagnosen zur Varianzinflationsrate, 95 %-Konfidenzintervalle, Effektgrößen-Schätzungen und Modellanpassungsindizes einbezogen.
Abschließend wurde die Übersetzungsqualität modelliert, um die prädiktiven Beiträge von Überarbeitungszeitpunkt und Überarbeitungsfunktion im Verhältnis zur Gesamtüberarbeitungshäufigkeit zu bewerten. Die Überschneidung zwischen danmu-markanten Segmenten und Übersetzungssegmenten mit hohem Aufwand wurde mithilfe des oberen Quintils jeder Verteilung, eines standardisierten zusammengesetzten Aufwandsindex und einer Analyse des Zufallsüberlappens untersucht. Es wurde keine explorative Faktoranalyse oder Strukturgleichungsmodellierung durchgeführt. Entsprechend werden die zugehörigen Abbildungen ausschließlich als konzeptionelle, deskriptive oder auf Regression basierende Zusammenfassungen dargestellt.