Tutti i metodi che coinvolgevano soggetti umani sono stati condotti nel rispetto delle linee guida istituzionali e sono stati approvati dal comitato etico istituzionale (IRB) o dal comitato per l'etica nella ricerca umana dell'Università Normale di Hanshan. Il consenso informato è stato ottenuto da tutti i partecipanti prima dell'inizio dell'esperimento.
Quadro concettuale e progettazione della ricerca
Questo studio ha adottato un disegno di ricerca di tipo processo-prodotto con un livello discorsivo ausiliario per esaminare in che modo i commenti danmu generati dal pubblico influenzano la traduzione dei sottotitoli. Il quadro analitico integrava caratteristiche testuali, indicatori del processo traduttivo e risultati relativi alla qualità della traduzione. In particolare, è stato indagato se l'attenzione del pubblico, riflessa dalla densità dei danmu, indirizzasse le risorse cognitive dei traduttori verso specifiche caratteristiche testuali e se tale allocazione dell'attenzione influisse successivamente sulla qualità della traduzione.
Per applicare questo quadro concettuale, lo studio ha innanzitutto definito caratteristiche testuali a livello di segmento basate su quattro dimensioni: carico culturale, densità valutativa, compressione narrativa e rilevanza dei danmu. Il carico culturale indicava la presenza di riferimenti specifici di carattere culturale che richiedevano adattamento o spiegazione. La densità valutativa misurava la concentrazione di linguaggio carico di emozioni o giudizi all'interno di un segmento. La compressione narrativa esprimeva il grado in cui il contenuto semantico veniva condensato a causa dei vincoli dei sottotitoli. La rilevanza dei danmu rappresentava il livello di attenzione del pubblico rivolto a ciascun segmento sottotitolato, quantificato in base al volume dei commenti danmu sincronizzati. A differenza delle misurazioni convenzionali della difficoltà di traduzione, la rilevanza dei danmu rifletteva un'attenzione socialmente distribuita piuttosto che una complessità testuale intrinseca. Un segmento che riceve un'intensa interazione da parte del pubblico non è necessariamente più difficile da tradurre; piuttosto, rappresenta un punto di particolare rilevanza comunicativa all'interno dell'esperienza visiva.
Il framework analitico comprendeva tre set di dati interconnessi. Il dataset a livello di partecipante includeva le caratteristiche demografiche individuali e il livello di competenza nella traduzione. Il dataset processo-prodotto collegava ogni segmento dei sottotitoli a indicatori comportamentali estratti dalla registrazione delle pressioni sui tasti, insieme a valutazioni esperte della qualità della traduzione. Il dataset danmu conteneva commenti sincronizzati del pubblico allineati ai tempi dei sottotitoli, a partire dai quali sono stati calcolati i valori di rilevanza (salience) dei danmu. Questi set di dati sono stati collegati tramite identificatori di partecipante e di segmento, consentendo un'analisi simultanea di ogni segmento di sottotitolo tradotto in relazione alle caratteristiche del traduttore, al comportamento cognitivo durante l'elaborazione, all'attenzione del pubblico e ai risultati della traduzione. L'archivio finale integrato comprendeva 216 sessioni complete di traduzione e 3.168 osservazioni partecipante-testo-segmento, fornendo la base empirica per le successive analisi processo-prodotto.
Selezione dei partecipanti e caratterizzazione anamnestica
Il campione era composto da 72 studenti di lingua inglese reclutati presso un'università pubblica del sud della Cina, distribuiti equamente tra il secondo, terzo e quarto anno del corso di laurea (24 partecipanti per ogni anno accademico). Tutti i partecipanti erano madrelingua cinesi che ricevevano un'istruzione formale nella scrittura e nella traduzione in inglese. Per garantire la comparabilità all'interno della popolazione di traduttori in formazione, sono stati esclusi coloro che avevano risieduto in un paese anglofono per più di 6 mesi o che possedevano una certificazione professionale di traduttore. I partecipanti non sono stati suddivisi in gruppi sperimentali distinti in base all'esperienza di traduzione, alla familiarità culturale o alla competenza nella seconda lingua. Al contrario, sono stati registrati il livello accademico, i punteggi più recenti nei test di competenza in inglese, i corsi precedenti di traduzione, il grado di familiarità autovalutato con argomenti culturali legati alla Cina e l'impegno medio settimanale in attività bilingue, e questi dati sono stati inclusi nei modelli statistici come covariate a livello individuale. Questa precisazione risolve anche l'incongruenza nel numero di partecipanti sollevata durante la revisione paritaria: sia il manoscritto che il dataset di replica includono 72 partecipanti, 216 sessioni di compito e 3.168 osservazioni a livello di segmento.
Selezione del testo sorgente e costruzione del compito
I materiali di traduzione consistevano in tre testi narrativi contemporanei focalizzati sulla Cina, sviluppati appositamente per questo studio per rispecchiare un discorso pubblico autentico ed evitare la riproduzione di materiali protetti da copyright. Ogni testo conteneva da 205 a 225 caratteri cinesi, ma differiva sistematicamente per le sue caratteristiche interne. Il testo A presenta una narrazione sul ritorno a casa per la Festa di Primavera, con un carico culturale moderato e una sintassi relativamente semplice. Il testo B racconta un ricordo legato alla Festa delle Barche del Drago e contiene una maggiore densità di espressioni specifiche della cultura e conoscenze contestuali implicite. Il testo C descrive una narrazione sul live streaming e sul commercio elettronico in ambito rurale, caratterizzata da un linguaggio valutativo denso e da una posizione narrativa compressa.
I testi sono stati suddivisi sistematicamente utilizzando i confini delle proposizioni, seguiti dai confini delle unità di significato, ottenendo 44 unità analizzabili nei tre compiti di traduzione (Tabella 1). Prima della codifica formale, un manuale di codifica ha definito carico culturale, densità valutativa e compressione narrativa mediante scale ordinali da 1 a 5. Uno studio pilota, che ha coinvolto 12 studenti non partecipanti all'esperimento principale, ha confermato la calibrazione della difficoltà prevista, la chiarezza delle istruzioni del compito e la stabilità dei confini dei segmenti per l'allineamento delle battute della tastiera.
Costruzione del corpus ausiliario e mappatura della rilevanza
Per identificare gli indizi narrativi salienti a livello pubblico, è stato compilato un corpus ausiliario di danmu a partire da 24 video di Bilibili caricati tra gennaio 2023 e dicembre 2025. I video sono stati inclusi soltanto se corrispondevano a uno dei tre domini semantici rappresentati nei testi sorgente, avevano raggiunto più di 50.000 visualizzazioni, presentavano un'interazione densa sotto forma di danmu e permettevano l'esportazione e la mappatura tematica dei commenti sincronizzati temporalmente. Dopo la rimozione dei duplicati e il filtraggio di emoji, onomatopee di riempimento e frammenti irrilevanti, il corpus finale comprendeva 18.642 commenti.
Le parole chiave sono state standardizzate e raggruppate utilizzando ancoraggi basati su parole chiave correlate al testo sorgente. A ogni segmento del testo sorgente è stato quindi assegnato un punteggio di rilevanza continua dei danmu, basato su una combinazione ponderata della frequenza normalizzata dei cluster di parole chiave, della concentrazione dei commenti all'interno del cluster tematico corrispondente e dell'intensità valutativa media. Questa procedura consente confronti tra lo sforzo cognitivo del traduttore e la rilevanza percepita dal pubblico a livello di cluster semantico, piuttosto che attraverso un semplice abbinamento lessicale diretto. Poiché i danmu riflettono le reazioni del pubblico ai video online e non il compito sperimentale di traduzione in sé, la rilevanza dei danmu è interpretata come un indicatore esterno dell'engagement del pubblico, piuttosto che come una prova diretta della difficoltà linguistica di un segmento sorgente.
Procedura sperimentale e acquisizione dei dati
Le sessioni di traduzione sono state condotte individualmente in un laboratorio informatico controllato, in condizioni standardizzate di hardware, software e accesso a internet (Figura 2). Dopo un'orientamento della durata di cinque minuti, incentrato sulla produzione di un inglese leggibile per un pubblico internazionale, i partecipanti hanno completato un riscaldamento di tre minuti di digitazione in inglese per ridurre al minimo gli effetti dell'abituazione alla tastiera. I tre compiti di traduzione sono stati somministrati in sequenza utilizzando Translog-II, con l'ordine dei compiti bilanciato secondo uno schema a quadrato latino, al fine di distribuire in modo uniforme tra i partecipanti gli effetti potenziali della fatica e dell'ordine. Ai partecipanti è stato assegnato un tempo massimo di 20 minuti per ciascun testo, intervallati da pause di riposo di cinque minuti.
Sebbene fosse consentito l'uso del dizionario bilingue integrato, erano vietati i sistemi di traduzione automatica e i motori di ricerca esterni. Tutte le pressioni dei tasti, le pause e i movimenti del cursore sono stati registrati automaticamente e integrati da registrazioni sincrone dello schermo per verificare gli episodi di revisione non lineari. Al termine di ogni compito, i partecipanti hanno compilato un'autovalutazione della difficoltà, utilizzata esclusivamente per supportare l'interpretazione dei casi limite nella codifica.
Misurazione del processo e codifica delle variabili
I record dei tasti premuti sono stati allineati con la struttura predefinita dei segmenti. Un episodio di allineamento iniziava con il primo tasto premuto nella lingua bersaglio corrispondente a un segmento e terminava quando il partecipante avanzava definitivamente al segmento successivo. Le revisioni sovrapposte sono state riassegnate utilizzando i record cronologici del tracciamento del cursore.
Il comportamento decisionale è stato quantificato mediante cinque indicatori: la durata della prima pausa prima della traduzione del segmento iniziale, la durata media delle pause all'interno dei segmenti, la frequenza delle pause superiori a due secondi, il numero di consultazioni del dizionario e il numero di interruzioni basate sul cursore, che indicano deviazioni dalla stesura lineare (Tabella 2). Il comportamento di revisione è stato classificato secondo due dimensioni: tempistica e funzione. La tempistica distingueva le revisioni locali immediate da quelle differite, effettuate dopo che la stesura era progredita oltre il segmento corrente. La codifica funzionale ha classificato le revisioni come revisioni superficiali (correzioni a livello formale senza cambiamento semantico), revisioni di significato (modifiche lessicali o sintattiche), revisioni a livello discorsivo (aggiustamenti delle relazioni tra proposizioni o della coerenza) e revisioni di adattamento culturale (riformulazioni orientate al pubblico target). Due codificatori addestrati hanno analizzato indipendentemente ciascun episodio di revisione prima della risoluzione congiunta e hanno assegnato una singola categoria funzionale primaria a ciascun evento. L'affidabilità tra i valutatori è risultata elevata per tutte le misure codificate. L'indice kappa di Cohen ha indicato un accordo sostanziale per la codifica categorica delle funzioni di revisione (ĸ = 0.84, p < 0.001). Per le variabili ordinali a livello testuale, i coefficienti di correlazione intraclasse (ICC, modello a effetti misti bidirezionale, accordo assoluto) hanno dimostrato un'elevata affidabilità per il carico culturale (ICC = 0.86), la densità valutativa (ICC = 0.78) e la compressione narrativa (ICC = 0.82). Eventuali discrepanze iniziali nella codifica sono state successivamente risolte mediante adjudicazione congiunta.
Valutazione della qualità della traduzione
La qualità della traduzione è stata valutata in modo indipendente dai dati del processo da due valutatori con formazione a livello di dottorato ed ampia esperienza nell'insegnamento della traduzione. In cieco rispetto alle identità dei partecipanti e alle misure di processo, i valutatori hanno applicato una griglia di valutazione su 100 punti, distribuita equamente su cinque dimensioni: accuratezza semantica, fluidità linguistica, coerenza narrativa, resa culturale e adeguatezza del registro (Tabella 3). Le discrepanze nei punteggi superiori agli otto punti hanno innescato una revisione congiunta e una rivalutazione concordata, utilizzando la media concordata come punteggio finale di qualità della traduzione. I punteggi registrati prima della mediazione sono stati conservati per facilitare una rendicontazione trasparente dell'affidabilità tra i valutatori nei materiali di replica.
Modellizzazione statistica
Le analisi sono state condotte in tre fasi sequenziali. In primo luogo, sono state calcolate statistiche descrittive per riassumere tutte le variabili attraverso i diversi gruppi d'età e i tipi di testo. In secondo luogo, lo sforzo di elaborazione a livello di segmento è stato analizzato mediante modelli di regressione a effetti misti, al fine di tenere conto della struttura annidata dei segmenti all'interno dei testi e delle osservazioni ripetute provenienti dai singoli partecipanti. Le variabili dipendenti, tra cui la durata della prima pausa e la frequenza di revisione, sono state modellate come funzioni del carico culturale, della densità valutativa, della compressione narrativa e della rilevanza dei danmu, controllando al contempo per la competenza dei partecipanti. Sono state incluse correlazioni tra predittori, diagnosi dell'inflazione della varianza, intervalli di confidenza al 95%, stime dell'entità dell'effetto e indici di adattamento del modello per migliorare la trasparenza statistica.
Infine, la qualità della traduzione è stata modellata per valutare i contributi predittivi del momento della revisione e della funzione della revisione rispetto alla frequenza complessiva delle revisioni. L'overlapping tra i segmenti salienti dei danmu e i segmenti di traduzione ad alto sforzo è stato valutato utilizzando il quintile superiore di ciascuna distribuzione, un indice composito standardizzato di sforzo e un'analisi di sovrapposizione casuale. Non è stata effettuata alcuna analisi fattoriale esplorativa né modellazione tramite equazioni strutturali. Di conseguenza, le figure allegate sono presentate esclusivamente come sommari concettuali, descrittivi o basati su regressione.