Todos os métodos envolvendo seres humanos foram conduzidos em conformidade com as diretrizes institucionais e foram aprovados pela comissão de ética institucional (IRB) ou pelo comitê de ética em pesquisa com seres humanos da Universidade Normal Hanshan. O consentimento informado foi obtido de todos os participantes antes do experimento.
Estrutura conceitual e desenho da pesquisa
Este estudo utilizou um delineamento de pesquisa processo-produto com uma camada discursiva auxiliar para examinar como os comentários danmu gerados pelo público influenciam a tradução de legendas. A estrutura analítica integrou características textuais, indicadores do processo de tradução e resultados de qualidade da tradução. Especificamente, investigou-se se a atenção do público, refletida pela densidade dos danmu, direcionava os recursos cognitivos dos tradutores para características textuais específicas e se essa alocação de atenção afetava posteriormente a qualidade da tradução.
Para operacionalizar esse quadro, o estudo primeiro estabeleceu características textuais em nível de segmento com base em quatro dimensões: carga cultural, densidade avaliativa, compressão narrativa e saliência do danmu. A carga cultural referia-se à presença de referências especificamente culturais que exigiam adaptação ou explicação. A densidade avaliativa mensurava a concentração de linguagem carregada emocionalmente ou em termos de atitude dentro de um segmento. A compressão narrativa capturava o grau em que o conteúdo semântico era condensado sob as restrições das legendas. A saliência do danmu representava o grau de atenção do público direcionada a cada segmento de legenda, quantificado pelo volume de comentários danmu sincronizados. Diferentemente das medidas convencionais de dificuldade de tradução, a saliência do danmu refletia a atenção socialmente distribuída, e não a complexidade textual intrínseca. Um segmento que recebia intenso engajamento do público não era necessariamente mais difícil de traduzir; ao contrário, representava um ponto de significado comunicativo acentuado dentro da experiência de visualização.
A estrutura analítica compreendia três conjuntos de dados interconectados. O conjunto de dados em nível de participante incluía características demográficas individuais e nível de experiência em tradução. O conjunto de dados processo-produto vinculava cada segmento de legenda a indicadores comportamentais extraídos do registro de digitação, juntamente com avaliações especializadas da qualidade da tradução. O conjunto de dados danmu continha comentários sincronizados do público alinhados ao tempo das legendas, a partir dos quais foram calculados os valores de saliência dos danmu. Esses conjuntos de dados foram vinculados por meio de identificadores de participantes e segmentos, permitindo a análise simultânea de cada segmento de legenda traduzido em relação às características do tradutor, ao comportamento de processamento cognitivo, à atenção do público e aos resultados da tradução. A base de dados integrada final compreendia 216 sessões completas de tradução e 3.168 observações de participante–texto–segmento, fornecendo a base empírica para as análises processo-produto subsequentes.
Triagem de participantes e perfilamento de fundo
A amostra foi composta por 72 estudantes de Letras Inglês recrutados em uma universidade pública no sul da China, distribuídos igualmente entre o segundo, terceiro e quarto ano do ensino de graduação (24 participantes por grupo anual). Todos os participantes eram falantes nativos de chinês que recebiam instrução formal em escrita e tradução em inglês. Para garantir comparabilidade dentro da população de tradutores em formação, foram excluídos indivíduos que tivessem residido em um país de língua inglesa por mais de 6 meses ou que possuíssem certificação profissional em tradução. Os participantes não foram estratificados em grupos experimentais separados de acordo com experiência em tradução, familiaridade cultural ou proficiência na segunda língua. Em vez disso, o nível acadêmico, pontuações recentes em testes de proficiência em inglês, disciplinas prévias de tradução, grau de familiaridade autoavaliado com temas culturais relacionados à China e o engajamento médio semanal em prática bilíngue foram registrados e incluídos como covariáveis no nível dos participantes nos modelos estatísticos. Essa explicação também resolve a inconsistência no número de participantes levantada durante a revisão por pares: tanto o manuscrito quanto o conjunto de dados de replicação incluem 72 participantes, 216 sessões de tarefas e 3.168 observações no nível de segmento.
Seleção do texto-fonte e construção da tarefa
Os materiais de tradução consistiram em três textos narrativos contemporâneos focados na China, desenvolvidos especificamente para este estudo, com o objetivo de refletir o discurso público autêntico e evitar a reprodução de materiais protegidos por direitos autorais. Cada texto continha entre 205 e 225 caracteres chineses, mas diferia sistematicamente em suas características internas. O Texto A apresenta uma narrativa sobre a viagem de retorno para casa durante o Festival da Primavera, com carga cultural moderada e sintaxe relativamente simples. O Texto B relata uma lembrança do Festival do Barco do Dragão e contém maior densidade de expressões específicas da cultura e conhecimento contextual implícito. O Texto C descreve uma narrativa sobre transmissões ao vivo e comércio eletrônico no meio rural, caracterizada por linguagem avaliativa densa e posicionamento narrativo condensado.
Os textos foram segmentados sistematicamente utilizando limites de cláusulas, seguidos por limites de unidades de significado, resultando em 44 unidades analisáveis ao longo das três tarefas de tradução (Tabela 1). Antes da codificação formal, um manual de codificação definiu carga cultural, densidade avaliativa e compressão narrativa utilizando escalas ordinais de 1 a 5. Um estudo piloto envolvendo 12 estudantes que não participaram do experimento principal confirmou a calibração pretendida de dificuldade, a clareza das instruções da tarefa e a estabilidade dos limites dos segmentos para o alinhamento de batidas de tecla.
Construção do corpus auxiliar e mapeamento de saliência
Para identificar pistas narrativas de destaque público, um corpus auxiliar de danmu foi compilado a partir de 24 vídeos do Bilibili publicados entre janeiro de 2023 e dezembro de 2025. Os vídeos foram incluídos apenas se corresponderem a um dos três domínios semânticos representados nos textos fonte, tiverem acumulado mais de 50.000 visualizações, apresentarem interação densa de danmu e permitirem a exportação e a associação temática de comentários sincronizados no tempo. Após a remoção de duplicatas e a filtragem de emojis, marcadores onomatopaicos e fragmentos irrelevantes, o corpus final continha 18.642 comentários.
As palavras-chave foram padronizadas e agrupadas utilizando âncoras de palavras-chave relacionadas ao texto-fonte. Cada segmento do texto-fonte foi então atribuído a uma pontuação contínua de saliência danmu com base em uma composição ponderada da frequência normalizada do agrupamento de palavras-chave, concentração de comentários dentro do agrupamento temático correspondente e intensidade avaliativa média. Este procedimento permite comparações entre o esforço de processamento do tradutor e a saliência do público no nível do agrupamento semântico, em vez de por meio de correspondência lexical direta. Como o danmu reflete as respostas do público a vídeos online e não à tarefa experimental de tradução em si, a saliência danmu é interpretada como um indicador externo de engajamento do público, e não como evidência direta da dificuldade linguística de um segmento-fonte.
Procedimento experimental e captura de dados
As sessões de tradução foram conduzidas individualmente em um laboratório de informática controlado, sob condições padronizadas de hardware, software e acesso à internet (Figura 2). Após uma orientação de cinco minutos enfatizando a produção de um inglês legível para um público internacional, os participantes realizaram um aquecimento de digitação em inglês com duração de três minutos, com o objetivo de minimizar os efeitos da adaptação ao teclado. As três tarefas de tradução foram aplicadas sequencialmente utilizando o Translog-II, com a ordem das tarefas balanceada segundo um delineamento em quadrado latino, de modo a distribuir uniformemente entre os participantes os possíveis efeitos de fadiga e de ordem. Foi alocado aos participantes um tempo máximo de 20 minutos por texto, com intervalos de descanso de cinco minutos entre eles.
Embora o dicionário bilíngue embutido fosse permitido, sistemas de tradução automática e mecanismos de busca externos foram proibidos. Todos os pressionamentos de teclas, pausas e movimentos do cursor foram registrados automaticamente e complementados por gravações síncronas da tela para verificar episódios de revisão não lineares. Após a conclusão de cada tarefa, os participantes preencheram uma avaliação subjetiva de dificuldade utilizada exclusivamente para auxiliar na interpretação de casos limítrofes de codificação.
Medição de processos e codificação de variáveis
Os registros de teclas pressionadas foram alinhados com a estrutura predefinida dos segmentos. Um episódio de alinhamento iniciou-se com a primeira tecla pressionada no idioma-alvo correspondente a um segmento e terminou quando o participante avançou definitivamente para o próximo segmento. Revisões sobrepostas foram reassinaladas utilizando registros cronometrados de rastreamento do cursor.
O comportamento de tomada de decisão foi quantificado utilizando cinco indicadores: duração da primeira pausa antes da tradução do segmento inicial, duração média das pausas dentro dos segmentos, frequência de pausas superiores a dois segundos, número de consultas ao dicionário e contagem de interrupções baseadas no cursor, indicando desvios do rascunho linear (Tabela 2). O comportamento de revisão foi classificado em duas dimensões: tempo e função. O critério temporal distinguiu revisões locais imediatas de revisões tardias realizadas após o avanço do rascunho para além do segmento atual. A codificação funcional classificou as revisões como revisões superficiais (correções em nível de forma sem mudança semântica), revisões de significado (modificações lexicais ou sintáticas), revisões em nível de discurso (ajustes nas relações entre orações ou na coerência) e revisões de adaptação cultural (reformulações orientadas para o público-alvo). Dois codificadores treinados analisaram independentemente cada episódio de revisão antes da mediação, atribuindo uma única categoria funcional primária a cada evento. A confiabilidade entre avaliadores foi elevada em todas as medidas codificadas. O kappa de Cohen indicou concordância substancial na codificação categórica das funções de revisão (ĸ = 0.84, p < 0,001). Para as variáveis ordinais em nível textual, os coeficientes de correlação intraclasse (CCI, modelo misto de dois fatores, acordo absoluto) demonstraram alta confiabilidade para carga cultural (CCI = 0,86), densidade avaliativa (CCI = 0,78) e compressão narrativa (CCI = 0,82). Quaisquer discrepâncias iniciais na codificação foram posteriormente resolvidas mediante mediação conjunta.
Avaliação da qualidade da tradução
A qualidade da tradução foi avaliada independentemente dos dados de processo por dois avaliadores com formação em nível de doutorado e ampla experiência no ensino de tradução. Sem conhecimento das identidades dos participantes e das medidas de processo, os avaliadores aplicaram uma rubrica de 100 pontos, distribuída igualmente em cinco dimensões: precisão semântica, fluência linguística, coerência narrativa, adequação cultural e adequação de registro (Tabela 3). Discrepâncias de pontuação superiores a oito pontos acionavam uma revisão conjunta e uma nova pontuação por consenso, sendo a média adjudicada utilizada como pontuação final de qualidade da tradução. Os registros de avaliação pré-adjudicação foram mantidos para facilitar a divulgação transparente da confiabilidade entre avaliadores nos materiais de replicação.
Modelagem estatística
As análises prosseguiram em três etapas sequenciais. Primeiro, foram calculadas estatísticas descritivas para resumir todas as variáveis entre os grupos etários e os tipos de texto. Segundo, o esforço de processamento em nível de segmento foi analisado por meio de modelos de regressão de efeitos mistos para levar em conta a estrutura aninhada dos segmentos dentro dos textos e as observações repetidas de participantes individuais. Variáveis dependentes, incluindo a duração da primeira pausa e a frequência de revisão, foram modeladas como funções da carga cultural, densidade avaliativa, compressão narrativa e saliência de danmu, controlando o nível de proficiência dos participantes. Foram incluídas correlações entre preditores, diagnósticos de inflação de variância, intervalos de confiança de 95%, estimativas de tamanho de efeito e índices de ajuste do modelo para melhorar a transparência estatística.
Por fim, a qualidade da tradução foi modelada para avaliar as contribuições preditivas do momento da revisão e da função da revisão em relação à frequência geral de revisão. A sobreposição entre os segmentos salientes de danmu e os segmentos de tradução de alto esforço foi avaliada utilizando o quinto superior de cada distribuição, um índice composto padronizado de esforço e uma análise de sobreposição ao acaso. Nenhuma análise fatorial exploratória ou modelagem de equações estruturais foi realizada. Assim, as figuras apresentadas são fornecidas apenas como resumos conceituais, descritivos ou baseados em regressão.