Todos los métodos que involucraron a sujetos humanos se realizaron cumpliendo con las directrices institucionales y fueron aprobados por el comité de revisión institucional (IRB) o el comité de ética en investigación humana de la Universidad Hanshan Normal. Se obtuvo el consentimiento informado de todos los participantes antes del experimento.
Marco conceptual y diseño de la investigación
Este estudio empleó un diseño de investigación proceso-producto con una capa discursiva auxiliar para examinar cómo los comentarios danmu generados por la audiencia influyen en la traducción de subtítulos. El marco analítico integró características textuales, indicadores del proceso de traducción y resultados de calidad traductora. Específicamente, investigó si la atención de la audiencia, reflejada en la densidad de danmu, dirigía los recursos cognitivos de los traductores hacia características textuales particulares y si esta asignación de atención afectaba posteriormente la calidad de la traducción.
Para operacionalizar este marco, el estudio estableció primero características textuales a nivel de segmento basadas en cuatro dimensiones: carga cultural, densidad evaluativa, compresión narrativa y relevancia de los danmu. La carga cultural hacía referencia a la presencia de referencias específicas de una cultura que requerían adaptación o explicación. La densidad evaluativa medía la concentración de lenguaje cargado emocional o actitudinalmente dentro de un segmento. La compresión narrativa capturaba el grado en que el contenido semántico se condensaba bajo las limitaciones de los subtítulos. La relevancia de los danmu representaba el grado de atención del público dirigida hacia cada segmento de subtítulo, cuantificada por el volumen de comentarios danmu sincronizados. A diferencia de las medidas convencionales de dificultad de traducción, la relevancia de los danmu reflejaba una atención socialmente distribuida en lugar de una complejidad textual intrínseca. Un segmento que recibía una participación intensa del público no era necesariamente más difícil de traducir; más bien, representaba un punto de significación comunicativa acentuada dentro de la experiencia de visualización.
El marco analítico comprendió tres conjuntos de datos interconectados. El conjunto de datos a nivel de participante incluyó características demográficas individuales y experiencia en traducción. El conjunto de datos proceso-producto vinculó cada segmento de subtítulo con indicadores conductuales extraídos del registro de pulsaciones del teclado, junto con evaluaciones expertas de la calidad de la traducción. El conjunto de datos danmu contenía comentarios sincronizados del público alineados con el momento de los subtítulos, a partir de los cuales se calcularon los valores de relevancia (salience) de los danmu. Estos conjuntos de datos se vincularon mediante identificadores de participantes y segmentos, lo que permitió el análisis simultáneo de cada segmento de subtítulo traducido en relación con las características del traductor, el comportamiento del procesamiento cognitivo, la atención del público y los resultados de la traducción. La base de datos integrada final comprendió 216 sesiones completas de traducción y 3.168 observaciones de participante–texto–segmento, proporcionando la base empírica para los análisis proceso-producto posteriores.
Selección de participantes y caracterización de antecedentes
La muestra comprendió a 72 estudiantes de inglés reclutados de una universidad pública del sur de China, distribuidos equitativamente entre el segundo, tercer y cuarto año de estudios de pregrado (24 participantes por grupo anual). Todos los participantes eran hablantes nativos de chino que recibían instrucción formal en escritura y traducción en inglés. Para garantizar la comparabilidad dentro de la población de traductores en formación, se excluyeron aquellos individuos que hubieran residido en un país de habla inglesa durante más de 6 meses o que tuvieran certificación profesional como traductor. Los participantes no fueron estratificados en grupos experimentales separados según su experiencia en traducción, familiaridad cultural o dominio del segundo idioma. En cambio, se registraron el nivel académico, las puntuaciones recientes en pruebas de dominio del inglés, los cursos previos de traducción, la familiaridad autopercebida con temas culturales relacionados con China y la participación promedio semanal en práctica bilingüe, y se incluyeron como covariables a nivel de participante en los modelos estadísticos. Esta aclaración también resuelve la inconsistencia en el número de participantes señalada durante la revisión por pares: tanto el manuscrito como el conjunto de datos de replicación incluyen 72 participantes, 216 sesiones de tareas y 3.168 observaciones a nivel de segmento.
Selección del texto fuente y construcción de la tarea
Los materiales de traducción consistieron en tres textos narrativos contemporáneos centrados en China, desarrollados específicamente para este estudio con el fin de reflejar un discurso público auténtico y evitar la reproducción de materiales con derechos de autor. Cada texto contenía entre 205 y 225 caracteres chinos, pero difería sistemáticamente en sus características internas. El texto A presenta una narrativa sobre el regreso a casa durante la Fiesta de Primavera, con una carga cultural moderada y una sintaxis relativamente sencilla. El texto B relata un recuerdo sobre la Fiesta del Bote del Dragón y contiene una mayor densidad de expresiones específicas de la cultura y conocimientos previos implícitos. El texto C describe una narrativa sobre transmisiones en vivo y comercio electrónico en zonas rurales, caracterizada por un lenguaje evaluativo denso y una posición narrativa comprimida.
Los textos se segmentaron sistemáticamente utilizando límites de cláusulas, seguidos de límites de unidades de significado, obteniendo 44 unidades analizables en las tres tareas de traducción (Tabla 1). Antes del codificado formal, un manual de codificación definió la carga cultural, la densidad evaluativa y la compresión narrativa mediante escalas ordinales de 1 a 5. Un estudio piloto con 12 estudiantes que no participaron en el experimento principal confirmó la calibración de dificultad prevista, la claridad de las instrucciones de la tarea y la estabilidad de los límites de segmento para la alineación de pulsaciones de tecla.
Construcción del corpus auxiliar y mapeo de la saliencia
Para identificar indicadores narrativos públicamente relevantes, se compiló un corpus auxiliar de danmu a partir de 24 videos de Bilibili subidos entre enero de 2023 y diciembre de 2025. Solo se incluyeron videos que coincidieran con uno de los tres dominios semánticos representados en los textos fuente, que hubieran acumulado más de 50.000 visualizaciones, que contuvieran interacciones densas de danmu y que permitieran la exportación y la asignación temática de comentarios sincronizados en el tiempo. Tras la eliminación de duplicados y el filtrado de emojis, rellenos onomatopéyicos y fragmentos irrelevantes, el corpus final constaba de 18.642 comentarios.
Las palabras clave se estandarizaron y agruparon utilizando anclas de palabras clave relacionadas con el texto fuente. Luego, a cada segmento del texto fuente se le asignó una puntuación continua de relevancia danmu basada en una composición ponderada de la frecuencia normalizada del grupo de palabras clave, la concentración de comentarios dentro del grupo temático correspondiente y la intensidad evaluativa media. Este procedimiento permite comparaciones entre el esfuerzo de procesamiento del traductor y la relevancia del público a nivel de grupo semántico, en lugar de mediante coincidencia léxica directa. Dado que los danmu reflejan las respuestas del público a videos en línea y no a la tarea experimental de traducción en sí, la relevancia danmu se interpreta como un indicador externo del nivel de participación del público, y no como evidencia directa de la dificultad lingüística de un segmento fuente.
Procedimiento experimental y captura de datos
Las sesiones de traducción se realizaron individualmente en un laboratorio informático controlado, bajo condiciones estandarizadas de hardware, software y acceso a internet (Figura 2). Tras una orientación de cinco minutos que enfatizaba la producción de un inglés comprensible para una audiencia internacional, los participantes realizaron un calentamiento de escritura en inglés de tres minutos para minimizar los efectos de adaptación al teclado. Las tres tareas de traducción se administraron secuencialmente utilizando Translog-II, con el orden de las tareas contrabalanceado mediante un diseño cuadrado latino para distribuir de forma equitativa los posibles efectos de fatiga y de orden entre los participantes. Se asignó a cada participante un máximo de 20 minutos por texto, separados por intervalos de descanso de cinco minutos.
Aunque se permitió el uso del diccionario bilingüe integrado, se prohibieron los sistemas de traducción automática y los motores de búsqueda externos. Todos los pulsaciones de teclas, pausas y movimientos del cursor se registraron automáticamente y se complementaron con grabaciones sincrónicas de pantalla para verificar episodios de revisión no lineales. Después de completar cada tarea, los participantes realizaron una evaluación subjetiva de dificultad utilizada únicamente para ayudar a interpretar casos límite en la codificación.
Medición del proceso y codificación de variables
Los registros de pulsaciones se alinearon con la estructura de segmentos predefinida. Un episodio de alineación comenzaba con la primera pulsación en el idioma objetivo correspondiente a un segmento y finalizaba cuando el participante avanzaba definitivamente al siguiente segmento. Las revisiones superpuestas se reasignaron utilizando registros cronometrados de seguimiento del cursor.
El comportamiento de toma de decisiones se cuantificó mediante cinco indicadores: duración de la primera pausa antes de la traducción del segmento inicial, duración media de las pausas dentro de los segmentos, frecuencia de pausas superiores a dos segundos, número de consultas al diccionario y número de interrupciones basadas en el cursor que indican desviaciones del redactado lineal (Tabla 2). El comportamiento de revisión se clasificó según dos dimensiones: momento y función. El momento diferenciaba entre revisiones locales inmediatas y revisiones diferidas realizadas después de que la redacción hubiera avanzado más allá del segmento actual. La codificación funcional clasificó las revisiones como revisiones superficiales (correcciones a nivel formal sin cambio semántico), revisiones de significado (modificaciones léxicas o sintácticas), revisiones a nivel del discurso (ajustes en las relaciones entre cláusulas o en la coherencia) y revisiones de adaptación cultural (reformulaciones orientadas al público objetivo). Dos codificadores entrenados analizaron independientemente cada episodio de revisión antes de la resolución de discrepancias y asignaron una única categoría funcional principal a cada evento. La confiabilidad entre evaluadores fue sólida en todas las medidas codificadas. El coeficiente kappa de Cohen indicó un acuerdo sustancial en la codificación categórica de las funciones de revisión (ĸ = 0.84, p < 0.001). Para las variables ordinales a nivel del texto, los coeficientes de correlación intraclase (CCI, modelo mixto de dos vías, acuerdo absoluto) mostraron una alta confiabilidad para la carga cultural (CCI = 0.86), la densidad evaluativa (CCI = 0.78) y la compresión narrativa (CCI = 0.82). Cualquier discrepancia inicial en la codificación se resolvió posteriormente mediante adjudicación conjunta.
Evaluación de la calidad de la traducción
La calidad de la traducción fue evaluada independientemente de los datos del proceso por dos evaluadores con formación a nivel doctoral y amplia experiencia en la enseñanza de la traducción. Sin conocer las identidades de los participantes ni las medidas del proceso, los evaluadores aplicaron una rúbrica de 100 puntos, distribuida equitativamente en cinco dimensiones: precisión semántica, fluidez lingüística, coherencia narrativa, adecuación cultural y adecuación del registro (Tabla 3). Las discrepancias en las puntuaciones superiores a ocho puntos dieron lugar a una revisión conjunta y una nueva calificación por consenso, utilizando el promedio adjudicado como puntuación final de calidad de la traducción. Se conservaron los registros de evaluación previos a la adjudicación para facilitar la presentación transparente de la confiabilidad entre evaluadores en los materiales de replicación.
Modelado estadístico
Los análisis avanzaron en tres etapas secuenciales. Primero, se calcularon estadísticas descriptivas para resumir todas las variables a través de los grupos por año y tipos de texto. Segundo, se analizó el esfuerzo de procesamiento a nivel de segmento mediante modelos de regresión de efectos mixtos para tener en cuenta la estructura anidada de los segmentos dentro de los textos y las observaciones repetidas de participantes individuales. Las variables dependientes, incluyendo la duración de la primera pausa y la frecuencia de revisión, se modelaron como funciones de la carga cultural, la densidad evaluativa, la compresión narrativa y la saliencia del danmu, controlando al mismo tiempo la competencia del participante. Se incluyeron correlaciones entre predictores, diagnósticos de inflación de varianza, intervalos de confianza del 95 %, estimaciones del tamaño del efecto e índices de ajuste del modelo para mejorar la transparencia estadística.
Finalmente, se modeló la calidad de la traducción para evaluar las contribuciones predictivas del momento de la revisión y la función de la revisión en relación con la frecuencia total de revisiones. Se evaluó la superposición entre los segmentos destacados de danmu y los segmentos de traducción de alto esfuerzo utilizando el quintil superior de cada distribución, un índice compuesto estandarizado de esfuerzo y un análisis de superposición aleatoria. No se realizó ningún análisis factorial exploratorio ni modelado de ecuaciones estructurales. Por consiguiente, las figuras adjuntas se presentan únicamente como resúmenes conceptuales, descriptivos o basados en regresión.