Toutes les méthodes impliquant des sujets humains ont été menées conformément aux directives institutionnelles et ont été approuvées par le comité d'éthique institutionnel (IRB) ou le comité d'éthique de la recherche sur les êtres humains de l'Université Hanshan. Un consentement éclairé a été obtenu de la part de tous les participants avant le début de l'expérience.
Cadre conceptuel et conception de la recherche
Cette étude a utilisé un dispositif de recherche processus-produit avec une couche discursive auxiliaire afin d'examiner comment les commentaires danmu générés par le public influencent la traduction des sous-titres. Le cadre analytique intégrait les caractéristiques textuelles, les indicateurs du processus de traduction et les résultats en matière de qualité de la traduction. Plus précisément, elle a cherché à déterminer si l'attention du public, reflétée par la densité des danmu, orientait les ressources cognitives des traducteurs vers des caractéristiques textuelles particulières et si cette allocation de l'attention affectait par la suite la qualité de la traduction.
Pour mettre en œuvre ce cadre, l'étude a d'abord établi des caractéristiques textuelles au niveau des segments selon quatre dimensions : la charge culturelle, la densité évaluative, la compression narrative et la saillance des danmu. La charge culturelle faisait référence à la présence de références spécifiques à une culture, nécessitant adaptation ou explication. La densité évaluative mesurait la concentration de langage chargé d'émotions ou d'attitudes au sein d'un segment. La compression narrative traduisait le degré de condensation du contenu sémantique imposé par les contraintes des sous-titres. La saillance des danmu représentait l'importance de l'attention du public portée à chaque segment de sous-titre, quantifiée par le volume des commentaires danmu synchronisés. Contrairement aux mesures classiques de la difficulté de traduction, la saillance des danmu reflétait une attention socialement distribuée plutôt qu'une complexité textuelle intrinsèque. Un segment suscitant un fort engagement du public n'était pas nécessairement plus difficile à traduire ; il marquait plutôt un point de signification communicationnelle accrue dans l'expérience de visionnage.
Le cadre analytique comprenait trois jeux de données interconnectés. Le jeu de données au niveau des participants incluait les caractéristiques démographiques individuelles et le niveau d'expertise en traduction. Le jeu de données processus-produit associait chaque segment de sous-titre à des indicateurs comportementaux extraits de l'enregistrement des frappes au clavier, ainsi qu'à des évaluations expertes de la qualité de la traduction. Le jeu de données danmu contenait les commentaires synchronisés du public alignés sur le défilement des sous-titres, à partir desquels des valeurs de saillance des danmu ont été calculées. Ces jeux de données ont été associés grâce à des identifiants de participants et de segments, permettant une analyse simultanée de chaque segment de sous-titre traduit en lien avec les caractéristiques des traducteurs, leur comportement de traitement cognitif, l'attention du public et les résultats de traduction. La base de données intégrée finale comprenait 216 séances de traduction complètes et 3 168 observations participant-texte-segment, fournissant la base empirique pour les analyses subséquentes de type processus-produit.
Dépistage des participants et profilage de base
L'échantillon comprenait 72 étudiants anglicistes recrutés au sein d'une université publique du sud de la Chine, répartis équitablement entre la deuxième, la troisième et la quatrième année d'études de premier cycle (24 participants par groupe d'année). Tous les participants étaient des locuteurs natifs chinois suivant un enseignement formel en rédaction et traduction en anglais. Afin d'assurer la comparabilité au sein de la population d'apprentis traducteurs, les individus ayant résidé plus de 6 mois dans un pays anglophone ou détenant une certification professionnelle de traducteur ont été exclus. Les participants n'ont pas été répartis en groupes expérimentaux distincts selon leur expérience en traduction, leur familiarité culturelle ou leur niveau de compétence en langue seconde. Au lieu de cela, le niveau d'études, les résultats récents aux tests de compétence en anglais, les cours antérieurs en traduction, le degré d'auto-évaluation de la familiarité avec des sujets culturels liés à la Chine, ainsi que la pratique bilingue hebdomadaire moyenne ont été enregistrés et intégrés comme covariables au niveau des participants dans les modèles statistiques. Cette précision permet également de résoudre l'incohérence concernant le nombre de participants soulevée lors de l'évaluation par les pairs : le manuscrit et le jeu de données de réplication comprennent tous deux 72 participants, 216 séances de tâche et 3 168 observations au niveau des segments.
Sélection du texte source et élaboration de la tâche
Les matériaux de traduction étaient composés de trois textes narratifs contemporains centrés sur la Chine, élaborés spécifiquement pour cette étude afin de refléter un discours public authentique et d'éviter la reproduction de contenus protégés par le droit d'auteur. Chaque texte contenait entre 205 et 225 caractères chinois, mais différait systématiquement par ses caractéristiques internes. Le texte A présente un récit sur le retour au pays pour le Nouvel An chinois, avec une charge culturelle modérée et une syntaxe relativement simple. Le texte B relate un souvenir de la fête des bateaux-dragons et contient une densité plus élevée d'expressions spécifiques à la culture ainsi qu'une connaissance implicite du contexte. Le texte C décrit un récit sur la diffusion en direct et le commerce électronique en milieu rural, caractérisé par un langage évaluatif dense et une position narrative condensée.
Les textes ont été segmentés systématiquement en utilisant d'abord les limites des propositions, puis les limites des unités de sens, produisant 44 unités analysables réparties sur les trois tâches de traduction (Tableau 1). Avant le codage formel, un manuel de codage a défini la charge culturelle, la densité évaluative et la compression narrative à l'aide d'échelles ordinales allant de 1 à 5. Une étude pilote menée auprès de 12 étudiants n'ayant pas participé à l'expérience principale a confirmé le calibrage prévu de la difficulté, la clarté des instructions de la tâche et la stabilité des limites des segments pour l'alignement des frappes au clavier.
Construction d'un corpus auxiliaire et cartographie de la saillance
Afin d'identifier les indices narratifs saillants pour le grand public, un corpus auxiliaire de danmu a été compilé à partir de 24 vidéos Bilibili publiées entre janvier 2023 et décembre 2025. Les vidéos n'ont été incluses que si elles correspondaient à l'un des trois domaines sémantiques présents dans les textes sources, avaient accumulé plus de 50 000 vues, présentaient une interaction dense en danmu et permettaient l'exportation et la cartographie thématique des commentaires synchronisés temporellement. Après suppression des doublons et filtrage des émoticônes, des remplissages onomatopéiques et des fragments non pertinents, le corpus final comprenait 18 642 commentaires.
Les mots-clés ont été normalisés et regroupés à l’aide d’ancres de mots-clés liées au texte source. Chaque segment du texte source s’est ensuite vu attribuer un score de saillance danmu continu, fondé sur une combinaison pondérée de la fréquence normalisée des clusters de mots-clés, de la concentration des commentaires au sein du cluster thématique correspondant et de l’intensité évaluative moyenne. Cette procédure permet des comparaisons entre l’effort de traitement du traducteur et la saillance du public au niveau des clusters sémantiques, plutôt que par une simple correspondance lexicale directe. Étant donné que les danmu reflètent les réactions du public à des vidéos en ligne et non la tâche expérimentale de traduction elle-même, la saillance danmu est interprétée comme un indicateur externe de l’engagement du public, et non comme une preuve directe de la difficulté linguistique d’un segment source.
Procédure expérimentale et acquisition des données
Les sessions de traduction ont été menées individuellement dans un laboratoire informatique contrôlé, dans des conditions normalisées de matériel, de logiciel et d'accès à Internet (Figure 2). Après une période d'orientation de cinq minutes, mettant l'accent sur la production d'un anglais lisible destiné à un public international, les participants ont effectué un échauffement de trois minutes à la saisie en anglais afin de minimiser les effets de l'adaptation au clavier. Les trois tâches de traduction ont été administrées séquentiellement à l'aide de Translog-II, l'ordre des tâches étant contrebalancé selon un plan en carré latin afin de répartir uniformément les effets potentiels de fatigue et d'ordre entre les participants. Une durée maximale de 20 minutes par texte a été allouée aux participants, avec des intervalles de repos de cinq minutes entre chaque tâche.
Bien que le dictionnaire bilingue intégré ait été autorisé, les systèmes de traduction automatique et les moteurs de recherche externes étaient interdits. Toutes les frappes au clavier, les pauses et les déplacements du curseur ont été enregistrés automatiquement et complétés par des enregistrements synchrones de l'écran afin de vérifier les épisodes de révision non linéaires. Après avoir terminé chaque tâche, les participants ont rempli une évaluation subjective de la difficulté, utilisée uniquement pour aider à l'interprétation des cas limites lors du codage.
Mesure du processus et codage des variables
Les enregistrements des frappes au clavier ont été alignés avec la structure de segment prédéfinie. Un épisode d'alignement commençait par la première frappe en langue cible correspondant à un segment et se terminait lorsque le participant passait définitivement au segment suivant. Les révisions chevauchantes ont été réaffectées à l'aide des enregistrements chronométrés du suivi du curseur.
Le comportement de prise de décision a été quantifié à l'aide de cinq indicateurs : la durée de la première pause avant la traduction du segment initial, la durée moyenne des pauses intra-segment, la fréquence des pauses dépassant deux secondes, le nombre de consultations du dictionnaire et le nombre d'interruptions basées sur le curseur, indiquant des écarts par rapport à la rédaction linéaire (Tableau 2). Le comportement de révision a été classé selon deux dimensions : le moment et la fonction. Le moment différenciait les révisions locales immédiates des révisions différées, effectuées après que la rédaction avait progressé au-delà du segment en cours. Le codage fonctionnel classait les révisions en révisions de surface (corrections au niveau de la forme sans changement sémantique), révisions de sens (modifications lexicales ou syntaxiques), révisions au niveau du discours (ajustements des relations entre propositions ou de la cohérence) et révisions d'adaptation culturelle (reformulations orientées vers le public cible). Deux codeurs formés ont analysé indépendamment chaque épisode de révision, puis ont procédé à une arbitrage conjoint afin d'attribuer une catégorie fonctionnelle principale unique à chaque événement. La fiabilité inter-jugeurs était élevée pour toutes les mesures codées. L'indice ĸ de Cohen indiquait un accord substantiel pour le codage catégoriel des fonctions de révision (ĸ = 0,84, p < 0,001). Pour les variables ordinales au niveau du texte, les coefficients de corrélation intra-classes (CCI, modèle mixte à deux facteurs, accord absolu) ont montré une forte fiabilité pour la charge culturelle (CCI = 0,86), la densité évaluative (CCI = 0,78) et la compression narrative (CCI = 0,82). Toutes les divergences initiales de codage ont été par la suite résolues par arbitrage conjoint.
Évaluation de la qualité de la traduction
La qualité de la traduction a été évaluée indépendamment des données de processus par deux évaluateurs ayant une formation de niveau doctorat et une vaste expérience dans l'enseignement de la traduction. Aveugles aux identités des participants et aux mesures de processus, les évaluateurs ont appliqué une grille sur 100 points, répartie équitablement entre cinq dimensions : exactitude sémantique, fluidité linguistique, cohérence narrative, adaptation culturelle et adéquation du registre (Tableau 3). Les écarts de notes supérieurs à huit points ont déclenché un examen conjoint et une nouvelle notation par consensus, la moyenne retenue après arbitrage servant de score final de qualité de traduction. Les notes avant arbitrage ont été conservées afin de permettre une communication transparente de la fiabilité inter-évaluateurs dans les matériaux de réplication.
Modélisation statistique
Les analyses ont été menées en trois étapes séquentielles. Premièrement, des statistiques descriptives ont été calculées afin de résumer toutes les variables selon les groupes d'âge et les types de texte. Deuxièmement, l'effort de traitement au niveau des segments a été analysé à l'aide de modèles de régression à effets mixtes, afin de tenir compte de la structure imbriquée des segments dans les textes et des observations répétées provenant des participants individuels. Les variables dépendantes, notamment la durée de la première pause et la fréquence des révisions, ont été modélisées en fonction de la charge culturelle, de la densité évaluative, de la compression narrative et de la saillance des danmu, tout en contrôlant le niveau de compétence des participants. Les corrélations entre prédicteurs, les diagnostics d'inflation de la variance, les intervalles de confiance à 95 %, les estimations de la taille de l'effet et les indices d'ajustement du modèle ont été inclus afin d'améliorer la transparence statistique.
Enfin, la qualité de la traduction a été modélisée afin d'évaluer les contributions prédictives du moment des révisions et de la fonction des révisions par rapport à la fréquence globale des révisions. Le recouvrement entre les segments saillants de danmu et les segments de traduction à haut effort a été évalué à l'aide du quintile supérieur de chaque distribution, d'un indice composite normalisé d'effort et d'une analyse de recouvrement aléatoire. Aucune analyse factorielle exploratoire ni modélisation par équation structurelle n'a été réalisée. En conséquence, les figures accompagnant l'article sont présentées uniquement comme des résumés conceptuels, descriptifs ou fondés sur la régression.