Все методы с участием людей проводились в соответствии с институциональными рекомендациями и были одобрены институциональным наблюдательным советом (IRB) или комитетом по этике исследований с участием людей Университета Ханшань. До начала эксперимента от всех участников было получено информированное согласие.
Концептуальная основа и дизайн исследования
В данном исследовании использовался дизайн исследования «процесс–продукт» с дополнительным дискурсивным уровнем для изучения того, как комментарии danmu, создаваемые аудиторией, влияют на перевод субтитров. Аналитическая база объединяла текстовые характеристики, показатели процесса перевода и результаты качества перевода. В частности, изучалось, направляло ли внимание аудитории, отраженное в плотности danmu, когнитивные ресурсы переводчиков на определенные текстовые особенности и влияло ли это распределение внимания впоследствии на качество перевода.
Для реализации данной концепции в исследовании сначала были определены текстовые признаки на уровне сегмента, основанные на четырех измерениях: культурной нагрузке, оценочной плотности, нарративном сжатии и значимости danmu. Под культурной нагрузкой понималось наличие культурно-специфических отсылок, требующих адаптации или пояснения. Оценочная плотность измеряла концентрацию эмоционально или аттитюдного окрашенной лексики в пределах сегмента. Нарративное сжатие отражало степень конденсации семантического содержания в условиях ограничений субтитров. Значимость danmu представляла собой степень внимания аудитории, направленного на каждый сегмент субтитров, которая количественно определялась объемом синхронизированных комментариев danmu. В отличие от традиционных показателей сложности перевода, значимость danmu отражала социально распределенное внимание, а не внутреннюю текстовую сложность. Сегмент, вызвавший широкий отклик аудитории, не обязательно был более трудным для перевода; напротив, он представлял собой точку повышенной коммуникативной значимости в процессе просмотра.
Аналитическая структура включала три взаимосвязанных набора данных. Набор данных на уровне участников содержал индивидуальные демографические характеристики и сведения об опыте перевода. Набор данных «процесс–продукт» связывал каждый сегмент субтитров с поведенческими показателями, полученными с помощью логгирования нажатий клавиш, а также с экспертными оценками качества перевода. Набор данных danmu содержал синхронизированные комментарии аудитории, соответствующие времени отображения субтитров, на основе которых были вычислены значения значимости danmu. Эти наборы данных были связаны через идентификаторы участников и сегментов, что позволило проводить одновременный анализ каждого переведенного сегмента субтитров в зависимости от характеристик переводчика, особенностей когнитивной обработки, внимания аудитории и результатов перевода. Итоговая интегрированная база данных включала 216 полных сессий перевода и 3 168 наблюдений типа «участник–текст–сегмент», что послужило эмпирической основой для последующего анализа взаимосвязи процесса и продукта.
Скрининг участников и составление профиля общих характеристик
Выборка состояла из 72 студентов специальности «английский язык», набранных в государственном университете на юге Китая и равномерно распределенных по второму, третьему и четвертому курсам бакалавриата (по 24 участника на каждом курсе). Все участники были носителями китайского языка, проходившими формальное обучение английскому письму и переводу. Для обеспечения сопоставимости группы стажеров-переводчиков из исследования были исключены лица, проживавшие в англоязычной стране более 6 месяцев или имевшие профессиональный сертификат переводчика. Участники не разделялись на отдельные экспериментальные группы по опыту перевода, степени знакомства с культурой или уровню владения вторым языком. Вместо этого были зафиксированы курс обучения, последние результаты тестов по уровню владения английским языком, ранее пройденные курсы по переводу, самооценка знакомства с культурными темами, связанными с Китаем, и среднее еженедельное время двуязычной практики; эти данные были включены в статистические модели в качестве ковариат на уровне участников. Данное уточнение также устраняет несоответствие в количестве участников, отмеченное в ходе экспертной оценки: и в рукописи, и в наборе данных для репликации указано 72 участника, 216 сессий выполнения заданий и 3 168 наблюдений на уровне сегментов.
Выбор исходного текста и построение задачи
Материалы для перевода состояли из трех современных повествовательных текстов о Китае, разработанных специально для данного исследования, чтобы отразить подлинный общественный дискурс и избежать использования материалов, защищенных авторским правом. Каждый текст содержал от 205 до 225 китайских иероглифов, но систематически различался по своим внутренним характеристикам. Текст A представляет собой повествование о возвращении домой на Праздник весны с умеренной культурной нагрузкой и относительно простым синтаксисом. Текст B описывает воспоминания о Празднике драконьих лодок и содержит более высокую плотность культурно-специфических выражений и скрытых фоновых знаний. Текст C описывает повествование о сельских прямых трансляциях и электронной коммерции, которое характеризуется насыщенным оценочным языком и сжатым повествовательным позиционированием.
Тексты были систематически разделены с использованием границ предложений, а затем границ смысловых единиц, что позволило выделить 44 единицы анализа по трем задачам перевода (Таблица 1). Перед формальным кодированием в руководстве по кодированию были определены культурная нагрузка, оценочная плотность и нарративное сжатие с использованием порядковых шкал от 1 до 5. Пилотное исследование с участием 12 студентов, не принимавших участия в основном эксперименте, подтвердило заданную калибровку сложности, ясность инструкций к заданиям и стабильность границ сегментов для выравнивания нажатий клавиш.
Построение вспомогательного корпуса и картирование значимости
Для выявления общественно значимых повествовательных маркеров был составлен вспомогательный корпус danmu на основе 24 видео с платформы Bilibili, загруженных в период с января 2023 г. по декабрь 2025 г. Видео включались в выборку только при условии, что они соответствовали одной из трех семантических областей, представленных в исходных текстах, имели более 50 000 просмотров, характеризовались интенсивным взаимодействием в danmu, а также позволяли экспортировать и проводить тематическое картирование синхронизированных по времени комментариев. После удаления дубликатов и фильтрации эмодзи, ономатопоэтических вставок и нерелевантных фрагментов окончательный корпус составил 18 642 комментария.
Контентные слова были стандартизированы и сгруппированы с использованием ключевых слов-якорей, относящихся к исходному тексту. Затем каждому сегменту исходного текста был присвоен непрерывный показатель значимости danmu, основанный на средневзвешенном композите нормализованной частоты кластеров ключевых слов, концентрации комментариев внутри соответствующего тематического кластера и средней интенсивности оценочных суждений. Эта процедура позволяет сравнивать трудозатраты переводчика и значимость для аудитории на уровне семантических кластеров, а не посредством прямого лексического сопоставления. Поскольку danmu отражает реакцию аудитории на онлайн-видео, а не на саму задачу экспериментального перевода, значимость danmu интерпретируется как внешний индикатор вовлеченности аудитории, а не как прямое свидетельство лингвистической сложности сегмента исходного текста.
Экспериментальная процедура и сбор данных
Сеансы перевода проводились индивидуально в контролируемой компьютерной лаборатории в стандартизированных условиях аппаратного и программного обеспечения, а также доступа к интернету (Рисунок 2). После пятиминутного инструктажа, в котором особое внимание уделялось созданию читабельного английского текста для международной аудитории, участники выполняли трехминутную разминку по печати на английском языке для минимизации эффекта привыкания к клавиатуре. Три задания по переводу выполнялись последовательно с использованием Translog-II, при этом порядок заданий был сбалансирован по схеме латинского квадрата для равномерного распределения возможной утомляемости и эффектов последовательности между участниками. На каждый текст участникам отводилось не более 20 минут, с пятиминутными перерывами между ними.
Хотя использование встроенного двуязычного словаря было разрешено, применение систем машинного перевода и внешних поисковых систем было запрещено. Все нажатия клавиш, паузы и перемещения курсора регистрировались автоматически; данные дополнялись синхронными записями экрана для проверки эпизодов нелинейного редактирования. После выполнения каждого задания участники проходили самооценку сложности, результаты которой использовались исключительно для помощи в интерпретации пограничных случаев кодирования.
Измерение показателей процесса и кодирование переменных
Записи нажатий клавиш были сопоставлены с заранее определенной структурой сегментов. Эпизод сопоставления начинался с первого нажатия клавиши на целевом языке, соответствующего сегменту, и заканчивался, когда участник окончательно переходил к следующему сегменту. Перекрывающиеся правки были переназначены с использованием записей отслеживания курсора с временными метками.
Поведение при принятии решений количественно оценивали с помощью пяти показателей: длительности первой паузы перед переводом начального сегмента, средней длительности пауз внутри сегмента, частоты пауз продолжительностью более двух секунд, количества обращений к словарю и количества прерываний с помощью курсора, указывающих на отступление от линейного черновика (Таблица 2). Поведение при редактировании классифицировали по двум параметрам: времени и функции. По времени разграничивали немедленные локальные правки и отложенные правки, внесенные после того, как работа над черновиком продвинулась дальше текущего сегмента. Функциональное кодирование разделяло правки на поверхностные (исправления на уровне формы без изменения смысла), смысловые (лексические или синтаксические модификации), правки на уровне дискурса (корректировка взаимосвязей между предложениями или связности текста) и правки по культурной адаптации (переформулирования, ориентированные на целевую аудиторию). Два обученных кодировщика независимо анализировали каждый эпизод редактирования перед вынесением окончательного решения и присваивали каждому событию одну основную функциональную категорию. Межэкспертная надежность была высокой по всем кодируемым показателям. Коэффициент каппа Коэна (ĸ) указал на значительное согласие при категориальном кодировании функций редактирования (ĸ = 0.84, p < 0.001). Для порядковых переменных текстового уровня коэффициенты внутриклассовой корреляции (ICC, двухфакторная модель со смешанными эффектами, абсолютное согласие) продемонстрировали высокую надежность для культурной нагрузки (ICC = 0.86), оценочной плотности (ICC = 0.78) и нарративного сжатия (ICC = 0.82). Все первоначальные расхождения в кодировании впоследствии устранялись путем совместного согласования.
Оценка качества перевода
Качество перевода оценивалось независимо от данных о процессе двумя экспертами со степенью доктора наук и обширным опытом преподавания перевода. Не имея доступа к именам участников и показателям процесса, эксперты использовали 100-балльную рубрику, равномерно распределенную по пяти критериям: семантическая точность, лингвистическая беглость, связность повествования, культурная адаптация и соответствие регистру (Таблица 3). Расхождения в оценках более чем в восемь баллов становились основанием для совместного анализа и достижения консенсуса при повторном оценивании, при этом итоговым показателем качества перевода служило согласованное среднее значение. Записи оценок до этапа согласования были сохранены для обеспечения прозрачности отчетности о надежности межэкспертной оценки в материалах для репликации.
Статистическое моделирование
Анализ проводился в три последовательных этапа. Сначала были рассчитаны показатели дескриптивной статистики для обобщения всех переменных по группам лет обучения и типам текстов. Во-вторых, трудозатраты на обработку на уровне сегментов были проанализированы с помощью моделей регрессии со смешанными эффектами, чтобы учесть вложенную структуру сегментов в текстах и повторные наблюдения отдельных участников. Зависимые переменные, включая длительность первой паузы и частоту правок, моделировались как функции культурной нагрузки, оценочной плотности, нарративного сжатия и значимости danmu при контроле уровня владения языком участников. Для повышения статистической прозрачности были приведены корреляции предикторов, диагностика инфляции дисперсии, 95% доверительные интервалы, оценки величины эффекта и индексы соответствия модели.
Наконец, было построено моделирование качества перевода для оценки прогностического вклада времени внесения правок и функции правки относительно общей частоты пересмотра. Перекрытие между сегментами, значимыми с точки зрения danmu, и сегментами перевода с высокими трудозатратами оценивалось с использованием верхнего квинтиля каждого распределения, стандартизированного композитного индекса трудозатрат и анализа случайного перекрытия. Эксплораторный факторный анализ или моделирование структурными уравнениями не проводились. Соответственно, прилагаемые рисунки представлены исключительно в виде концептуальных, описательных или основанных на регрессии сводок.