Методическая статья

Воспроизводимый протокол создания китайско-английского керамического культурного туристического лексикона с использованием зарегистрированных корпораций

DOI:

10.3791/71320

3 июля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол формирует китайско-английский керамический культурный туристический лексикон с использованием зарегистрированных билингвальных корпусов, стандартизированной очистки, выделения кандидатных терминов, выравнивания по сходству и экспертной валидации с арбитражным рассмотрением. Используя этот рабочий процесс, было экспортировано 60 проверенных записей с определениями, примерами использования, записями происхождения и совместимыми с TBX выходами.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Создание ресурсов с двуязычной терминологией для керамического культурного туризма сложно, поскольку релевантные тексты часто фрагментированы, выбор перевода непоследовательный, а многоразовые рабочие процессы строительства редко документируются. Этот протокол представляет воспроизводимый, пошаговый рабочий процесс для создания китайско-английского керамического культурного туристического лексикона через регистрацию и очистку корпусов, выделение кандидатных терминов, билингвальное согласование и экспертную валидацию с рассмотрением решений. Применённый к зарегистрированному билингвальному корпусу, рабочий процесс формировал короткий список кандидатов на китайском и английском языках, создавал ранжированные пары двуязычных терминов и сохранял валидированные согласования после независимого экспертного рассмотрения. Финальный лексикон экспортировал 60 проверенных записей с двуязычными формами терминов, доменными тегами, типами переводов, двуязычными определениями, примерами использования, записями происхождения и совместимыми выходами, такими как файлы Excel и TBX. Для поддержки прозрачности и повторного запуска протокол также фиксирует пороги, версии упаковок, замороженные ресурсы и решения по валидации на протяжении всего рабочего процесса. Это делает процедуру проверяемой и проще адаптироваться к другим направлениям туризма наследия. При переносе на новый домен пользователи могут расширять список ключевых слов домена, обновлять двуязычный ресурс отображения и корректировать небольшое количество шорт-листа и порогов сходства в зависимости от размера корпуса и плотности терминологии.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Культурный туризм стал важным драйвером развития направлений, поскольку путешественники всё чаще ищут опыт, основанный на наследии, которые имеют смысл, а не чисторекреационные 1. На уровне политики и отрасли международные организации неоднократно подчёркивали ценность связи туризма с культурой и улучшения интерпретации, документации и коммуникации между различными объектами наследия. В этом более широком контексте керамический культурный туризм особенно насыщен терминологией, поскольку посетители регулярно сталкиваются с специализированными понятиями, связанными с материалами, процессами глазури и обжига, технологиями печей, стилистическими мотивами, типами артефактов и нарративами ремесленных процессов. Эти термины часто имеют технические значения, которые сложно передать через неформальные перефразы, а выбор перевода может напрямую влиять на понимание посетителей через ярлыки, направляемую интерпретацию иобразовательные материалы 2. В то же время рамки наследия подчёркивают, что защита нематериального культурного наследия зависит от устойчивой передачи знаний и общественной осведомлённости, что требует точного, доступного и контекстуально подходящего языка для интерпретации и образования3.

Несмотря на этот спрос, ресурсы билингвальной терминологии для керамического культурного туризма остаются фрагментированными и непоследовательными. На музейных этикетках, в текстах выставок, на страницах туристических путеводителей и описаниях наследия одна и та же концепция может быть по-разному представлена в разных учреждениях, регионах и коммуникативныхусловиях 4. Такое разнообразие — это не только стилистическое разнообразие. Это может повлиять на понимание посетителями, снизить сопоставимость описаний между объектами и ослабить воспринимаемую достоверность коммуникациинаследия 5. Исследования терминологии давно утверждают, что высококачественные терминологические ресурсы должны быть ориентированы на концепцию, подкреплены явными определениями и основаны на прослеживаемых доказательствах, таких как источники, контексты и записи контролякачества 6. Однако многие команды домена всё ещё не имеют рабочего процесса, который мог бы систематически преобразовывать разбросанные тексты в кураторский двуязычный лексикон, сохраняя при этом прозрачные правила принятия решений, воспроизводимые процедуры и повторно используемыевыходы 7. По сравнению с разовой ручной компиляцией, стандартизированный протокол обеспечивает более чёткую документацию, более последовательную валидацию и лучшие условия для обновления, аудита и межинституционального повторного использования.

Для решения этих проблем практический протокол построения двуязычного лексикона должен организовать две связанные задачи: поиск кандидатных терминов и двуязычное согласование. Для обнаружения терминов автоматическое извлечение на основе корпуса может снизить зависимость от полностью ручного сбора, сочетая лингвистические закономерности со статистическими данными, что облегчает выявление релевантной для области терминологии нашкале 8. Однако в культурных культурных объектах строительство корпуса редко бывает простым. Исходные материалы часто отличаются стилем, регистром и коммуникативным назначением, и могут содержать специфические названия и смешанные описательныеконвенции 9. Эти функции делают прозрачную запись параметров и стабильные правила обработки особенно важными. Для билингвального выравнивания вычислительные методы могут генерировать ранжированные пары кандидатов между языками, сравнивая формы терминов и их окружающие контексты использования, после чего эксперты могут проверить, являются ли предложенные пары концептуальноуместными 10. В этом протоколе сначала используется автоматизация для генерации и ранжирования правдоподобных кандидатов, а экспертное рассмотрение — для подтверждения или отклонения их последующего результата. Такое сочетание повышает эффективность, не убирая интерпретативное суждение из окончательного решения. Поскольку терминология наследия часто несёт культурные и образовательные последствия, рецензенты должны иметь возможность изучать доказательства, лежащие в основе каждой предлагаемой пары, а не полагаться на непрозрачный результат11.

Здесь представлен пошаговый и аудитируемый протокол для создания китайско-английского керамического культурного туристического лексикона на основе зарегистрированных текстовых источников. Рабочий процесс стандартизирует регистрацию и очистку корпуса, двуязычную экстракцию кандидатов, генерацию ранжированных пар, проверку двух аннотаторов с рассмотрением и завершение окончательной записи по фиксированной схеме. Интегрируя логирование версий, контроль порогов, замороженные ресурсы и экспертную валидацию, протокол улучшает воспроизводимость, аудитируемость и стандартизацию по сравнению с менее структурированными рабочими процессами по построению терминологии. Для поддержки долгосрочного повторного использования в управлении терминологией и практике перевода окончательный лексикон также может быть экспортирован в формате TermBase eXchange (TBX) — стандарте ISO-согласованности для обмена структурированными терминологическимиданными 12.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании использовались только публично доступные или санкционированные учрежденными текстовые данные и не касались людей или животных. Институциональное этическое одобрение не требовалось.

1. Создайте рабочее пространство проекта

  1. Создайте папку проекта и следующие подпапки: corpus_raw, corpus_clean, кандидаты, выравнивание, валидация, выходы, журналы и ресурсы.
  2. Создайте журнал запуска и запишите настройки среды.
    1. Создайте логи/run_notes.txt.
    2. Запишите дату/время выполнения, версию операционной системы и объём проекта как «китайско-английская терминология керамического культурного туризма».
    3. Установите интерпретатор Python на Python 3.11 и запишите эту информацию в logs/run_notes.txt.
  3. Запустите python -m pip freeze > logs/pip_freeze.txt и убедитесь, что logs/pip_freeze.txt сгенерирован и не пуст13.
  4. Создайте файл зависимостей и установите программную среду.
    1. Создавайте ресурсы/requirements.txt.
    2. Перечислите основные версии пакетов, используемых в этом протоколе, следующим образом: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 и RapidFuzz==3.6.1.
    3. Запишите команду установки в logs/run_notes.txt.
    4. Установить en_core_web_sm==3.7.1. 1.4.5 Запустить python -m spacy, проверить и записать проверенную версию модели в logs/run_notes.txt.
      ПРИМЕЧАНИЕ: Убедитесь, что log/pip_freeze.txt и logs/run_notes.txt существуют и не пусты, прежде чем продолжить.

2. Составить сбалансированный билингвальный корпус и регистровые источники

  1. Выберите источники, соответствующие двуязычной и жанровой композиции, указанной в Таблице 1 , и присваивать каждому документу уникальный source_id, например, S001 или S00214.
  2. Создайте SourceRegister.xlsx и записывайте для каждого документа source_id, название, владельца/издателя, язык, жанр, access_date и license_note.
  3. Преобразуйте каждый документ в обычный текст UTF-8, назовите каждый файл как source_id_lang.txt (например, S001_zh.txt или S001_en.txt) и сохраняйте файлы в corpus_raw.
  4. Сохраните заморожённую копию регистра как выходы/SourceRegister_v1.xlsx и запишите дату заморозки и сумму документов (n_docs_zh и n_docs_en) в logs/run_notes.txt.
    ПРИМЕЧАНИЕ: Здесь протокол может быть приостановлен. Если вы возобновите занятия позже, не изменяйте source_id назначения.
    ВНИМАНИЕ: Используйте только общедоступные или санкционированные учебными заведениями тексты. Не распространяйте защищённые авторским правом полные тексты без явного разрешения.

3. Очистить и нормализовать корпусные файлы

  1. Удалите только навигационные линии, линии только по URL и дублированные заголовки или подвалы, повторяющиеся как минимум в трёх документах. Оставьте все оставшиеся строки в исходномпорядке 15.
  2. Сохраняйте пунктуацию, которая может быть частью многословных или сложных терминов при очистке, включая дефис (-), косую черту (/), скобки (( и )) и среднюю точку (·).
  3. Нормализуйте китайский текст, преобразовав буквенно-цифровые символы полной ширины в символы полуширины и стандартизировав формы скобок в ( и ).
  4. Нормализуйте английский текст, сжав повторяющиеся пробелы в одно пространство и стандартизируя все варианты дефиса в ASCII дефис (-), сохраняя при этом дефисные соединения.
  5. Сохраняйте каждый очищенный файл в corpus_clean с тем же source_id_lang.txt именем, что и в corpus_raw.
  6. Запишите source_id, lang, n_chars_before, n_chars_after, timestamp и cleaning_ruleset установлены как v1.0 в выходах/CorpusStats.xlsx16.
    ПРИМЕЧАНИЕ: Для каждого языка проверьте, есть ли у каждого файла в corpus_raw соответствующий очищенный файл в corpus_clean с тем же суффиксом source_id и языком.
    ВНИМАНИЕ: Удаляйте личную информацию, такую как имена, номера телефонов и адреса электронной почты, во время предварительной обработки, если такая информация появляется в исходном тексте.

4. Извлечение кандидатных терминов на китайском и английском языках

  1. Сегментируйте китайский текст с использованием jieba версии 0.42.1 с фиксированными ресурсами/userdict_zh.txt пользовательского словаря и сохраняйте кандидаты, совпадающие либо с 2–8 последовательными китайскими иероглифами, либо с 2–6 китайскими иероглифами, разделённые одним сохранённымразделителем 17.
  2. Обрабатывайте английский текст с помощью spaCy версии 3.7.2 с версией 3.7.1 en_core_web_sm и сохраняйте только существительные и дефисные составные с 1–5токенами 18.
  3. Вычислите частоту как общее количество появления каждого кандидата в очищенном корпусе и вычислите doc_freq как количество отдельных source_id файлов, содержащих этого кандидата хотя бы один раз.
  4. Примените пороги в шорт-листе, оставив только кандидатов с doc_freq ≥ 2 и частотой ≥ 3, а остальных исключить19.
    ПРИМЕЧАНИЕ: Эти пороги в шорт-лист были отобраны для относительно небольшого, сбалансированного по жанру корпуса. Для более крупных или более разнородных корпусов пороги могут быть корректированы после пилотной инспекции.
  5. Экспортируйте кандидатов/Candidates_ZH.xlsx и кандидатов/Candidates_EN.xlsx с указанием столбцов термином, частотой, doc_freq, example_source_id и example_snippet.
  6. Экспортируйте кандидатов/Shortlist_ZH.xlsx и кандидатов/Shortlist_EN.xlsx с одними и теми же столбцами, при этом китайские фрагменты отображаются как ±20 символов, а английские — как ±10 жетонов вокруг одного заверённого случая.
  7. Записывайте имена и версии токенайзеров или теггеров, шаблоны кандидатов и пороги короткого списка в логах/thresholds.txt.
  8. Вычислите контрольную сумму для ресурсов/userdict_zh.txt, запишите её в logs/thresholds.txt и сохраните замороженную копию как выходы/userdict_zh_v1.txt20.
    ПРИМЕЧАНИЕ: Откройте Shortlist_ZH.xlsx и Shortlist_EN.xlsx и убедитесь, что оба файла содержат ненулевые строки и заполненные example_snippet поля.

5. Генерируйте билингвальных кандидатов и ранжуйте пары терминов

  1. Для каждого отобранного китайского термина собирайте контекстные окна из ±20 китайских иероглифов вокруг каждого случая и объединяйте до пяти окон, чтобы создать одну контекстную строку с названием ctx_zh.
  2. Для каждого короткого английского термина собирайте контекстные окна ±10 токенов вокруг каждого события и объединяйте до пяти окон, чтобы создать одну контекстную строку с названием ctx_en.
  3. Создайте и заморозьте двуязычный ресурс картирования.
    1. Создайте ресурсы/term_map_zh2en.xlsx со столбцами term_zh и term_zh_en.
    2. Заполнить файл с помощью авторизованного процесса, такого как существующие институциональные глоссарии, ранее принятые двуязычные списки терминов и нормализация на основе правил.
    3. Сохрани замороженное отображение как выходы/term_map_zh2en_v1.xlsx.
    4. Запишите дату заморозки, покрытие карт и контрольную сумму в логах/alignment_log.txt. ПРИМЕЧАНИЕ: При адаптации этого рабочего процесса к новому домену начинайте ресурс отображения с исходного списка терминов высокочастотных доменов и расширяйте таблицу между полными повторами, а не во время подсчёта оценок.
  4. Сопоставьте каждую term_zh в форму, сопоставимую с английской term_zh_en используя замороженное отображение, и сохраняйте тот же ресурс картирования на протяжении всего21-го забега.
  5. Генерируйте ctx_zh_en, применяя замороженное отображение к ctx_zh, заменяя совпадающие term_zh события на term_zh_en, при этом оставляя весь остальной текст без изменений.
  6. Запишите процедуру сопоставления и нормализации.
    1. Запишите процедуру сопоставления в logs/alignment_log.txt.
    2. Записывайте все правила нормализации, включая нижние регистры и нормализацию дефиса, в логах/alignment_log.txt.
  7. Вычислите оценку сходства строк S_str, используя версию RapidFuzz версии 3.6.1 token_sort_ratio для сравнения нормализованных английских строк терминов между term_zh_en и term_en и делите результат на 100, чтобы масштабировать оценку до диапазона [0, 1]22.
  8. Вычислите оценку сходства контекста S_ctx.
    1. Используйте scikit-learn версии 1.4.2 и TfidfVectorizer с фиксированными параметрами строчной=True, ngram_range=(1, 2), min_df=1, max_df=0.95 и stop_words="english"23.
    2. Поместить векторизатор на объединённый набор ctx_en и ctx_zh_en струн из текущей серии.
    3. Вычислим S_ctx как косинусное сходство между каждой ctx_zh_en строкой и каждой ctx_en строкой.
      ПРИМЕЧАНИЕ: TF-IDF отражает относительную важность слов и коротких фраз в каждом контекстном окне, а косинусное сходство используется для сравнения полученных контекстных представлений.
  9. Вычислите итоговую оценку сходства и ранжуйте кандидатские пары.
    1. Вычислите итоговый балл как S = 0,60 × S_str + 0,40 × S_ctx.
    2. За каждый китайский семестр сохраняют лучшие k = 3 англоязычных кандидата, ранжированных по S.
    3. Удалять дубликаторы, сохраняя экземпляр с наивысшим баллом для каждой уникальной (term_zh, term_en) пары.
    4. Запись k, веса баллов и общее количество экспортированных пар в logs/alignment_log.txt24.
      ПРИМЕЧАНИЕ: Схема взвешивания и значение k были выбраны для поддержания управляемого набора обзора при сохранении правдоподобных альтернатив. Для больших корпусов или более вариативной терминологии эти настройки могут быть скорректированы после пилотного тестирования.
  10. Назначайте domain_tag значения с использованием фиксированной карты ключевых слов resources/domain_keywords.csv и следующего порядка приоритетов: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    ПРИМЕЧАНИЕ: При переносе рабочего процесса в другой предметный домен замените карту ключевых слов и пересмотрите порядок приоритетов перед повторным запуском полного пайплайна.
  11. Сохраните замороженную копию карты ключевых слов как outputs/domain_keywords_v1.csv и запишите её контрольную сумму в logs/alignment_log.txt.
  12. Экспортное выравнивание/AlignmentPairs.xlsx с колонками pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en и evidence_snippet_zh_en.
  13. Обозначьте каждую пару как auto_accept, review или auto_reject по следующим пороговым значениям: S ≥ 0,90, 0,75 ≤ S ≤ 0,89, и S < 0,75, и записывайте пороги и счёты в каждой группе меток в logs/alignment_log.txt.
    ПРИМЕЧАНИЕ: В стандартной рабочей среде, сопоставимой с используемой в данном исследовании, генерация контекста, подгонка TF-IDF и оценка сходства для корпуса такого размера были завершены за несколько минут.
    ПРИМЕЧАНИЕ: Случайным образом проверьте как минимум 10 строк в AlignmentPairs.xlsx и убедитесь, что evidence_snippet_zh_en присутствует и что term_zh_en не пустой для отображённых случаев.
    ВНИМАНИЕ: Держите все картографические ресурсы фиксированными внутри забега. Не обновляйте двуязычную таблицу или карту по ключевым словам после начала подсчёта очков.

6. Проверять пары терминов с помощью экспертной аннотации и рассмотрения

  1. Создайте валидацию/Annotation.xlsx с помощью столбцов pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, adjudication и reasone.
  2. Подготовьте одностраничное руководство по аннотациям, определяющее концептуальную эквивалентность в керамическом культурном туризме, допустимые объяснительные переводы и случаи исключения, такие как частичное пересечение, чрезмерно общие изображения и несовпадающие типыартефактов 26.
  3. Поручите двум аннотаторам независимо обозначить каждую пару как включить или исключить, используя предоставленные фрагменты доказательств, и не позволять аннотаторам просматривать решения друг друга.
  4. Пересмотрите все разногласия после независимой аннотации и зафиксируйте окончательное решение и логическое изложение в колонках «adjudication» и «Reasone».
  5. Вычислите исходное согласование и κ Коэна с помощью меток включать и исключать, записывать метрики соглашения и суммы включать и исключать в выходах/Evaluation.xlsx 27.
  6. Проанализировать исключённые пары для выявления систематических ложноположительных закономерностей и сохранить наиболее частые отклонённые паттерны в логах/rule_update_v1.txt.
  7. Сохраняйте замороженную копию завершённого файла аннотации как выходы/Annotation_v1.xlsx и не меняйте проверенные метки после этого момента.
    ПРИМЕЧАНИЕ: Здесь протокол может быть приостановлен. Если вы возобновляете позже, не пересматривайте решения о замороженной валидации.

7. Завершить лексикон и экспортировать

  1. Заполните окончательный лексикон с помощью полей вводных записей, изложенных в таблице 2, включая двуязычные формы терминов, части речи, доменные теги, тип перевода, билингвальные определения, примеры использования, информацию о происхождении и флаги качества.
  2. Используйте одинаковые значения entry_id во всех экспортах и проверяйте согласованность идентификатора перед генерацией файла.
  3. Экспортируйте финальную таблицу в виде выходов/FinalLexicon.xlsx и убедитесь, что все необходимые поля заполнены перед сохранением.
  4. Сгенерируйте и проверьте экспорт TBX.
    1. Сгенерируйте TBX-файл с теми же значениями entry_id для сохранения отслеживаемости.
    2. Проверьте TBX-файл по предполагаемой схеме TBX.
    3. Запишите результат валидации в logs/run_notes.txt28.
  5. Архивируйте все журналы, файлы параметров, замороженные ресурсы и выходы в версионной папке выходов/Lexicon_v1/ и записывайте дату архива и количество файлов в logs/run_notes.txt.
  6. Предоставьте скрипты, замороженные ресурсы и логи параметров в виде дополнительных файлов, включая выходы/userdict_zh_v1.txt, выходы/domain_keywords_v1.csv, выходы/term_map_zh2en_v1.xlsx, логи/thresholds.txt и логи/alignment_log.txt.
  7. Предоставить подмножество верификации корпуса с разрешением, используя ту же структуру файла и схему вывода, чтобы читатели могли воспроизводить рабочий процесс на опубликованномподмножестве 29.
    ВНИМАНИЕ: Перед публикацией дополнительных материалов убедитесь, что в пакет релиза не включены полные тексты, охраняемые авторским правом, чувствительные идентификаторы или несанкционированные институциональные ресурсы.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сборка корпуса и выход очистки
Следуя корпусному дизайну, показанному в таблице 1, был собран зарегистрированный двуязычный корпус из музейных и выставочных текстов, описаний наследия и туристических материалов, ориентированных на посетителей. После очистки корпус включал 12 китайских и 8 английских документов, всего 47 843 китайских иероглифа и 32 193 английскихиероглифа 30. Корпус сохранил предполагаемое сочетание технических...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Основная ценность этого протокола заключается в его способности преобразовывать терминологическую задачу, которая часто обрабатывается неформально, в воспроизводимый и подлежащий обзору рабочий процесс. В керамическом культурном туризме многие термины носят как технические, так и интерпретативные: они относятся не только к материалам, типам печей, стадиям обжига или декоративным стилям, но и к тому, как эти концепции передаются посетителям в ярлыках, повествовании и образовательных

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих финансовых или нефинансовых интересов, связанных с этой работой.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы благодарят практиков керамического культурного туризма и сотрудников музеев, которые предоставили доступ к текстовым материалам и обратной связи по доменам во время создания корпуса и валидации. Авторы также благодарят двух независимых аннотаторов доменов за тщательный анализ кандидатов на выравнивание и конструктивные комментарии по дизайну записей. Эта работа была поддержана исследовательским проектом Ассоциации высшего образования Цзянси под названием «Исследование интеллектуального английского перевода терминологии китайского керамического туризма на основе DeepSeek и её многоканальной модели распространения» (Грант No WY-D-115).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Компьютерная рабочая станцияОборудованиеЛюбой современный компьютер, способный запускать Python 3.11 и обрабатывать текстовые корпуса; рекомендуется >=8 ГБ ОЗУНе требуется номер каталога
Источник: Универсальный (любой поставщик)
Операционная системаПрограммное обеспечениеWindows 10/11, macOS или Linux (записывайте точную версию ОС в logs/run_notes.txt)Версия записана в run_notes.txt
Источник: Установленная в системе
PythonПрограммное обеспечениеPython 3.11Версия записана в logs/pip_freeze.txt
Источник: Распределение Python Software Foundation
jiebaБиблиотека программного обеспечения0.42.1jieba==0.42.1
Источник: Репозиторий пакетов PyPI
spaCyБиблиотека программного обеспечения3.7.2spacy==3.7.2
Источник: Репозиторий пакетов PyPI
Модель английского языкаМодель NLPen_core_web_sm 3.7.1 (пакет моделей spaCy)en_core_web_sm==3.7.1; установка записана в run_notes.txt
Источник: Репозиторий моделей spaCy
scikit-learnБиблиотека программного обеспечения1.4.2scikit-learn==1.4.2
Источник: Репозиторий пакетов PyPI
RapidFuzzБиблиотека программного обеспечения3.6.1RapidFuzz==3.6.1
Источник: Репозиторий пакетов PyPI
Редактор электронных таблицПрограммное обеспечениеЛюбое программное обеспечение, способное редактировать файлы.xlsxИспользуется для просмотра/редактирования SourceRegister.xlsx, CorpusStats.xlsx, файлов Candidates/Shortlist
Источник: Универсальный (любой поставщик)
Редактор простого текстаПрограммное обеспечениеЛюбое программное обеспечение, способное редактировать файлы.txt и.csvИспользуется для просмотра/редактирования logs/.txt и resources/.csv
Источник: Универсальный (любой поставщик)
Инструмент конвертации текста UTF-8Программное обеспечениеЛюбой инструмент, способный экспортировать документы в простой текст UTF-8Используется на шаге 2.3; точный метод записан в run_notes.txt
Источник: Универсальный (любой поставщик)
Шаблон SourceRegisterШаблон файлаSourceRegister.xlsx с полями: source_id, title, owner/publisher, language, genre, access_date, license_noteЗафиксирован как outputs/SourceRegister_v1.xlsx
Источник: Создано в рамках данного исследования
Шаблон статистики корпусаШаблон файлаCorpusStats.xlsx с полями: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetСоздано на шаге 3.6
Источник: Создано в рамках данного исследования
Пользовательский китайский словарьФайл ресурсаresources/userdict_zh.txt (список терминов специализированной области для поддержки сегментации)Зафиксирована копия; контрольная сумма записана в thresholds.txt
Источник: Создано/кураторство в рамках данного исследования
Карта ключевых слов доменаФайл ресурсаresources/domain_keywords.csv с правилами приоритета domain_tagЗафиксировано как outputs/domain_keywords_v1.csv; контрольная сумма записана в alignment_log.txt
Источник: Создано/кураторство в рамках данного исследования
Таблица сопоставления терминов китайского и английского языковФайл ресурсаresources/term_map_zh2en.xlsx с колонками term_zh и term_zh_enЗафиксировано как outputs/term_map_zh2en_v1.xlsx; охват записан в alignment_log.txt
Источник: Создано/кураторство в рамках данного исследования
Журнал пороговФайл журналаlogs/thresholds.txt (шаблоны, пороги, версии библиотек, контрольные суммы ресурсов)Необходим для детерминированных повторных запусков
Источник: Создано в рамках данного исследования
Журнал выравниванияФайл журналаlogs/alignment_log.txt (веса, k, пороговые значения, параметры векторизатора, покрытие карты, контрольные суммы карты)Необходим для детерминированных повторных запусков
Источник: Создано в рамках данного исследования
Лист аннотацииШаблон файлаvalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisions, adjudication, rationale)Зафиксировано как outputs/Annotation_v1.xlsx после шага 6.6
Источник: Создано в рамках данного исследования
Результат оценкиВыходной файлoutputs/Evaluation.xlsx (сырая согласованность, κ Коэффициент Коэна, общее количество)Создано на шаге 6.4
Источник: Создано в рамках данного исследования
Экспорт итогового лексиконаВыходной файлoutputs/FinalLexicon.xlsx в соответствии со схемой Таблицы 2Создано на шаге 7.2
Источник: Создано в рамках данного исследования
Экспорт TBXВыходной файлФайл TBX, созданный из FinalLexicon.xlsx с устойчивым сопоставлением entry_id

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

233233TBX TermBase eXchange

Похожие статьи