方法文章

使用注册语料库构建汉英陶瓷文化旅游术语库的可复现方案

DOI:

10.3791/71320

2026年7月3日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案利用已注册的双语语料库,通过标准化清洗、候选术语提取、基于相似度排序的对齐以及专家验证与裁决,构建了中英陶瓷文化旅游术语库。采用该工作流程,导出了60个经过验证的词条,包含定义、用法示例、来源记录以及兼容TBX格式的输出结果。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

构建陶瓷文化旅游领域的双语术语资源面临诸多挑战,因为相关文本往往零散不全,翻译选择缺乏一致性,且可复用的构建流程很少被系统记录。本方案提出了一种可重复的、分步实施的工作流程,用于构建中英陶瓷文化旅游术语库,具体步骤包括语料库注册与清洗、候选术语提取、双语对齐以及专家验证与裁决。该流程应用于一个已注册的双语语料库后,成功生成了中英文候选术语短名单,产出排序后的双语术语对,并在独立专家评审后保留了经验证的对齐结果。最终形成的术语库导出了60个经核实的词条,包含双语术语形式、领域标签、翻译类型、双语定义、用法示例、来源记录,以及Excel和TBX等可互操作的输出格式。为确保透明性和可重复性,本方案在全流程中记录了各项阈值、软件包版本、冻结资源及验证决策,从而使整个过程具备可审计性,并更易于推广至其他文化遗产旅游领域。当迁移至新领域时,用户可通过扩展领域关键词列表、更新双语映射资源,并根据语料库规模和术语密度调整少量短名单及相似度阈值,实现流程的适配与延展。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着游客日益追求具有意义的文化遗产体验而不仅仅是纯粹的休闲活动,文化旅游已成为目的地发展的重要推动力1。在政策和产业层面,国际组织多次强调将旅游与文化相结合的价值,并呼吁加强对多样化遗产资源的阐释、记录与传播。在此宏观背景下,陶瓷文化旅游尤其涉及大量专业术语,因为游客经常接触到与材料、釉料和烧制工艺、窑炉技术、风格纹样、器物类型以及手工艺过程叙述相关的专门概念。这些术语往往具有难以通过随意转述传达的技术含义,而翻译选择会直接影响游客对展签、导览解说和教育材料内容的理解2。与此同时,文化遗产保护框架强调,非物质文化遗产的保护依赖于持续的知识传承和公众认知,而这两者都要求在阐释与教育中使用准确、易懂且符合语境的语言3

尽管存在这一需求,陶瓷文化旅游领域的双语术语资源仍处于零散且不一致的状态。在博物馆标签、展览文字、旅游指南页面和遗产描述中,相同的概念在不同机构、地区和交际场景下可能呈现不同的表达方式4。这种差异不仅仅是风格上的不同,它可能影响游客的理解,降低各遗址描述之间的可比性,并削弱遗产传播的可信度5。术语学研究长期以来主张,高质量的术语资源应以概念为中心,配有明确的定义,并以可追溯的证据为基础,例如来源、语境以及质量控制记录

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究仅使用公开可用或机构授权的文本数据,未涉及人类或动物受试者。无需机构伦理审批。

1. 创建项目工作区

  1. 创建一个项目文件夹,并建立以下子文件夹:corpus_raw、corpus_clean、candidates、alignment、validation、outputs、logs 和 resources。
  2. 创建运行日志并记录环境设置。
    1. 创建 logs/run_notes.txt。
    2. 记录运行的日期/时间、操作系统版本以及项目范围为“中文–英文陶瓷文化旅游术语”。
    3. 将 Python 解释器设置为 Python 3.11,并将此信息记录在 logs/run_notes.txt 中。
  3. 运行 python -m pip freeze > logs/pip_freeze.txt,并确认 logs/pip_freeze.txt 已生成且不为空13
  4. 创建依赖文件并安装软件环境。
    1. 创建 resources/requirements.txt。
    2. 列出本实验方案中使用的核心包版本,如下所示:jieba==0.42.1、spacy==3.7.2、scikit-learn==1.4.2 ....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

语料库构建与清洗结果
根据表1所示的语料库设计,从博物馆和展览文本、文化遗产描述以及面向游客的旅游资料中整理构建了一个注册的双语语料库。经过清洗后,语料库包含12份中文文档和8份英文文档,共计47,843个中文字符和32,193个英文字符30。该语料库保留了技术性、阐释性及旅游导向类材料的预期组合。最终语料库的构成符合表1中定义的目标范围。

此阶段的阳性结果特征为:来源标识符稳定,注册文件与清洗后文件完全对应,且每份文档的清洗后文本均可使用。阴性或次优结果更可能涉及清洗后文件缺失、标识符不一致,或清洗后文本丢失过多。此类情况会降低下游术语覆盖率,应在候选术语提取前予以纠正。

.......

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案的主要价值在于能够将通常以非正式方式处理的术语工作转化为可重复、可审查的工作流程。在陶瓷文化旅游领域,许多术语既具有技术性又具有诠释性:它们不仅指代材料、窑炉类型、烧制阶段或装饰风格,还涉及这些概念如何通过标签、解说文本和教育材料向游客传达36。因此,该领域中的双语差异并非微不足道的表达风格问题,而可能影响游客的理解方式,并改变文化意义在不同平台和机构间的传播效果37。本方案通过结合固定的预处理规则、固定的参数设置、排序的双语对齐方法以及专家验证,构建了一个可追溯的整合工作流程,以解决这一问题。

该方法可靠运行依赖于若干关键步骤。首先,语料库的注册、清洗和参数冻结应被视为受控步骤,而非常规准备工作。预处理过程中微小的未记录变更,例如软件包版本或阈值的变化,可能导致两次运行结果看似相似,但实际上已不再具有可比性。因此,完整记录参数状态并冻结输入资源有助于实现可重复运行,并使后续差异更易于追溯38

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们与本研究无任何相关的竞争性财务或非财务利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢在语料库构建与验证过程中提供文本资料和领域反馈的陶瓷文化旅游从业者及博物馆工作人员。作者还感谢两位独立的领域标注人员,他们对对齐候选条目进行了仔细审阅,并对词条设计提出了建设性意见。本研究得到了江西省高等教育学会研究项目“基于DeepSeek的中国陶瓷旅游术语智能英译及其多渠道传播模型研究”(项目编号:WY-D-115)的资助。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
计算机工作站硬件任何能够运行 Python 3.11 并处理文本语料库的现代计算机;建议配备 ≥8 GB 内存无需目录编号
来源:通用(任意供应商)
操作系统软件Windows 10/11、macOS 或 Linux(在 logs/run_notes.txt 中记录确切的操作系统版本)版本记录在 run_notes.txt 中
来源:系统预装
Python软件Python 3.11版本记录在 logs/pip_freeze.txt 中
来源:Python 软件基金会发行版
jieba软件库0.42.1jieba==0.42.1
来源:PyPI 软件包仓库
spaCy软件库3.7.2spacy==3.7.2
来源:PyPI 软件包仓库
英文自然语言处理模型NLP 模型en_core_web_sm 3.7.1(spaCy 模型包)en_core_web_sm==3.7.1;安装记录在 run_notes.txt 中
来源:spaCy 模型仓库
scikit-learn软件库1.4.2scikit-learn==1.4.2
来源:PyPI 软件包仓库
RapidFuzz软件库3.6.1RapidFuzz==3.6.1
来源:PyPI 软件包仓库
电子表格编辑器软件任何能够编辑 .xlsx 文件的软件用于查看/编辑 SourceRegister.xlsx、CorpusStats.xlsx、Candidates/Shortlist 文件
来源:通用(任意供应商)
纯文本编辑器软件任何能够编辑 .txt 和 .csv 文件的软件用于查看/编辑 logs/.txt 和 resources/.csv
来源:通用(任意供应商)
UTF-8 文本转换工具软件任何能够将文档导出为 UTF-8 纯文本的工具在步骤 2.3 中使用;具体方法记录在 run_notes.txt 中
来源:通用(任意供应商)
源注册模板文件模板SourceRegister.xlsx,包含字段:source_id、title、owner/publisher、language、genre、access_date、license_note冻结为 outputs/SourceRegister_v1.xlsx
来源:本研究创建
语料库统计模板文件模板CorpusStats.xlsx,包含字段:source_id、lang、n_chars_before、n_chars_after、timestamp、cleaning_ruleset在步骤 3.6 中生成
来源:本研究创建
中文用户词典资源文件resources/userdict_zh.txt(用于支持分词的领域特定术语列表)保存了冻结副本;校验和记录在 thresholds.txt 中
来源:本研究创建/整理
领域关键词映射表资源文件resources/domain_keywords.csv,包含 domain_tag 优先级规则冻结为 outputs/domain_keywords_v1.csv;校验和记录在 alignment_log.txt 中
来源:本研究创建/整理
中英术语映射表资源文件resources/term_map_zh2en.xlsx,包含列 term_zh 和 term_zh_en冻结为 outputs/term_map_zh2en_v1.xlsx;覆盖率记录在 alignment_log.txt 中
来源:本研究创建/整理
阈值日志日志文件logs/thresholds.txt(模式、阈值、库版本、资源校验和)确定性重运行所必需
来源:本研究生成
对齐日志日志文件logs/alignment_log.txt(权重、k、截断值、向量化器设置、映射覆盖率、映射校验和)确定性重运行所必需
来源:本研究生成
标注表单文件模板validation/Annotation.xlsx(pair_id、term_zh、term_en、S、decisions、adjudication、rationale)在步骤 6.6 后冻结为 outputs/Annotation_v1.xlsx
来源:本研究创建
评估输出输出文件outputs/Evaluation.xlsx(原始一致性、Cohen’s κ、总计)在步骤 6.4 中生成
来源:本研究生成
最终词典导出输出文件outputs/FinalLexicon.xlsx,遵循表 2 的模式在步骤 7.2 中生成
来源:本研究生成
TBX 导出文件输出文件由 FinalLexicon.xlsx 生成的 TBX 文件,具有稳定的 entry_id 映射验证结果记录在 run_notes.txt 中
来源:本研究生成

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learni....

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233 TBX

相关文章