このプロトコルは、登録されたバイリンガルコーパス、標準化された清掃、候補用語抽出、類似度ランキングのアラインメント、専門家による検証と裁定を用いて、中国・英語の陶磁文化観光語彙を構築します。このワークフローを用いて、60件の検証済みエントリーが定義、使用例、出所記録、TBX互換出力とともにエクスポートされました。
方法論記事
このプロトコルは、登録されたバイリンガルコーパス、標準化された清掃、候補用語抽出、類似度ランキングのアラインメント、専門家による検証と裁定を用いて、中国・英語の陶磁文化観光語彙を構築します。このワークフローを用いて、60件の検証済みエントリーが定義、使用例、出所記録、TBX互換出力とともにエクスポートされました。
陶芸文化観光のためのバイリンガル用語リソースを構築することは、関連するテキストが断片的であることが多く、翻訳の選択が一貫性がなく、再利用可能な建設ワークフローがほとんど文書化されていないため、困難です。本プロトコルは、コーパス登録とクレンジング、候補語抽出、バイリンガルアラインメント、専門家による検証と裁定を通じて、中国語・英語陶磁文化観光語彙を構築するための再現可能で段階的なワークフローを提供します。登録済みのバイリンガルコーパスに適用し、ワークフローは中国語と英語の候補用語を選び、ランク付けされたバイリンガル用語ペアを作成し、独立した専門家レビューの後も検証済みのアラインメントを維持しました。最終的な辞書は、バイリンガル用語フォーム、ドメインタグ、翻訳タイプ、バイリンガル定義、使用例、出所記録、ExcelやTBXファイルなどの相互運用可能な出力を含む60の検証済みエントリーをエクスポートしました。透明性と再実行性をサポートするため、プロトコルはワークフロー全体で閾値、パッケージバージョン、凍結リソース、検証決定も記録します。これにより、手続きは監査可能になり、他のヘリテージツーリズム分野への適応が容易になります。新しいドメインに移行すると、ユーザーはドメインキーワードリストを拡張し、バイリンガルマッピングリソースを更新し、コーパスサイズや用語密度に応じてショートリストや類似度の閾値を少数調整できます。
文化観光は、旅行者が単なるレクリエーションだけでなく意味のある遺産に基づく体験を求めるようになる中、目的地開発の重要な原動力となっています。政策および産業レベルでは、国際機関は観光と文化を結びつけ、多様な遺産資産間の解釈、記録、コミュニケーションを改善する価値を繰り返し強調しています。この広い文脈の中で、陶芸文化観光は特に用語が濃密です。なぜなら、訪問者は材料、釉薬や焼成工程、窯技術、様式モチーフ、工芸品の種類、工芸過程の物語に関する専門的な概念に頻繁に出会うからです。これらの用語はしばしば、カジュアルな言い換えでは伝えにくい技術的な意味を持ち、翻訳の選択によってラベルやガイド付き通訳、教育資料から訪問者が理解する内容が直接的に影響します。同時に、遺産枠組みは、無形文化遺産の保護は持続的な知識伝達と公共の意識向上に依存し、これらは正確でアクセスしやすく、解釈や教育に文脈に応じた文言を必要としていることを強調しています。
この需要にもかかわらず、陶芸文化観光のためのバイリンガル用語資源は断片的で一貫性に欠けています。博物館のラベル、展示テキスト、観光ガイドページ、遺産説明などを通じて、同じ概念が機関や地域、コミュニケーションの場によって異なる表現がされることがあります。このような変化は単なる様式的なものではありません。訪問者の理解に影響を及ぼし、場所間での説明の比較可能性を低下させ、遺産コミュニケーションの信頼性を弱める可能性があります。用語研究は長らく、高品質な用語資源は概念志向であり、明示的な定義に支えられ、出典、文脈、品質管理記録などの追跡可能な証拠に根ざすべきだと主張されてきました。しかし、多くのドメインチームは、分散したテキストを体系的にキュレーションされたバイリンガル語彙に変換しつつ、透明な意思決定ルール、再現可能な手順、再利用可能な出力を維持できるワークフローをまだ持っていません。アドホックマニュアル作成と比べて、標準化されたプロトコルはより明確な文書化、一貫した検証、そして更新、監査、機関間再利用のより良い条件を提供します。
これらの課題に対処するために、実用的なバイリンガル語彙構築のプロトコルは、候補語発見とバイリンガルアラインメントという2つの関連したタスクを整理する必要があります。用語発見においては、コーパスベースの自動抽出により、言語パターンと統計的証拠を組み合わせることで、完全な手動収集への依存を減らし、スケール8でドメイン関連用語の特定が容易になります。しかし、文化遺産の場では、コーパスの構築はめったに単純ではありません。ソース資料はスタイル、レジスター、コミュニケーション目的が異なり、ドメイン固有の名称や混合的な記述慣習を含むこともあります。これらの特徴により、透明なパラメータ記録や安定した処理ルールが特に重要になります。バイリンガルアライメントのために、計算手法は用語形式とその周囲の使用文脈を比較することでランク付けされた言語間候補ペアを生成することができ、その後、ドメイン専門家が提案されたペアが概念的に適切かどうかを検証できます。このプロトコルでは、まず妥当な候補者を生成・ランク付けするために自動化を用い、その後専門家による確認または拒否を行います。この組み合わせは、最終決定から解釈判断を奪うことなく効率を向上させます。遺産用語はしばしば文化的・教育的な意味合いを伴うため、レビュアーは不透明な結果に頼らず、各提案されたペアの背後にある証拠を検証できる必要があります11。
ここでは、登録されたテキストソースから中国・英語の陶芸文化観光語彙を構築するための段階的かつ監査可能なプロトコルを提示します。ワークフローは、コーパス登録とクレンジング、バイリンガル候補抽出、ランク付けペア生成、2アノテーターレビューと裁定、最終エントリーの完了を固定スキーマの下で標準化しています。バージョンログ、閾値管理、凍結リソース、専門家による検証を統合することで、このプロトコルは、より構造化されていない用語構築ワークフローに比べて再現性、監査可能性、標準化を向上させます。用語管理や翻訳の長期的な再利用を支援するために、最終化されたレキシコンは構造化用語交換のためのISOに準拠した標準であるTermBase eXchange(TBX)形式でエクスポートすることも可能です。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究は公開されているか機関が認可したテキストデータのみを使用し、人間や動物の被験者は含まれていません。機関の倫理的承認は必要ありませんでした。
1. プロジェクトワークスペースを作成する
2. バランスの取れたバイリンガルコーパスとレジスタ資料をまとめる
3. コーパスファイルのクリーンアップと正規化
4. 中国語と英語の候補用語を抽出する
5. バイリンガルのアラインメント候補を生成し、用語ペアをランク付けする
6. 専門的な注釈と裁定によって用語ペアの検証
7. 語彙の最終化とエクスポート
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
コーパス組み立てと洗浄収率
表1に示されたコーパス設計に従い、博物館や展示のテキスト、遺産説明、訪問者向けの観光資料から登録されたバイリンガルコーパスが作成されました。整理後、コーパスは中国文書12点と英語文書8点で構成され、合計47,843漢字と32,193漢字30。コーパスは技術的、解説的、観光志向の資料を意図した組み合わせを維持しました。最終的なコーパス構成は表1で定義された目標範囲に従っていました。
この段階での肯定的な結果は、安定したソース識別子、登録済みファイルとクリーンファイル間の完全な対応、そしてすべての文書で使用可能なクリーンテキストが特徴でした。否定的または最適でない結果は、クリーン化されたファイルの欠如、識別子の不一致、またはクリーニング後の過度なテキスト損失を伴う可能性が高いです。このようなケースは下流の期間のカバー範囲を減少させるため、...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このプロトコルの主な価値は、しばしば非公式に扱われる用語のタスクを再現可能でレビュー可能なワークフローに変換できる点にあります。陶芸文化観光において、多くの用語は技術的かつ解釈的でもあります。これらは材料、窯の種類、焼成段階、装飾様式だけでなく、ラベルや物語、教育資料で訪問者にどのように伝えられるかにも関わっています。そのため、この分野でのバイリンガルの多様性は小さな文体問題ではありません。訪問者の理解や、プラットフォームや機関を通じて文化的意味がどのように伝達されるかを変える可能性があります。このプロトコルは、固定された前処理ルール、凍結パラメータ、ランク付けされたバイリンガルアライメント、専門家による検証を単一の追跡可能なワークフローに組み合わせることで、この問題に対処しています。
この手法が確実に機能するためには、特にいくつかのステップが重要です。まず、コーパス登録、クリーニング、パラメータ凍結は、日常的な準備では...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者らは、この研究に関して競合する財務的または非財務的利害関係はないと宣言しています。
著者たちは、コーパス構築と検証の際にテキスト資料やドメインフィードバックへのアクセスを提供してくれた陶芸文化観光の実務者や博物館スタッフに感謝しています。著者らはまた、アライメント候補の慎重な審査とエントリーデザインに関する建設的なコメントをいただいた2人の独立ドメイン注釈者に感謝しています。この研究は、江西高等教育協会の「DeepSeekおよびその多チャネル普及モデルに基づく中国陶磁観光用語の知的英語翻訳研究」(助成金番号)の支援を受けました。WY-D-115)。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| コンピューターワークステーション | ハードウェア | Python 3.11を実行し、テキストコーパスを処理できる現代のコンピューター(8 GB RAM以上推奨) | カタログ番号は不要 ソース:汎用(任意のサプライヤー) |
| オペレーティングシステム | ソフトウェア | Windows 10/11、macOS、またはLinux(正確なOSバージョンをログ/run_notes.txtに記録) | バージョンはrun_notes.txtに記録 ソース:システムにインストール済み |
| Python | ソフトウェア | Python 3.11 | バージョンはlogs/pip_freeze.txtに記録 ソース:Python Software Foundationの配布 |
| jieba | ソフトウェアライブラリ | 0.42.1 | jieba==0.42.1 ソース:PyPIパッケージリポジトリ |
| spaCy | ソフトウェアライブラリ | 3.7.2 | spacy==3.7.2 ソース:PyPIパッケージリポジトリ |
| 英語パイプラインモデル | NLPモデル | en_core_web_sm 3.7.1(spaCyモデルパッケージ) | en_core_web_sm==3.7.1; インストールはrun_notes.txtに記録 ソース:spaCyモデルリポジトリ |
| scikit-learn | ソフトウェアライブラリ | 1.4.2 | scikit-learn==1.4.2 ソース:PyPIパッケージリポジトリ |
| RapidFuzz | ソフトウェアライブラリ | 3.6.1 | RapidFuzz==3.6.1 ソース:PyPIパッケージリポジトリ |
| スプレッドシートエディター | ソフトウェア | .xlsxファイルを編集できる任意のソフトウェア | SourceRegister.xlsx、CorpusStats.xlsx、Candidates/Shortlistファイルを見る/編集するために使用 ソース:汎用(任意のサプライヤー) |
| プレーンテキストエディター | ソフトウェア | .txtと.csvファイルを編集できる任意のソフトウェア | logs/.txtとresources/.csvを見る/編集するために使用 ソース:汎用(任意のサプライヤー) |
| UTF-8テキスト変換ツール | ソフトウェア | 文書をUTF-8プレーンテキストにエクスポートできる任意のツール | ステップ2.3で使用; 正確な方法はrun_notes.txtに記録 ソース:汎用(任意のサプライヤー) |
| SourceRegisterテンプレート | ファイルテンプレート | SourceRegister.xlsx(フィールド:source_id、title、owner/publisher、language、genre、access_date、license_note) | outputs/SourceRegister_v1.xlsxとして固定 ソース:この研究で作成 |
| コーパス統計テンプレート | ファイルテンプレート | CorpusStats.xlsx(フィールド:source_id、lang、n_chars_before、n_chars_after、timestamp、cleaning_ruleset) | ステップ3.6で生成 ソース:この研究で作成 |
| 中国語ユーザー辞書 | リソースファイル | resources/userdict_zh.txt(セグメンテーションサポートのためのドメイン固有の用語リスト) | 固定コピーが保存; checksumはthresholds.txtに記録 ソース:この研究で作成/キュレーション |
| ドメインキーワードマップ | リソースファイル | resources/domain_keywords.csv(domain_tag優先ルール付き) | outputs/domain_keywords_v1.csvとして固定; checksumはalignment_log.txtに記録 ソース:この研究で作成/キュレーション |
| 中国語から英語への用語マッピングテーブル | リソースファイル | resources/term_map_zh2en.xlsx(term_zhとterm_zh_enの列付き) | outputs/term_map_zh2en_v1.xlsxとして固定; カバレッジはalignment_log.txtに記録 ソース:この研究で作成/キュレーション |
| しきい値ログ | ログファイル | logs/thresholds.txt(パターン、しきい値、ライブラリバージョン、リソースチェックサム) | 決定論的な再実行に必要 ソース:この研究で生成 |
| アラインメントログ | ログファイル | logs/alignment_log.txt(重み、k、カットオフ、ベクトライザー設定、マッピングカバレッジ、マップチェックサム) | 決定論的な再実行に必要 ソース:この研究で生成 |
| アノテーションシート | ファイルテンプレート | validation/Annotation.xlsx(pair_id、term_zh、term_en、S、decisions、adjudication、rationale) | Step 6.6の後にoutputs/Annotation_v1.xlsxとして固定 ソース:この研究で作成 |
| 評価出力 | 出力ファイル | outputs/Evaluation.xlsx(生の合意、Cohen’s κ、合計) | Step 6.4で生成 ソース:この研究で生成 |
| 最終レキシコンエクスポート | 出力ファイル | outputs/FinalLexicon.xlsx(Table 2のスキーマに従う) | Step 7.2で生成 ソース:この研究で生成 |
| TBXエクスポート | 出力ファイル | FinalLexicon.xlsxから生成されたTBXファイル(安定したentry_idマッピング付き) | 検証結果はrun_notes.txtに記録 ソース:この研究で生成 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト