Article de méthode

Un protocole reproductible pour la construction d’un lexique culturel céramique chinois-anglais utilisant des corpus enregistrés

DOI :

10.3791/71320

3 juillet 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole construit un lexique de tourisme culturel céramique sino-anglais utilisant des corpus bilingues enregistrés, un nettoyage standardisé, l’extraction des termes candidats, l’alignement par similarité et la validation par expert par adjudication. Grâce à ce flux de travail, 60 entrées vérifiées ont été exportées avec des définitions, des exemples d’utilisation, des enregistrements de provenance et des sorties compatibles TBX.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Construire des ressources terminologiques bilingues pour le tourisme culturel céramique est difficile car les textes pertinents sont souvent fragmentés, les choix de traduction incohérents et les flux de travail de construction réutilisables sont rarement documentés. Ce protocole présente un flux de travail reproductible, étape par étape, pour construire un lexique culturel céramique chinois-anglais via l’enregistrement et le nettoyage des corpus, l’extraction des termes candidats, l’alignement bilingue et la validation par un expert avec jugement. Appliqué à un corpus bilingue enregistré, le flux de travail générait des termes candidats présélectionnés en chinois et en anglais, produisait des paires de mots bilingues classées et conservait les alignements validés après examen indépendant d’experts. Le lexique finalisé exportait 60 entrées vérifiées avec des formulaires de terme bilingues, des balises de domaine, des types de traduction, des définitions bilingues, des exemples d’usage, des enregistrements de provenance et des sorties interopérables telles que des fichiers Excel et TBX. Pour soutenir la transparence et la réexécutabilité, le protocole enregistre également les seuils, les versions des paquets, les ressources gelées et les décisions de validation tout au long du flux de travail. Cela rend la procédure auditable et plus facile à adapter aux autres domaines du tourisme patrimonial. Lorsqu’ils sont transférés vers un nouveau domaine, les utilisateurs peuvent étendre la liste des mots-clés du domaine, mettre à jour la ressource bilingue de cartographie, et ajuster un petit nombre de seuils de liste restreinte et de similarité selon la taille du corpus et la densité terminologique.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le tourisme culturel est devenu un moteur important du développement des destinations, les voyageurs recherchant de plus en plus des expériences patrimoniales qui sont significatives plutôt que purementrécréatives. Au niveau des politiques et de l’industrie, les organisations internationales ont à plusieurs reprises souligné la valeur de lier le tourisme à la culture et d’améliorer l’interprétation, la documentation et la communication entre divers biens patrimoniaux. Dans ce contexte plus large, le tourisme culturel céramique est particulièrement riche en termes de terminologie, car les visiteurs rencontrent régulièrement des concepts spécialisés liés aux matériaux, aux émails et aux procédés de cuisson, aux technologies des fours, aux motifs stylistiques, aux types d’artefacts et aux récits de processus artisanaux. Ces termes contiennent souvent des significations techniques difficiles à transmettre par des paraphrases informelles, et les choix de traduction peuvent directement influencer ce que les visiteurs comprennent à partir des étiquettes, de l’interprétation guidée et des supportséducatifs 2. Parallèlement, les cadres patrimoniaux ont souligné que la sauvegarde du patrimoine culturel immatériel dépend d’une transmission durable des connaissances et d’une prise de conscience publique, qui nécessitent toutes deux une langue exacte, accessible et contextuellement appropriée pour l’interprétation et l’éducation3.

Malgré cette demande, les ressources terminologiques bilingues pour le tourisme culturel céramique restent fragmentées et incohérentes. À travers les étiquettes de musées, les textes d’exposition, les pages de guides touristiques et les descriptions patrimoniales, le même concept peut être rendu différemment selon les institutions, les régions et les contextesde communication 4. Une telle variation n’est pas seulement stylistique. Elle peut affecter la compréhension des visiteurs, réduire la comparabilité des descriptions entre les sites et affaiblir la crédibilité perçue de la communicationpatrimoniale 5. La recherche terminologique soutient depuis longtemps que les ressources termologiques de haute qualité doivent être orientées conceptuel, soutenues par des définitions explicites et ancrées dans des preuves traçables telles que les sources, les contextes et les dossiers de contrôlequalité 6. Cependant, de nombreuses équipes de domaine manquent encore d’un flux de travail capable de transformer systématiquement les textes dispersés en un lexique bilingue soigneusement sélectionné tout en préservant des règles de décision transparentes, des procédures reproductibles et des résultatsréutilisables 7. Comparé à la compilation manuelle ad hoc, un protocole standardisé offre une documentation plus claire, une validation plus cohérente et de meilleures conditions pour la mise à jour, l’audit et la réutilisation interinstitutionnelle.

Pour relever ces défis, un protocole pratique pour la construction du lexique bilingue doit organiser deux tâches liées : la découverte des termes candidats et l’alignement bilingue. Pour la découverte de termes, l’extraction automatique basée sur corpus peut réduire la dépendance à la collecte entièrement manuelle en combinant des motifs linguistiques avec des preuves statistiques, facilitant ainsi l’identification de terminologie pertinente pour le domaine àl’échelle 8. Dans les contextes du patrimoine culturel, cependant, la construction de corpus est rarement simple. Les sources diffèrent souvent par le style, le registre et l’objectif communicatif, et peuvent contenir des noms spécifiques à un domaine ainsi que des conventions descriptivesmixtes 9. Ces fonctionnalités rendent l’enregistrement transparent des paramètres et des règles de traitement stables particulièrement importantes. Pour l’alignement bilingue, les méthodes computationnelles peuvent générer des paires candidates inter-langues classées en comparant les formes de termes et leurs contextes d’utilisation environnants, après quoi les experts du domaine peuvent vérifier si les paires proposées sont conceptuellementappropriées 10. Dans ce protocole, l’automatisation est utilisée pour générer et classer d’abord les candidats plausibles, tandis que la revue d’experts sert à les confirmer ou à les rejeter par la suite. Cette combinaison améliore l’efficacité sans retirer le jugement interprétatif de la décision finale. Parce que la terminologie patrimoniale a souvent des implications culturelles et éducatives, les évaluateurs doivent pouvoir examiner les preuves derrière chaque paire proposée plutôt que de se fier à un résultatopaque 11.

Ici, un protocole étape par étape et auditable est présenté pour construire un lexique culturel céramique chinois-anglais à partir de sources textuelles enregistrées. Le flux de travail standardise l’enregistrement et le nettoyage des corpus, l’extraction bilingue des candidats en bilingüité, la génération de paires classées, la revue à deux annotateurs avec adjudication, et la complétion des saisies finales sous un schéma fixe. En intégrant la journalisation des versions, le contrôle des seuils, les ressources gelées et la validation experte, le protocole améliore la reproductibilité, l’auditabilité et la standardisation par rapport à des flux de travail moins structurés de construction terminologique. Pour soutenir une réutilisation à plus long terme dans la gestion terminologique et la traduction, le lexique finalisé peut également être exporté au format TermBase eXchange (TBX), une norme alignée ISO pour l’échange structuré de donnéesterminologiques 12.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude n’a utilisé que des données textuelles publiques ou autorisées par l’institution et n’a pas impliqué des sujets humains ou animaux. Aucune approbation éthique institutionnelle n’était requise.

1. Créer l’espace de travail du projet

  1. Créez un dossier projet ainsi que les sous-dossiers suivants : corpus_raw, corpus_clean, candidats, alignement, validation, sorties, journaux et ressources.
  2. Créez le journal de run et enregistrez les paramètres de l’environnement.
    1. Créez des journaux/run_notes.txt.
    2. Notez la date/heure de l’exécution, la version du système d’exploitation et l’étendue du projet sous forme de « terminologie chinoise-anglaise du tourisme culturel céramique ».
    3. Réglez l’interpréteur Python sur Python 3.11 et enregistrez ces informations dans des journaux/run_notes.txt.
  3. Exécutez python -m pip freeze > logs/pip_freeze.txt et confirmez que les logs/pip_freeze.txt ont été générés et ne sont pasvides 13.
  4. Créez le fichier de dépendance et installez l’environnement logiciel.
    1. Créez des ressources/requirements.txt.
    2. Listez les versions de base du package utilisées dans ce protocole comme suit : jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2, et RapidFuzz==3.6.1.
    3. Enregistrez la commande d’installation dans les journaux/run_notes.txt.
    4. Installer en_core_web_sm==3.7.1. 1.4.5 Exécuter python -m spacy valider et enregistrer la version validée du modèle dans des logs/run_notes.txt.
      REMARQUE : Confirmez que les logs/pip_freeze.txt et les logs/run_notes.txt existent et ne sont pas vides avant de continuer.

2. Compiler un corpus bilingue équilibré et enregistrer les sources

  1. Sélectionnez les sources pour correspondre à la composition bilingue et de genre indiquée dans le tableau 1 et attribuez à chaque document une source_id unique, comme S001 ou S00214.
  2. Créez SourceRegister.xlsx et enregistrez, pour chaque document, source_id, titre, propriétaire/éditeur, langue, genre, access_date et license_note.
  3. Convertissez chaque document en texte brut UTF-8, nommez chaque fichier comme source_id_lang.txt (par exemple, S001_zh.txt ou S001_en.txt), et enregistrez les fichiers dans corpus_raw.
  4. Enregistrez une copie figée du registre en sorties/SourceRegister_v1.xlsx et notez la date de gel ainsi que les totaux du document (n_docs_zh et n_docs_en) dans les logs/run_notes.txt.
    REMARQUE : Le protocole peut être mis en pause ici. Si vous reprenez plus tard, ne modifiez aucune source_id affectations.
    ATTENTION : Utilisez uniquement des textes accessibles au public ou autorisés par l’institution. Ne redistribuez pas de textes complets protégés par le droit d’auteur sans autorisation explicite.

3. Nettoyer et normaliser les fichiers de corpus

  1. Supprimez les lignes uniquement de navigation, les lignes uniquement URL, et les en-têtes ou pieds de page dupliqués répétés sur au moins trois documents. Gardez toutes les lignes restantes dans leur ordreinitial 15.
  2. Conservez la ponctuation qui peut faire partie de termes multi-mots ou composés lors du nettoyage, y compris le trait d’union (-), la barre oblique (/), les parenthèses ( et )) et le point du milieu (·).
  3. Normaliser le texte chinois en convertissant les caractères alphanumériques pleine largeur en caractères demi-largeur et en standardisant les formes entre crochets en ( et ).
  4. Normaliser le texte anglais en réduisant les espaces blancs répétés en un seul espace et en standardisant toutes les variantes de trait d’union au tiret ASCII (-) tout en préservant les composés composés par trait d’union.
  5. Sauvegardez chaque fichier nettoyé sur corpus_clean en utilisant le même nom source_id_lang.txt que dans corpus_raw.
  6. Enregistrez source_id, lang, n_chars_before, n_chars_after, horodatage et cleaning_ruleset réglés en v1.0 dans les sorties/CorpusStats.xlsx16.
    REMARQUE : Pour chaque langue, vérifiez que chaque fichier dans corpus_raw possède un fichier épuré correspondant dans corpus_clean avec le même suffixe source_id et langage.
    ATTENTION : Supprimez les informations personnelles telles que les noms, numéros de téléphone et adresses e-mail lors du prétraitement si ces informations apparaissent dans le texte brut.

4. Extraire les termes candidats en chinois et en anglais

  1. Segmentez le texte chinois en utilisant jieba version 0.42.1 avec les ressources/userdict_zh.txt du dictionnaire utilisateur fixes et gardez les candidats correspondant soit à 2 à 8 caractères chinois consécutifs, soit à 2 à 6 caractères chinois séparés par un délimiteurconservé 17.
  2. Traiter le texte anglais à l’aide de spaCy version 3.7.2 avec en_core_web_sm version 3.7.1 et ne garder que les syntagmes nominaux et composés composés contenant 1 à 5 jetons18.
  3. Calculez la fréquence comme le nombre total d’occurrences de chaque candidat sur le corpus nettoyé et calculez doc_freq comme le nombre de fichiers source_id distincts contenant ce candidat au moins une fois.
  4. Appliquez les seuils de la liste restreinte en ne gardant que les candidats avec doc_freq ≥ 2 et fréquence ≥ 3, puis écartez les candidatsrestants 19.
    REMARQUE : Ces seuils de liste restreinte ont été sélectionnés pour un corpus relativement petit et équilibré selon les genres. Pour des corpus plus grands ou plus hétérogènes, les seuils peuvent être ajustés après inspection pilote.
  5. Exportez candidats/Candidates_ZH.xlsx et candidats/Candidates_EN.xlsx avec les colonnes terme, fréquence, doc_freq, example_source_id et example_snippet.
  6. Exportez les candidats/Shortlist_ZH.xlsx et candidats/Shortlist_EN.xlsx en utilisant les mêmes colonnes, avec des extraits chinois affichés en ±20 caractères et en anglais en ±10 jetons autour d’un événement attesté.
  7. Notez les noms et versions du tokenizer ou du tagger, les modèles candidats et les seuils de la liste restreinte dans les journaux/thresholds.txt.
  8. Calculez une somme de contrôle pour les ressources/userdict_zh.txt, enregistrez-la dans les logs/thresholds.txt, et enregistrez une copie gelée en sorties/userdict_zh_v1.txt20.
    REMARQUE : Ouvrez Shortlist_ZH.xlsx et Shortlist_EN.xlsx et confirmez que les deux fichiers contiennent des lignes non nulles et des champs example_snippet remplis.

5. Générer des candidats d’alignement bilingue et classer les paires de termes

  1. Pour chaque terme chinois présélectionné, collectez des fenêtres contextuelles de ±20 caractères chinois autour de chaque occurrence et concaténez jusqu’à cinq fenêtres pour former une chaîne de contexte nommée ctx_zh.
  2. Pour chaque terme anglais présélectionné, collectez des fenêtres contextuelles de ±10 jetons autour de chaque occurrence et concaténez jusqu’à cinq fenêtres pour former une chaîne de contexte nommée ctx_en.
  3. Créez et gelez la ressource bilingue de cartographie.
    1. Créez des ressources/term_map_zh2en.xlsx avec les colonnes term_zh et term_zh_en.
    2. Peupler le fichier en utilisant un processus autorisé tel que les glossaires institutionnels existants, les listes de termes bilingues précédemment acceptées et la normalisation basée sur des règles.
    3. Sauvegardez le mappage figé en sorties/term_map_zh2en_v1.xlsx.
    4. Notez la date de gel, la cartographie de la couverture et enregistrez la somme de contrôle dans les journaux/alignment_log.txt. REMARQUE : Lors de l’adaptation de ce flux de travail à un nouveau domaine, commencez la ressource de mappage avec une liste de départ des termes du domaine haute fréquence et développez la table entre les rediffusions complètes plutôt que lors du score.
  4. Mappe chaque term_zh à une forme anglaise comparable term_zh_en utiliser la cartographie figée et conserve la même ressource de cartographie pour toute ladurée de 21.
  5. Générez ctx_zh_en en appliquant la correspondance figée à ctx_zh, en remplaçant les occurrences de term_zh correspondantes par term_zh_en tout en laissant tout le reste du texte inchangé.
  6. Enregistrez la procédure de cartographie et de normalisation.
    1. Enregistrez la procédure de cartographie dans les journaux/alignment_log.txt.
    2. Consignez toutes les règles de normalisation, y compris les minuscules et la normalisation du trait d’endroit, dans les journaux/alignment_log.txt.
  7. Calculez le score de similarité des chaînes S_str en utilisant RapidFuzz version 3.6.1 token_sort_ratio pour comparer les chaînes de termes anglais normalisés entre term_zh_en et term_en et divisez le résultat par 100 pour faire passer le score à la plage [0, 1]22.
  8. Calculez le score de similarité de contexte S_ctx.
    1. Utilisez scikit-learn version 1.4.2 et TfidfVectorizer avec les paramètres fixes minuscules=True, ngram_range=(1, 2), min_df=1, max_df=0,95 et stop_words="english"23.
    2. Ajustez le vectoriseur sur l’ensemble combiné des chaînes de ctx_en et ctx_zh_en de la course courante.
    3. Calculons S_ctx comme la similarité cosinus entre chaque ctx_zh_en chaîne et chaque ctx_en chaîne.
      REMARQUE : TF-IDF représente l’importance relative des mots et des expressions courtes dans chaque fenêtre de contexte, et la similarité cosinus est utilisée pour comparer les représentations contextuelles obtenues.
  9. Calculez le score final de similarité et classez les paires candidates.
    1. Calculez le score final comme S = 0,60 × S_str + 0,40 × S_ctx.
    2. Pour chaque trimestre chinois, conservez les k = 3 meilleurs candidats anglais classés par S.
    3. Supprimez les doublons en conservant l’instance la plus élevée pour chaque paire unique (term_zh, term_en).
    4. Enregistrez k, les pondérations des scores, et le nombre total de paires exportées en logs/alignment_log.txt24.
      REMARQUE : Le schéma de pondération et la valeur de k ont été sélectionnés pour maintenir un ensemble de revues gérable tout en préservant des alternatives plausibles. Pour des corpus plus volumineux ou une terminologie plus variable, ces réglages peuvent être ajustés après des tests pilotes.
  10. Attribuez domain_tag valeurs en utilisant la carte de mots-clés fixe ressources/domain_keywords.csv et l’ordre de priorité suivant : kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    REMARQUE : Lors du transfert du workflow vers un autre domaine thématique, remplacez la carte de mots-clés et révisez l’ordre de priorité avant de relancer l’intégralité du pipeline.
  11. Sauvegardez une copie figée de la carte de mots-clés en sorties/domain_keywords_v1.csv et enregistrez sa somme de contrôle dans les logs/alignment_log.txt.
  12. Exportez l’alignement/AlignmentPairs.xlsx avec les colonnes pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en et evidence_snippet_zh_en.
  13. Étiquetez chaque paire comme auto_accept, revue ou auto_reject en utilisant les seuils suivants : S ≥ 0,90, 0,75 ≤ S ≤ 0,89, et S < 0,75, et notez les seuils et les comptes dans chaque groupe d’étiquettes en logs/alignment_log.txt.
    REMARQUE : Sur un environnement de bureau standard comparable à celui utilisé dans cette étude, la génération de contexte, l’ajustement TF-IDF et la notation de similarité pour un corpus de cette taille ont été réalisés en quelques minutes.
    REMARQUE : Inspectez aléatoirement au moins 10 lignes dans AlignmentPairs.xlsx et confirmez que evidence_snippet_zh_en est présent et que term_zh_en est non vide pour les cas mappés.
    ATTENTION : Gardez toutes les ressources de cartographie fixes lors d’une partie. Ne mettez pas à jour la table de cartographie bilingue ou la carte des mots-clés après le début du score.

6. Vérifier les paires de termes par annotation d’expert et arbitrage

  1. Créez une validation/Annotation.xlsx avec les colonnes pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, adjudication et justification.
  2. Préparez une directive d’annotation d’une page définissant l’équivalence conceptuelle dans le tourisme culturel céramique, les traductions explicatives acceptables et les cas d’exclusion tels que les chevauchements partiels, les rendus trop génériques et les types d’artefacts26 décalés.
  3. Demandez à deux annotateurs d’étiqueter indépendamment chaque paire comme incluant ou excluant en utilisant les extraits de preuves fournis, et n’autorisez pas les annotateurs à consulter les décisions de l’autre.
  4. Examinez tous les désaccords après une annotation indépendante et notez la décision finale ainsi qu’une justification d’une phrase dans les colonnes d’adjudication et de justification.
  5. Calculez l’accord brut et le κ de Cohen en utilisant les étiquettes d’inclusion et d’exclusion et notez les métriques d’accord ainsi que les totaux d’inclusion et d’exclusion dans les sorties/Evaluation.xlsx27.
  6. Examinez les paires exclues pour identifier les schémas systématiques de faux positifs et sauvegardez les schémas les plus fréquemment rejetés dans les logs/rule_update_v1.txt.
  7. Sauvegardez une copie figée du fichier d’annotation complété en sorties/Annotation_v1.xlsx et ne changez pas les étiquettes arbitrées après ce point.
    REMARQUE : Le protocole peut être mis en pause ici. Si vous reprenez plus tard, ne révisez aucune décision de validation gelée.

7. Finaliser le lexique et exporter

  1. Remplissez le lexique final à l’aide des champs d’entrée résumés dans le tableau 2, incluant les formes de termes bilingues, la catégorie de langage, les tags de domaine, le type de traduction, les définitions bilingues, les exemples d’usage, les informations de provenance et les indicateurs de qualité.
  2. Utilisez les mêmes valeurs de entry_id pour toutes les exportations et confirmez la cohérence des identifiants avant la génération des fichiers.
  3. Exportez le tableau final en sorties/FinalLexicon.xlsx et vérifiez que tous les champs requis sont remplis avant de sauvegarder.
  4. Générez et validez l’exportation TBX.
    1. Générez un fichier TBX en utilisant les mêmes valeurs entry_id pour préserver la traçabilité.
    2. Validez le fichier TBX par rapport au schéma TBX prévu.
    3. Notez le résultat de validation dans les journaux/run_notes.txt28.
  5. Archivez tous les journaux, fichiers paramètres, ressources gelées et sorties dans les sorties/Lexicon_v1/ du dossier versionné, et enregistrez la date d’archive et le nombre de fichiers dans les journaux/run_notes.txt.
  6. Fournissez les scripts, les ressources figées et les journaux de paramètres sous forme de fichiers supplémentaires, incluant les sorties/userdict_zh_v1.txt, sorties/domain_keywords_v1.csv, sorties/term_map_zh2en_v1.xlsx, logs/thresholds.txt et logs/alignment_log.txt.
  7. Fournir un sous-ensemble de vérification du corpus avec autorisation en utilisant la même structure de fichiers et schéma de sortie afin que les lecteurs puissent reproduire le flux de travail sur le sous-ensemble29 publié.
    ATTENTION : Avant de partager des documents complémentaires, assurez-vous qu’aucun texte intégral protégé par le droit d’auteur, aucun identifiant sensible ou aucune ressource institutionnelle non autorisée n’est inclus dans le paquet de publication.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Assemblage et rendement du corps
Suivant le plan de corpus présenté dans le tableau 1, un corpus bilingue enregistré a été assemblé à partir de textes de musées et d’expositions, de descriptions patrimoniales et de documents touristiques destinés aux visiteurs. Après nettoyage, le corpus comprenait 12 documents chinois et 8 documents anglais, totalisant 47 843 caractères chinois et 32 193 caractères anglais30. Le corpus a conse...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La principale valeur de ce protocole réside dans sa capacité à transformer une tâche terminologique souvent traitée de manière informelle en un flux de travail reproductible et réexaminé. Dans le tourisme culturel céramique, de nombreux termes sont à la fois techniques et interprétatifs : ils désignent non seulement les matériaux, les types de fours, les étapes de cuisson ou les styles décoratifs, mais aussi la manière dont ces concepts sont communiqués aux visiteurs sous forme d’étiquet...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun intérêt financier ou non financier concurrent lié à cette œuvre.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs remercient les praticiens du tourisme culturel céramique et le personnel du musée qui ont donné accès à des documents textuels et à des retours de domaine lors de la construction et de la validation du corpus. Les auteurs remercient également les deux annotateurs indépendants de domaines pour leur examen minutieux des candidats d’alignement et leurs commentaires constructifs sur la conception des entrées. Ce travail a été soutenu par le projet de recherche de l’Association de l’enseignement supérieur du Jiangxi intitulé « Étude sur la traduction intelligente de l’anglais de la terminologie touristique céramique chinoise basée sur DeepSeek et son modèle de diffusion multicanal » (Grant No. WY-D-115).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Station de travail informatiqueMatérielTout ordinateur moderne capable d'exécuter Python 3.11 et de traiter des corpus textuels ; >=8 Go de RAM recommandésAucun numéro de catalogue requis
Source : Générique (n'importe quel fournisseur)
Système d'exploitationLogicielWindows 10/11, macOS ou Linux (enregistrer la version exacte du système d'exploitation dans logs/run_notes.txt)Version enregistrée dans run_notes.txt
Source : Installé sur le système
PythonLogicielPython 3.11Version enregistrée dans logs/pip_freeze.txt
Source : Distribution de la Fondation Python Software
jiebaBibliothèque logicielle0.42.1jieba==0.42.1
Source : Dépôt de packages PyPI
spaCyBibliothèque logicielle3.7.2spacy==3.7.2
Source : Dépôt de packages PyPI
Modèle de pipeline anglaisModèle NLPen_core_web_sm 3.7.1 (paquet de modèle spaCy)en_core_web_sm==3.7.1; installation enregistrée dans run_notes.txt
Source : Dépôt de modèles spaCy
scikit-learnBibliothèque logicielle1.4.2scikit-learn==1.4.2
Source : Dépôt de packages PyPI
RapidFuzzBibliothèque logicielle3.6.1RapidFuzz==3.6.1
Source : Dépôt de packages PyPI
Éditeur de tableurLogicielTout logiciel capable d'éditer des fichiers.xlsxUtilisé pour afficher/éditer SourceRegister.xlsx, CorpusStats.xlsx, fichiers Candidates/Shortlist
Source : Générique (n'importe quel fournisseur)
Éditeur de texte brutLogicielTout logiciel capable d'éditer des fichiers.txt et.csvUtilisé pour afficher/éditer logs/.txt et resources/.csv
Source : Générique (n'importe quel fournisseur)
Outil de conversion de texte UTF-8LogicielTout outil capable d'exporter des documents en texte brut UTF-8Utilisé à l'étape 2.3; méthode exacte enregistrée dans run_notes.txt
Source : Générique (n'importe quel fournisseur)
Modèle SourceRegisterModèle de fichierSourceRegister.xlsx avec les champs : source_id, title, owner/publisher, language, genre, access_date, license_noteCongelé sous la forme de outputs/SourceRegister_v1.xlsx
Source : Créé dans cette étude
Modèle de statistiques de corpusModèle de fichierCorpusStats.xlsx avec les champs : source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGénéré pendant l'étape 3.6
Source : Créé dans cette étude
Dictionnaire utilisateur chinoisFichier de ressourcesresources/userdict_zh.txt (liste de termes spécifiques au domaine pour le support de segmentation)Copie gelée sauvegardée; checksum enregistré dans thresholds.txt
Source : Créé/curé dans cette étude
Carte de mots-clés de domaineFichier de ressourcesresources/domain_keywords.csv avec des règles de priorité domain_tagCongelé sous la forme de outputs/domain_keywords_v1.csv; checksum enregistré dans alignment_log.txt
Source : Créé/curé dans cette étude
Table de correspondance de termes chinois-anglaisFichier de ressourcesresources/term_map_zh2en.xlsx avec les colonnes term_zh et term_zh_enCongelé sous la forme de outputs/term_map_zh2en_v1.xlsx; couverture enregistrée dans alignment_log.txt
Source : Créé/curé dans cette étude
Journal de seuilsFichier journallogs/thresholds.txt (modèles, seuils, versions de bibliothèque, checksums de ressources)Requis pour les réexécutions déterministes
Source : Généré dans cette étude
Journal d'alignementFichier journallogs/alignment_log.txt (poids, k, seuils, paramètres du vecteur, couverture de la carte, checksums de la carte)Requis pour les réexécutions déterministes
Source : Généré dans cette étude
Feuille d'annotationModèle de fichiervalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, décisions, adjudication, justification)Congelé sous la forme de outputs/Annotation_v1.xlsx après l'étape 6.6
Source : Créé dans cette étude
Sortie d'évaluationFichier de sortieoutputs/Evaluation.xlsx (accord brut, kappa de Cohen, totaux)Produit à l'étape 6.4
Source : Généré dans cette étude
Export final du lexiqueFichier de sortieoutputs/FinalLexicon.xlsx suivant le schéma du Tableau 2Produit à l'étape 7.2
Source : Généré dans cette étude
Export TBXFichier de sortieFichier TBX généré à partir de FinalLexicon.xlsx avec une correspondance stable entry_idRésultat de validation enregistré dans run_notes.txt
Source : Généré dans cette étude

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

ComportementNum ro 233Num ro 233TousNum roValeur videNum roterminologie bilingueconstruction de lexiquesextraction automatique de termesalignement terminologique bilinguevalidation par des expertsTBX TermBase eXchangeinterpr tation du patrimoine cultureltraduction chinois anglais

Articles connexes