Artigo de método

Um Protocolo Reproduzível para Construção de um Léxico de Turismo Cultural Cerâmico Chinês-Inglês usando Corpora Registrados

DOI:

10.3791/71320

3 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo constrói um léxico cultural cultural chineso-inglês usando corpora bilíngues registrados, limpeza padronizada, extração de termos candidatos, alinhamento por similaridade e validação de especialistas com adjudicação. Usando esse fluxo de trabalho, 60 entradas verificadas foram exportadas com definições, exemplos de uso, registros de proveniência e saídas compatíveis com TBX.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Construir recursos terminológicos bilíngues para o turismo cultural cerâmico é desafiador porque textos relevantes são frequentemente fragmentados, as escolhas de tradução são inconsistentes e os fluxos de trabalho de construção reutilizáveis raramente são documentados. Este protocolo apresenta um fluxo de trabalho reproduzível e passo a passo para construir um léxico cultural cultural cerâmico chinês-inglês por meio do registro e limpeza de corpus, extração de termos candidatos, alinhamento bilíngue e validação de especialistas com adjudicação. Aplicado a um corpus bilíngue registrado, o fluxo de trabalho gerou termos selecionados para candidatos em chinês e inglês, produziu pares de termos bilíngues ranqueados e manteve alinhamentos validados após revisão independente de especialistas. O léxico finalizado exportou 60 entradas verificadas com formulários bilíngues, tags de domínio, tipos de tradução, definições bilíngues, exemplos de uso, registros de proveniência e saídas interoperáveis como arquivos Excel e TBX. Para apoiar transparência e reexecução, o protocolo também registra limiares, versões de pacotes, recursos congelados e decisões de validação ao longo de todo o fluxo de trabalho. Isso torna o procedimento auditável e mais fácil de adaptar a outros domínios do turismo patrimonial. Quando transferido para um novo domínio, os usuários podem estender a lista de palavras-chave do domínio, atualizar o recurso bilíngue de mapeamento e ajustar um pequeno número de limiares de lista curta e similaridade de acordo com o tamanho do corpus e densidade terminológica.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O turismo cultural tornou-se um importante motor do desenvolvimento de destinos, à medida que os viajantes buscam cada vez mais experiências baseadas no patrimônio que sejam significativas, em vez de puramenterecreativas. Nos níveis de políticas e indústria, organizações internacionais têm enfatizado repetidamente o valor de conectar o turismo à cultura e melhorar a interpretação, documentação e comunicação entre diversos bens patrimoniais. Dentro desse contexto mais amplo, o turismo cultural cerâmico é especialmente denso em terminologia, pois visitantes frequentemente encontram conceitos especializados relacionados a materiais, processos de esmalte e queima, tecnologias de fornos, motivos estilísticos, tipos de artefatos e narrativas de processos artesanais. Esses termos frequentemente carregam significados técnicos que não são facilmente transmitidos por meio de paráfrases casuais, e escolhas de tradução podem moldar diretamente o que os visitantes entendem a partir de rótulos, interpretações guiadas e materiaiseducacionais 2. Ao mesmo tempo, os marcos patrimoniais enfatizam que a salvaguarda do patrimônio cultural imaterial depende da transmissão sustentada do conhecimento e da conscientização pública, ambas exigindo uma linguagem precisa, acessível e contextualmente adequada para interpretação eeducação 3.

Apesar dessa demanda, os recursos de terminologia bilíngue para o turismo cultural cerâmico continuam fragmentados e inconsistentes. Em etiquetas de museus, textos de exposições, páginas de guias turísticos e descrições de patrimônio, o mesmo conceito pode ser representado de forma diferente entre instituições, regiões e ambientescomunicativos 4. Essa variação não é meramente estilística. Pode afetar a compreensão do visitante, reduzir a comparabilidade das descrições entre os sítios e enfraquecer a credibilidade percebida da comunicação sobrepatrimônio 5. Pesquisas terminológicas há muito argumentam que recursos temporários de alta qualidade devem ser orientados a conceitos, apoiados por definições explícitas e ancorados em evidências rastreáveis, como fontes, contextos e registros de controlede qualidade 6. No entanto, muitas equipes de domínio ainda carecem de um fluxo de trabalho que possa transformar sistematicamente textos dispersos em um léxico bilíngue curado, preservando regras de decisão transparentes, procedimentos reproduzíveis e saídasreutilizáveis 7. Comparado à compilação manual ad hoc, um protocolo padronizado oferece documentação mais clara, validação mais consistente e melhores condições para atualização, auditoria e reutilização entre instituições.

Para enfrentar esses desafios, um protocolo prático para a construção de léxicos bilíngues precisa organizar duas tarefas interligadas: descoberta de termos candidatos e alinhamento bilíngue. Para a descoberta de termos, a extração automática baseada em corpus pode reduzir a dependência da coleta totalmente manual ao combinar padrões linguísticos com evidências estatísticas, facilitando a identificação de terminologia relevante para o domínio na escala8. Em contextos de patrimônio cultural, entretanto, a construção de corpus raramente é simples. Os materiais fonte frequentemente diferem em estilo, registro e propósito comunicativo, podendo conter nomes específicos de domínio e convenções descritivasmistas 9. Essas características tornam o registro transparente de parâmetros e regras de processamento estáveis especialmente importantes. Para alinhamento bilíngue, métodos computacionais podem gerar pares candidatos classificados entre línguas comparando formas de termos e seus contextos de uso ao redor, após o que especialistas do domínio podem verificar se os pares propostos são conceitualmenteapropriados 10. Neste protocolo, a automação é usada para gerar e ranquear candidatos plausíveis primeiro, enquanto a revisão de especialistas é usada para confirmá-los ou rejeitá-los posteriormente. Essa combinação melhora a eficiência sem remover o julgamento interpretativo da decisão final. Como a terminologia do patrimônio frequentemente carrega implicações culturais e educacionais, os revisores devem ser capazes de inspecionar as evidências por trás de cada par proposto, em vez de depender de um resultadoopaco 11.

Aqui, é apresentado um protocolo passo a passo e auditável para a construção de um léxico cultural cultural cerâmico chinês-inglês a partir de fontes de texto registradas. O fluxo de trabalho padroniza o registro e a limpeza de corpus, extração bilíngue de candidatos a corpos, geração de pares ranqueados, revisão com dois anotadores com adjudicação e conclusão da entrada final sob um esquema fixo. Ao integrar registro de versões, controle de limiar, recursos congelados e validação de especialistas, o protocolo melhora a reprodutibilidade, auditabilidade e padronização em relação a fluxos de trabalho menos estruturados para construção de terminologia. Para apoiar o reuso de longo prazo na gestão terminológica e na prática de tradução, o léxico finalizado também pode ser exportado no formato TermBase eXchange (TBX), um padrão alinhado à ISO para troca estruturada de dadosterminológicos 12.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utilizou apenas dados textuais públicos ou autorizados pela instituição e não envolveu indivíduos humanos ou animais. Não era necessária aprovação ética institucional.

1. Criar o espaço de trabalho do projeto

  1. Crie uma pasta de projeto e as seguintes subpastas: corpus_raw, corpus_clean, candidatos, alinhamento, validação, saídas, logs e recursos.
  2. Crie o log de execução e registre as configurações do ambiente.
    1. Crie logs/run_notes.txt.
    2. Registre a data/hora da execução, a versão do sistema operacional e o escopo do projeto como "terminologia cultural cultural chinesa-inglesa".
    3. Defina o interpretador de Python para Python 3.11 e registre essas informações em logs/run_notes.txt.
  3. Execute python -m pip freeze > logs/pip_freeze.txt e confirme que logs/pip_freeze.txt foram gerados e não estãovazios 13.
  4. Crie o arquivo de dependência e instale o ambiente de software.
    1. Crie recursos/requirements.txt.
    2. Liste as versões principais dos pacotes usados neste protocolo da seguinte forma: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 e RapidFuzz==3.6.1.
    3. Registre o comando de instalação nos logs/run_notes.txt.
    4. Instalar en_core_web_sm==3.7.1. 1.4.5 Execute python -m spacy valide e registre a versão validada do modelo em logs/run_notes.txt.
      NOTA: Confirme que tanto os logs/pip_freeze.txt quanto os logs/run_notes.txt existem e não estão vazios antes de prosseguir.

2. Compilar um corpus bilíngue equilibrado e registrar fontes

  1. Selecione fontes para corresponder à composição bilíngue e de gênero mostrada na Tabela 1 e atribua a cada documento uma source_id única, como S001 ou S00214.
  2. Crie SourceRegister.xlsx e registre para cada documento, source_id, título, proprietário/editor, idioma, gênero, access_date e license_note.
  3. Converta cada documento para texto simples UTF-8, nomeie cada arquivo como source_id_lang.txt (por exemplo, S001_zh.txt ou S001_en.txt) e salve os arquivos em corpus_raw.
  4. Salve uma cópia congelada do registrador como saídas/SourceRegister_v1.xlsx e registre a data de congelamento e os totais do documento (n_docs_zh e n_docs_en) em logs/run_notes.txt.
    NOTA: O protocolo pode ser pausado aqui. Se retomar mais tarde, não mude nenhuma source_id tarefa.
    ATENÇÃO: Use apenas textos acessíveis publicamente ou autorizados pela instituição. Não redistribua textos completos protegidos por direitos autorais sem permissão explícita.

3. Limpar e normalizar arquivos de corpus

  1. Remova linhas apenas de navegação, linhas apenas de URL e cabeçalhos ou rodapés duplicados repetidos em pelo menos três documentos. Mantenha todas as linhas restantes na ordemoriginal 15.
  2. Mantenha a pontuação que pode fazer parte de termos multipalavras ou compostos durante a limpeza, incluindo o hífen (-), barra (/), parênteses (( e )) e ponto do meio (·).
  3. Normalize o texto chinês convertendo caracteres alfanuméricos de largura total para caracteres de meia largura e padronizando as formas de colchete para ( e ).
  4. Normalize o texto em inglês colapsando espaços em branco repetidos em um único espaço e padronizando todas as variantes de hífen para o hífen ASCII (-), preservando os compostos hifenizados.
  5. Salve cada arquivo limpo em corpus_clean usando o mesmo nome source_id_lang.txt de arquivo que em corpus_raw.
  6. Registre source_id, lang, n_chars_before, n_chars_after, carimbo de tempo e cleaning_ruleset definido como v1.0 nas saídas/CorpusStats.xlsx16.
    NOTA: Para cada linguagem, verifique se cada arquivo em corpus_raw possui um arquivo limpo correspondente em corpus_clean com o mesmo sufixo de source_id e idioma.
    ATENÇÃO: Remova informações pessoais como nomes, números de telefone e endereços de e-mail durante o pré-processamento caso tais informações apareçam no texto bruto.

4. Extrair termos candidatos em chinês e inglês

  1. Segmente o texto chinês usando jieba versão 0.42.1 com os recursos/userdict_zh.txt fixos do dicionário do usuário e mantenha os candidatos que correspondam a 2–8 caracteres chineses consecutivos ou 2–6 caracteres chineses separados por um delimitadorretido 17.
  2. Processe texto em inglês usando spaCy versão 3.7.2 com en_core_web_sm versão 3.7.1 e mantenha apenas frases nominais e compostos hifenizados contendo 1–5 tokens18.
  3. Calcule a frequência como o número total de ocorrências de cada candidato em todo o corpus limpo e calcule doc_freq como o número de arquivos de source_id distintos contendo esse candidato pelo menos uma vez.
  4. Aplique os limiares da lista curta mantendo apenas candidatos com doc_freq ≥ 2 e frequência ≥ 3 e descarte os demaiscandidatos 19.
    NOTA: Esses limites da lista curta foram selecionados para um corpus relativamente pequeno e equilibrado em gêneros. Para corpora maiores ou mais heterogêneos, os limites podem ser ajustados após a inspeção do piloto.
  5. Exporte candidatos/Candidates_ZH.xlsx e candidatos/Candidates_EN.xlsx com as colunas termo, frequência, doc_freq, example_source_id e example_snippet.
  6. Exportar candidatos/Shortlist_ZH.xlsx e candidatos/Shortlist_EN.xlsx usando as mesmas colunas, com trechos em chinês mostrados como ±20 caracteres e trechos em inglês como ±10 tokens em torno de uma ocorrência atestada.
  7. Registre os nomes e versões do tokenizador ou tagger, padrões de candidatos e limiares de lista curta em logs/thresholds.txt.
  8. Calcule uma soma de verificação para recursos/userdict_zh.txt, registre em logs/thresholds.txt e salve uma cópia congelada como saídas/userdict_zh_v1.txt20.
    NOTA: Abra Shortlist_ZH.xlsx e Shortlist_EN.xlsx e confirme que ambos os arquivos contêm linhas diferentes de zero e campos example_snippet preenchidos.

5. Gerar candidatos bilíngues de alinhamento e classificar pares de termos

  1. Para cada termo chinês pré-selecionado, colete janelas de contexto de ±20 caracteres chineses ao redor de cada ocorrência e concatene até cinco janelas para formar uma cadeia de contexto chamada ctx_zh.
  2. Para cada termo em inglês selecionado, colete janelas de contexto de ±10 tokens ao redor de cada ocorrência e concatene até cinco janelas para formar uma string de contexto chamada ctx_en.
  3. Crie e congele o recurso de mapeamento bilíngue.
    1. Crie recursos/term_map_zh2en.xlsx com as colunas term_zh e term_zh_en.
    2. Preencha o arquivo usando um processo autorizado, como glossários institucionais existentes, listas de termos bilíngues previamente aceitas e normalização baseada em regras.
    3. Salve o mapeamento congelado como saídas/term_map_zh2en_v1.xlsx.
    4. Registre a data de congelamento, mapeando a cobertura e registrando a soma de verificação nos logs/alignment_log.txt. NOTA: Ao adaptar esse fluxo de trabalho para um novo domínio, comece o recurso de mapeamento com uma lista inicial de termos de domínio de alta frequência e expanda a tabela entre reprises completas, em vez de durante a pontuação.
  4. Mapear cada term_zh para uma forma compatível em inglês term_zh_en usando o mapeamento congelado e manter o mesmo recurso de mapeamento durante toda aexecução 21.
  5. Gerar ctx_zh_en aplicando o mapeamento congelado a ctx_zh, substituindo ocorrências de term_zh correspondidas por term_zh_en enquanto deixa todo o outro texto inalterado.
  6. Registre o procedimento de mapeamento e normalização.
    1. Registre o procedimento de mapeamento em logs/alignment_log.txt.
    2. Registre todas as regras de normalização, incluindo minúsculas e normalização de hífen, em logs/alignment_log.txt.
  7. Calcule a pontuação de similaridade de strings S_str usando a versão 3.6.1 do RapidFuzz token_sort_ratio para comparar cadeias de termos em inglês normalizadas entre term_zh_en e term_en e divida o resultado por 100 para escalar a pontuação até a faixa [0, 1]22.
  8. Calcule a pontuação de similaridade de contexto S_ctx.
    1. Use scikit-learn versão 1.4.2 e TfidfVectorizer com parâmetros fixos minúsculas=True, ngram_range=(1, 2), min_df=1, max_df=0,95 e stop_words="english"23.
    2. Ajuste o vetorizador no conjunto combinado de cadeias de ctx_en e ctx_zh_en da execução atual.
    3. Calcule S_ctx como a similaridade cosseno entre cada ctx_zh_en cadeia e cada ctx_en cadeia.
      NOTA: O TF-IDF representa a importância relativa das palavras e frases curtas em cada janela de contexto, e a similaridade cosseno é usada para comparar as representações contextuais resultantes.
  9. Calcule a pontuação final de similaridade e ranqueie os pares candidatos.
    1. Calcule a pontuação final como S = 0,60 × S_str + 0,40 × S_ctx.
    2. Para cada termo em chinês, mantenha os k = 3 melhores candidatos em inglês classificados por S.
    3. Remova duplicados mantendo a instância de maior pontuação para cada par único (term_zh, term_en).
    4. Registre k, os pesos da pontuação e o número total de pares exportados em logs/alignment_log.txt24.
      NOTA: O esquema de ponderação e o valor de k foram selecionados para manter um conjunto de revisão gerenciável, preservando alternativas plausíveis. Para corpora maiores ou terminologia mais variável, essas configurações podem ser ajustadas após testes piloto.
  10. Atribua valores domain_tag usando o mapa de palavras-chave fixo recursos/domain_keywords.csv e a seguinte ordem de prioridade: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    NOTA: Ao transferir o fluxo de trabalho para outro domínio de assunto, substitua o mapa de palavras-chave e revise a ordem de prioridade antes de reexecutar todo o pipeline.
  11. Salve uma cópia congelada do mapa de palavras-chave como saídas/domain_keywords_v1.csv e registre sua soma de verificação em logs/alignment_log.txt.
  12. Exporte alinhamento/AlignmentPairs.xlsx com as colunas pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en e evidence_snippet_zh_en.
  13. Rotule cada par como auto_accept, revisão ou auto_reject usando os seguintes cortes: S ≥ 0,90, 0,75 ≤ S ≤ 0,89, e S < 0,75, e registre os cortes e contagens em cada grupo de rótulos em logs/alignment_log.txt.
    NOTA: Em um ambiente desktop padrão comparável ao utilizado neste estudo, a geração de contexto, o ajuste TF-IDF e a pontuação de similaridade para um corpus desse tamanho foram concluídos em poucos minutos.
    NOTA: Inspecione aleatoriamente pelo menos 10 linhas em AlignmentPairs.xlsx e confirme que evidence_snippet_zh_en está presente e que term_zh_en não está vazio para casos mapeados.
    ATENÇÃO: Mantenha todos os recursos de mapeamento fixos dentro de uma run. Não atualize a tabela de mapeamento bilíngue ou o mapa de palavras-chave após o início da pontuação.

6. Verificar pares de termos por anotação e adjudicação de especialistas

  1. Crie validação/Annotation.xlsx com as colunas pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, adjudicação e justificativa.
  2. Prepare uma diretriz de anotação de uma página definindo equivalência conceitual no turismo cultural cerâmico, traduções explicativas aceitáveis e casos de exclusão como sobreposição parcial, renderizações excessivamente genéricas e tipos de artefatosincompatíveis 26.
  3. Instrua dois anotadores a rotularem cada par independentemente como incluir ou excluir usando os trechos de evidências fornecidos, e não permita que os anotadores vejam as decisões uns dos outros.
  4. Revise todas as discordâncias após anotação independente e registre a decisão final e uma justificativa de uma frase nas colunas de julgamento e justificativa.
  5. Calcule a concordância bruta e o κ de Cohen usando os rótulos de inclusão e exclusão e registre as métricas de concordância e os totais de inclusão e exclusão em saídas/Evaluation.xlsx27.
  6. Revise os pares excluídos para identificar padrões sistemáticos de falsos positivos e salve os padrões rejeitados mais frequentes em logs/rule_update_v1.txt.
  7. Salve uma cópia congelada do arquivo de anotação concluído como saídas/Annotation_v1.xlsx e não mude os rótulos adjudicados após esse ponto.
    NOTA: O protocolo pode ser pausado aqui. Se retomar depois, não revise nenhuma decisão de validação congelada.

7. Finalizar o léxico e exportar

  1. Preencha o léxico final usando os campos de entrada resumidos na Tabela 2, incluindo formulários de termos bilíngues, classes gramaticais, tags de domínio, tipo de tradução, definições bilíngues, exemplos de uso, informações de proveniência e indicadores de qualidade.
  2. Use os mesmos valores de entry_id em todas as exportações e confirme a consistência do identificador antes da geração do arquivo.
  3. Exporte a planilha final como saídas/FinalLexicon.xlsx e verifique se todos os campos necessários estão preenchidos antes de salvar.
  4. Gerar e validar a exportação TBX.
    1. Gerar um arquivo TBX usando os mesmos valores de entry_id para preservar a rastreabilidade.
    2. Valide o arquivo TBX em relação ao esquema TBX pretendido.
    3. Registre o resultado da validação nos logs/run_notes.txt28.
  5. Arquive todos os logs, arquivos de parâmetros, recursos congelados e saídas nas saídas/Lexicon_v1/ da pasta versionada e registre a data do arquivo e a contagem de arquivos em logs/run_notes.txt.
  6. Forneça os scripts, recursos congelados e logs de parâmetros como Arquivos Suplementares, incluindo saídas/userdict_zh_v1.txt, saídas/domain_keywords_v1.csv, saídas/term_map_zh2en_v1.xlsx, logs/thresholds.txt e logs/alignment_log.txt.
  7. Forneça um subconjunto de verificação do corpus com autorização usando a mesma estrutura de arquivos e esquema de saída, para que os leitores possam reproduzir o fluxo de trabalho no subconjunto29 liberado.
    ATENÇÃO: Antes de compartilhar materiais suplementares, confirme que nenhum texto completo protegido por direitos autorais, identificadores sensíveis ou recursos institucionais não autorizados está incluído no pacote de liberação.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rendimento de montagem e limpeza de corpos
Seguindo o desenho do corpus mostrado na Tabela 1, um corpus bilíngue registrado foi montado a partir de textos de museus e exposições, descrições patrimoniais e materiais turísticos voltados para o público. Após a limpeza, o corpus compreendia 12 documentos chineses e 8 documentos em inglês, totalizando 47.843 caracteres chineses e 32.193 caracteresingleses (30). O corpus manteve a co...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O principal valor desse protocolo está em sua capacidade de transformar uma tarefa terminológica que muitas vezes é tratada informalmente em um fluxo de trabalho reproduzível e revisável. No turismo cultural cerâmico, muitos termos são tanto técnicos quanto interpretativos: referem-se não apenas a materiais, tipos de fornos, estágios de queima ou estilos decorativos, mas também a como esses conceitos são comunicados aos visitantes em rótulos, narrativas e materiaiseduca...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não possuem interesses financeiros ou não financeiros concorrentes relacionados a esta obra.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem aos profissionais do turismo cultural cerâmico e à equipe do museu que forneceram acesso a materiais textuais e feedback do domínio durante a construção e validação do corpus. Os autores também agradecem aos dois anotadores independentes de domínio pela análise cuidadosa dos candidatos a alinhamento e pelos comentários construtivos sobre o design da entrada. Esse trabalho foi apoiado pelo Projeto de Pesquisa da Associação de Ensino Superior de Jiangxi intitulado "Estudo sobre Tradução Inteligente para o Inglês da Terminologia do Turismo Cerâmico Chinês Baseado no DeepSeek e seu Modelo de Disseminação Multicanal" (Grant No. WY-D-115).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Computer workstationHardwareQualquer computador moderno capaz de executar Python 3.11 e processar corpora de texto; ≥8 GB RAM recomendadoNenhum número de catálogo necessário
Origem: Genérico (qualquer fornecedor)
Sistema operacionalSoftwareWindows 10/11, macOS, ou Linux (registre a versão exata do SO em logs/run_notes.txt)Versão registrada em run_notes.txt
Origem: Instalado no sistema
PythonSoftwarePython 3.11Versão registrada em logs/pip_freeze.txt
Origem: Distribuição da Python Software Foundation
jiebaBiblioteca de software0.42.1jieba==0.42.1
Origem: Repositório de pacotes PyPI
spaCyBiblioteca de software3.7.2spacy==3.7.2
Origem: Repositório de pacotes PyPI
Modelo de pipeline em inglêsModelo de NLPen_core_web_sm 3.7.1 (pacote de modelo spaCy)en_core_web_sm==3.7.1; instalação registrada em run_notes.txt
Origem: Repositório de modelos spaCy
scikit-learnBiblioteca de software1.4.2scikit-learn==1.4.2
Origem: Repositório de pacotes PyPI
RapidFuzzBiblioteca de software3.6.1RapidFuzz==3.6.1
Origem: Repositório de pacotes PyPI
Editor de planilhaSoftwareQualquer software capaz de editar arquivos .xlsxUsado para visualizar/editar SourceRegister.xlsx, CorpusStats.xlsx, arquivos Candidates/Shortlist
Origem: Genérico (qualquer fornecedor)
Editor de texto simplesSoftwareQualquer software capaz de editar arquivos .txt e.csvUsado para visualizar/editar logs/.txt e resources/.csv
Origem: Genérico (qualquer fornecedor)
Ferramenta de conversão de texto UTF-8SoftwareQualquer ferramenta capaz de exportar documentos para texto simples UTF-8Usado na Etapa 2.3; método exato registrado em run_notes.txt
Origem: Genérico (qualquer fornecedor)
Modelo SourceRegisterModelo de arquivoSourceRegister.xlsx com campos: source_id, title, owner/publisher, language, genre, access_date, license_noteCongelado como outputs/SourceRegister_v1.xlsx
Origem: Criado neste estudo
Modelo de estatísticas do corpusModelo de arquivoCorpusStats.xlsx com campos: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGerado durante a Etapa 3.6
Origem: Criado neste estudo
Dicionário de usuário chinêsArquivo de recursosresources/userdict_zh.txt (lista de termos específicos do domínio para suporte de segmentação)Cópia congelada salva; checksum registrado em thresholds.txt
Origem: Criado/curado neste estudo
Mapa de palavras-chave do domínioArquivo de recursosresources/domain_keywords.csv com regras de prioridade de domain_tagCongelado como outputs/domain_keywords_v1.csv; checksum registrado em alignment_log.txt
Origem: Criado/curado neste estudo
Tabela de mapeamento de termos chinês-inglêsArquivo de recursosresources/term_map_zh2en.xlsx com colunas term_zh e term_zh_enCongelado como outputs/term_map_zh2en_v1.xlsx; cobertura registrada em alignment_log.txt
Origem: Criado/curado neste estudo
Log de limiteArquivo de loglogs/thresholds.txt (padrões, limites, versões da biblioteca, checksums de recursos)Necessário para reexecuções determinísticas
Origem: Gerado neste estudo
Log de alinhamentoArquivo de loglogs/alignment_log.txt (pesos, k, cutoffs, configurações do vetorizador, cobertura do mapeamento, checksums do mapa)Necessário para reexecuções determinísticas
Origem: Gerado neste estudo
Planilha de anotaçãoModelo de arquivovalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisões, adjudicação, racionalização)Congelado como outputs/Annotation_v1.xlsx após a Etapa 6.6
Origem: Criado neste estudo
Saída de avaliaçãoArquivo de saídaoutputs/Evaluation.xlsx (acordo bruto, kappa de Cohen, totais)Produzido na Etapa 6.4
Origem: Gerado neste estudo
Exportação final do léxicoArquivo de saídaoutputs/FinalLexicon.xlsx seguindo o esquema da Tabela 2Produzido na Etapa 7.2
Origem: Gerado neste estudo
Exportação TBXArquivo de saídaArquivo TBX gerado a partir do FinalLexicon.xlsx com mapeamento entry_id estávelResultado de validação registrado em run_notes.txt
Origem: Gerado neste estudo

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

ComportamentoEdi o 233Edi o 233TodosEdi oValor VazioEdi oterminologia bil ngueconstru o de l xicoextra o autom tica de termosalinhamento de termos bil nguesvalida o por especialistasTBX TermBase eXchangeinterpreta o do patrim nio culturaltradu o chin s ingl s

Artigos relacionados