Artículo de método

Un protocolo reproducible para la construcción de un léxico de turismo cultural cerámico chino-inglés utilizando corpus registrados

DOI:

10.3791/71320

3 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo construye un léxico turístico cultural cerámico chino-inglés utilizando corpus bilingües registrados, limpieza estandarizada, extracción de términos candidatos, alineación por similitud y validación experta mediante adjudicación. Usando este flujo de trabajo, se exportaron 60 entradas verificadas con definiciones, ejemplos de uso, registros de procedencia y salidas compatibles con TBX.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Construir recursos de terminología bilingüe para el turismo cultural cerámico es un reto porque los textos relevantes suelen estar fragmentados, las elecciones de traducción son inconsistentes y los flujos de trabajo de construcción reutilizables rara vez se documentan. Este protocolo presenta un flujo de trabajo reproducible y paso a paso para construir un léxico cultural cultural cerámico chino-inglés mediante registro y limpieza de corpus, extracción de términos candidatos, alineación bilingüe y validación experta con adjudicación. Aplicado a un corpus bilingüe registrado, el flujo de trabajo generó términos candidatos seleccionados en chino e inglés, produjo pares de términos bilingües clasificados y mantuvo alineaciones validadas tras una revisión independiente de expertos. El léxico finalizado exportó 60 entradas verificadas con formularios bilingües, etiquetas de dominio, tipos de traducción, definiciones bilingües, ejemplos de uso, registros de procedencia y salidas interoperables como archivos Excel y TBX. Para apoyar la transparencia y la rerunability, el protocolo también registra umbrales, versiones de paquetes, recursos congelados y decisiones de validación a lo largo del flujo de trabajo. Esto hace que el procedimiento sea auditable y más fácil de adaptar a otros ámbitos del turismo patrimonial. Cuando se transfiere a un nuevo dominio, los usuarios pueden ampliar la lista de palabras clave del dominio, actualizar el recurso bilingüe de mapeo y ajustar un pequeño número de umbrales de lista corta y similitud según el tamaño del corpus y la densidad terminológica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El turismo cultural se ha convertido en un motor importante del desarrollo de destinos, ya que los viajeros buscan cada vez más experiencias basadas en el patrimonio que sean significativas en lugar de puramenterecreativas. A nivel de políticas e industria, las organizaciones internacionales han enfatizado repetidamente el valor de vincular el turismo con la cultura y mejorar la interpretación, la documentación y la comunicación entre diversos activos patrimoniales. Dentro de este contexto más amplio, el turismo cultural cerámico es especialmente denso en terminología porque los visitantes se encuentran regularmente con conceptos especializados relacionados con materiales, procesos de esmalte y cocción, tecnologías de hornos, motivos estilísticos, tipos de artefactos y narrativas de procesos artesanales. Estos términos suelen tener significados técnicos que no se transmiten fácilmente mediante una paráfrasis casual, y las elecciones de traducción pueden moldear directamente lo que los visitantes entienden a partir de las etiquetas, la interpretación guiada y los materialeseducativos 2. Al mismo tiempo, los marcos del patrimonio han subrayado que la salvaguardia del patrimonio cultural inmaterial depende de la transmisión sostenida del conocimiento y la concienciación pública, ambas requieren un lenguaje preciso, accesible y contextualmente adecuado para su interpretación y educación3.

A pesar de esta demanda, los recursos bilingües de terminología para el turismo cultural cerámico siguen siendo fragmentados e inconsistentes. En etiquetas de museos, textos de exposiciones, páginas de guías turísticas y descripciones de patrimonio, el mismo concepto puede representarse de forma diferente según las instituciones, regiones y entornoscomunicativos 4. Tal variación no es meramente estilística. Puede afectar la comprensión de los visitantes, reducir la comparabilidad de descripciones entre sitios y debilitar la credibilidad percibida de la comunicación sobre el patrimonio5. La investigación terminológica ha argumentado durante mucho tiempo que los recursos temporales de alta calidad deben estar orientados a conceptos, respaldados por definiciones explícitas y anclados en evidencia rastreable como fuentes, contextos y registros de control de calidad6. Sin embargo, muchos equipos de dominio aún carecen de un flujo de trabajo que pueda transformar sistemáticamente textos dispersos en un léxico bilingüe curado, preservando al mismo tiempo reglas de decisión transparentes, procedimientos reproducibles y salidasreutilizables 7. En comparación con la compilación manual ad hoc, un protocolo estandarizado ofrece una documentación más clara, una validación más consistente y mejores condiciones para actualizar, auditar y reutilizar entre instituciones.

Para abordar estos desafíos, un protocolo práctico para la construcción de léxicos bilingües debe organizar dos tareas vinculadas: el descubrimiento de términos candidatos y la alineación bilingüe. Para el descubrimiento de términos, la extracción automática basada en corpus puede reducir la dependencia de la recogida completamente manual al combinar patrones lingüísticos con evidencia estadística, facilitando la identificación de terminología relevante para el dominio en la escala8. Sin embargo, en contextos de patrimonio cultural, la construcción de corpus rara vez es sencilla. Los materiales fuente suelen diferir en estilo, registro y propósito comunicativo, y pueden contener nombres específicos de dominio y convenciones descriptivasmixtas 9. Estas características hacen que el registro transparente de parámetros y las reglas de procesamiento estables sean especialmente importantes. Para la alineación bilingüe, los métodos computacionales pueden generar pares candidatos clasificados entre lenguas comparando formas de término y sus contextos de uso circundantes, tras lo cual los expertos del dominio pueden verificar si los pares propuestos son conceptualmenteapropiados 10. En este protocolo, la automatización se utiliza para generar y clasificar primero a los candidatos plausibles, mientras que la revisión experta se utiliza para confirmarlos o rechazarlos después. Esta combinación mejora la eficiencia sin eliminar el juicio interpretativo de la decisión final. Dado que la terminología patrimonial suele tener implicaciones culturales y educativas, los revisores deben poder inspeccionar la evidencia detrás de cada par propuesto en lugar de confiar en un resultadoopaco 11.

Aquí se presenta un protocolo paso a paso y auditable para construir un léxico cultural cultural chino-inglés a partir de fuentes de texto registradas. El flujo de trabajo estandariza el registro y limpieza de corpus, la extracción bilingüe de candidatos a cuerpos, la generación de pares clasificados, la revisión de dos anotadores con adjudicación y la finalización de la entrada final bajo un esquema fijo. Al integrar registro de versiones, control de umbrales, recursos congelados y validación experta, el protocolo mejora la reproducibilidad, la auditabilidad y la estandarización en comparación con flujos de trabajo menos estructurados que construyen terminología. Para apoyar la reutilización a largo plazo en la gestión terminológica y la práctica de traducción, el léxico finalizado también puede exportarse en formato TermBase eXchange (TBX), un estándar alineado con la ISO para el intercambio estructurado de datosterminológicos 12.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó únicamente datos textuales públicos o autorizados por la institución y no involucró a sujetos humanos ni animales. No se requirió ninguna aprobación ética institucional.

1. Crear el espacio de trabajo del proyecto

  1. Crea una carpeta de proyecto y las siguientes subcarpetas: corpus_raw, corpus_clean, candidatos, alineación, validación, salidas, registros y recursos.
  2. Crea el registro de ejecuciones y registra la configuración del entorno.
    1. Crea registros/run_notes.txt.
    2. Registra la fecha/hora de ejecución, la versión del sistema operativo y el alcance del proyecto como "terminología cultural cultural china-inglesa".
    3. Configura el intérprete de Python en Python 3.11 y registra esta información en registros/run_notes.txt.
  3. Ejecuta python -m pip freeze > logs/pip_freeze.txt y confirma que se han generado logs/pip_freeze.txt y no estánvacíos 13.
  4. Crea el archivo de dependencia e instala el entorno de software.
    1. Crea recursos/requirements.txt.
    2. Enumera las versiones principales del paquete utilizado en este protocolo de la siguiente manera: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 y RapidFuzz==3.6.1.
    3. Graba el comando de instalación en los registros/run_notes.txt.
    4. Instalar en_core_web_sm==3.7.1. 1.4.5 Ejecutar python -m spacy validar y registrar la versión validada del modelo en logs/run_notes.txt.
      NOTA: Confirma que existen tanto los logs/pip_freeze.txt como los logs/run_notes.txt y que no estén vacíos antes de continuar.

2. Compilar un corpus bilingüe equilibrado y registrar fuentes

  1. Selecciona fuentes para que coincidan con la composición bilingüe y de género mostrada en la Tabla 1 y asigna a cada documento un source_id único, como S001 o S00214.
  2. Crea SourceRegister.xlsx y registra, para cada documento, source_id, título, propietario/editor, idioma, género, access_date y license_note.
  3. Convierte cada documento a texto plano UTF-8, nombra cada archivo como source_id_lang.txt (por ejemplo, S001_zh.txt o S001_en.txt) y guarda los archivos en corpus_raw.
  4. Guarda una copia congelada del registro como salidas/SourceRegister_v1.xlsx y registra la fecha de congelación y los totales de documentos (n_docs_zh y n_docs_en) en registros/run_notes.txt.
    NOTA: El protocolo puede pausarse aquí. Si reanudas más tarde, no cambies ninguna source_id asignación.
    PRECAUCIÓN: Utiliza solo textos accesibles públicamente o autorizados por la institución. No redistribuyas textos completos protegidos por derechos de autor sin permiso explícito.

3. Limpiar y normalizar archivos de corpus

  1. Elimina líneas solo de navegación, líneas solo de URL y cabeceras o pies de página duplicados que se repitan en al menos tres documentos. Mantén todas las líneas restantes en su ordenoriginal 15.
  2. Conservar la puntuación que pueda formar parte de términos de varias palabras o compuestos durante la limpieza, incluyendo el guion (-), barra (/), paréntesis (( y )) y punto central (·).
  3. Normalizar el texto chino convirtiendo caracteres alfanuméricos de ancho completo en caracteres de media anchura y estandarizar las formas de corchetes a ( y ).
  4. Normalizar el texto en inglés colapsando espacios en blanco repetidos en un solo espacio y estandarizando todas las variantes de guion al guion ASCII (-) mientras se conservan los compuestos con guion.
  5. Guarda cada archivo limpio en corpus_clean usando el mismo nombre de archivo source_id_lang.txt que en corpus_raw.
  6. Graba source_id, lang, n_chars_before, n_chars_after, marca de tiempo y cleaning_ruleset configurado como v1.0 en salidas/CorpusStats.xlsx16.
    NOTA: Para cada idioma, verifica que cada archivo en corpus_raw tenga un archivo limpio correspondiente en corpus_clean con el mismo sufijo source_id y lenguaje.
    PRECAUCIÓN: Elimina información personal como nombres, números de teléfono y direcciones de correo electrónico durante el preprocesamiento si dicha información aparece en el texto en bruto.

4. Extraer términos candidatos en chino e inglés

  1. Segmentar el texto chino usando jieba versión 0.42.1 con los recursos/userdict_zh.txt fijos del diccionario de usuario y mantener los candidatos que coincidan con 2–8 caracteres chinos consecutivos o 2–6 caracteres chinos separados por un delimitadorconservado 17.
  2. Procesar el texto en inglés usando spaCy versión 3.7.2 con en_core_web_sm versión 3.7.1 y mantener solo sintagmas nominales y compuestos compuestos compuestos que contengan 1–5 tokens18.
  3. Calcula la frecuencia como el número total de ocurrencias de cada candidato a lo largo del corpus limpiado y calcula doc_freq como el número de archivos de source_id distintos que contienen ese candidato al menos una vez.
  4. Aplica los umbrales de la lista corta manteniendo solo a los candidatos con doc_freq ≥ 2 y frecuencia ≥ 3 y descarta a los candidatosrestantes 19.
    NOTA: Estos umbrales de la lista corta se seleccionaron para un corpus relativamente pequeño y equilibrado en géneros. Para corpus más grandes o más heterogéneos, los umbrales pueden ajustarse tras la inspección del piloto.
  5. Exporta candidatos/Candidates_ZH.xlsx y candidatos/Candidates_EN.xlsx con las columnas término, frecuencia, doc_freq, example_source_id y example_snippet.
  6. Exportar candidatos/Shortlist_ZH.xlsx y candidatos/Shortlist_EN.xlsx usando las mismas columnas, mostrando fragmentos chinos como ±20 caracteres y fragmentos en inglés como ±10 tokens alrededor de un suceso atestiguado.
  7. Registra los nombres y versiones del tokenizador o etiquetador, patrones de candidatos y umbrales de lista corta en registros o thresholds.txt.
  8. Calcula una suma de comprobación para recursos/userdict_zh.txt, regístrala en registros/thresholds.txt y guarda una copia congelada como salidas/userdict_zh_v1.txt20.
    NOTA: Abre Shortlist_ZH.xlsx y Shortlist_EN.xlsx y confirma que ambos archivos contienen filas distintas de cero y example_snippet campos rellenados.

5. Generar candidatos de alineación bilingüe y ordenar pares de términos

  1. Para cada término chino preseleccionado, recoge ventanas de contexto de ±20 caracteres chinos alrededor de cada ocurrencia y concatena hasta cinco ventanas para formar una cadena de contexto llamada ctx_zh.
  2. Para cada término inglés preseleccionado, recopila ventanas de contexto de ±10 tokens alrededor de cada ocurrencia y concatena hasta cinco ventanas para formar una cadena de contexto llamada ctx_en.
  3. Crea y congela el recurso de mapeo bilingüe.
    1. Crea recursos/term_map_zh2en.xlsx con las columnas term_zh y term_zh_en.
    2. Llena el archivo utilizando un proceso autorizado como glosarios institucionales existentes, listas de términos bilingües previamente aceptadas y normalización basada en reglas.
    3. Guarda el mapeo congelado como salidas/term_map_zh2en_v1.xlsx.
    4. Anota la fecha de congelación, mapea la cobertura y registra la suma de comprobación en los registros/alignment_log.txt. NOTA: Al adaptar este flujo de trabajo a un nuevo dominio, comienza el recurso de mapeo con una lista semilla de términos de dominio de alta frecuencia y amplía la tabla entre repeticiones completas en lugar de durante la puntuación.
  4. Mapea cada term_zh a una forma similar al inglés term_zh_en usando el mapeo congelado y mantén el mismo recurso de mapeo durante toda laejecución 21.
  5. Genera ctx_zh_en aplicando el mapeo congelado a ctx_zh, reemplazando las ocurrencias de term_zh coincididas por term_zh_en dejando todo el resto del texto sin cambios.
  6. Registra el procedimiento de mapeo y normalización.
    1. Registra el procedimiento de mapeo en registros o alignment_log.txt.
    2. Registra todas las reglas de normalización, incluyendo minúsculas y normalización de guion, en logs/alignment_log.txt.
  7. Calcula la puntuación de similitud de cadenas S_str usando RapidFuzz versión 3.6.1 token_sort_ratio para comparar cadenas de términos normalizadas en inglés entre term_zh_en y term_en y divide el resultado entre 100 para escalar la puntuación al rango [0, 1]22.
  8. Calcula la puntuación de similitud de contexto S_ctx.
    1. Utiliza scikit-learn versión 1.4.2 y TfidfVectorizer con los parámetros fijos minúscula=True, ngram_range=(1, 2), min_df=1, max_df=0.95 y stop_words="english"23.
    2. Ajusta el vectorizador en el conjunto combinado de cadenas de ctx_en y ctx_zh_en de la secuencia actual.
    3. Calcula S_ctx como la similitud coseno entre cada cadena ctx_zh_en y cada cadena ctx_en.
      NOTA: TF-IDF representa la importancia relativa de palabras y frases cortas en cada ventana de contexto, y se utiliza similitud coseno para comparar las representaciones contextuales resultantes.
  9. Calcula la puntuación final de similitud y clasifica los pares de candidatos.
    1. Calcular la puntuación final como S = 0,60 × S_str + 0,40 × S_ctx.
    2. Para cada trimestre chino, conservar los k = 3 mejores candidatos en inglés ordenados por S.
    3. Elimina duplicados manteniendo la instancia con mayor puntuación para cada par único (term_zh, term_en).
    4. Registro k, los pesos de puntuación y el número total de pares exportados en logs/alignment_log.txt24.
      NOTA: El esquema de ponderación y el valor de k se seleccionaron para mantener un conjunto de revisiones manejable y conservar alternativas plausibles. Para corpus más grandes o terminología más variable, estos ajustes pueden ajustarse tras las pruebas piloto.
  10. Asignar domain_tag valores usando el mapa de palabras clave fijo de recursos/domain_keywords.csv y el siguiente orden de prioridad: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    NOTA: Al transferir el flujo de trabajo a otro dominio temático, reemplaza el mapa de palabras clave y revisa el orden de prioridad antes de volver a ejecutar toda la pipeline.
  11. Guarda una copia congelada del mapa de palabras clave como salidas/domain_keywords_v1.csv y registra su suma de comprobación en registros/alignment_log.txt.
  12. Exporta alineación/AlignmentPairs.xlsx con las columnas pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en y evidence_snippet_zh_en.
  13. Etiqueta cada par como auto_accept, revisión o auto_reject usando los siguientes cortes: S ≥ 0,90, 0,75 ≤ S ≤ 0,89 y S < 0,75, y registra los cortes y los conteos en cada grupo de etiquetas en logs/alignment_log.txt.
    NOTA: En un entorno de escritorio estándar comparable al utilizado en este estudio, la generación de contexto, el ajuste TF-IDF y la puntuación de similitud para un corpus de este tamaño se completaron en pocos minutos.
    NOTA: Inspecciona aleatoriamente al menos 10 filas en AlignmentPairs.xlsx y confirma que evidence_snippet_zh_en está presente y que term_zh_en no está vacío para los casos mapeados.
    PRECAUCIÓN: Mantén todos los recursos de mapeo fijos dentro de una partida. No actualices la tabla de mapeo bilingüe ni el mapa de palabras clave una vez que haya comenzado la puntuación.

6. Verificar pares de términos mediante anotación y adjudicación experta

  1. Crea validación/Annotation.xlsx con las columnas pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, adjudicación y justificación.
  2. Prepara una guía de anotación de una página que defina la equivalencia conceptual en el turismo cultural cerámico, traducciones explicativas aceptables y casos de exclusión como solapamiento parcial, representaciones excesivamente genéricas y tipos de artefactos26 desajustados.
  3. Instruye a dos anotadores para que etiqueten independientemente cada par como incluir o excluir usando los fragmentos de evidencia proporcionados, y no permitir que los anotadores vean las decisiones del otro.
  4. Revisa todos los desacuerdos tras la anotación independiente y registra la decisión final y una justificación de una frase en las columnas de adjudicación y justificación.
  5. Calcula la concordancia bruta y el κ de Cohen usando las etiquetas de inclusión y exclusión y registra las métricas de acuerdo y los totales de inclusión y exclusión en los resultados/Evaluation.xlsx27.
  6. Revisa los pares excluidos para identificar patrones sistemáticos de falsos positivos y guarda los patrones rechazados más frecuentes en logs/rule_update_v1.txt.
  7. Guarda una copia congelada del archivo de anotación completado como salidas/Annotation_v1.xlsx y no cambies las etiquetas adjudicadas después de este punto.
    NOTA: El protocolo puede pausarse aquí. Si se reanuda más tarde, no revise ninguna decisión de validación congelada.

7. Finalizar el léxico y exportar

  1. Llena el léxico final usando los campos de entrada resumidos en la Tabla 2, incluyendo formas bilingües de términos, clases gramaticales, etiquetas de dominio, tipo de traducción, definiciones bilingües, ejemplos de uso, información de procedencia y indicadores de calidad.
  2. Utiliza los mismos valores de entry_id en todas las exportaciones y confirma la consistencia del identificador antes de la generación del archivo.
  3. Exporta la hoja de cálculo final como salidas/FinalLexicon.xlsx y verifica que todos los campos requeridos estén rellenados antes de guardar.
  4. Genera y valida la exportación TBX.
    1. Genera un archivo TBX usando los mismos valores de entry_id para preservar la trazabilidad.
    2. Valida el archivo TBX con el esquema TBX previsto.
    3. Registra el resultado de la validación en los registros/run_notes.txt28.
  5. Archiva todos los logs, archivos de parámetros, recursos congelados y salidas en las salidas/Lexicon_v1/ de la carpeta versionada y registra la fecha de archivo y el recuento de archivos en logs/run_notes.txt.
  6. Proporciona los scripts, recursos congelados y registros de parámetros como archivos suplementarios, incluyendo salidas/userdict_zh_v1.txt, salidas/domain_keywords_v1.csv, salidas/term_map_zh2en_v1.xlsx, logs/thresholds.txt y logs/alignment_log.txt.
  7. Proporcionar un subconjunto de verificación del corpus con permiso autorizado usando la misma estructura de archivos y esquema de salida para que los lectores puedan reproducir el flujo de trabajo en el subconjunto29 liberado.
    PRECAUCIÓN: Antes de compartir materiales complementarios, confirma que no se incluyan textos completos protegidos por derechos de autor, identificadores sensibles ni recursos institucionales no autorizados en el paquete de liberación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rendimiento de ensamblaje y limpieza de cuerpos
Siguiendo el diseño del corpus mostrado en la Tabla 1, se reunió un corpus bilingüe registrado a partir de textos de museos y exposiciones, descripciones patrimoniales y materiales turísticos dirigidos al público. Tras la limpieza, el corpus comprendía 12 documentos chinos y 8 documentos ingleses, sumando un total de 47.843 caracteres chinos y 30 caracteresingleses 30. El corpus c...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El principal valor de este protocolo radica en su capacidad para transformar una tarea terminológica que a menudo se maneja de forma informal en un flujo de trabajo reproducible y revisable. En el turismo cultural cerámico, muchos términos son tanto técnicos como interpretativos: se refieren no solo a materiales, tipos de hornos, etapas de cocción o estilos decorativos, sino también a cómo estos conceptos se comunican a los visitantes en etiquetas, narrativas y materiales

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros o no financieros en competencia relacionados con esta obra.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a los profesionales del turismo cultural cerámico y al personal del museo que proporcionaron acceso a materiales textuales y retroalimentación del dominio durante la construcción y validación del corpus. Los autores también agradecen a los dos anotadores independientes de dominios su cuidadosa revisión de los candidatos a alineación y sus comentarios constructivos sobre el diseño de las entradas. Este trabajo fue apoyado por el Proyecto de Investigación de la Asociación de Educación Superior de Jiangxi titulado "Estudio sobre la traducción inteligente al inglés de la terminología del turismo cerámico chino basado en DeepSeek y su modelo de difusión multicanal" (Subvención nº WY-D-115).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Computer workstationHardwareCualquier computadora moderna capaz de ejecutar Python 3.11 y procesar corpora de texto; se recomienda >8 GB de RAMNo se requiere número de catálogo
Fuente: Genérico (cualquier proveedor)
Sistema operativoSoftwareWindows 10/11, macOS, o Linux (registre la versión exacta del sistema operativo en logs/run_notes.txt)Versión registrada en run_notes.txt
Fuente: Instalación del sistema
PythonSoftwarePython 3.11Versión registrada en logs/pip_freeze.txt
Fuente: Distribución de Python Software Foundation
jiebaBiblioteca de software0.42.1jieba==0.42.1
Fuente: Repositorio de paquetes PyPI
spaCyBiblioteca de software3.7.2spacy==3.7.2
Fuente: Repositorio de paquetes PyPI
Modelo de pipeline en inglésModelo NLPen_core_web_sm 3.7.1 (paquete de modelo spaCy)en_core_web_sm==3.7.1; instalación registrada en run_notes.txt
Fuente: Repositorio de modelos spaCy
scikit-learnBiblioteca de software1.4.2scikit-learn==1.4.2
Fuente: Repositorio de paquetes PyPI
RapidFuzzBiblioteca de software3.6.1RapidFuzz==3.6.1
Fuente: Repositorio de paquetes PyPI
Editor de hojas de cálculoSoftwareCualquier software capaz de editar archivos.xlsxUsado para ver/editar SourceRegister.xlsx, CorpusStats.xlsx, archivos Candidates/Shortlist
Fuente: Genérico (cualquier proveedor)
Editor de texto planoSoftwareCualquier software capaz de editar archivos.txt y .csvUsado para ver/editar logs/.txt y resources/.csv
Fuente: Genérico (cualquier proveedor)
Herramienta de conversión de texto UTF-8SoftwareCualquier herramienta capaz de exportar documentos a texto plano UTF-8Usada en el Paso 2.3; método exacto registrado en run_notes.txt
Fuente: Genérico (cualquier proveedor)
Plantilla SourceRegisterPlantilla de archivoSourceRegister.xlsx con campos: source_id, title, owner/publisher, language, genre, access_date, license_noteCongelada como outputs/SourceRegister_v1.xlsx
Fuente: Creada en este estudio
Plantilla de estadísticas de corpusPlantilla de archivoCorpusStats.xlsx con campos: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGenerada durante el Paso 3.6
Fuente: Creada en este estudio
Diccionario de usuario chinoArchivo de recursoresources/userdict_zh.txt (lista de términos específicos del dominio para soporte de segmentación)Copia congelada guardada; suma de comprobación registrada en thresholds.txt
Fuente: Creado/curado en este estudio
Mapa de palabras clave de dominioArchivo de recursoresources/domain_keywords.csv con reglas de prioridad domain_tagCongelado como outputs/domain_keywords_v1.csv; suma de comprobación registrada en alignment_log.txt
Fuente: Creado/curado en este estudio
Tabla de mapeo de términos chino a inglésArchivo de recursoresources/term_map_zh2en.xlsx con columnas term_zh y term_zh_enCongelado como outputs/term_map_zh2en_v1.xlsx; cobertura registrada en alignment_log.txt
Fuente: Creado/curado en este estudio
Registro de umbralArchivo de registrologs/thresholds.txt (patrones, umbrales, versiones de biblioteca, sumas de comprobación de recursos)Requerido para repeticiones deterministas
Fuente: Generado en este estudio
Registro de alineaciónArchivo de registrologs/alignment_log.txt (pesos, k, cortes, configuración del vectorizador, cobertura del mapeo, sumas de comprobación del mapeo)Requerido para repeticiones deterministas
Fuente: Generado en este estudio
Hoja de anotaciónPlantilla de archivovalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisiones, adjudicación, justificación)Congelada como outputs/Annotation_v1.xlsx después del Paso 6.6
Fuente: Creada en este estudio
Salida de evaluaciónArchivo de salidaoutputs/Evaluation.xlsx (acuerdo bruto, coeficiente de Cohen’s κ, totales)Producida en el Paso 6.4
Fuente: Generada en este estudio
Exportación de léxico finalArchivo de salidaoutputs/FinalLexicon.xlsx siguiendo el esquema de la Tabla 2Producida en el Paso 7.2
Fuente: Generada en este estudio
Exportación TBXArchivo de salidaArchivo TBX generado a partir de FinalLexicon.xlsx con mapeo entry_id estableResultado de validación registrado en run_notes.txt
Fuente: Generada en este estudio

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

ComportamientoN mero 233N mero 233TodoN meroValor vac oN meroterminolog a biling econstrucci n de l xicosextracci n autom tica de t rminosalineaci n de t rminos biling esvalidaci n de expertosTBX TermBase eXchangeinterpretaci n del patrimonio culturaltraducci n chino ingl s

Artículos relacionados