방법 논문

등록된 코포라를 이용한 중국-영어 도자기 문화관광 어휘집 구축을 위한 재현 가능한 프로토콜

DOI:

10.3791/71320

2026년 7월 3일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 등록된 이중언어 말뭉치, 표준화된 세척, 후보 단어 추출, 유사도 순위 정렬, 전문가 검증과 심사를 통해 중국-영어 도자기 문화 관광 어휘를 구성합니다. 이 워크플로우를 사용하여 60개의 검증된 항목이 정의, 사용 사례, 출처 기록, TBX 호환 출력과 함께 내보내졌습니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

도자기 문화 관광을 위한 이중언어 용어 자료 구축은 관련 텍스트가 종종 단편화되어 있고, 번역 선택이 일관되지 않으며, 재사용 가능한 건축 작업 흐름이 문서화되지 않아 도전적입니다. 이 프로토콜은 말뭉치 등록 및 정리, 후보 용어 추출, 이중언어 정렬, 전문가 검증과 심사 과정을 통해 중국-영어 도자기 문화 관광 어휘를 구축하는 재현 가능한 단계별 워크플로우를 제시합니다. 등록된 이중언어 말뭉치에 적용된 워크플로우는 중국어와 영어 후보 용어를 선정하고, 순위가 매겨진 이중언어 용어 쌍을 생성하며, 독립적인 전문가 검토 후 검증된 정렬을 유지했습니다. 최종 어휘는 이중언어 용어 양식, 도메인 태그, 번역 유형, 이중언어 정의, 사용 사례, 출처 기록, Excel 및 TBX 파일과 같은 상호 운용 가능한 출력물을 포함한 60개의 검증된 항목을 내보냈습니다. 투명성과 재실행성을 지원하기 위해 프로토콜은 워크플로우 전반에 걸쳐 임계값, 패키지 버전, 동결된 자원, 검증 결정도 기록합니다. 이로 인해 절차가 감사 가능해지고 다른 문화유산 관광 분야에 적용하기 쉬워집니다. 새로운 도메인으로 이전할 때, 사용자는 도메인 키워드 목록을 확장하고, 이중언어 매핑 자원을 업데이트하며, 말뭉치 크기와 용어 밀도에 따라 소수의 후보 및 유사도 임계값을 조정할 수 있습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

문화 관광은 여행객들이 순수한 레크리에이션이 아닌 의미 있는 유산 기반 경험을 점점 더 추구함에 따라 목적지 개발의 중요한 동력이 되었습니다. 정책 및 산업 차원에서 국제기구들은 관광과 문화를 연결하고 다양한 유산 자산 간의 해석, 기록, 소통을 개선하는 것의 가치를 반복해서 강조해 왔습니다. 이 넓은 맥락에서 도자기 문화 관광은 특히 용어가 많은데, 방문객들은 재료, 유약 및 소성 과정, 가마 기술, 양식적 모티프, 유물 유형, 공예 과정 서사와 관련된 전문 개념을 정기적으로 접하기 때문입니다. 이 용어들은 종종 일상적인 의역으로는 쉽게 전달되지 않는 기술적 의미를 지니고 있으며, 번역 선택은 라벨, 안내 해석, 교육 자료에서 방문객이 이해하는 내용을 직접적으로 형성할 수 있습니다2. 동시에 유산 프레임워크는 무형문화유산 보호가 지속적인 지식 전달과 대중 인식에 달려 있으며, 이 두 가지는 해석과 교육에 정확하고 접근성 있으며 맥락에 적합한 언어를 필요로 한다고 강조해 왔습니다.

이러한 수요에도 불구하고, 도자기 문화 관광을 위한 이중언어 용어 자원은 여전히 단편적이고 일관성이 없습니다. 박물관 라벨, 전시 문구, 관광 안내 페이지, 유산 설명 등에서는 동일한 개념이 기관, 지역, 소통 환경에 따라 다르게 표현될 수 있습니다. 4. 이러한 변주는 단순한 스타일적 차이만이 아니다. 이는 방문객의 이해에 영향을 미치고, 장소 간 설명의 비교 가능성을 떨어뜨리며, 유산 커뮤니케이션의 신뢰성을 약화시킬 수 있습니다. 용어 연구는 오랫동안 고품질 용어 자원이 개념 중심적이어야 하며, 명확한 정의에 의해 뒷받침되고, 출처, 맥락, 품질관리 기록과 같은 추적 가능한 증거에 기반해야 한다고 주장해 왔습니다. 하지만 많은 도메인 팀은 분산된 텍스트를 체계적으로 엄선된 이중언어 어휘로 변환하면서도 투명한 의사결정 규칙, 재현 가능한 절차, 재사용 가능한 출력을 유지할 수 있는 워크플로우를 아직 갖추지 못하고 있습니다7. 임시 매뉴얼 편찬과 비교할 때, 표준화된 프로토콜은 더 명확한 문서화, 일관된 검증, 그리고 업데이트, 감사, 기관 간 재사용에 더 나은 조건을 제공합니다.

이러한 문제를 해결하기 위해, 이중언어 어휘 구성에 대한 실용적인 프로토콜은 두 가지 연관된 작업을 조직해야 합니다: 후보 용어 발견과 이중언어 정렬입니다. 용어 발견을 위해 말뭉치 기반 자동 추출은 언어 패턴과 통계적 증거를 결합하여 완전 수작업 수집에 대한 의존도를 줄여 8척도에서 도메인 관련 용어를 더 쉽게 식별할 수 있게 합니다. 하지만 문화유산 환경에서는 코퍼스 구성이 거의 간단하지 않습니다. 원본 자료는 스타일, 레지스터, 소통 목적 면에서 종종 다르며, 도메인 특화적 이름과 혼합된 설명 관습을 포함할 수 있습니다9. 이러한 기능들은 투명한 매개변수 기록과 안정적인 처리 규칙을 특히 중요하게 만듭니다. 이중언어 정렬을 위해 계산 방법은 용어 형태와 주변 사용 맥락을 비교하여 순위가 매겨진 언어 간 후보 쌍을 생성할 수 있으며, 이후 도메인 전문가들은 제안된 쌍이 개념적으로 적절한지 검증할 수 있습니다. 이 프로토콜에서는 자동화를 통해 먼저 그럴듯한 후보자를 생성하고 순위를 매기고, 전문가 검토를 통해 이를 확인하거나 거부합니다. 이 조합은 최종 결정에서 해석적 판단을 제거하면서도 효율성을 향상시킵니다. 유산 용어는 종종 문화적·교육적 함의를 수반하기 때문에, 심사자들은 불투명한 결과에 의존하지 않고 각 제안된 쌍의 증거를 직접 검토할 수 있어야 한다11.

여기서는 등록된 텍스트 소스를 바탕으로 중국-영어 도자기 문화 관광 어휘를 구축하는 단계별 청사진 프로토콜을 제시합니다. 워크플로우는 코퍼스 등록 및 정리, 이중언어 후보 추출, 순위별 쌍 생성, 2인노테이터 검토와 심사, 최종 입력 완료를 고정 스키마 하에서 표준화합니다. 버전 로깅, 임계값 제어, 동결된 자원, 전문가 검증을 통합함으로써, 프로토콜은 덜 구조화된 용어 구축 워크플로우에 비해 재현성, 감사 가능성, 표준화를 향상시킵니다. 용어 관리 및 번역 실무에서 장기적인 재사용을 지원하기 위해, 최종 어휘는 구조화된 용어 데이터 교환을 위한 ISO 정렬 표준인 TermBase eXchange(TBX) 형식으로 내보낼 수도 있습니다.12.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 공개 자료나 기관에서 승인한 텍스트 데이터만을 사용했으며, 인간이나 동물 피험자는 포함하지 않았습니다. 기관의 윤리적 승인은 필요하지 않았습니다.

1. 프로젝트 작업 공간 생성

  1. 프로젝트 폴더와 다음 하위 폴더를 생성하세요: corpus_raw, corpus_clean, 후보, 정렬, 검증, 출력, 로그, 리소스.
  2. 런 로그를 만들고 환경 설정을 기록하세요.
    1. 로그나 run_notes.txt을 만드세요.
    2. 운영 날짜/시간, 운영체제 버전, 프로젝트 범위를 "중국-영어 도자기 문화 관광 용어"로 기록하세요.
    3. Python 인터프리터를 Python 3.11로 설정하고 이 정보를 로그/run_notes.txt에 기록하세요.
  3. python -m pip freeze > logs/pip_freeze.txt 그리고 logs/pip_freeze.txt가 생성되었고 비어 있지 않은지 확인해보세요 13.
  4. 의존성 파일을 만들고 소프트웨어 환경을 설치하세요.
    1. 자원/requirements.txt을 만드세요.
    2. 이 프로토콜에서 사용된 핵심 패키지 버전을 다음과 같이 나열합니다: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2, RapidFuzz==3.6.1.
    3. 설치 명령을 로그/run_notes.txt에 기록하세요.
    4. 설치 en_core_web_sm==3.7.1. 1.4.5 실행: python -m spacy 검증 및 검증된 모델 버전을 logs/run_notes.txt에 기록합니다.
      참고: 진행하기 전에 로그/pip_freeze.txt와 로그/run_notes.txt 모두 존재하고 비어 있지 않은지 확인하세요.

2. 균형 잡힌 이중언어 말뭉치와 등록부 자료를 작성한다

  1. 표 1에 표시된 이중언어 및 장르 구성에 맞는 출처를 선택하고, 각 문서에 S001 또는 S00214와 같은 고유한 source_id을 할당하세요.
  2. 각 문서별로 SourceRegister.xlsx을 만들고 기록하세요. 각 문서, source_id, 제목, 소유자/출판사, 언어, 장르, access_date, license_note.
  3. 각 문서를 UTF-8 평문으로 변환하고, 각 파일 이름을 source_id_lang.txt(예: S001_zh.txt 또는 S001_en.txt)로 지정한 뒤, 파일을 corpus_raw에 저장하세요.
  4. 레지스터의 동결된 복사본을 출력/SourceRegister_v1.xlsx로 저장하고, 동결 날짜와 문서 총합(n_docs_zh 및 n_docs_en)을 로그/run_notes.txt에 기록하세요.
    참고: 여기서 프로토콜을 잠시 멈출 수 있습니다. 나중에 재개할 경우에는 source_id 할당을 변경하지 마십시오.
    주의: 공개적으로 접근 가능하거나 기관에서 승인한 텍스트만 사용하십시오. 명시적 허가 없이 저작권이 있는 전체 텍스트를 재배포하지 마십시오.

3. 코퍼스 파일을 정리하고 정규화합니다

  1. 내비게이션 전용 줄, URL 전용 줄, 그리고 최소 세 개 문서에서 반복되는 중복된 헤더나 푸터를 제거하세요. 남은 모든 라인은원래 순서대로 유지하세요.
  2. 청소 시 하이픈(-), 슬래시(/), 괄호(((와 )), 중간 점(·) 등 다중 단어나 복합 용어의 일부가 될 수 있는 구두점을 유지하세요.
  3. 중국어 텍스트를 정규화하려면 전폭 영숫자 문자를 반도 문자로 변환하고 괄호 형태를 ( 및 )로 표준화합니다.
  4. 영어 텍스트를 정규화하려면 반복된 여백을 하나의 공간으로 접고, 모든 하이픈 변형을 ASCII 하이픈(-)으로 표준화하면서 하이픈이 붙은 합성어는 보존합니다.
  5. 정리된 각 파일을 corpus_clean corpus_raw와 같은 source_id_lang.txt 파일 이름으로 저장하세요.
  6. source_id, 랭, n_chars_before, n_chars_after, 타임스탬프, cleaning_ruleset 출력/CorpusStats.xlsx16에서 v1.0으로 설정하세요.
    참고: 각 언어별로 corpus_raw 내 모든 파일이 동일한 source_id 및 언어 접미사를 가진 해당 정리된 파일이 corpus_clean 있는지 확인하세요.
    주의: 원문에 이름, 전화번호, 이메일 주소와 같은 개인정보가 포함되어 있다면 사전 처리 과정에서 삭제하세요.

4. 중국어와 영어로 후보 용어를 추출한다

  1. 고정된 사용자 사전 리소스/userdict_zh.txt을 적용한 jieba 버전 0.42.1을 사용해 중국어 텍스트를 세분화하고, 2–8개의 연속 중국어 문자 또는 2–6개의 중국어 문자와 일치하는 후보는 17개의 구분자17로 구분합니다.
  2. spaCy 버전 3.7.2를 사용해 영어 텍스트를 처리하며, en_core_web_sm 버전 3.7.1을 사용하고, 1–5개의 토큰을 포함하는 명사구와 하이픈이 포함된 복합어만 보관합니다.
  3. freq를 정화된 코퍼스 전반에 걸쳐 각 후보가 총 발생한 횟수로 계산하고, doc_freq는 해당 후보를 포함하는 서로 다른 source_id 파일의 개수로 계산합니다.
  4. doc_freq ≥ 2와 ≥ 3 출연 후보만 유지하고 나머지19명은 버려 최종 후보 명단 임계치를 적용합니다.
    참고: 이 최종 후보 기준은 비교적 작고 장르 균형이 맞춘 코퍼스에서 선정되었습니다. 더 크거나 이질적인 말뭉치의 경우, 시험 검사 후 임계값을 조정할 수 있습니다.
  5. term, freq, doc_freq, example_source_id, example_snippet 열을 포함한 후보/Candidates_ZH.xlsx 및 후보/Candidates_EN.xlsx을 내보내세요.
  6. 수출 후보/Shortlist_ZH.xlsx과 후보/Shortlist_EN.xlsx는 동일한 열을 사용하며, 중국어 스니펫은 ±20자, 영어 스니펫은 ±10 토큰으로 표시되어 있습니다.
  7. 토큰 또는 태거 이름과 버전, 후보 패턴, 그리고 최종 순위 임계값을 로그/thresholds.txt에 기록하세요.
  8. 자원/userdict_zh.txt에 대해 체크섬을 계산해 로그나 thresholds.txt에 기록하고, userdict_zh_v1.txt20 출력으로 저장한 동결된 복사본을 저장하세요.
    참고: Shortlist_ZH.xlsx 열고 Shortlist_EN.xlsx 두 파일에 0이 아닌 행과 채워진 example_snippet 필드가 있는지 확인하세요.

5. 이중언어 정렬 후보자 생성 및 용어 쌍 순위 매김

  1. 각 최종 선정된 중국어 용어에 대해 각 등장 시 ±20개의 한자 문맥 창을 모아 최대 다섯 개의 창을 연결하여 하나의 문맥 문자열인 ctx_zh를 만듭니다.
  2. 각 최종 선정된 영어 용어마다 ±10개의 토큰으로 구성된 문맥 창을 모아 최대 다섯 개의 창을 연결해 하나의 문맥 문자열인 ctx_en을 만듭니다.
  3. 이중 언어 지도 자료를 생성하고 동결하세요.
    1. term_zh와 term_zh_en 열로 리소스/term_map_zh2en.xlsx을 생성하세요.
    2. 기존의 기관 용어집, 이전에 인정된 이중언어 용어 목록, 규칙 기반 정규화 등 허가된 절차를 사용하여 파일을 채웁니다.
    3. 프리즌 매핑을 출력/term_map_zh2en_v1.xlsx로 저장하세요.
    4. 동결 날짜, 매핑 적용 범위, 파일 체크섬을 로그/alignment_log.txt에 기록하세요. 참고: 이 워크플로우를 새로운 도메인에 적용할 때는, 매핑 자원을 고빈도 도메인 항들의 시드 리스트로 시작하고, 점수 매기기가 아닌 전체 재실행 사이에 테이블을 확장하세요.
  4. 각 term_zh을 영국 term_zh_en 유사한 형태로 매핑하고, 전체 실행21 동안 동일한 매핑 자원을 유지하세요.
  5. ctx_zh에 고정된 매핑을 적용하여 ctx_zh_en을 생성하고, 매칭된 term_zh 현상을 term_zh_en으로 대체하고 나머지 텍스트는 변경하지 않습니다.
  6. 매핑 및 정규화 과정을 기록하세요.
    1. 매핑 과정을 로그/alignment_log.txt로 기록하세요.
    2. 로우캐싱과 하이픈 정규화 등 모든 정규화 규칙을 로그/alignment_log.txt에 기록하세요.
  7. RapidFuzz 버전 3.6.1 token_sort_ratio을 사용해 term_zh_en와 term_en 사이의 정규화된 영어 용어 문자열을 비교하여 문자열 유사S_str도 점수를 계산하고, 결과를 100으로 나누어 점수를 범위 [0, 1]22로 조정합니다.
  8. 맥락 유사도 점수를 계산S_ctx.
    1. scikit-learn 버전 1.4.2와 TfidfVectorizer를 사용하여 고정된 매개변수 소문자=True, ngram_range=(1, 2), min_df=1, max_df=0.95, stop_words="english"23을 사용하세요.
    2. 현재 실행 중인 ctx_en와 ctx_zh_en 문자열 조합 세트에 벡터라이저를 맞추세요.
    3. S_ctx를 각 ctx_zh_en 문자열과 각 ctx_en 문자열 간의 코사인 유사도로 계산합니다.
      참고: TF-IDF는 각 문맥 창에서 단어와 짧은 구의 상대적 중요성을 나타내며, 코사인 유사도를 사용해 결과 문맥 표현을 비교합니다.
  9. 최종 유사도 점수를 계산하고 후보 쌍을 순위 매깁니다.
    1. 최종 점수를 계산하면 S = 0.60 × S_str + 0.40 × S_ctx.
    2. 각 중국어 학기마다 상위 k = 3명의 영어 후보자를 S로 순위 매김하여 유지합니다.
    3. 각 고유한(term_zh, term_en) 쌍마다 가장 높은 점수를 받은 인스턴스를 유지하여 중복을 제거하세요.
    4. 기록 k, 점수 가중치, 로그/alignment_log.txt24 내보내는 총 쌍 수를 기록합니다.
      참고: 가중치 체계와 k의 값은 관리 가능한 검토 세트를 유지하면서 그럴듯한 대안을 유지하기 위해 선택되었습니다. 더 큰 말뭉치나 더 다양한 용어의 경우, 파일럿 테스트 후에 이러한 설정이 조정될 수 있습니다.
  10. 고정 키워드 맵 리소스/domain_keywords.csv과 다음과 같은 우선순위 순서를 사용하여 domain_tag 값을 할당합니다: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    참고: 워크플로우를 다른 주제 도메인으로 이전할 때는 키워드 맵을 교체하고 우선순위 순서를 수정한 후 전체 파이프라인을 재실행하세요.
  11. 키워드 맵의 동결된 복사본을 출력/domain_keywords_v1.csv로 저장하고, 체크섬을 로그/alignment_log.txt에 기록하세요.
  12. pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en, evidence_snippet_zh_en 열로 정렬/AlignmentPairs.xlsx을 내보내세요.
  13. 각 쌍을 다음 컷오프를 auto_accept, 리뷰, 또는 auto_reject로 라벨링하세요: S ≥ 0.90, 0.75 ≤ S ≤ 0.89, S < 0.75, 그리고 각 라벨 그룹의 컷오프와 카운트를 로그/alignment_log.txt로 기록합니다.
    참고: 이 연구에서 사용한 것과 유사한 표준 데스크톱 환경에서는, 이 크기의 말뭉치에 대해 맥락 생성, TF-IDF 적합, 유사도 점수 산출이 몇 분 내에 완료되었습니다.
    참고: AlignmentPairs.xlsx에서 최소 10개의 행을 무작위로 점검하여 evidence_snippet_zh_en가 존재하는지, 그리고 매핑된 케이스에 대해 term_zh_en가 비어 있지 않은지 확인하세요.
    주의: 한 번의 실행 내에서는 모든 매핑 자원을 고정하세요. 점수 매기가 시작된 후에는 이중언어 매핑 테이블이나 키워드 맵을 업데이트하지 마세요.

6. 전문가의 주석 및 판정을 통해 용어 쌍을 검증합니다

  1. pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, 심결, 근거 등으로 검증/Annotation.xlsx을 생성합니다.
  2. 도자기 문화 관광에서의 개념적 동등성, 허용 가능한 설명 번역, 부분 중복, 지나치게 일반적인 렌더링, 불일치 유물 유형 등 제외 사례를 정의하는 1페이지 분량의 주석 가이드라인을 준비하세요26.
  3. 두 명의 주석자에게 제공된 증거 스니펫을 사용해 각 조합을 독립적으로 포함 또는 제외로 표시하도록 지시하며, 서로의 결정을 볼 수 없게 하십시오.
  4. 독립적인 주석 후 모든 이견을 검토하고 최종 결정과 한 문장으로 된 이유를 판결 및 논리 열에 기록하세요.
  5. 포함 및 제외 라벨을 사용하여 원시 합의와 코헨의 κ를 계산하고, 합의 지표와 포함 및 제외 합계를 출력/Evaluation.xlsx27에 기록합니다.
  6. 제외된 쌍을 검토하여 체계적인 위양성 패턴을 식별하고, 가장 자주 거부된 패턴을 로그/rule_update_v1.txt에 저장합니다.
  7. 완성된 주석 파일의 동결된 복사본을 출력/Annotation_v1.xlsx로 저장하고, 이 시점 이후로는 판정된 라벨을 변경하지 마세요.
    참고: 여기서 프로토콜을 잠시 멈출 수 있습니다. 나중에 재개할 경우, 동결된 검증 결정을 수정하지 마십시오.

7. 어휘를 최종 확정하고 내보내기

  1. 표 2에 요약된 항목 필드를 사용하여 최종 어휘를 채우세요. 여기에는 이중언어 용어 형태, 품사, 도메인 태그, 번역 유형, 이중언어 정의, 사용 사례, 출처 정보, 품질 플래그가 포함됩니다.
  2. 모든 내보내기에서 동일한 entry_id 값을 사용하고, 파일 생성 전에 식별자 일관성을 확인하세요.
  3. 최종 스프레드시트를 출력/FinalLexicon.xlsx로 내보내고, 필요한 모든 필드가 채워진 후 저장하세요.
  4. TBX 내보내기를 생성하고 검증하세요.
    1. 추적성을 유지하기 위해 동일한 entry_id 값을 사용해 TBX 파일을 생성하세요.
    2. TBX 파일을 의도한 TBX 스키마와 대조해 검증하세요.
    3. 검증 결과를 로그/run_notes.txt28에 기록하세요.
  5. 모든 로그, 매개변수 파일, 동결된 자원, 출력물을 버전이 있는 폴더 outputs/Lexicon_v1/에 보관하고, 아카이브 날짜와 파일 수를 logs/run_notes.txt에 기록하세요.
  6. 스크립트, 동결된 자원, 매개변수 로그를 보충 파일로 제공하며, 여기에는 outputs/userdict_zh_v1.txt, outputs/domain_keywords_v1.csv, outputs/term_map_zh2en_v1.xlsx, logs/thresholds.txt, logs/alignment_log.txt 포함됩니다.
  7. 동일한 파일 구조와 출력 스키마를 사용하여 권한 승인된 검증 코퍼스 부분집합을 제공하여 읽기가 해제된 하위 집합29에서 워크플로우를 재현할 수 있도록 합니다.
    주의: 보조 자료를 공유하기 전에, 공개 패키지에 저작권이 있는 전문, 민감한 식별자, 또는 무단 기관 자원이 포함되어 있지 않은지 반드시 확인하세요.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

코퍼스 조립과 정제 수확량
표 1에 표시된 말뭉치 설계에 따라, 박물관 및 전시 텍스트, 유산 설명, 방문객 대상 관광 자료를 모아 등록된 이중언어 말뭉치가 구성되었습니다. 정리 후 말뭉치는 12개의 중국어 문서와 8개의 영어 문서로 구성되어 총 47,843개의 한자와 32,193개의영어 자로 구성되었다. 이 코퍼스는 기술적, 해석적, 관광 지향적 자료의 의도된 결합을 유지했다. 최종 말뭉치 구성은 표 1에서 정의된 목표 범위를 따랐습니다.

이 단계에서 긍정적인 결과는 안정적인 소스 식별자, 등록된 파일과 정리된 파일 간의 완전한 대응, 그리고 모든 문서에 대해 사용할 수 있는 깨끗한 텍스트가 특징이었습니다. 부정적이거나 최적이 아닌 결과는 정리된 파일이 누락되었거나, 식별자가 일관...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜의 주요 가치는 종종 비공식적으로 처리되는 용어 작업을 재현 가능하고 검토 가능한 워크플로우로 변환할 수 있다는 데 있습니다. 도자기 문화 관광에서 많은 용어는 기술적이면서도 해석적이다. 이는 재료, 가마 종류, 소성 단계, 장식 양식뿐만 아니라 이러한 개념들이 라벨, 서사,교육 자료를 통해 방문객에게 전달되는 방식을 포함한다. 이 때문에 이 분야에서 이중언어 변이는 사소한 문체적 문제가 아니다. 방문객이 이해하는 것과 문화적 의미가 플랫폼과 기관 전반에 전달되는 방식을 바꿀 수있습니다. 이 프로토콜은 고정된 전처리 규칙, 동결된 매개변수, 순위 부여된 이중언어 정렬, 전문가 검증을 단일 추적 가능한 워크플로우로 결합하여 이 문제를 해결합니다.

이 방법이 신뢰성 있게 작동하려면 여러 단계가 특히 중요합니다. 첫째, 코퍼스 등...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이 연구와 관련된 경쟁적인 재정적 또는 비재정적 이해관계가 없다고 선언합니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 코퍼스 구축과 검증 과정에서 텍스트 자료와 도메인 피드백에 접근할 수 있도록 해준 도자기 문화 관광 실무자와 박물관 직원들에게 감사를 표합니다. 저자들은 또한 두 독립 도메인 주석자에게 정렬 후보를 신중히 검토하고 진입 디자인에 대한 건설적인 의견을 제공해 준 것에 대해 감사를 표합니다. 이 연구는 장시 고등교육협회의 연구 프로젝트인 "Deepseek 및 그 다중 채널 배포 모델을 기반으로 한 중국 도자기 관광 용어의 지능형 영어 번역 연구"(연구비 번호) WY-D-115).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
컴퓨터 워크스테이션하드웨어Python 3.11을 실행하고 텍스트 코퍼스를 처리할 수 있는 최신 컴퓨터; 8 GB 이상의 RAM 권장카탈로그 번호 필요 없음
출처: 일반(모든 공급업체)
운영 체제소프트웨어Windows 10/11, macOS, 또는 Linux (정확한 OS 버전은 logs/run_notes.txt에 기록)버전은 run_notes.txt에 기록
출처: 시스템 설치
Python소프트웨어Python 3.11버전은 logs/pip_freeze.txt에 기록
출처: Python Software Foundation 배포
jieba소프트웨어 라이브러리0.42.1jieba==0.42.1
출처: PyPI 패키지 저장소
spaCy소프트웨어 라이브러리3.7.2spacy==3.7.2
출처: PyPI 패키지 저장소
영어 파이프라인 모델NLP 모델en_core_web_sm 3.7.1 (spaCy 모델 패키지)en_core_web_sm==3.7.1; 설치는 run_notes.txt에 기록
출처: spaCy 모델 저장소
scikit-learn소프트웨어 라이브러리1.4.2scikit-learn==1.4.2
출처: PyPI 패키지 저장소
RapidFuzz소프트웨어 라이브러리3.6.1RapidFuzz==3.6.1
출처: PyPI 패키지 저장소
스프레드시트 편집기소프트웨어.xlsx 파일을 편집할 수 있는 모든 소프트웨어SourceRegister.xlsx, CorpusStats.xlsx, Candidates/Shortlist 파일 보기/편집에 사용
출처: 일반(모든 공급업체)
평문 편집기소프트웨어.txt 및.csv 파일을 편집할 수 있는 모든 소프트웨어logs/.txt 및 resources/.csv 보기/편집에 사용
출처: 일반(모든 공급업체)
UTF-8 텍스트 변환 도구소프트웨어문서를 UTF-8 평문으로 내보낼 수 있는 모든 도구2.3단계에서 사용; 정확한 방법은 run_notes.txt에 기록
출처: 일반(모든 공급업체)
SourceRegister 템플릿파일 템플릿source_id, title, owner/publisher, language, genre, access_date, license_note 필드가 있는 SourceRegister.xlsxoutputs/SourceRegister_v1.xlsx로 고정
출처: 이 연구에서 생성됨
코퍼스 통계 템플릿파일 템플릿source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_ruleset 필드가 있는 CorpusStats.xlsx3.6단계 중에 생성
출처: 이 연구에서 생성됨
중국어 사용자 사전리소스 파일segmentation 지원을 위한 도메인 특정 용어 목록인 resources/userdict_zh.txt고정된 복사본 저장; 체크섬은 thresholds.txt에 기록
출처: 이 연구에서 생성/큐레이팅됨
도메인 키워드 맵리소스 파일domain_tag 우선 순위 규칙이 있는 resources/domain_keywords.csvoutputs/domain_keywords_v1.csv로 고정; 체크섬은 alignment_log.txt에 기록
출처: 이 연구에서 생성/큐레이팅됨
중국어-영어 용어 매핑 테이블리소스 파일term_zh와 term_zh_en 컬럼이 있는 resources/term_map_zh2en.xlsxoutputs/term_map_zh2en_v1.xlsx로 고정; 커버리지는 alignment_log.txt에 기록
출처: 이 연구에서 생성/큐레이팅됨
임계값 로그로그 파일logs/thresholds.txt(패턴, 임계값, 라이브러리 버전, 리소스 체크섬)결정론적 재실행에 필요
출처: 이 연구에서 생성됨
정렬 로그로그 파일logs/alignment_log.txt(가중치, k, 커터, 벡터화 설정, 매핑 커버리지, 맵 체크섬)결정론적 재실행에 필요
출처: 이 연구에서 생성됨
주석 시트파일 템플릿validation/Annotation.xlsx(pair_id, term_zh, term_en, S, decisions, adjudication, rationale)Step 6.6 이후에 outputs/Annotation_v1.xlsx로 고정
출처: 이 연구에서 생성됨
평가 출력출력 파일outputs/Evaluation.xlsx(원시 합의, Cohen’s κ, 합계)6.4단계에서 생성
출처: 이 연구에서 생성됨
최종 어휘 내보내기출력 파일Table 2 스키마를 따르는 outputs/FinalLexicon.xlsx7.2단계에서 생성
출처: 이 연구에서 생성됨
TBX 내보내기출력 파일stable entry_id 매핑을 가진 FinalLexicon.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

233233TBX TermBase eXchange

관련 논문