이 프로토콜은 등록된 이중언어 말뭉치, 표준화된 세척, 후보 단어 추출, 유사도 순위 정렬, 전문가 검증과 심사를 통해 중국-영어 도자기 문화 관광 어휘를 구성합니다. 이 워크플로우를 사용하여 60개의 검증된 항목이 정의, 사용 사례, 출처 기록, TBX 호환 출력과 함께 내보내졌습니다.
방법 논문
이 프로토콜은 등록된 이중언어 말뭉치, 표준화된 세척, 후보 단어 추출, 유사도 순위 정렬, 전문가 검증과 심사를 통해 중국-영어 도자기 문화 관광 어휘를 구성합니다. 이 워크플로우를 사용하여 60개의 검증된 항목이 정의, 사용 사례, 출처 기록, TBX 호환 출력과 함께 내보내졌습니다.
도자기 문화 관광을 위한 이중언어 용어 자료 구축은 관련 텍스트가 종종 단편화되어 있고, 번역 선택이 일관되지 않으며, 재사용 가능한 건축 작업 흐름이 문서화되지 않아 도전적입니다. 이 프로토콜은 말뭉치 등록 및 정리, 후보 용어 추출, 이중언어 정렬, 전문가 검증과 심사 과정을 통해 중국-영어 도자기 문화 관광 어휘를 구축하는 재현 가능한 단계별 워크플로우를 제시합니다. 등록된 이중언어 말뭉치에 적용된 워크플로우는 중국어와 영어 후보 용어를 선정하고, 순위가 매겨진 이중언어 용어 쌍을 생성하며, 독립적인 전문가 검토 후 검증된 정렬을 유지했습니다. 최종 어휘는 이중언어 용어 양식, 도메인 태그, 번역 유형, 이중언어 정의, 사용 사례, 출처 기록, Excel 및 TBX 파일과 같은 상호 운용 가능한 출력물을 포함한 60개의 검증된 항목을 내보냈습니다. 투명성과 재실행성을 지원하기 위해 프로토콜은 워크플로우 전반에 걸쳐 임계값, 패키지 버전, 동결된 자원, 검증 결정도 기록합니다. 이로 인해 절차가 감사 가능해지고 다른 문화유산 관광 분야에 적용하기 쉬워집니다. 새로운 도메인으로 이전할 때, 사용자는 도메인 키워드 목록을 확장하고, 이중언어 매핑 자원을 업데이트하며, 말뭉치 크기와 용어 밀도에 따라 소수의 후보 및 유사도 임계값을 조정할 수 있습니다.
문화 관광은 여행객들이 순수한 레크리에이션이 아닌 의미 있는 유산 기반 경험을 점점 더 추구함에 따라 목적지 개발의 중요한 동력이 되었습니다. 정책 및 산업 차원에서 국제기구들은 관광과 문화를 연결하고 다양한 유산 자산 간의 해석, 기록, 소통을 개선하는 것의 가치를 반복해서 강조해 왔습니다. 이 넓은 맥락에서 도자기 문화 관광은 특히 용어가 많은데, 방문객들은 재료, 유약 및 소성 과정, 가마 기술, 양식적 모티프, 유물 유형, 공예 과정 서사와 관련된 전문 개념을 정기적으로 접하기 때문입니다. 이 용어들은 종종 일상적인 의역으로는 쉽게 전달되지 않는 기술적 의미를 지니고 있으며, 번역 선택은 라벨, 안내 해석, 교육 자료에서 방문객이 이해하는 내용을 직접적으로 형성할 수 있습니다2. 동시에 유산 프레임워크는 무형문화유산 보호가 지속적인 지식 전달과 대중 인식에 달려 있으며, 이 두 가지는 해석과 교육에 정확하고 접근성 있으며 맥락에 적합한 언어를 필요로 한다고 강조해 왔습니다.
이러한 수요에도 불구하고, 도자기 문화 관광을 위한 이중언어 용어 자원은 여전히 단편적이고 일관성이 없습니다. 박물관 라벨, 전시 문구, 관광 안내 페이지, 유산 설명 등에서는 동일한 개념이 기관, 지역, 소통 환경에 따라 다르게 표현될 수 있습니다. 4. 이러한 변주는 단순한 스타일적 차이만이 아니다. 이는 방문객의 이해에 영향을 미치고, 장소 간 설명의 비교 가능성을 떨어뜨리며, 유산 커뮤니케이션의 신뢰성을 약화시킬 수 있습니다. 용어 연구는 오랫동안 고품질 용어 자원이 개념 중심적이어야 하며, 명확한 정의에 의해 뒷받침되고, 출처, 맥락, 품질관리 기록과 같은 추적 가능한 증거에 기반해야 한다고 주장해 왔습니다. 하지만 많은 도메인 팀은 분산된 텍스트를 체계적으로 엄선된 이중언어 어휘로 변환하면서도 투명한 의사결정 규칙, 재현 가능한 절차, 재사용 가능한 출력을 유지할 수 있는 워크플로우를 아직 갖추지 못하고 있습니다7. 임시 매뉴얼 편찬과 비교할 때, 표준화된 프로토콜은 더 명확한 문서화, 일관된 검증, 그리고 업데이트, 감사, 기관 간 재사용에 더 나은 조건을 제공합니다.
이러한 문제를 해결하기 위해, 이중언어 어휘 구성에 대한 실용적인 프로토콜은 두 가지 연관된 작업을 조직해야 합니다: 후보 용어 발견과 이중언어 정렬입니다. 용어 발견을 위해 말뭉치 기반 자동 추출은 언어 패턴과 통계적 증거를 결합하여 완전 수작업 수집에 대한 의존도를 줄여 8척도에서 도메인 관련 용어를 더 쉽게 식별할 수 있게 합니다. 하지만 문화유산 환경에서는 코퍼스 구성이 거의 간단하지 않습니다. 원본 자료는 스타일, 레지스터, 소통 목적 면에서 종종 다르며, 도메인 특화적 이름과 혼합된 설명 관습을 포함할 수 있습니다9. 이러한 기능들은 투명한 매개변수 기록과 안정적인 처리 규칙을 특히 중요하게 만듭니다. 이중언어 정렬을 위해 계산 방법은 용어 형태와 주변 사용 맥락을 비교하여 순위가 매겨진 언어 간 후보 쌍을 생성할 수 있으며, 이후 도메인 전문가들은 제안된 쌍이 개념적으로 적절한지 검증할 수 있습니다. 이 프로토콜에서는 자동화를 통해 먼저 그럴듯한 후보자를 생성하고 순위를 매기고, 전문가 검토를 통해 이를 확인하거나 거부합니다. 이 조합은 최종 결정에서 해석적 판단을 제거하면서도 효율성을 향상시킵니다. 유산 용어는 종종 문화적·교육적 함의를 수반하기 때문에, 심사자들은 불투명한 결과에 의존하지 않고 각 제안된 쌍의 증거를 직접 검토할 수 있어야 한다11.
여기서는 등록된 텍스트 소스를 바탕으로 중국-영어 도자기 문화 관광 어휘를 구축하는 단계별 청사진 프로토콜을 제시합니다. 워크플로우는 코퍼스 등록 및 정리, 이중언어 후보 추출, 순위별 쌍 생성, 2인노테이터 검토와 심사, 최종 입력 완료를 고정 스키마 하에서 표준화합니다. 버전 로깅, 임계값 제어, 동결된 자원, 전문가 검증을 통합함으로써, 프로토콜은 덜 구조화된 용어 구축 워크플로우에 비해 재현성, 감사 가능성, 표준화를 향상시킵니다. 용어 관리 및 번역 실무에서 장기적인 재사용을 지원하기 위해, 최종 어휘는 구조화된 용어 데이터 교환을 위한 ISO 정렬 표준인 TermBase eXchange(TBX) 형식으로 내보낼 수도 있습니다.12.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 공개 자료나 기관에서 승인한 텍스트 데이터만을 사용했으며, 인간이나 동물 피험자는 포함하지 않았습니다. 기관의 윤리적 승인은 필요하지 않았습니다.
1. 프로젝트 작업 공간 생성
2. 균형 잡힌 이중언어 말뭉치와 등록부 자료를 작성한다
3. 코퍼스 파일을 정리하고 정규화합니다
4. 중국어와 영어로 후보 용어를 추출한다
5. 이중언어 정렬 후보자 생성 및 용어 쌍 순위 매김
6. 전문가의 주석 및 판정을 통해 용어 쌍을 검증합니다
7. 어휘를 최종 확정하고 내보내기
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
코퍼스 조립과 정제 수확량
표 1에 표시된 말뭉치 설계에 따라, 박물관 및 전시 텍스트, 유산 설명, 방문객 대상 관광 자료를 모아 등록된 이중언어 말뭉치가 구성되었습니다. 정리 후 말뭉치는 12개의 중국어 문서와 8개의 영어 문서로 구성되어 총 47,843개의 한자와 32,193개의영어 자로 구성되었다. 이 코퍼스는 기술적, 해석적, 관광 지향적 자료의 의도된 결합을 유지했다. 최종 말뭉치 구성은 표 1에서 정의된 목표 범위를 따랐습니다.
이 단계에서 긍정적인 결과는 안정적인 소스 식별자, 등록된 파일과 정리된 파일 간의 완전한 대응, 그리고 모든 문서에 대해 사용할 수 있는 깨끗한 텍스트가 특징이었습니다. 부정적이거나 최적이 아닌 결과는 정리된 파일이 누락되었거나, 식별자가 일관...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 프로토콜의 주요 가치는 종종 비공식적으로 처리되는 용어 작업을 재현 가능하고 검토 가능한 워크플로우로 변환할 수 있다는 데 있습니다. 도자기 문화 관광에서 많은 용어는 기술적이면서도 해석적이다. 이는 재료, 가마 종류, 소성 단계, 장식 양식뿐만 아니라 이러한 개념들이 라벨, 서사,교육 자료를 통해 방문객에게 전달되는 방식을 포함한다. 이 때문에 이 분야에서 이중언어 변이는 사소한 문체적 문제가 아니다. 방문객이 이해하는 것과 문화적 의미가 플랫폼과 기관 전반에 전달되는 방식을 바꿀 수있습니다. 이 프로토콜은 고정된 전처리 규칙, 동결된 매개변수, 순위 부여된 이중언어 정렬, 전문가 검증을 단일 추적 가능한 워크플로우로 결합하여 이 문제를 해결합니다.
이 방법이 신뢰성 있게 작동하려면 여러 단계가 특히 중요합니다. 첫째, 코퍼스 등...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이 연구와 관련된 경쟁적인 재정적 또는 비재정적 이해관계가 없다고 선언합니다.
저자들은 코퍼스 구축과 검증 과정에서 텍스트 자료와 도메인 피드백에 접근할 수 있도록 해준 도자기 문화 관광 실무자와 박물관 직원들에게 감사를 표합니다. 저자들은 또한 두 독립 도메인 주석자에게 정렬 후보를 신중히 검토하고 진입 디자인에 대한 건설적인 의견을 제공해 준 것에 대해 감사를 표합니다. 이 연구는 장시 고등교육협회의 연구 프로젝트인 "Deepseek 및 그 다중 채널 배포 모델을 기반으로 한 중국 도자기 관광 용어의 지능형 영어 번역 연구"(연구비 번호) WY-D-115).
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 컴퓨터 워크스테이션 | 하드웨어 | Python 3.11을 실행하고 텍스트 코퍼스를 처리할 수 있는 최신 컴퓨터; 8 GB 이상의 RAM 권장 | 카탈로그 번호 필요 없음 출처: 일반(모든 공급업체) |
| 운영 체제 | 소프트웨어 | Windows 10/11, macOS, 또는 Linux (정확한 OS 버전은 logs/run_notes.txt에 기록) | 버전은 run_notes.txt에 기록 출처: 시스템 설치 |
| Python | 소프트웨어 | Python 3.11 | 버전은 logs/pip_freeze.txt에 기록 출처: Python Software Foundation 배포 |
| jieba | 소프트웨어 라이브러리 | 0.42.1 | jieba==0.42.1 출처: PyPI 패키지 저장소 |
| spaCy | 소프트웨어 라이브러리 | 3.7.2 | spacy==3.7.2 출처: PyPI 패키지 저장소 |
| 영어 파이프라인 모델 | NLP 모델 | en_core_web_sm 3.7.1 (spaCy 모델 패키지) | en_core_web_sm==3.7.1; 설치는 run_notes.txt에 기록 출처: spaCy 모델 저장소 |
| scikit-learn | 소프트웨어 라이브러리 | 1.4.2 | scikit-learn==1.4.2 출처: PyPI 패키지 저장소 |
| RapidFuzz | 소프트웨어 라이브러리 | 3.6.1 | RapidFuzz==3.6.1 출처: PyPI 패키지 저장소 |
| 스프레드시트 편집기 | 소프트웨어 | .xlsx 파일을 편집할 수 있는 모든 소프트웨어 | SourceRegister.xlsx, CorpusStats.xlsx, Candidates/Shortlist 파일 보기/편집에 사용 출처: 일반(모든 공급업체) |
| 평문 편집기 | 소프트웨어 | .txt 및.csv 파일을 편집할 수 있는 모든 소프트웨어 | logs/.txt 및 resources/.csv 보기/편집에 사용 출처: 일반(모든 공급업체) |
| UTF-8 텍스트 변환 도구 | 소프트웨어 | 문서를 UTF-8 평문으로 내보낼 수 있는 모든 도구 | 2.3단계에서 사용; 정확한 방법은 run_notes.txt에 기록 출처: 일반(모든 공급업체) |
| SourceRegister 템플릿 | 파일 템플릿 | source_id, title, owner/publisher, language, genre, access_date, license_note 필드가 있는 SourceRegister.xlsx | outputs/SourceRegister_v1.xlsx로 고정 출처: 이 연구에서 생성됨 |
| 코퍼스 통계 템플릿 | 파일 템플릿 | source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_ruleset 필드가 있는 CorpusStats.xlsx | 3.6단계 중에 생성 출처: 이 연구에서 생성됨 |
| 중국어 사용자 사전 | 리소스 파일 | segmentation 지원을 위한 도메인 특정 용어 목록인 resources/userdict_zh.txt | 고정된 복사본 저장; 체크섬은 thresholds.txt에 기록 출처: 이 연구에서 생성/큐레이팅됨 |
| 도메인 키워드 맵 | 리소스 파일 | domain_tag 우선 순위 규칙이 있는 resources/domain_keywords.csv | outputs/domain_keywords_v1.csv로 고정; 체크섬은 alignment_log.txt에 기록 출처: 이 연구에서 생성/큐레이팅됨 |
| 중국어-영어 용어 매핑 테이블 | 리소스 파일 | term_zh와 term_zh_en 컬럼이 있는 resources/term_map_zh2en.xlsx | outputs/term_map_zh2en_v1.xlsx로 고정; 커버리지는 alignment_log.txt에 기록 출처: 이 연구에서 생성/큐레이팅됨 |
| 임계값 로그 | 로그 파일 | logs/thresholds.txt(패턴, 임계값, 라이브러리 버전, 리소스 체크섬) | 결정론적 재실행에 필요 출처: 이 연구에서 생성됨 |
| 정렬 로그 | 로그 파일 | logs/alignment_log.txt(가중치, k, 커터, 벡터화 설정, 매핑 커버리지, 맵 체크섬) | 결정론적 재실행에 필요 출처: 이 연구에서 생성됨 |
| 주석 시트 | 파일 템플릿 | validation/Annotation.xlsx(pair_id, term_zh, term_en, S, decisions, adjudication, rationale) | Step 6.6 이후에 outputs/Annotation_v1.xlsx로 고정 출처: 이 연구에서 생성됨 |
| 평가 출력 | 출력 파일 | outputs/Evaluation.xlsx(원시 합의, Cohen’s κ, 합계) | 6.4단계에서 생성 출처: 이 연구에서 생성됨 |
| 최종 어휘 내보내기 | 출력 파일 | Table 2 스키마를 따르는 outputs/FinalLexicon.xlsx | 7.2단계에서 생성 출처: 이 연구에서 생성됨 |
| TBX 내보내기 | 출력 파일 | stable entry_id 매핑을 가진 FinalLexicon. |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청