Yöntem makalesi

Kayıtlı Korpora Kullanarak Çin-İngilizce Seramik Kültürel Turizm Sözlüğü Oluşturmak İçin Tekrarlanabilir Bir Protokol

DOI:

10.3791/71320

3 Temmuz 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, kayıtlı iki dilli korpora, standart temizlik, aday terimi çıkarma, benzerlik sıralaması ve uzman doğrulama ile yargı yoluyla Çin-İngilizce seramik kültürel turizm sözlüğü oluşturur. Bu iş akışı kullanılarak, tanımlar, kullanım örnekleri, kaynak kayıtları ve TBX uyumlu çıktılarla birlikte 60 doğrulanmış giriş dışa aktarıldı.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Seramik kültürel turizmi için çift dilli terim kaynakları oluşturmak zordur çünkü ilgili metinler genellikle parçalanmıştır, çeviri seçenekleri tutarsızdır ve yeniden kullanılabilir inşaat iş akışları nadiren belgelenir. Bu protokol, Çin-İngilizce seramik kültürel turizm sözlüğünü korpus kaydı ve temizliği, aday terimlerinin çıkarılması, iki dilli hizalama ve yargı ile uzman doğrulama yoluyla inşa etmek için tekrarlanabilir, adım adım bir iş akışı sunar. Kayıtlı iki dilli bir korpusa uygulanan bu iş akışı, Çince ve İngilizce aday terimlerinin kısa listeye alındığı, sıralanmış çift dilli terim çiftleri oluşturulduğu ve bağımsız uzman incelemesinden sonra doğrulanmış hizalanmaların korunduğu ortaya çıktı. Nihai sözlük, iki dilli terim formları, alan etiketleri, çeviri türleri, iki dilli tanımlar, kullanım örnekleri, kaynak kayıtları ve Excel ile TBX dosyaları gibi birlikte çalışabilir çıktılarla 60 doğrulanmış girişi dışa aktardı. Şeffaflık ve yeniden çalıştırılabilirliği desteklemek için protokol, iş akışı boyunca eşikleri, paket sürümlerini, dondurulmuş kaynakları ve doğrulama kararlarını da kaydeder. Bu da sürecin denetlenebilir ve diğer miras turizmi alanlarına daha kolay uyarlanmasını sağlar. Yeni bir alan adına aktarıldığında, kullanıcılar alan alan anahtar kelime listesini genişletebilir, çift dilli haritalama kaynağını güncelleyebiliyor ve korpus büyüklüğü ile terminoloji yoğunluğuna göre az sayıda kısa liste ve benzerlik eşiğini ayarlayabilir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kültürel turizm, turistlerin giderek anlamlı ve sadece rekreasyon değil, miras temelli deneyimler aramasıyla destinasyon gelişiminde önemli bir itici güçhaline gelmiştir. Politika ve sektör düzeyinde, uluslararası kuruluşlar turizmi kültürle bağlamanın ve çeşitli miras varlıkları arasında yorumlama, belgeleme ve iletişimin geliştirilmesinin değerini defalarca vurgulamıştır. Bu daha geniş bağlamda, seramik kültürel turizmi özellikle terimlerle yoğun bir şekilde ilgilidir çünkü ziyaretçiler malzemeler, sır ve pişirme süreçleri, fırın teknolojileri, stilistik motifler, eser türleri ve zanaat-süreç anlatılarıyla ilgili özel kavramlarla sık sık karşılaşırlar. Bu terimler genellikle teknik anlamlar taşır ve bunlar kolayca geçici bir şekilde aktarılanamaz ve çeviri seçimleri, ziyaretçilerin etiketlerden, rehberli yorumlardan ve eğitim materyallerinden ne anlamalarını doğrudanşekillendirebilir. Aynı zamanda, miras çerçeveleri, maddi olmayan kültürel mirasın korunmasının sürekli bilgi aktarımı ve kamu farkındalığına bağlı olduğunu vurgulamıştır; bu iki dili de yorum ve eğitim için doğru, erişilebilir ve bağlamsal olarak uygun bir dil gerektirir3.

Bu talebe rağmen, seramik kültürel turizmi için iki dilli terimler kaynakları parçalı ve tutarsız kalır. Müze etiketleri, sergi metinleri, turizm rehberi sayfaları ve miras açıklamaları arasında aynı kavram kurumlar, bölgeler ve iletişim ortamları arasında farklı şekildesunulabilir 4. Bu tür varyasyonlar sadece stilistik değildir. Ziyaretçi anlayışını etkileyebilir, alanlar arasında tanımların karşılaştırılabilirliğini azaltabilir ve miras iletişiminin algılanan güvenilirliğinizayıflatabilir 5. Terminoloji araştırmaları, yüksek kaliteli terim kaynaklarının kavram odaklı olması, açık tanımlarla desteklenmesi ve kaynaklar, bağlamlar ve kalite kontrol kayıtları gibi izlenebilir kanıtlara dayanması gerektiğini uzun süredirsavunmaktadır 6. Ancak, birçok alan ekibi, şeffaf karar kuralları, tekrarlanabilir prosedürler ve yeniden kullanılabilir çıktıları koruyarak dağınık metinleri sistematik olarak küratörlü iki dilli bir sözlüğe dönüştürebilen bir iş akışına sahipdeğildir 7. Ad hoc manuel derleme ile karşılaştırıldığında, standartlaştırılmış bir protokol daha net dokümantasyon, daha tutarlı doğrulama ve güncelleme, denetim ve kurumlar arası yeniden kullanım için daha iyi koşullar sunar.

Bu zorlukları ele almak için, iki dilli sözlük oluşturma için pratik bir protokolün iki bağlantılı görevi organize etmelidir: aday terim keşfi ve iki dilli hizalama. Terim keşfi için, korpus tabanlı otomatik çıkarma, dilsel kalıpları istatistiksel kanıtlarla birleştirerek tam manuel toplama bağımlılığını azaltabilir vealanla ilgili terminolojiyi 8. ölçekte tanımlamayı kolaylaştırır. Ancak kültürel miras ortamlarında korpus inşası nadiren doğrudan olur. Kaynak materyaller genellikle tarz, kayıt ve iletişim amaçlı farklılıklar gösterir ve alan adına özgü isimler ile karışık betimleyici gelenekleriçerebilirler 9. Bu özellikler, şeffaf parametre kaydı ve kararlı işleme kurallarını özellikle önemli kılar. İki dilli hizalama için, hesaplamalı yöntemler terim formlarını ve çevresindeki kullanım bağlamlarını karşılaştırarak sıralanmış diller arası aday çiftler üretebilir; bundan sonra alan uzmanları önerilen çiftlerin kavramsal olarak uygun olup olmadığınıdoğrulayabilir 10. Bu protokolde, otomasyon önce makul adayları oluşturmak ve sıralamak için kullanılırken, uzman incelemesi onları onaylamak veya reddetmek için kullanılır. Bu kombinasyon, nihai karardan yorumlayıcı yargıyı kaldırmadan verimliliği artırır. Miras terminolojisi genellikle kültürel ve eğitimsel sonuçlar taşırken, inceleyiciler her önerilen çiftin arkasındaki kanıtları inceleyebilmelidir; bunun yerine belirsiz birçıktıya güvenmek yerine gereklidir.

Burada, kayıtlı metin kaynaklarından Çin-İngilizce seramik kültürel turizm sözlüğü oluşturmak için adım adım ve denetlenebilir bir protokol sunulmaktadır. İş akışı, korpus kaydı ve temizliğini, iki dilli aday çıkarmayı, sıralanmış çift oluşturmayı, iki anlatıcılı değerlendirmeyi ve kararlaştırmayı ve sabit bir şema altında nihai girişi tamamlamayı standartlaştırır. Sürüm kaydı, eşik kontrolü, dondurulmuş kaynaklar ve uzman doğrulamayı entegre ederek, protokol daha az yapılandırılmış terminoloji oluşturma iş akışlarına kıyasla tekrarlanabilirlik, denetlenebilirlik ve standartlaştırmayı artırır. Terminoloji yönetimi ve çeviri uygulamalarında uzun vadeli yeniden kullanımı desteklemek için, nihai sözlük ayrıca yapılandırılmış terminolojik veri alışverişi için ISO uyumlu bir standart olan TermBase eXchange (TBX)formatında da dışa aktarılabilir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma yalnızca kamuya açık veya kurum tarafından yetkilendirilmiş metin verilerini kullandı ve insan veya hayvan denekleri içermedi. Kurumsal etik onay gerekmiyordu.

1. Proje çalışma alanını oluşturun

  1. Bir proje klasörü ve aşağıdaki alt klasörler oluşturun: corpus_raw, corpus_clean, adaylar, hizalama, doğrulama, çıktılar, günlükler ve kaynaklar.
  2. Çalıştırma günlüğünü oluşturun ve ortam ayarlarını kaydedin.
    1. Günlükler/run_notes.txt oluşturun.
    2. Çalışma tarihi/saati, işletim sistemi versiyonu ve proje kapsamını "Çin-İngiliz seramik kültürel turizm terminolojisi" olarak kaydedin.
    3. Python yorumlayıcısını Python 3.11 olarak ayarlayın ve bu bilgileri logs/run_notes.txt'a kaydedin.
  3. Python -m pip çalıştırın, > logs/pip_freeze.txt dondurma ve logs/pip_freeze.txt oluşturulduğunu ve boş olmadığınıdoğrulayın 13.
  4. Bağımlılık dosyasını oluşturun ve yazılım ortamını kurun.
    1. Kaynaklar/requirements.txt oluşturun.
    2. Bu protokolde kullanılan temel paket sürümlerini şu şekilde listeleyin: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 ve RapidFuzz==3.6.1.
    3. Kurulum komutunu logs/run_notes.txt'a kaydedin.
    4. Kurulum en_core_web_sm==3.7.1. 1.4.5 python -m spacy çalıştır, doğrulanmış model versiyonunu logs/run_notes.txt'da kaydet ve doğrulama.
      NOT: Devam etmeden önce hem log/pip_freeze.txt hem de log/run_notes.txt var olup olmadığını ve boş olmadığını doğrulayın.

2. Dengeli bir çift dilli korpus derleyin ve kaynakları kaydedin

  1. Tablo 1'de gösterilen iki dilli ve tür bileşimine uygun kaynakları seçin ve her belgeye S001 veya S00214 gibi benzersiz bir source_id atayın.
  2. Her belge için SourceRegister.xlsx oluşturun ve kaydedin, source_id, başlık, sahibi/yayıncı, dil, tür, access_date ve license_note.
  3. Her belgeyi UTF-8 düz metne dönüştürün, her dosyayı source_id_lang.txt olarak adlandırın (örneğin S001_zh.txt veya S001_en.txt) ve dosyaları corpus_raw'de kaydedin.
  4. Kayıt cihazının donmuş bir kopyasını çıktı/SourceRegister_v1.xlsx olarak kaydedin ve dondurma tarihini ve belge toplamlarını (n_docs_zh ve n_docs_en) logs/run_notes.txt'a kaydedin.
    NOT: Protokol burada duraklatılabilir. Daha sonra devam edecekseniz, source_id ödevleri değiştirmeyin.
    DIKKAT: Yalnızca kamuya açık veya kurum tarafından yetkilendirilen metinleri kullanın. Telif hakkı korumalı tam metinleri açık izin olmadan yeniden dağıtmayın.

3. Korpus dosyalarını temizleyin ve normalize edin

  1. Yalnızca gezinme için kullanılan satırlar, sadece URL satırları ve en az üç belgede tekrarlanan başlık veya alt sayfaları kaldırın. Kalan tüm hatları orijinalsıralarında tutun 15.
  2. Temizleme sırasında çoklu kelime veya bileşik terimlerin bir parçası olabilecek noktalama işaretlerini koruyun; örneğin tire (-), eğik çizgi (/), parantezler (( ve )) ve orta nokta (·).
  3. Çince metni, tam genişlikli alfanumerik karakterleri yarım genişlikli karakterlere dönüştürerek ve parantez formlarını ( ve ) olarak standartlaştırarak normalleştirin.
  4. İngilizce metni, tekrarlanan boşlukları tek bir boşlukta birleştirerek ve tire varyantlarını ASCII tire (-) standartlaştırarak tireli bileşikleri koruyarak normalleştirin.
  5. Her temizlenmiş dosyayı corpus_clean olarak kaydet, corpus_raw'daki source_id_lang.txt dosya adını kullanarak.
  6. Kayıt source_id, dil, n_chars_before, n_chars_after, zaman damgası ve cleaning_ruleset 16 çıkış sayısında v1.0 olarak ayarlandıCorpusStats.xlsx 16.
    NOT: Her dil için, corpus_raw'daki her dosyanın aynı source_id ve dil ekine sahip corpus_clean içinde temizlenmiş bir dosyaya sahip olduğunu doğrulayın.
    DIKKAT: Ön işlem sırasında isimler, telefon numaraları ve e-posta adresleri gibi kişisel bilgiler ham metinde görünürse silinecektir.

4. Aday terimlerini Çince ve İngilizce olarak çıkar

  1. Sabit kullanıcı sözlüğü kaynakları/userdict_zh.txt ile jieba sürüm 0.42.1 kullanarak Çince metnini segmente edin ve ardışık 2–8 Çince karakteri veya 2–6 Çin karakteri ile aralarında bir ayrılanadayları saklayın.
  2. İngilizce metni spaCy sürüm 3.7.2 ile 3.7.1 sürüm en_core_web_sm işleyin ve sadece isim cümleleri ve 1–5 işaret içeren tireli bileşikler18 tutun.
  3. Kuru sayısını temizlenmiş korpusta her adayın toplam karşılaşma sayısı olarak hesaplayın ve doc_freq o adayı en az bir kez içeren farklı source_id dosyalarının sayısı olarak hesaplayın.
  4. Kısa liste eşiklerini uygulayarak sadece doc_freq ≥ 2 ve ≥ 3 koşulu adaylar tutulur ve kalan19 adayları çıkarır.
    NOT: Bu kısa liste eşikleri, nispeten küçük, tür dengeli bir korpus için seçildi. Daha büyük veya daha heterojen korporalar için, eşikler pilot incelemeden sonra ayarlanabilir.
  5. Adaylar/Candidates_ZH.xlsx ve adaylar/Candidates_EN.xlsx terim, freq, doc_freq, example_source_id ve example_snippet sütunlarıyla dışa aktarın.
  6. Adaylar/Shortlist_ZH.xlsx ve adaylar/Shortlist_EN.xlsx aynı sütunları kullanarak dışa aktarın; Çince kesitleri ±20 karakter olarak, İngilizce kesitler ise bir onaylanmış olay etrafında ±10 token olarak gösterilir.
  7. Tokenizer veya etiketleyici isimlerini ve sürümlerini, aday kalıplarını ve kısa liste eşiklerini loglar/thresholds.txt'a kaydedin.
  8. Kaynaklar/userdict_zh.txt için bir kontrol toplamı hesaplayın, bunu logs/thresholds.txt'a kaydedin ve donmuş bir kopyayı çıktı/userdict_zh_v1.txt20 olarak kaydedin.
    NOT: Shortlist_ZH.xlsx ve Shortlist_EN.xlsx açın ve her iki dosyanın da sıfır olmayan satır ve doldurulmuş example_snippet alanları içerdiğini doğrulayın.

5. İki dilli hizalama adayları oluşturun ve dönem çiftlerini sıralayın

  1. Her kısa listeye alınan Çin terimi için, her karşılaşmanın etrafında ±20 Çince karakterlik bağlam pencereleri toplayın ve ctx_zh adlı tek bir bağlam dizisi oluşturmak için beş pencereye kadar birleştirin.
  2. Her kısa listeye alınan İngilizce terim için, her karşılaşma etrafında ±10 token bağlam penceresi toplayın ve ctx_en adında bir bağlam dizisi oluşturmak için en fazla beş pencereyi birleştirin.
  3. İki dilli haritalama kaynağını oluştur ve dondur.
    1. term_zh ve term_zh_en sütunlarıyla kaynaklar/term_map_zh2en.xlsx oluşturun.
    2. Dosyayı mevcut kurumsal sözlükler, daha önce kabul edilmiş iki dilli terim listeleri ve kural temelli normalleştirme gibi yetkili bir süreçle doldurun.
    3. Donmuş eşlemeyi çıkış/term_map_zh2en_v1.xlsx olarak kaydet.
    4. Dondurma tarihini, kapsama haritasını ve kayıt hesaplarını loglar/alignment_log.txt içinde kaydedin. NOT: Bu iş akışını yeni bir alana uyarlarken, haritalama kaynağına yüksek frekanslı alan terimlerinin tohum listesiyle başlayın ve tabloyu puanlama sırasında değil, tam tekrarlar arasında genişletin.
  4. Her term_zh donmuş eşleme term_zh_en İngilizce benzeri bir forma eşlenin ve aynı haritalama kaynağını tam21 boyunca koruyun.
  5. Donmuş eşlemeyi ctx_zh'e uygulayarak ctx_zh_en oluşturun, eşleşen term_zh örneklerini term_zh_en ile değiştirerek diğer tüm metinleri değiştirmeyip değiştirin.
  6. Haritalama ve normalizasyon prosedürünü kaydedin.
    1. Eşleme prosedürünü logs/alignment_log.txt içinde kaydedin.
    2. Tüm normalizasyon kurallarını, küçük harf ve tire normalizasyonu dahil, logs/alignment_log.txt içinde kaydedin.
  7. RapidFuzz versiyon 3.6.1 kullanarak dize benzerlik S_str puanını hesaplayın token_sort_ratio normalize İngilizce terim dizelerini term_zh_en ile term_en arasındaki karşılaştırın ve sonucu 100'e bölerek puanı [0, 1]22 aralığına ölçeklendirin.
  8. Bağlam benzerlik puanını hesaplayın S_ctx.
    1. Sabit parametrelerle scikit-learn sürüm 1.4.2 ve TfidfVectorizer kullanın; sabitlenmiş parametreler küçük harf=True, ngram_range=(1, 2), min_df=1, max_df=0.95 ve stop_words="english"23.
    2. Vektörizatoru mevcut koşudan ctx_en ve ctx_zh_en dizimlerinin birleşik kümesine yerleştirin.
    3. Hesaplama S_ctx her ctx_zh_en teli ile her ctx_en teli arasındaki kosinüs benzerliği olarak hesaplar.
      NOT: TF-IDF, her bağlam penceresinde kelimelerin ve kısa ifadelerin göreceli önemini temsil eder ve ortaya çıkan bağlam temsillerini karşılaştırmak için kosinüs benzerliği kullanılır.
  9. Nihai benzerlik puanını hesaplayın ve aday çiftleri sıralayın.
    1. Final skoru S = 0.60 × S_str + 0.40 × S_ctx olarak hesaplayın.
    2. Her Çin terimi için, en üst k = 3 İngiliz adayı S ile sıralanmış olarak korun.
    3. Her benzersiz (term_zh, term_en) çift için en yüksek puan alan örneği tutarak, tekrarları kaldırın.
    4. k kaydı, skor ağırlıkları ve toplam dışa aktarılan çift sayısı loglar/alignment_log.txt24.
      NOT: Ağırlık şeması ve k değeri, yönetilebilir bir inceleme setini korumak ve makul alternatifleri korumak için seçildi. Daha büyük korporasyonlar veya daha değişken terimler için, bu ayarlar pilot testlerden sonra ayarlanabilir.
  10. Sabit anahtar kelime haritası resources/domain_keywords.csv ve aşağıdaki öncelik sırasını kullanarak domain_tag değerleri atayın: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    NOT: İş akışını başka bir konu alanına aktarırken, anahtar kelime haritasını değiştirin ve öncelik sırasını revize ederek tam boru hattını yeniden çalıştırın.
  11. Anahtar kelime haritasının donmuş bir kopyasını çıktı/domain_keywords_v1.csv olarak kaydedin ve kontrol toplamını logs/alignment_log.txt'a kaydedin.
  12. Raket hizalama/AlignmentPairs.xlsx pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en ve evidence_snippet_zh_en sütunlarıyla birlikte alın.
  13. Her çifti şu kesim değerleri kullanarak auto_accept, inceleme veya auto_reject olarak etiketleyin: S ≥ 0.90, 0.75 ≤ S ≤ 0.89 ve S < 0.75, ve her etiket grubundaki kesim ve sayıları log/alignment_log.txt olarak kaydet.
    NOT: Bu çalışmada kullanılan standart masaüstü ortamında, bu büyüklükte bir korpus için bağlam oluşturma, TF-IDF uyumu ve benzerlik puanlaması birkaç dakika içinde tamamlandı.
    NOT: AlignmentPairs.xlsx'de en az 10 satırı rastgele inceleyin ve evidence_snippet_zh_en'nin mevcut olduğunu ve haritalanmış vakalar için term_zh_en boş olmadığını doğrulayın.
    DIKKAT: Tüm haritalama kaynaklarını bir koşu içinde sabit tutun. Puan belirleme başladıktan sonra iki dilli eşleme tablosunu veya anahtar kelime haritasını güncellemeyin.

6. Terim çiftlerini uzman açıklama ve değerlendirme ile doğrulayın

  1. pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, yargı ve mantık sütunlarıyla doğrulama/Annotation.xlsx oluşturun.
  2. Seramik kültürel turizmde kavramsal eşdeğerlik, kabul edilebilir açıklayıcı çeviriler ve kısmi örtüşme, aşırı genel çizimler ve uyumsuz eser türleri gibi hariç durumları tanımlayan tek sayfalık bir açıklamarehberi hazırlayın 26.
  3. İki annotatora, sağlanan kanıt parçalarını kullanarak her çifti bağımsız olarak dahil etme veya hariç olarak etiketlemeleri ve annotatörlerin birbirlerinin kararlarını görmelerine izin vermemelerini talimatlayın.
  4. Bağımsız açıklamadan sonra tüm anlaşmazlıkları gözden geçirin ve nihai kararı ile tek cümlelik gerekçeyi karar ve gerekçe sütunlarına kaydedin.
  5. Ham uyum ve Cohen'in κ'sini dahil et ve hariç etiketleri kullanarak hesaplayın ve anlaşma metriklerini ve dahil etme ve hariç toplamlarını çıktı/Evaluation.xlsx27 olarak kaydedin.
  6. Dışlanan çiftleri gözden geçirerek sistematik yanlış pozitif kalıpları tespit edin ve en sık reddedilen desenleri log/rule_update_v1.txt'de kaydedin.
  7. Tamamlanmış notasyon dosyasının donmuş bir kopyasını çıktı/Annotation_v1.xlsx olarak kaydedin ve bu noktadan sonra karar verilen etiketleri değiştirmeyin.
    NOT: Protokol burada duraklatılabilir. Daha sonra devam edecekse, dondurulmuş doğrulama kararlarını revizyona çevirmeyin.

7. Sözlüğü tamamla ve dışa aktar

  1. Tablo 2'de özetlenen giriş alanlarını kullanarak son sözlüğü doldurun; bunlar arasında iki dilli terim formları, konuşma bölümü, alan etiketleri, çeviri türü, iki dilli tanımlar, kullanım örnekleri, kaynak bilgileri ve kalite bayrakları bulunur.
  2. Tüm dışa aktarmalarda aynı entry_id değerlerini kullanın ve dosya oluşturmadan önce tanımlayıcı tutarlılığını onaylayın.
  3. Son tabloyu çıktı/FinalLexicon.xlsx olarak dışa aktarın ve kaydetmeden önce gerekli tüm alanların doldurulduğunu doğrulayın.
  4. TBX dışa aktarmasını oluşturup doğrulayın.
    1. İzlenebilirliği korumak için aynı entry_id değerleri kullanarak bir TBX dosyası oluşturun.
    2. TBX dosyasını amaçlanan TBX şemasına göre doğrulayın.
    3. Doğrulama sonucunu logs/run_notes.txt28'de kaydedin.
  5. Tüm logları, parametre dosyalarını, dondurulmuş kaynakları ve çıktıları sürümlü klasördeki çıktılar/Lexicon_v1/ arşivleyin ve dosya sayılarını logs/run_notes.txt'da kaydedin.
  6. Girişler/userdict_zh_v1.txt, çıktılar/çıktılar/domain_keywords_v1.csv, çıktılar/term_map_zh2en_v1.xlsx, loglar/thresholds.txt ve loglar/alignment_log.txt dahil olmak üzere betikleri, dondurulmuş kaynakları ve parametre kayıtlarını Ek Dosyalar olarak sağla.
  7. Aynı dosya yapısı ve çıkış şemasını kullanarak korpusun izin onaylı bir doğrulama alt kümesi sağlayışın; böylece okuyucular serbest bırakılanalt küme 29'da iş akışını yeniden üretebilsin.
    DIKKAT: Ek materyalleri paylaşmadan önce, yayın paketinde telif hakkı korumalı tam metinler, hassas tanımlayıcılar veya yetkisiz kurumsal kaynakların yer almadığını doğrulayın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Korpus montajı ve temizleme verimi
Tablo 1'de gösterilen korpus tasarımına tabikat, müze ve sergi metinleri, miras tanımları ve ziyaretçilere yönelik turizm materyallerinden kayıtlı iki dilli bir korpus oluşturuldu. Temizlikten sonra, korpus 12 Çin ve 8 İngilizce belgeden oluşuyordu; toplamda 47.843 Çin karakteri ve 32.193 İngilizce karakter30 idi. Korpus, teknik, yorumlayıcı ve turizm odaklı materyallerin amaçlanan kombinasyon...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokolün temel değeri, genellikle gayri resmi olarak ele alınan bir terminoloji görevini tekrarlanabilir ve incelenebilir bir iş akışına dönüştürme yeteneğinde yatmaktadır. Seramik kültürel turizminde, birçok terim hem teknik hem de yorumlayıcıdır: sadece malzemelere, fırın türlerine, pişirme aşamalarına veya dekoratif tarzlara değil, aynı zamanda bu kavramların ziyaretçilere etiketler, anlatılar ve eğitim materyallerinde nasıl aktarıldığınıda ifade eder 36. ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu çalışmayla ilgili rekabet eden finansal veya finansal olmayan çıkarları olmadığını belirtmektedir.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, korpus inşamı ve doğrulama sırasında metin materyallerine ve alan geri bildirimlerine erişim sağlayan seramik kültürel turizm uygulayıcılarına ve müze personeline teşekkür etmektedir. Yazarlar ayrıca, hizalama adaylarını dikkatlice inceledikleri ve giriş tasarımı üzerine yapıcı yorumlar yaptıkları için iki bağımsız alan anlatıcısına teşekkür etmektedir. Bu çalışma, Jiangxi Yükseköğretim Derneği'nin "DeepSeek ve Çok Kanallı Yayım Modeline Dayalı Çin Seramik Turizm Terminolojisinin Akıllıca İngilizce Çevirisi Üzerine Çalışma" adlı Araştırma Projesi tarafından desteklenmiştir (Grant No. WY-D-115).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Computer workstationDonanımPython 3.11 çalıştırma ve metin korpuslarını işleme yeteneğine sahip her modern bilgisayar; ≥8 GB RAM önerilirKatalog numarası gerekmez
Kaynak: Genel (herhangi bir tedarikçi)
İşletim sistemiYazılımWindows 10/11, macOS veya Linux (tam OS sürümünü loglar/run_notes.txt'de kaydedin)Sürüm, run_notes.txt'de kaydedilmiştir
Kaynak: Sisteme yüklü
PythonYazılımPython 3.11Sürüm, logs/pip_freeze.txt'de kaydedilmiştir
Kaynak: Python Software Foundation dağıtımı
jiebaYazılım kütüphanesi0.42.1jieba==0.42.1
Kaynak: PyPI paket deposu
spaCyYazılım kütüphanesi3.7.2spacy==3.7.2
Kaynak: PyPI paket deposu
İngilizce boru hattı modeliNLP modelien_core_web_sm 3.7.1 (spaCy model paketi)en_core_web_sm==3.7.1; kurulum, run_notes.txt'de kaydedilmiştir
Kaynak: spaCy model deposu
scikit-learnYazılım kütüphanesi1.4.2scikit-learn==1.4.2
Kaynak: PyPI paket deposu
RapidFuzzYazılım kütüphanesi3.6.1RapidFuzz==3.6.1
Kaynak: PyPI paket deposu
Elektronik tablo düzenleyiciYazılım.xlsx dosyalarını düzenleyebilen herhangi bir yazılımSourceRegister.xlsx, CorpusStats.xlsx, Candidates/Shortlist dosyalarını görüntülemek/düzenlemek için kullanılır
Kaynak: Genel (herhangi bir tedarikçi)
Düz metin düzenleyiciYazılım.txt ve.csv dosyalarını düzenleyebilen herhangi bir yazılımloglar/.txt ve kaynaklar/.csv dosyalarını görüntülemek/düzenlemek için kullanılır
Kaynak: Genel (herhangi bir tedarikçi)
UTF-8 metin dönüştürme aracıYazılımBelgeleri UTF-8 düz metne dışa aktarabilen herhangi bir araç2.3 Adımında kullanılır; tam yöntem, run_notes.txt'de kaydedilmiştir
Kaynak: Genel (herhangi bir tedarikçi)
SourceRegister şablonuDosya şablonusource_id, title, owner/publisher, language, genre, access_date, license_note alanlarına sahip SourceRegister.xlsxoutputs/SourceRegister_v1.xlsx olarak dondurulmuş
Kaynak: Bu çalışmada oluşturuldu
Korpus istatistikleri şablonuDosya şablonusource_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_ruleset alanlarına sahip CorpusStats.xlsx3.6 Adımı sırasında oluşturuldu
Kaynak: Bu çalışmada oluşturuldu
Çince kullanıcı sözlüğüKaynak dosyasıresources/userdict_zh.txt (segmentasyon desteği için alan-özgü terim listesi)Dondurulmuş kopya kaydedildi; toplam kontrol kaydı, thresholds.txt'de kaydedildi
Kaynak: Bu çalışmada oluşturuldu/küratörlüğü yapıldı
Alan anahtar kelime haritasıKaynak dosyasıdomain_tag öncelik kuralları ile resources/domain_keywords.csvoutputs/domain_keywords_v1.csv olarak dondurulmuş; toplam kontrol, alignment_log.txt'de kaydedildi
Kaynak: Bu çalışmada oluşturuldu/küratörlüğü yapıldı
Çince-İngilizce terim eşleme tablosuKaynak dosyasıterm_zh ve term_zh_en sütunlarına sahip resources/term_map_zh2en.xlsxoutputs/term_map_zh2en_v1.xlsx olarak dondurulmuş; kapsam, alignment_log.txt'de kaydedildi
Kaynak: Bu çalışmada oluşturuldu/küratörlüğü yapıldı
Eşik loguLog dosyasıloglar/thresholds.txt (kalıplar, eşikler, kütüphane sürümleri, kaynak kontrol toplamları)Deterministik yeniden çalışmalar için gerekli
Kaynak: Bu çalışmada oluşturuldu
Hizalama loguLog dosyasıloglar/alignment_log.txt (ağırlıklar, k, eşikler, vektörleyici ayarları, eşleme kapsamı, eşleme kontrol toplamları)Deterministik yeniden çalışmalar için gerekli
Kaynak: Bu çalışmada oluşturuldu
Etiketleme sayfasıDosya şablonuvalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisions, adjudication, rationale)6.6 Adımından sonra outputs/Annotation_v1.xlsx olarak dondurulmuş
Kaynak: Bu çalışmada oluşturuldu
Değerlendirme çıktısıÇıktı dosyasıoutputs/Evaluation.xlsx (ham anlaşma, Cohen’s κ, toplamlar)6.4 Adımında üretildi
Kaynak: Bu çalışmada oluşturuldu
Son sözlük dışa aktarılmasıÇıktı dosyasıTable 2 şemasına uygun outputs/FinalLexicon.xlsx7.2 Adımında üretildi
Kaynak: Bu çalışmada oluşturuldu
TBX dışa aktarılmasıÇıktı dosyasıFinalLexicon.xlsx'ten oluşturulan ve kararlı entry_id eşlemesi ile TBX dosyasıDoğrulama sonucu, run_notes.txt'de kaydedildi
Kaynak: Bu çalışmada oluşturuldu

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

DavranSay 233Say 233T mSayBo De erSayiki dilli terminolojis zl k olu turmaotomatik terim kar miki dilli terim hizalamauzman do rulamasTBX TermBase eXchangek lt rel miras yorumlamaince ngilizce eviri

İlgili makaleler