Artykuł metodologiczny

Zwęzły protokół dotyczący konstruowania chińskiego– angielskiego słownictwa turystyki kulturowej z wykorzystaniem zarejestrowanych korpusów

DOI:

10.3791/71320

3 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół tworzy chiński-angielski słownik turystyki kulturalnej związanej z ceramiką, wykorzystując zarejestrowane korpusy dwujęzyczne, standaryzowane czyszczenie, ekstrakcję kandydatów do terminów, wyrównanie w oparciu o podobieństwo oraz walidację ekspercką z arbitrażem. Korzystając z tego procesu, 60 zweryfikowanych wpisów zostało eksportowanych z definicjami, przykładami użycia, zapisami pochodzenia oraz wynikami zgodnymi z TBX.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tworzenie dwujęzycznych zasobów terminologicznych dla turystyki kulturalnej związanej z ceramiką jest wyzwaniem, ponieważ odpowiednie teksty są często fragmentami, wybory tłumaczeń są niejednolite, a powtarzalne przepływy pracy dotyczące konstrukcji są rzadko dokumentowane. Ten protokół przedstawia powtarzalny, krok po kroku przepływ pracy nad stworzeniem chińsko-angielskiego leksykonu turystyki kulturalnej związanej z ceramiką poprzez rejestrację i oczyszczanie korpusu, wyodrębnianie kandydatów na wyrazy, dwujęzyczne dopasowanie oraz walidację przez ekspertów z orzecznictwem. Zastosowany do zarejestrowanego dwujęzycznego korpusu, przepływ pracy wygenerował wybrane kandydatów na wyrazy po chińsku i angielsku, wyprodukował uporządkowane pary dwujęzycznych terminów i zachował zweryfikowane dopasowania po niezależnej recenzji ekspertów. Skompletowany leksykon eksportował 60 zweryfikowanych wpisów z dwujęzycznymi formami terminów, etykietami dziedzin, typami tłumaczeń, dwujęzycznymi definicjami, przykładami użycia, zapisami pochodzenia oraz interoperacyjnymi wynikami, takimi jak pliki Excel i TBX. Aby wspierać przejrzystość i możliwość ponownego uruchomienia, protokół rejestruje także progi, wersje pakietów, zamrożone zasoby i decyzje walidacyjne na całym przepływie pracy. Dzięki temu procedura jest podatna na audyt i łatwiejsza do zastosowania w innych dziedzinach turystyki dziedzictwa kulturowego. Po przeniesieniu do nowej dziedziny, użytkownicy mogą rozszerzyć listę słów kluczowych dziedziny, zaktualizować dwujęzyczny zasób mapowania i dostosować niewielką liczbę progów kandydatów i podobieństwa zgodnie z wielkością korpusu i gęstością terminologii.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Turystyka kulturowa stała się ważnym czynnikiem rozwoju miejsc przeznaczonych dla podróżników, którzy coraz częściej szukają doświadczeń opartych na dziedzictwie kulturowym, które są znaczące, a nie tylko rekreacyjne1. Na poziomie polityki i przemysłu, międzynarodowe organizacje wielokrotnie podkreślały wartość łączenia turystyki z kulturą oraz poprawę interpretacji, dokumentacji i komunikacji w różnorodnych aktywach dziedzictwa1. W szerszym kontekście turystyka kulturowa ceramiki jest szczególnie bogata w terminologię, ponieważ odwiedzający regularnie spotykają się z wyspecjalizowanymi pojęciami dotyczącymi materiałów, procesów szkliwienia i wypalania, technologii pieców, motywów stylistycznych, typów artefaktów oraz narracji o procesach rzemieślniczych. Te terminy często mają znaczenia techniczne, które nie są łatwo przekazywane poprzez przypadkowe parafrazy, a wybory tłumaczeniowe mogą bezpośrednio kształtować to, co odwiedzający rozumie z etykiet, interpretacji przewodników oraz materiałów edukacyjnych2. Jednocześnie, ramy dziedzictwa podkreślają, że ochrona niematerialnego dziedzictwa kulturowego zależy od ciągłej transmisji wiedzy i świadomości publicznej, które wymagają języka, który jest dokładny, dostępny i odpowiedni kontekstowo dla interpretacji i edukacji3.

Mimo tego zapotrzebowania, zasoby terminologiczne dwuizyczne dla turystyki kulturowej ceramiki pozostają rozproszone i niespójne. W etykietach muzealnych, tekstach wystaw, stronach przewodników turystycznych i opisach dziedzictwa, ten sam koncept może być oddany różnie w różnych instytucjach, regionach i ustawieniach komunikacyjnych4. Taka różnorodność nie jest tylko stylistyczna. Może wpływać na zrozumienie odwiedzających, zmniejszać porównywalność opisów między stronami i osłabiać postrzeganą wiarygodność komunikacji o dziedzictwie5. Badania nad terminologią od dawna argumentują, że wysokiej jakości zasoby terminowe powinny być zorientowane na pojęcia, wspierane przez jasne definicje i zakotwiczone w śledzonym dowodzie, takim jak źródła, konteksty i zapisy kontroli jakości6. Jednak wiele zespołów dziedzinowych nadal nie posiada procesu, który mógłby systematycznie przekształcić rozproszone teksty w spisane dwuizyczne leksykony, zachowując przezroczyste zasady decyzyjne, powtarzalne procedury i ponownie używalne wyniki7. W porównaniu z przypadkową manualną kompilacją, znormalizowany protokół oferuje jaśniejszą dokumentację, bardziej spójną weryfikację i lepsze warunki do aktualizacji, audytów i ponownego użycia między instytucjami.

Aby sprostać tym wyzwaniom, praktyczny protokół budowy dwuizycznego leksykonu musi zorganizować dwa powiązane zadania: odkrywanie kandydatów do terminów i dwuizyczne dopasowanie. Dla odkrywania terminów, automatyczne wyciąganie oparte na korpusie może zmniejszyć zależność od całkowicie manualnego zbierania, łącząc wzorce językowe ze statystycznymi dowodami, ułatwiając identyfikację terminologii istotnej dla dziedziny w dużej skali8. W ustawieniach dziedzictwa kulturowego, jednak, budowa korpusu rzadko jest prosta. Materiały źródłowe często różnią się stylem, rejestrem i celem komunikacyjnym, a mogą zawierać nazwy specyficzne dla dziedziny i mieszane konwencje opisowe9. Te cechy sprawiają, że przejrzyste rejestrowanie parametrów i stabilne reguły przetwarzania są szczególnie ważne. Dla dwuizycznego dopasowania, metody komputerowe mogą generować sklasyfikowane kandydacki pary międzyjęzykowe, porównując formy terminów i ich otaczające konteksty użycia, po czym eksperci z dziedziny mogą zweryfikować, czy proponowane pary są koncepcyjnie odpowiednie10. W tym protokole, automatyzacja jest używana do generowania i klasyfikowania prawdopodobnych kandydatów, podczas gdy recenzja ekspertów jest używana do potwierdzenia lub odrzucenia ich później. Ta kombinacja poprawia efektywność bez usuwania interpretacyjnego osądu z ostatecznej decyzji. Ponieważ terminologia dziedzictwa często ma implikacje kulturowe i edukacyjne, recenzenci muszą być w stanie sprawdzić dowód za każdą zaproponowaną parą, zamiast polegać na nieprzejrzystym wyjściu11.

Tutaj przedstawiono krok po kroku i audytowalny protokół budowy chińskiego–angielskiego leksykonu turystyki kulturowej ceramiki z zarejestrowanych źródeł tekstowych. Workflow standaryzuje rejestrację korpusu i czyszczenie, dwuizyczne wyciąganie kandydatów, generowanie sklasyfikowanych par, recenzję dwóch anotatorów z orzecznictwem oraz końcowe ukończenie wpisu według stałego schematu. Integrując rejestrację wersji, kontrolę progów, zamrożone zasoby i walidację ekspertów, protokół poprawia reprodykowalność, możliwość audytu i standaryzację względem mniej strukturalnych workflowów budowy terminologii. Aby wspierać dłuższy czas ponownego użycia w zarządzaniu terminologią i praktyce tłumaczeniowej, sfinalizowany leksykon może być również eksportowany w formacie TermBase eXchange (TBX), który jest zgodny z ISO i przeznaczony do strukturalnej wymiany danych terminologicznych12</

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie wykorzystało tylko dane tekstowe dostępne publicznie lub autoryzowane przez instytucję i nie obejmowało badań na ludziach ani na zwierzętach. Nie była wymagana zgoda etyczna instytucji.

1. Utwórz przestrzeń roboczą projektu

  1. Utwórz folder projektu i następujące podfoldery: corpus_raw, corpus_clean, candidates, alignment, validation, outputs, logs i resources.
  2. Utwórz log uruchomienia i zapisz ustawienia środowiska.
    1. Utwórz logs/run_notes.txt.
    2. Zapisz datę/godzinę uruchomienia, wersję systemu operacyjnego i zakres projektu jako “Chińsko-angielskie terminologie dotyczące turystyki kulturalnej związanej z ceramiką”.
    3. Ustaw interpreter Pythona na Python 3.11 i zapisz tę informację w logs/run_notes.txt.
  3. Uruchom python -m pip freeze > logs/pip_freeze.txt i upewnij się, że logs/pip_freeze.txt zostało wygenerowane i nie jest puste13.
  4. Utwórz plik zależności i zainstaluj środowisko oprogramowania.
    1. Utwórz resources/requirements.txt.
    2. Wypisz wersje pakietów rdzeniowych użytych w tym protokołe: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 i RapidFuzz==3.6.1.
    3. Zapisz polecenie instalacyjne w logs/run_notes.txt.
    4. Zainstaluj en_core_web_sm==3.7.1. 1.4.5 Uruchom python -m spacy validate i zapisz zweryfikowaną wersję modelu w logs/run_notes.txt.
      UWAGA: Przed kontynuowaniem upewnij się, że oba pliki logs/pip_freeze.txt i logs/run_notes.txt istnieją i nie są puste.

2. Skompiluj zbalansowane dwujęzyczne korpus i zarejestruj źródła

  1. Wybierz źródła, aby pasowały do składu dwuizycznego i gatunkowego przedstawionego w Tabeli 1 i przypisz każdemu dokumentowi unikalne source_id, takie jak S001 lub S00214.
  2. Utwórz SourceRegister.xlsx i zapisz dla każdego dokumentu source_id, tytuł, właściciel/wydawca, język, gatunek, data dostępu i license_note.
  3. Przekształć każdy dokument na zwykły tekst UTF-8, nazwać każdy plik jako source_id_lang.txt (np. S001_zh.txt lub S001_en.txt) i zapisz pliki w corpus_raw.
  4. Zapisz zamrożoną kopię rejestru jako outputs/SourceRegister_v1.xlsx i zapisz datę zamrożenia oraz łączną liczbę dokumentów (n_docs_zh i n_docs_en) w logs/run_notes.txt.
    UWAGA: Protokół można tutaj wstrzymać. Jeśli wznawia się później, nie zmieniaj przypisań source_id.
    OSTRZEŻENIE: Używaj tylko tekstów dostępnych publicznie lub autoryzowanych przez instytucję. Nie rozprowadzaj chronionych prawami autorskimi pełnych tekstów bez wyraźnej zgody.

3. Oczyść i normalizuj pliki korpusu

  1. Usuń linie tylko z nawigacją, linie tylko z URL-ami i powtórzone nagłówki lub stopki powtarzające się w co najmniej trzech dokumentach. Zachowaj pozostałe linie w oryginalnej kolejności15.
  2. Zachowaj interpunkcję, która może tworzyć część wielowyrazowych lub złożonych terminów podczas czyszczenia, w tym myślnik (-), ukośnik (/), nawiasy (( i )) i kropka środkowa (·).
  3. Normalizuj tekst chiński, konwertując pełnoszerokościowe znaki alfanumeryczne na znaki o połowę szerokości i standaryzując formy nawiasów do ( i ).
  4. Normalizuj tekst angielski, ściągając powtórzone spacje do pojedynczej spacji i standaryzując wszystkie warianty myślników do ASCII myślnika (-), zachowując jednocześnie złożone z myślnikiem słowa.
  5. Zapisz każdy oczyszczony plik do corpus_clean, używając tej samej nazwy pliku source_id_lang.txt jak w corpus_raw.
  6. Zapisz source_id, lang, n_chars_before, n_chars_after, timestamp i cleaning_ruleset ustawione na v1.0 w outputs/CorpusStats.xlsx16.
    UWAGA: Dla każdego języka upewnij się, że każdy plik w corpus_raw ma odpowiednik w oczyszczonym pliku w corpus_clean o tym samym source_id i sufiksie językowym.
    OSTRZEŻENIE: Usuń informacje osobiste, takie jak imiona, numery telefonów i adresy e-mail, podczas przetwarzania wstępnego, jeśli takie informacje pojawiają się w surowym tekście.

4. Wyodrębnij kandydatów do terminów w języku chińskim i angielskim

  1. Segmentuj tekst chiński za pomocą wersji jieba 0.42.1 z zasobami słownika użytkownika resources/userdict_zh.txt i zachowaj kandydatów pasujących do 2–8 kolejnych znaków chińskich lub 2–6 znaków chińskich oddzielonych jednym zachowanym delimiterem17.
  2. Przetwarzaj tekst angielski za pomocą spaCy wersji 3.7.2 z en_core_web_sm wersja 3.7.1 i zachowaj tylko frazy rzeczownikowe i złożone z myślnikiem słowa

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zbiór korpusu i wydajność oczyszczania
Zgodnie z projektem korpusu przedstawionym w Tabeli 1, zarejestrowany dwujęzyczny korpus został skompletowany z tekstów muzealnych i wystawowych, opisów dziedzictwa kulturowego oraz materiałów turystycznych skierowanych do odwiedzających. Po oczyszczeniu korpus składał się z 12 chińskich dokumentów i 8 angielskich dokumentów, obejmując 47 843 chińskie znaki i 32 193 angielskie znaki30. Korpus zachował zamierzone połącze...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Główną wartość tego protokołu stanowi jego zdolność do przekształcenia zadania terminologicznego, które często jest realizowane nieformalnie, w przejrzysty i możliwy do powtórzenia przepływ pracy. W ceramicznym turystyce kulturalnej wiele terminów jest zarówno technicznych, jak i interpretacyjnych: odnoszą się nie tylko do materiałów, rodzajów pieców, etapów wypalania czy stylów dekoracyjnych, ale także do tego, jak te koncepcje są przekazywane gościom w etykietach, narracjach i materiałach edukacyjnych...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konkurencyjnych interesów finansowych ani niefinansowych związanych z tą pracą.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy dziękują praktykom z zakresu turystyki kulturalnej dotyczącej ceramiki oraz pracownikom muzeów, którzy zapewnili dostęp do materiałów tekstowych i opinii fachowych podczas budowy i walidacji korpusu. Autorzy dziękują również dwóm niezależnym anotatorom domeny za staranne przeglądanie kandydatów do dopasowania oraz konstruktywne uwagi dotyczące projektu wpisu. Praca ta była wspierana przez projekt badawczy Jiangxi Association of Higher Education zatytułowany “Badanie nad inteligentnym tłumaczeniem angielskim chińskiej terminologii turystyki ceramicznej na podstawie DeepSeek i jego modelu wielokanałowego rozpowszechniania” (Grant No. WY-D-115).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Komputer stacjonarnySprzętKażdy nowoczesny komputer zdolny do uruchomienia Pythona 3.11 i przetwarzania korpusów tekstowych; zalecane >=8 GB RAMBrak wymogu numeru katalogowego
Źródło: Generyczne (dowolny dostawca)
System operacyjnyOprogramowanieWindows 10/11, macOS lub Linux (dokładna wersja systemu zapisywana w logs/run_notes.txt)Wersja zapisywana w run_notes.txt
Źródło: Zainstalowane w systemie
PythonOprogramowaniePython 3.11Wersja zapisywana w logs/pip_freeze.txt
Źródło: Dystrybucja Python Software Foundation
jiebaBiblioteka oprogramowania0.42.1jieba==0.42.1
Źródło: Repozytorium pakietów PyPI
spaCyBiblioteka oprogramowania3.7.2spacy==3.7.2
Źródło: Repozytorium pakietów PyPI
Angielski model potokuModel NLPen_core_web_sm 3.7.1 (pakiet modelu spaCy)en_core_web_sm==3.7.1; instalacja zapisywana w run_notes.txt
Źródło: Repozytorium modeli spaCy
scikit-learnBiblioteka oprogramowania1.4.2scikit-learn==1.4.2
Źródło: Repozytorium pakietów PyPI
RapidFuzzBiblioteka oprogramowania3.6.1RapidFuzz==3.6.1
Źródło: Repozytorium pakietów PyPI
Edytor arkuszy kalkulacyjnychOprogramowanieDowolne oprogramowanie zdolne do edycji plików.xlsxUżywane do przeglądania/edycji SourceRegister.xlsx, CorpusStats.xlsx, plików Candidates/Shortlist
Źródło: Generyczne (dowolny dostawca)
Edytor tekstu prostegoOprogramowanieDowolne oprogramowanie zdolne do edycji plików .txt i.csvUżywane do przeglądania/edycji logs/.txt i resources/.csv
Źródło: Generyczne (dowolny dostawca)
Narzędzie do konwersji tekstu UTF-8OprogramowanieDowolne narzędzie zdolne do eksportu dokumentów do prostego tekstu UTF-8Używane w kroku 2.3; dokładna metoda zapisywana w run_notes.txt
Źródło: Generyczne (dowolny dostawca)
Szablon SourceRegisterSzablon plikuSourceRegister.xlsx z polami: source_id, title, owner/publisher, language, genre, access_date, license_noteZablokowane jako outputs/SourceRegister_v1.xlsx
Źródło: Stworzone w tym badaniu
Szablon statystyk korpusuSzablon plikuCorpusStats.xlsx z polami: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGenerowane w kroku 3.6
Źródło: Stworzone w tym badaniu
Chiński słownik użytkownikaPlik zasobówresources/userdict_zh.txt (lista terminów specyficznych dla domeny wsparcia segmentacji)Zablokowana kopia zapisana; suma kontrolna zapisywana w thresholds.txt
Źródło: Stworzone/kuratowane w tym badaniu
Mapa słowa kluczowego domenyPlik zasobówresources/domain_keywords.csv z zasadami priorytetu domain_tagZablokowane jako outputs/domain_keywords_v1.csv; suma kontrolna zapisywana w alignment_log.txt
Źródło: Stworzone/kuratowane w tym badaniu
Tabela mapowania terminów chińsko-angielskichPlik zasobówresources/term_map_zh2en.xlsx z kolumnami term_zh i term_zh_enZablokowane jako outputs/term_map_zh2en_v1.xlsx; zasięg zapisany w alignment_log.txt
Źródło: Stworzone/kuratowane w tym badaniu
Log progówPlik logulogs/thresholds.txt (wzory, progi, wersje bibliotek, sumy kontrolne zasobów)Wymagane dla deterministycznych ponownych uruchomień
Źródło: Generowane w tym badaniu
Log alineacjiPlik logulogs/alignment_log.txt (wagi, k, progi, ustawienia wektoryzatora, zasięg mapowania, sumy kontrolne map)Wymagane dla deterministycznych ponownych uruchomień
Źródło: Generowane w tym badaniu
Arkusz adnotacyjnySzablon plikuvalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decyzje, orzeczenie, uzasadnienie)Zablokowane jako outputs/Annotation_v1.xlsx po kroku 6.6
Źródło: Stworzone w tym badaniu
Wynik ewaluacyjnyPlik wyjściowyoutputs/Evaluation.xlsx (suma zgody brutto, Cohen’s κ, sumarycznie)Generowane w kroku 6.4
Źródło: Generowane w tym badaniu
Ostateczny eksport leksykonuPlik wyjściowyoutputs/FinalLexicon.xlsx zgodnie ze schematem Tabeli 2Generowane w kroku 7.2
Źródło: Generowane w tym badaniu
Eksport TBXPlik wyjściowyPlik TBX wygenerowany z FinalLexicon.xlsx z mapowaniem stable entry_idWynik walidacji zapisywany w run_notes.txt
Źródło: Generowane w tym badaniu

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

ZachowanieNumer 233Numer 233WszystkieNumerPusta wartoNumerterminologia dwuj zycznatworzenie leksykon wautomatyczna ekstrakcja termin wdwuj zyczne wyr wnywanie termin wwalidacja eksperckaTBX TermBase eXchangeinterpretacja dziedzictwa kulturowegot umaczenie chi sko angielskie

Powiązane artykuły