Methodenartikel

Een reproduceerbaar protocol voor het construeren van een Chinees-Engels keramisch cultureel toerismelexicon met behulp van geregistreerde corpora

DOI:

10.3791/71320

3 juli 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol construeert een Chinees-Engels keramisch cultureel toerismelexicon met behulp van geregistreerde tweetalige corpora, gestandaardiseerde reiniging, kandidaattermextractie, gelijkenissen-gerangschikte uitlijning en expertvalidatie met beoordeling. Met deze workflow werden 60 geverifieerde vermeldingen geëxporteerd met definities, gebruiksvoorbeelden, herkomstrecords en TBX-compatibele uitvoer.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het opbouwen van tweetalige terminologiebronnen voor keramisch cultureel toerisme is uitdagend omdat relevante teksten vaak gefragmenteerd zijn, vertaalkeuzes inconsistent zijn en herbruikbare bouwworkflows zelden worden gedocumenteerd. Dit protocol biedt een reproduceerbare, stapsgewijze workflow voor het construeren van een Chinees-Engels keramisch cultureel toerismelexicon door middel van corpusregistratie en -reiniging, het extraheren van kandidaattermen, tweetalige uitlijning en deskundige validatie met beoordeling. Toegepast op een geregistreerd tweetalig corpus genereerde de workflow geselecteerde Chinese en Engelse kandidatentermen, produceerde gerangschikte tweetalige termenparen en behield gevalideerde uitlijningen na onafhankelijke deskundige beoordeling. Het definitieve lexicon exporteerde 60 geverifieerde vermeldingen met tweetalige termen, domeintags, vertaaltypes, tweetalige definities, gebruiksvoorbeelden, herkomstrecords en interoperabele uitvoer zoals Excel- en TBX-bestanden. Om transparantie en herhaalbaarheid te ondersteunen, registreert het protocol ook drempels, pakketversies, bevroren resources en validatiebeslissingen gedurende de hele workflow. Dit maakt de procedure auditeerbaar en eenvoudiger aan te passen aan andere erfgoedtoerismedomeinen. Wanneer gebruikers naar een nieuw domein worden overgezet, kunnen ze de domeinzoekwoordenlijst uitbreiden, de tweetalige mappingbron bijwerken en een klein aantal shortlist- en gelijkenisdrempels aanpassen op basis van corpusgrootte en terminologiedichtheid.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cultureel toerisme is een belangrijke drijfveer geworden voor de ontwikkeling van bestemmingen, aangezien reizigers steeds vaker op zoek zijn naar erfgoedgebaseerde ervaringen die betekenisvol zijn in plaats van puur recreatief. Op beleids- en industrieniveau hebben internationale organisaties herhaaldelijk de waarde benadrukt van het verbinden van toerisme met cultuur en het verbeteren van interpretatie, documentatie en communicatie over diverse erfgoedobjecten. Binnen deze bredere context is keramisch cultureel toerisme bijzonder terminologie-dicht omdat bezoekers regelmatig gespecialiseerde concepten tegenkomen met betrekking tot materialen, glazuur- en stookprocessen, oventechnologieën, stilistische motieven, artefakttypen en ambachtelijke verhalen. Deze termen dragen vaak technische betekenissen die niet gemakkelijk overgebracht zijn via een informele parafrase, en vertaalkeuzes kunnen direct bepalen wat bezoekers begrijpen van labels, begeleide interpretatie en educatief materiaal2. Tegelijkertijd hebben erfgoedkaders benadrukt dat het beschermen van immaterieel cultureel erfgoed afhankelijk is van duurzame kennisoverdracht en publieke bewustwording, die beide een taal vereisen die nauwkeurig, toegankelijk en contextueel geschikt is voor interpretatie en onderwijs3.

Ondanks deze vraag blijven tweetalige terminologiebronnen voor keramiek cultureel toerisme gefragmenteerd en inconsistent. Op museumlabels, tentoonstellingsteksten, toeristische gidspagina's en erfgoedbeschrijvingen kan hetzelfde concept verschillend worden weergegeven tussen instellingen, regio's en communicatieve omgevingen4. Dergelijke variatie is niet louter stijlistisch. Het kan het begrip van bezoekers beïnvloeden, de vergelijkbaarheid van beschrijvingen tussen locaties verminderen en de waargenomen geloofwaardigheid van erfgoedcommunicatie verzwakken5. Terminologieonderzoek stelt al lange tijd dat hoogwaardige termenbronnen conceptgericht moeten zijn, ondersteund door expliciete definities en verankerd in traceerbaar bewijs zoals bronnen, contexten en kwaliteitscontrolegegevens6. Toch missen veel domeinteams nog steeds een workflow die verspreide teksten systematisch kan omzetten in een zorgvuldig samengesteld tweetalig lexicon, terwijl transparante beslissingsregels, reproduceerbare procedures en herbruikbare outputbehouden blijven. In vergelijking met ad-hoc handmatige compilatie biedt een gestandaardiseerd protocol duidelijkere documentatie, consistentere validatie en betere voorwaarden voor update, auditing en hergebruik tussen instellingen.

Om deze uitdagingen aan te pakken, moet een praktisch protocol voor tweetalige lexiconconstructie twee gekoppelde taken organiseren: het ontdekken van kandidaattermen en tweetalige uitlijning. Voor termontdekking kan corpusgebaseerde automatische extractie de afhankelijkheid van volledig handmatige verzameling verminderen door taalkundige patronen te combineren met statistisch bewijs, waardoor het makkelijker wordt domeinrelevante terminologie op schaal8 te identificeren. In cultureel erfgoed is corpusconstructie echter zelden eenvoudig. Bronmaterialen verschillen vaak in stijl, register en communicatief doel, en kunnen domeinspecifieke namen en gemengde beschrijvende conventiesbevatten 9. Deze functies maken transparante parameterregistratie en stabiele verwerkingsregels bijzonder belangrijk. Voor tweetalige uitlijning kunnen computationele methoden gerangschikte cross-language kandidaatparen genereren door termvormen en hun omliggende gebruikscontexten te vergelijken, waarna domeinexperts kunnen verifiëren of de voorgestelde paren conceptueel geschikt zijn10. In dit protocol wordt automatisering gebruikt om eerst plausibele kandidaten te genereren en te rangschikken, terwijl deskundige beoordeling wordt gebruikt om ze daarna te bevestigen of af te wijzen. Deze combinatie verbetert de efficiëntie zonder interpretatieve beoordeling uit de uiteindelijke beslissing te verwijderen. Omdat erfgoedterminologie vaak culturele en educatieve implicaties heeft, moeten beoordelaars het bewijs achter elk voorgesteld paar kunnen inspecteren in plaats van te vertrouwen op een ondoorzichtig resultaatvan 11.

Hier wordt een stapsgewijze en controleerbare procedure gepresenteerd voor het samenstellen van een Chinees-Engels keramisch cultureel toerismelexicon uit geregistreerde tekstbronnen. De workflow standaardiseert corpusregistratie en -opruiming, tweetalige kandidaatextractie, generatie van gerangschikte paren, beoordeling met twee annotators en beoordeling, en het voltooien van de definitieve invoer onder een vast schema. Door versielogging, drempelcontrole, bevroren bronnen en expertvalidatie te integreren, verbetert het protocol reproduceerbaarheid, auditeerbaarheid en standaardisatie ten opzichte van minder gestructureerde terminologie-opbouwworkflows. Om langdurig hergebruik in terminologiebeheer en vertaalpraktijk te ondersteunen, kan het definitieve lexicon ook worden geëxporteerd in TermBase eXchange (TBX)-formaat, een ISO-georiënteerde standaard voor gestructureerde terminologische gegevensuitwisseling12.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie gebruikte uitsluitend openbaar beschikbare of door de instelling goedgekeurde tekstuele gegevens en betrof geen menselijke of dierlijke proefpersonen. Er was geen institutionele ethische goedkeuring vereist.

1. Maak de projectwerkruimte aan

  1. Maak een projectmap aan en de volgende submappen: corpus_raw, corpus_clean, kandidaten, uitlijning, validatie, outputs, logs en resources.
  2. Maak het run log aan en registreer de omgevingsinstellingen.
    1. Maak logs/run_notes.txt.
    2. Noteer de uitvoeringsdatum/tijd, besturingssysteemversie en projectomvang als "Chinees-Engelse keramische culturele toerismeterminologie".
    3. Stel de Python-interpreter in op Python 3.11 en registreer deze informatie in logs/run_notes.txt.
  3. Voer python -m pip freeze uit > logs/pip_freeze.txt en bevestig dat logs/pip_freeze.txt is gegenereerd en niet leeg13 is.
  4. Maak het dependency file aan en installeer de softwareomgeving.
    1. Maak bronnen/requirements.txt.
    2. Vermeld de kernpakketversies die in dit protocol worden gebruikt als volgt: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2, en RapidFuzz==3.6.1.
    3. Noteer het installatiecommando in logs/run_notes.txt.
    4. Installeer en_core_web_sm==3.7.1. 1.4.5 Voer python -m spacy uit, valideer en registreer de gevalideerde modelversie in logs/run_notes.txt.
      OPMERKING: Controleer of zowel logs/pip_freeze.txt als logs/run_notes.txt bestaan en niet leeg zijn voordat je verder gaat.

2. Stel een gebalanceerd tweetalig corpus samen en registreer bronnen

  1. Selecteer bronnen die passen bij de tweetalige en genrecompositie zoals weergegeven in Tabel 1 en ken elk document een unieke source_id toe, zoals S001 of S00214.
  2. Maak SourceRegister.xlsx aan en registreer voor elk document, source_id, titel, eigenaar/uitgever, taal, genre, access_date en license_note.
  3. Converteer elk document naar UTF-8 platte tekst, noem elk bestand als source_id_lang.txt (bijvoorbeeld S001_zh.txt of S001_en.txt) en sla de bestanden op in corpus_raw.
  4. Sla een bevroren kopie van het register op als outputs/SourceRegister_v1.xlsx en noteer de bevriesdatum en de documenttotalen (n_docs_zh en n_docs_en) in logs/run_notes.txt.
    OPMERKING: Het protocol kan hier worden gepauzeerd. Als je later weer begint, verander dan geen source_id opdrachten.
    VOORZICHTIG: Gebruik alleen openbaar toegankelijke of door de instelling goedgekeurde teksten. Verspreid geen auteursrechtelijk beschermde volledige teksten zonder expliciete toestemming.

3. Schoonmaak en normaliseer corpusbestanden

  1. Verwijder alleen navigatieregels, URL-only regels en gedupliceerde headers of footers die in ten minste drie documenten worden herhaald. Houd alle resterende lijnen in hun oorspronkelijke volgorde15.
  2. Behoud de interpunctie die deel kan uitmaken van meerwoord- of samengestelde termen tijdens het schoonmaken, waaronder het koppelteken (-), de slash (/), haakjes (( en )) en de middelste punt (·).
  3. Normaliseer Chinese tekst door alfanumerieke tekens van volledige breedte om te zetten naar halve breedte tekens en tussen haakjes te standaardiseren naar ( en ).
  4. Normaliseer Engelse tekst door herhaalde witruimte in één ruimte te vermengen en alle koppeltekenvarianten te standaardiseren naar het ASCII-koppelteken (-), terwijl de samengestelde verbindingen behouden blijven.
  5. Sla elk schoongemaakt bestand op in corpus_clean met dezelfde source_id_lang.txt bestandsnaam als in corpus_raw.
  6. Record source_id, lang, n_chars_before, n_chars_after, timestamp en cleaning_ruleset ingesteld als v1.0 in outputs/CorpusStats.xlsx16.
    OPMERKING: Controleer voor elke taal of elk bestand in corpus_raw een overeenkomstig schoongemaakt bestand in corpus_clean heeft met hetzelfde source_id en taalachtervoegsel.
    VOORZICHTIG: Verwijder persoonlijke informatie zoals namen, telefoonnummers en e-mailadressen tijdens de preprocessing als dergelijke informatie in de ruwe tekst verschijnt.

4. Extractie van kandidaattermen in het Chinees en Engels

  1. Segmenteer Chinese tekst met jieba versie 0.42.1 met de vaste gebruikerswoordenboekbronnen/userdict_zh.txt en houd kandidaten die overeenkomen met 2–8 opeenvolgende Chinese tekens of 2–6 Chinese tekens gescheiden door één behouden scheidingsteken17.
  2. Verwerk Engelse tekst met spaCy versie 3.7.2 met en_core_web_sm versie 3.7.1 en bewaar alleen naamwoordgroepen en samengestelde koppeltekens met 1–5 tokens18.
  3. Bereken de frequentie als het totale aantal voorkomsten van elke kandidaat in het opgeschonde corpus en bereken doc_freq als het aantal verschillende source_id bestanden die die kandidaat minstens één keer bevatten.
  4. Pas de drempels van de shortlist toe door alleen kandidaten met doc_freq ≥ 2 en frequentie ≥ 3 te houden en de overige kandidaten19 te laten vallen.
    OPMERKING: Deze shortlist-drempels werden geselecteerd voor een relatief klein, genre-gebalanceerd corpus. Voor grotere of meer heterogene corpora kunnen de drempels na pilotinspectie worden aangepast.
  5. Exporteer kandidaten/Candidates_ZH.xlsx en kandidaten/Candidates_EN.xlsx met de kolommen term, frequentie, doc_freq, example_source_id en example_snippet.
  6. Exporteren kandidaten/Shortlist_ZH.xlsx en kandidaten/Shortlist_EN.xlsx met dezelfde kolommen, waarbij Chinese fragmenten worden weergegeven als ±20 tekens en Engelse fragmenten als ±10 tokens rond één bevestigd voorval.
  7. Noteer de namen en versies van de tokenizer of tagger, kandidatenpatronen en kies de drempels in logs/thresholds.txt.
  8. Bereken een checksum voor resources/userdict_zh.txt, noteer dit in logs/thresholds.txt en sla een bevroren kopie op als outputs/userdict_zh_v1.txt20.
    OPMERKING: Open Shortlist_ZH.xlsx en Shortlist_EN.xlsx en bevestig dat beide bestanden niet-nul rijen en invulde example_snippet velden bevatten.

5. Genereer tweetalige kandidaten voor uitlijning en rangschik van termijnparen

  1. Voor elke geselecteerde Chinese term verzamel je contextvensters van ±20 Chinese tekens rond elke gebeurtenis en voeg je tot vijf vensters samen tot één contextstring genaamd ctx_zh.
  2. Voor elke geselecteerde Engelse term verzamel je contextvensters van ±10 tokens rond elke gebeurtenis en voeg je tot vijf vensters samen tot één contextstring genaamd ctx_en.
  3. Maak de tweetalige kaartbron aan en bevries ze.
    1. Maak bronnen/term_map_zh2en.xlsx met de kolommen term_zh en term_zh_en.
    2. Vul het bestand in met een geautoriseerd proces zoals bestaande institutionele glossaria, eerder geaccepteerde tweetalige termenlijsten en regelgebaseerde normalisatie.
    3. Bewaar de bevroren mapping als output/term_map_zh2en_v1.xlsx.
    4. Noteer de bevriesdatum, de mapping coverage en de checksum in logs/alignment_log.txt. OPMERKING: Bij het aanpassen van deze workflow aan een nieuw domein begin je de mappingbron met een zaadlijst van termen voor een hoog frequentiedomein en breid je de tabel uit tussen volledige herhalingen in plaats van tijdens de scoring.
  4. Map elke term_zh naar een Engels-vergelijkbare vorm term_zh_en gebruik van de bevroren mapping en behoud dezelfde kaartbron voor de volledigerun 21.
  5. Genereer ctx_zh_en door de bevroren mapping toe te passen op ctx_zh, waarbij overeenkomende term_zh voorkomsten worden vervangen door term_zh_en terwijl alle andere tekst ongewijzigd blijft.
  6. Noteer de mapping en normalisatieprocedure.
    1. Noteer de mappingprocedure in logs/alignment_log.txt.
    2. Noteer alle normalisatieregels, inclusief smallcasing en koppeltekennormalisatie, in logs/alignment_log.txt.
  7. Bereken de string-similariteitsscore S_str door gebruik te maken van RapidFuzz versie 3.6.1 token_sort_ratio om genormaliseerde Engelse termstrings tussen term_zh_en en term_en te vergelijken en deel het resultaat door 100 om de score te schalen naar het bereik [0, 1]22.
  8. Bereken de context similarity score S_ctx.
    1. Gebruik scikit-learn versie 1.4.2 en TfidfVectorizer met vaste parameters: kleine letters=True, ngram_range=(1, 2), min_df=1, max_df=0.95 en stop_words="english"23.
    2. Pas de vectorizer aan op de gecombineerde set van ctx_en en ctx_zh_en strings uit de huidige run.
    3. Bereken S_ctx als de cosinusgelijkenis tussen elke ctx_zh_en string en elke ctx_en string.
      OPMERKING: TF-IDF vertegenwoordigt het relatieve belang van woorden en korte zinnen in elk contextvenster, en cosinusgelijkenis wordt gebruikt om de resulterende contextrepresentaties te vergelijken.
  9. Bereken de uiteindelijke gelijkenisscore en rangschik de kandidatenparen.
    1. Bereken de eindscore als S = 0,60 × S_str + 0,40 × S_ctx.
    2. Voor elk Chinees term, behoud de top k = 3 Engelse kandidaten, gerangschikt door S.
    3. Verwijder duplicaten door voor elk uniek (term_zh, term_en) paar de hoogste score te behouden.
    4. Record k, de scoregewichten en het totale aantal geëxporteerde paren in logs/alignment_log.txt24.
      OPMERKING: Het wegingsschema en de waarde van k werden gekozen om een beheersbare beoordelingsset te behouden, terwijl aannemelijke alternatieven behouden bleven. Voor grotere corpora of meer variabele terminologie kunnen deze instellingen worden aangepast na pilottests.
  10. Ken domain_tag waarden toe met behulp van de vaste trefwoordmap resources/domain_keywords.csv en de volgende prioriteitsvolgorde: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    OPMERKING: Wanneer je de workflow naar een ander subjectdomein overzet, vervang dan de trefwoordmap en wijs je de prioriteitsvolgorde aan voordat je de volledige pijplijn opnieuw uitvoert.
  11. Sla een bevroren kopie van de trefwoordkaart op als output/domain_keywords_v1.csv en noteer de checksum in logs/alignment_log.txt.
  12. Exporteer uitlijning/AlignmentPairs.xlsx met de kolommen pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en en evidence_snippet_zh_en.
  13. Label elk paar als auto_accept, review of auto_reject met de volgende cutoffs: S ≥ 0,90, 0,75 ≤ S ≤ 0,89 en S < 0,75, en registreer de cutoffs en tellingen in elke labelgroep in logs/alignment_log.txt.
    OPMERKING: In een standaard desktopomgeving vergelijkbaar met die in deze studie werden contextgeneratie, TF-IDF-fitting en gelijkenisscores voor een corpus van deze omvang binnen enkele minuten voltooid.
    OPMERKING: Controleer willekeurig minstens 10 rijen in AlignmentPairs.xlsx en bevestig dat evidence_snippet_zh_en aanwezig is en dat term_zh_en niet leeg is voor gemapte gevallen.
    VOORZICHTIG: Houd alle mappingbronnen binnen een run vast. Werk de tweetalige kaarttabel of trefwoordkaart niet bij nadat de score is begonnen.

6. Verifieer termparen door expert-annotatie en beoordeling

  1. Maak validatie/Annotation.xlsx met de kolommen pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, beoordeling en rationale.
  2. Bereid een richtlijn van één pagina voor waarin conceptuele equivalentie in keramisch cultureel toerisme, acceptabele verklarende vertalingen en uitsluitingsgevallen zoals gedeeltelijke overlap, te generieke weergaven en mismatched artefacttypesworden gedefinieerd 26.
  3. Geef twee annotatoren opdracht om elk paar onafhankelijk te labelen als inclusief of uitsluitend met behulp van de verstrekte bewijsfragmenten, en laat de annotateurs elkaars beslissingen niet bekijken.
  4. Bekijk alle meningsverschillen na onafhankelijke annotatie en noter de definitieve beslissing en een eenzinsredenering in de kolommen beoordeling en motivering.
  5. Bereken de ruwe overeenkomst en Cohen's κ met behulp van de labels inclusief en uitsluiten en registreer de overeenkomstmetrieken en de totalen van include- en exkluderaties in outputs/Evaluation.xlsx27.
  6. Bekijk de uitgesloten paren om systematische vals-positieve patronen te identificeren en sla de meest frequent afgewezen patronen op in logs/rule_update_v1.txt.
  7. Sla een bevroren kopie van het voltooide annotatiebestand op als outputs/Annotation_v1.xlsx en verander de adjudicated labels na dit punt niet meer.
    OPMERKING: Het protocol kan hier worden gepauzeerd. Als je later weer opneemt, herzie dan geen beslissingen over bevroren validatie.

7. Het lexicon afronden en exporteren

  1. Vul het definitieve lexicon in met behulp van de invoervelden die in Tabel 2 zijn samengevat, inclusief tweetalige termen, woordsoorten, domeintags, vertaaltype, tweetalige definities, gebruiksvoorbeelden, herkomstinformatie en kwaliteitsvlaggen.
  2. Gebruik dezelfde entry_id waarden over alle exports en controleer de consistentie van de identificatie vóór het genereren van bestanden.
  3. Exporteer de uiteindelijke spreadsheet als output/FinalLexicon.xlsx en controleer of alle benodigde velden zijn ingevuld voordat je opslaat.
  4. Genereer en valideer de TBX-export.
    1. Genereer een TBX-bestand met dezelfde entry_id waarden om traceerbaarheid te behouden.
    2. Valideer het TBX-bestand aan de hand van het bedoelde TBX-schema.
    3. Noteer het validatieresultaat in logs/run_notes.txt28.
  5. Archiveer alle logs, parameterbestanden, bevroren bronnen en outputs in de versiegegradeerde map outputs/Lexicon_v1/ en noteer de archiveerdatum en bestandsaantallen in logs/run_notes.txt.
  6. Bied de scripts, bevroren bronnen en parameterlogs aan als aanvullende bestanden, inclusief outputs/userdict_zh_v1.txt, outputs/domain_keywords_v1.csv, outputs/term_map_zh2en_v1.xlsx, logs/thresholds.txt en logs/alignment_log.txt.
  7. Bied een verificatiesubset van het corpus die met toestemming is goedgekeurd met dezelfde bestandsstructuur en outputschema, zodat lezers de workflow op de vrijgegeven subset29 kunnen reproduceren.
    VOORZICHTIG: Controleer voordat u aanvullende materialen deelt dat er geen auteursrechtelijk beschermde volledige teksten, gevoelige identificaties of ongeautoriseerde institutionele bronnen in het releasepakket zijn opgenomen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Corpusassemblage en reinigingsopbrengst
Naar aanleiding van het corpusontwerp dat in Tabel 1 wordt getoond, werd een geregistreerd tweetalig corpus samengesteld uit museum- en tentoonstellingsteksten, erfgoedbeschrijvingen en toeristengericht toerismemateriaal. Na het schoonmaken bestond het corpus uit 12 Chinese documenten en 8 Engelse documenten, in totaal 47.843 Chinese karakters en 32.193 Engelse karakters30. Het corpus beh...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De belangrijkste waarde van dit protocol ligt in het vermogen om een terminologietaak die vaak informeel wordt afgehandeld om te zetten in een reproduceerbare en reviewbare workflow. In keramiek cultureel toerisme zijn veel termen zowel technisch als interpretatief: ze verwijzen niet alleen naar materialen, oventypes, bakfasen of decoratieve stijlen, maar ook naar hoe deze concepten aan bezoekers worden overgebracht via etiketten, verhalen en educatief materiaal36...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen concurrerende financiële of niet-financiële belangen hebben met betrekking tot dit werk.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs danken de keramische culturele toerisme-professionals en het museumpersoneel die toegang boden tot tekstuele materialen en domeinfeedback tijdens de corpusconstructie en validatie. De auteurs bedanken ook de twee onafhankelijke domeinannotateurs voor hun zorgvuldige beoordeling van alignment-kandidaten en constructieve opmerkingen over het ontwerp van de inzendingen. Dit werk werd ondersteund door het onderzoeksproject van de Jiangxi Association of Higher Education getiteld "Studie over intelligente Engelse vertaling van Chinese keramiektoerismeterminologie gebaseerd op DeepSeek en het multikanaal verspreidingsmodel" (subsidie nr. WY-D-115).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Computer workstationHardwareElke moderne computer die Python 3.11 kan draaien en tekstcorpora kan verwerken; >=8 GB RAM aanbevolenGeen catalogusnummer vereist
Bron: Generic (elke leverancier)
BesturingssysteemSoftwareWindows 10/11, macOS of Linux (exacte OS-versie in logs/run_notes.txt vastleggen)Versie vastgelegd in run_notes.txt
Bron: Systeem geïnstalleerd
PythonSoftwarePython 3.11Versie vastgelegd in logs/pip_freeze.txt
Bron: Python Software Foundation distributie
jiebaSoftwarebibliotheek0.42.1jieba==0.42.1
Bron: PyPI pakket repository
spaCySoftwarebibliotheek3.7.2spacy==3.7.2
Bron: PyPI pakket repository
Engels pipeline modelNLP modelen_core_web_sm 3.7.1 (spaCy modelpakket)en_core_web_sm==3.7.1; installatie vastgelegd in run_notes.txt
Bron: spaCy model repository
scikit-learnSoftwarebibliotheek1.4.2scikit-learn==1.4.2
Bron: PyPI pakket repository
RapidFuzzSoftwarebibliotheek3.6.1RapidFuzz==3.6.1
Bron: PyPI pakket repository
Spreadsheet editorSoftwareElke software die.xlsx-bestanden kan bewerkenGebaten voor het bekijken/bewerken van SourceRegister.xlsx, CorpusStats.xlsx, Candidates/Shortlist bestanden
Bron: Generic (elke leverancier)
Plain-text editorSoftwareElke software die.txt en.csv-bestanden kan bewerkenGebaten voor het bekijken/bewerken van logs/.txt en resources/.csv
Bron: Generic (elke leverancier)
UTF-8 tekstconversietoolSoftwareElke tool die documenten naar UTF-8 plain text kan exporterenGebaten in Stap 2.3; exacte methode vastgelegd in run_notes.txt
Bron: Generic (elke leverancier)
SourceRegister templateBestandstemplateSourceRegister.xlsx met velden: source_id, titel, eigenaar/uitgever, taal, genre, toegangsdatum, licentie-opmerkingBevroren als outputs/SourceRegister_v1.xlsx
Bron: Gemaakt in deze studie
Corpus statistieken templateBestandstemplateCorpusStats.xlsx met velden: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGegenereerd tijdens Stap 3.6
Bron: Gemaakt in deze studie
Chinees gebruikerswoordenboekResourcebestandresources/userdict_zh.txt (domeinspecifieke termenlijst voor segmentatieondersteuning)Bevroren kopie opgeslagen; checksum vastgelegd in thresholds.txt
Bron: Gemaakt/beheerd in deze studie
Domein trefwoord kaartResourcebestandresources/domain_keywords.csv met domein_tag prioriteitsregelsBevroren als outputs/domain_keywords_v1.csv; checksum vastgelegd in alignment_log.txt
Bron: Gemaakt/beheerd in deze studie
Chinees-Engels term toewijzingstabelResourcebestandresources/term_map_zh2en.xlsx met kolommen term_zh en term_zh_enBevroren als outputs/term_map_zh2en_v1.xlsx; dekking vastgelegd in alignment_log.txt
Bron: Gemaakt/beheerd in deze studie
Drempel logLogbestandlogs/thresholds.txt (patronen, drempels, bibliotheekversies, resource checksums)Vereist voor deterministische herhalingen
Bron: Gemaakt in deze studie
AfstemmingslogLogbestandlogs/alignment_log.txt (gewichten, k, cutoffs, vectorizer instellingen, mapping dekking, map checksums)Vereist voor deterministische herhalingen
Bron: Gemaakt in deze studie
AnnotatiebladBestandstemplatevalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, beslissingen, beslissing, redenering)Bevroren als outputs/Annotation_v1.xlsx na Stap 6.6
Bron: Gemaakt in deze studie
Evaluatie uitvoerUitvoerbestandoutputs/Evaluation.xlsx (ruwe overeenkomst, Cohen’s κ, totalen)Geproduceerd in Stap 6.4
Bron: Gemaakt in deze studie
Eindlexicon exportUitvoerbestandoutputs/FinalLexicon.xlsx volgens Tabel 2 schemaGeproduceerd in Stap 7.2
Bron: Gemaakt in deze studie
TBX exportUitvoerbestandTBX-bestand gegenereerd vanuit FinalLexicon.xlsx met stabiele entry_id mappingValidatieresultaat vastgelegd in run_notes.txt
Bron: Gemaakt in deze studie

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

GedragNummer 233Nummer 233AllesNummerLege waardeNummertweetalige terminologielexiconconstructieautomatische termextractietweetalige termaligneringexpertvalidatieTBX TermBase eXchangeinterpretatie van cultureel erfgoedChinees Engelse vertaling

Gerelateerde artikelen