Methodenartikel

Ein reproduzierbares Protokoll zur Erstellung eines chinesisch-englischen keramischen Kulturtourismus-Lexikons mit registrierten Corpora

DOI:

10.3791/71320

3. Juli 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieses Protokoll erstellt ein chinesisch-englisches Lexikon des keramischen Kulturtourismus unter Verwendung registrierter zweisprachiger Korpora, standardisierter Reinigung, Extraktion von Kandidatenbegriffen, Ähnlichkeitsbewertung und Expertenvalidierung mit Bewertung. Mit diesem Workflow wurden 60 verifizierte Einträge mit Definitionen, Nutzungsbeispielen, Herkunftsdatensätzen und TBX-kompatiblen Ausgaben exportiert.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Erstellung bilingualer Terminologie-Ressourcen für den keramischen Kulturtourismus ist eine Herausforderung, da relevante Texte oft fragmentiert sind, Übersetzungsentscheidungen inkonsistent sind und wiederverwendbare Bauabläufe selten dokumentiert sind. Dieses Protokoll bietet einen reproduzierbaren Schritt-für-Schritt-Workflow zur Erstellung eines chinesisch-englischen keramischen Kulturtourismus-Lexikons durch Korpusregistrierung und -reinigung, Extraktion von Kandidatenbegriffen, bilinguale Ausrichtung und Expertenvalidierung mit Beurteilung. Angewandt auf ein registriertes bilingualtes Korpus generierte der Workflow ausgewählte chinesische und englische Kandidatenbegriffe, erstellte gerankte bilinguale Begriffspaare und behielt validierte Ausrichtungen nach unabhängiger Expertenprüfung. Das finalisierte Lexikon exportierte 60 verifizierte Einträge mit bilingualen Begriffsformen, Domänentags, Übersetzungstypen, bilingualen Definitionen, Nutzungsbeispielen, Herkunftsdatensätzen und interoperablen Ausgaben wie Excel- und TBX-Dateien. Um Transparenz und Wiederholbarkeit zu unterstützen, zeichnet das Protokoll zudem Schwellenwerte, Paketversionen, eingefrorene Ressourcen und Validierungsentscheidungen während des gesamten Workflows auf. Dies macht das Verfahren prüfbar und leichter an andere Kulturerbetourismusbereiche anzupassen. Wenn sie auf eine neue Domain übertragen werden, können Nutzer die Domain-Keyword-Liste erweitern, die bilinguale Kartierungsressource aktualisieren und eine kleine Anzahl von Shortlist- und Ähnlichkeitsschwellen entsprechend Korpusgröße und Terminologiedichte anpassen.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Der Kulturtourismus ist zu einem wichtigen Treiber der Zielentwicklung geworden, da Reisende zunehmend nach erbebasierten Erlebnissen suchen, die bedeutungsvoll und nicht rein freizeitlich sind. Auf Politik- und Branchenebene haben internationale Organisationen wiederholt den Wert betont, Tourismus mit Kultur zu verknüpfen und die Interpretation, Dokumentation und Kommunikation über verschiedene Kulturerbewerte hinweg zu verbessern. In diesem breiteren Kontext ist keramischer Kulturtourismus besonders terminologiedicht, da Besucher regelmäßig auf spezialisierte Konzepte zu Materialien, Glasur- und Brennprozessen, Ofentechnologien, stilistischen Motiven, Artefakttypen und handwerklichen Prozesserzählungen stoßen. Diese Begriffe tragen oft technische Bedeutungen, die sich nicht leicht durch eine beiläufige Paraphrase vermitteln lassen, und Übersetzungsentscheidungen können direkt beeinflussen, was Besucher von Etiketten, geführter Interpretation und Bildungsmaterialien verstehen2. Gleichzeitig haben die Denkmalrahmen betont, dass der Schutz immateriellen Kulturerbes auf einer nachhaltigen Wissensvermittlung und öffentlichem Bewusstsein beruht, die beide eine Sprache erfordern, die genau, zugänglich und kontextuell für Interpretationund Bildung geeignet ist.

Trotz dieser Nachfrage bleiben die zweisprachigen Terminologie-Ressourcen für den keramischen Kulturtourismus fragmentiert und inkonsistent. Über Museumsetiketten, Ausstellungstexte, Tourismusführerseiten und Kulturerbebeschreibungen hinweg kann dasselbe Konzept je nach Institution, Region und kommunikativen Umgebungen unterschiedlich dargestelltwerden 4. Eine solche Variation ist nicht nur stilistisch. Es kann das Verständnis der Besucher beeinträchtigen, die Vergleichbarkeit von Beschreibungen zwischen Stätten verringern und die wahrgenommene Glaubwürdigkeitder Kulturerbekommunikation schwächen. Die Terminologieforschung argumentiert seit langem, dass hochwertige Begriffsressourcen konzeptorientiert, durch explizite Definitionen gestützt und auf nachverfolgbaren Belegen wie Quellen, Kontexten und Qualitätskontrollaufzeichnungen basieren sollten6. Viele Domain-Teams verfügen jedoch immer noch nicht über einen Workflow, der verstreute Texte systematisch in ein kuratiertes zweisprachiges Lexikon verwandeln kann, während transparente Entscheidungsregeln, reproduzierbare Verfahren und wiederverwendbare Ausgaben erhaltenbleiben 7. Im Vergleich zur ad-hoc-manuellen Kompilierung bietet ein standardisiertes Protokoll eine klarere Dokumentation, eine konsistentere Validierung und bessere Bedingungen für Aktualisierungen, Audits und institutionelle Wiederverwendung.

Um diese Herausforderungen zu bewältigen, muss ein praktisches Protokoll für die Konstruktion bilingualer Lexikone zwei verknüpfte Aufgaben organisieren: die Entdeckung von Kandidatenbegriffen und die bilinguale Ausrichtung. Für die Begriffsentdeckung kann korpusbasierte automatische Extraktion die Abhängigkeit von vollständig manueller Sammlung verringern, indem sie linguistische Muster mit statistischen Evidenzen kombiniert und so die domänenrelevante Terminologie auf Skala8 erleichtert. In kulturellen Erbekontexten ist der Korpusaufbau jedoch selten unkompliziert. Quellmaterialien unterscheiden sich oft in Stil, Register und kommunikativem Zweck und können domänenspezifische Namen und gemischte beschreibende Konventionenenthalten. Diese Funktionen machen die transparente Parametererfassung und stabile Verarbeitungsregeln besonders wichtig. Für die bilinguale Ausrichtung können rechnergestützte Methoden rangierte sprachübergreifende Kandidatenpaare erzeugen, indem Begriffsformen und deren umgebende Nutzungskontexte verglichen werden, woraufhin Fachexperten überprüfen können, ob die vorgeschlagenen Paare konzeptionell angemessen sind10. In diesem Protokoll wird Automatisierung verwendet, um plausible Kandidaten zuerst zu generieren und zu bewerten, während eine Expertenbewertung sie anschließend bestätigt oder ablehnt. Diese Kombination verbessert die Effizienz, ohne das interpretative Urteil aus der endgültigen Entscheidung zu entfernen. Da Kulturerbeterminologie oft kulturelle und pädagogische Implikationen hat, müssen Gutachter die Belege hinter jedem vorgeschlagenen Paar einsehen können, anstatt sich auf eine undurchsichtige Ausgabe11 zu verlassen.

Hier wird ein schrittweises und auditierbares Protokoll zur Erstellung eines chinesisch-englischen keramischen Kulturtourismuslexikons aus registrierten Textquellen vorgestellt. Der Workflow standardisiert die Korpusregistrierung und -reinigung, die Extraktion bilingualer Kandidaten, die Erzeugung von rangierten Paaren, die Überprüfung mit zwei Annotatoren und die Beurteilung sowie den Abschluss der endgültigen Einträge unter einem festen Schema. Durch die Integration von Versionsprotokollierung, Schwellenkontrolle, eingefrorenen Ressourcen und Expertenvalidierung verbessert das Protokoll die Reproduzierbarkeit, Überprüfbarkeit und Standardisierung im Vergleich zu weniger strukturierten Terminologie-Workflows. Um eine längerfristige Wiederverwendung im Terminologiemanagement und in der Übersetzungspraxis zu unterstützen, kann das finalisierte Lexikon auch im TermBase eXchange (TBX)-Format exportiert werden, einem ISO-angepassten Standard für den strukturierten terminologischen Datenaustausch12.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie verwendete ausschließlich öffentlich zugängliche oder von der Institution autorisierte Textdaten und betraf keine menschlichen oder tierischen Proben. Eine institutionelle ethische Genehmigung war nicht erforderlich.

1. Erstellen Sie den Projektarbeitsbereich

  1. Erstellen Sie einen Projektordner und folgende Unterordner: corpus_raw, corpus_clean, Kandidaten, Ausrichtung, Validierung, Ausgaben, Logs und Ressourcen.
  2. Erstellen Sie das Lauflog und notieren Sie die Umgebungseinstellungen.
    1. Erstelle Logs/run_notes.txt.
    2. Erfassen Sie Laufzeit/-zeit, Betriebssystemversion und Projektumfang als "chinesisch-englische keramische Kulturtourismus-Terminologie".
    3. Setze den Python-Interpreter auf Python 3.11 und notiere diese Informationen in Logs/run_notes.txt.
  3. Führe Python -m Pip Freeze > Logs/pip_freeze.txt aus und stelle sicher, dass Logs/pip_freeze.txt generiert wurde und nicht leer13 ist.
  4. Erstellen Sie die Abhängigkeitsdatei und installieren Sie die Softwareumgebung.
    1. Erstelle Ressourcen/requirements.txt.
    2. Listen die in diesem Protokoll verwendeten Kernpaketversionen wie folgt auf: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 und RapidFuzz==3.6.1.
    3. Trage den Installationsbefehl in Logs/run_notes.txt auf.
    4. Installation en_core_web_sm==3.7.1. 1.4.5 Python ausführen -m spacy, validieren und die validierte Modellversion in Logs/run_notes.txt aufzeichnen.
      HINWEIS: Bestätigen Sie, dass sowohl Logs/pip_freeze.txt als auch Logs/run_notes.txt existieren und nicht leer sind, bevor Sie fortfahren.

2. Einen ausgewogenen bilingualen Korpus und Registerquellen zusammenstellen

  1. Wählen Sie Quellen aus, die zur in Tabelle 1 gezeigten zweisprachigen und Genre-Zusammensetzung passen, und weisen Sie jedem Dokument eine einzigartige source_id zu, wie S001 oder S00214.
  2. Erstellen Sie SourceRegister.xlsx und zeichnen Sie für jedes Dokument, source_id, Titel, Eigentümer/Verlag, Sprache, Genre, access_date und license_note auf.
  3. Konvertiere jedes Dokument in UTF-8-Klartext, benennen Sie jede Datei als source_id_lang.txt (z. B. S001_zh.txt oder S001_en.txt) und speichern Sie die Dateien in corpus_raw.
  4. Speichere eine eingefrorene Kopie des Registers als Ausgaben/SourceRegister_v1.xlsx und notiere das Einfrierdatum sowie die Dokumentsummen (n_docs_zh und n_docs_en) in Logs/run_notes.txt.
    HINWEIS: Das Protokoll kann hier pausiert werden. Wenn Sie später wieder aufnehmen, ändern Sie keine source_id Aufgaben.
    VORSICHT: Verwenden Sie nur öffentlich zugängliche oder von der Institution autorisierte Texte. Verbreiten Sie nicht urheberrechtlich geschützte vollständige Texte ohne ausdrückliche Erlaubnis.

3. Korpusdateien reinigen und normalisieren

  1. Entfernen Sie nur Navigationszeilen, URL-Only-Zeilen und duplizierte Kopf- oder Fußzeilen, die sich in mindestens drei Dokumenten wiederholen. Behalte alle verbleibenden Zeilen in ihrer ursprünglichenReihenfolge 15.
  2. Behalte die Satzzeichen, die während der Reinigung Teil von Mehrwort- oder zusammengesetzten Begriffen sein können, einschließlich des Bindestrichs (-), des Schrägstrichs (/), der Klammern (( und )) und des mittleren Punkts (·).
  3. Normalisieren Sie chinesischen Text, indem Sie vollbreite alphanumerische Zeichen in halbweitige Zeichen umwandeln und Klammerformen zu ( und standardisieren.
  4. Normalisieren Sie den englischen Text, indem Sie wiederholten Weißraum in ein einziges Leerzeichen zusammenfassen und alle Bindestrichvarianten auf den ASCII-Bindestrich (-) standardisieren, während bindestrichgebundene Verbindungen erhalten bleiben.
  5. Speichere jede bereinigte Datei in corpus_clean mit demselben source_id_lang.txt Dateinamen wie in corpus_raw.
  6. Record source_id, lang, n_chars_before, n_chars_after, Zeitstempel und cleaning_ruleset als v1.0 in Ausgaben/CorpusStats.xlsx16 gesetzt.
    HINWEIS: Für jede Sprache wird überprüft, dass jede Datei in corpus_raw eine entsprechende bereinigte Datei in corpus_clean mit demselben source_id- und Sprachsuffix hat.
    VORSICHT: Entfernen Sie persönliche Informationen wie Namen, Telefonnummern und E-Mail-Adressen während der Vorbearbeitung, wenn diese Informationen im Rohtext erscheinen.

4. Kandidatenbegriffe in Chinesisch und Englisch extrahieren

  1. Segmentiere chinesischen Text mit Jieba-Version 0.42.1 mit den festen Benutzerwörterbuchressourcen/userdict_zh.txt und behalte Kandidaten, die entweder 2–8 aufeinanderfolgende chinesische Zeichen oder 2–6 chinesische Zeichen durch einen behaltenen Trenner17 übereinstimmen.
  2. Verwenden Sie den englischen Text mit spaCy-Version 3.7.2 und en_core_web_sm Version 3.7.1 und behalten Sie nur Nominalphrasen und bindestrichartige Zusammensetzungen, die 1–5 Token18 enthalten.
  3. Berechnen Sie die Freq als die Gesamtzahl der Vorkommen jedes Kandidaten im bereinigten Korpus und berechnen Sie doc_freq als die Anzahl der unterschiedlichen source_id Dateien, die diesen Kandidaten mindestens einmal enthalten.
  4. Wende die Shortlist-Schwellenwerte an, indem du nur Kandidaten mit doc_freq ≥ 2 und Frequenz ≥ 3 behältst und die übrigenKandidaten mit 19 ausscheidest.
    HINWEIS: Diese Shortlist-Schwellenwerte wurden für ein relativ kleines, genre-ausbalanciertes Korpus ausgewählt. Bei größeren oder heterogeneren Korpora können die Schwellenwerte nach der Pilotinspektion angepasst werden.
  5. Exportiere Kandidaten/Candidates_ZH.xlsx und Kandidaten/Candidates_EN.xlsx mit den Spalten Begriff, Frequenz, doc_freq, example_source_id und example_snippet.
  6. Exportieren von Kandidaten/Shortlist_ZH.xlsx und Kandidaten/Shortlist_EN.xlsx mit denselben Spalten, wobei chinesische Schnipsel als ±20 Zeichen und englische Schnipsel als ±10 Token um ein belegtes Vorkommen herum angezeigt werden.
  7. Ertrage die Namen und Versionen des Tokenizers oder Taggers, Kandidatenmuster und liste Schwellenwerte in Logs/thresholds.txt auf.
  8. Berechnen Sie eine Prüfsumme für Ressourcen/userdict_zh.txt, notieren Sie sie in Logs/thresholds.txt und speichern Sie eine eingefrorene Kopie als Ausgaben/userdict_zh_v1.txt20.
    HINWEIS: Öffnen Sie Shortlist_ZH.xlsx und Shortlist_EN.xlsx und bestätigen Sie, dass beide Dateien verschiedene Zeilen und ausgefüllte example_snippet Felder enthalten.

5. Generiere Kandidaten für zweisprachige Ausrichtung und ordne Amtspaare

  1. Für jeden ausgewählten chinesischen Begriff sammeln Sie Kontextfenster mit ±20 chinesischen Zeichen um jedes Vorkommen herum und fügen bis zu fünf Fenster zusammen, um eine Kontextfolge namens ctx_zh zu bilden.
  2. Für jeden ausgewählten englischen Begriff werden Kontextfenster mit ±10 Token um jedes Vorkommen herum gesammelt und bis zu fünf Fenster zu einer Kontextzeichenkette namens ctx_en zusammengeführt.
  3. Erstelle und friere die zweisprachige Kartierungsressource ein.
    1. Erstellen Sie Ressourcen/term_map_zh2en.xlsx mit den Spalten term_zh und term_zh_en.
    2. Befüllen Sie die Datei mit einem autorisierten Verfahren wie bestehenden institutionellen Glossaren, zuvor akzeptierten zweisprachigen Begriffslisten und regelbasierter Normalisierung.
    3. Speichere das eingefrorene Mapping als Ausgaben/term_map_zh2en_v1.xlsx.
    4. Notiere das Einfrierdatum, die Abdeckung der Kartierung und die Kontrollsumme in Logs/alignment_log.txt. HINWEIS: Wenn Sie diesen Workflow an eine neue Domäne anpassen, beginnen Sie die Mapping-Ressource mit einer Startliste von Hochfrequenzdomänenbegriffen und erweitern Sie die Tabelle zwischen vollständigen Wiederholungen statt während der Bewertung.
  4. Mappe jede term_zh auf eine englisch vergleichbare Form term_zh_en Verwendung der eingefrorenen Kartierung und behalte dieselbe Kartierungsressource für den komplettenDurchlauf 21.
  5. Erzeugen Sie ctx_zh_en, indem Sie die eingefrorene Abbildung auf ctx_zh anwenden, übereinstimmende term_zh Vorkommen durch term_zh_en ersetzen und alle anderen Texte unverändert lassen.
  6. Zeichnen Sie das Mapping- und Normalisierungsverfahren auf.
    1. Trage das Kartierungsverfahren in Logs/alignment_log.txt auf.
    2. Trage alle Normalisierungsregeln, einschließlich Kleinbuchstaben und Bindestrich-Normalisierung, in Logs/alignment_log.txt auf.
  7. Berechnen Sie den String-Ähnlichkeitsscore S_str, indem Sie RapidFuzz Version 3.6.1 token_sort_ratio verwenden, um normalisierte englische Begriffsstrings zwischen term_zh_en und term_en zu vergleichen und das Ergebnis durch 100 zu teilen, um den Wert auf den Bereich [0, 1]22 zu skalieren.
  8. Berechnen Sie den Kontext-Ähnlichkeitsscore S_ctx.
    1. Verwenden Sie scikit-learn Version 1.4.2 und TfidfVectorizer mit den festen Parametern, Kleinbuchstaben=True, ngram_range=(1, 2), min_df=1, max_df=0.95 und stop_words="english"23.
    2. Passe den Vektorizer auf die kombinierte Menge von ctx_en und ctx_zh_en Strings aus dem aktuellen Durchlauf an.
    3. Berechnen Sie S_ctx als die Kosinusähnlichkeit zwischen jedem ctx_zh_en String und jedem ctx_en String.
      HINWEIS: TF-IDF stellt die relative Bedeutung von Wörtern und kurzen Phrasen in jedem Kontextfenster dar, und Kosinusähnlichkeit wird verwendet, um die resultierenden Kontextrepräsentationen zu vergleichen.
  9. Berechnen Sie den endgültigen Ähnlichkeitswert und ordnen Sie die Kandidatenpaare ein.
    1. Berechnen Sie den Endwert als S = 0,60 × S_str + 0,40 × S_ctx.
    2. Für jedes chinesische Semester behalten Sie die besten k = 3 englischen Kandidaten, die nach S gerankt sind.
    3. Entfernen Sie Duplikate, indem Sie für jedes einzigartige (term_zh, term_en) Paar die höchstbewertete Instanz behalten.
    4. Datensatz k, die Punktegewichtungen und die Gesamtzahl der exportierten Paare in Logs/alignment_log.txt24.
      HINWEIS: Das Gewichtungsschema und der Wert von k wurden gewählt, um einen handhabbaren Bewertungssatz zu gewährleisten und gleichzeitig plausible Alternativen zu erhalten. Für größere Korpora oder variablere Terminologie können diese Einstellungen nach Pilottests angepasst werden.
  10. Weisen Sie domain_tag Werte mit der festen Keyword-Map resources/domain_keywords.csv und folgender Prioritätsreihenfolge zu: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    HINWEIS: Beim Übertragen des Workflows auf eine andere Themendomäne ersetzen Sie die Keyword-Map und überarbeiten Sie die Prioritätsreihenfolge, bevor Sie die gesamte Pipeline erneut ausführen.
  11. Speichere eine eingefrorene Kopie der Schlüsselwortkarte als Ausgaben/domain_keywords_v1.csv und trage die Prüfsumme in Logs/alignment_log.txt auf.
  12. Exportiere Ausrichtung/AlignmentPairs.xlsx mit den Spalten pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en und evidence_snippet_zh_en.
  13. Beschrifte jedes Paar als auto_accept, Review oder auto_reject mit den folgenden Cutoffs: S ≥ 0,90, 0,75 ≤ S ≤ 0,89 und S < 0,75, und notiere die Cutoffs und Counts in jeder Labelgruppe in Logs/alignment_log.txt.
    HINWEIS: In einer Standard-Desktop-Umgebung, die mit der in dieser Studie vergleichbar ist, wurden Kontextgenerierung, TF-IDF-Anpassung und Ähnlichkeitsbewertung für einen Korpus dieser Größe innerhalb weniger Minuten abgeschlossen.
    HINWEIS: Überprüfen Sie zufällig mindestens 10 Zeilen in AlignmentPairs.xlsx und bestätigen, dass evidence_snippet_zh_en vorhanden ist und dass term_zh_en für abgebildete Fälle nicht leer ist.
    VORSICHT: Halten Sie alle Kartierungsressourcen innerhalb eines Durchlaufs stabil. Aktualisieren Sie die zweisprachige Mapping-Tabelle oder Keyword-Map nicht, nachdem die Bewertung begonnen hat.

6. Verifizieren Sie Termpaare durch fachkundige Annotation und Beurteilung

  1. Erstellen Sie Validierung/Annotation.xlsx mit den Spalten pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, Beurteilung und Begründung.
  2. Bereiten Sie eine einseitige Annotationsrichtlinie vor, die die konzeptuelle Äquivalenz im keramischen Kulturtourismus, akzeptable erklärende Übersetzungen und Ausschlussfälle wie teilweise Überschneidungen, zu generische Darstellungen und nicht übereinstimmende Artefakttypendefiniert 26.
  3. Weisen Sie zwei Annotatoren an, jedes Paar unabhängig voneinander als Ein- oder Ausschließen zu kennzeichnen, indem Sie die bereitgestellten Beweisschnipsel verwenden, und erlauben Sie den Annotatoren nicht, die Entscheidungen des jeweils anderen einzusehen.
  4. Überprüfen Sie alle Meinungsverschiedenheiten nach der unabhängigen Annotation und notieren Sie die endgültige Entscheidung sowie eine ein-Satz-Begründung in den Spalten für Entscheidung und Begründung.
  5. Berechnen Sie die Rohübereinstimmung und Cohens κ unter Verwendung der Labels Include and Exclude und notieren Sie die Vereinbarungsmetriken sowie die Ein- und Ausschlusssummen in Outputs/Evaluation.xlsx 27.
  6. Überprüfen Sie die ausgeschlossenen Paare, um systematische falsch-positive Muster zu identifizieren, und speichern Sie die häufigsten abgelehnten Muster in Logs/rule_update_v1.txt.
  7. Speichere eine eingefrorene Kopie der fertigen Annotationsdatei als Outputs/Annotation_v1.xlsx und ändere nach diesem Punkt keine beurteilten Labels mehr.
    HINWEIS: Das Protokoll kann hier pausiert werden. Wenn Sie später wieder aufnehmen, überarbeiten Sie keine Entscheidungen über eingefrorene Validierungen.

7. Terminologie des Lexikons und Export abschließen

  1. Befüllen Sie das endgültige Lexikon mit den in Tabelle 2 zusammengefassten Eintragsfeldern, einschließlich zweisprachiger Begriffsformen, Wortarten, Domänentags, Übersetzungstyp, zweisprachigen Definitionen, Anwendungsbeispielen, Herkunftsinformationen und Qualitätsflaggen.
  2. Verwenden Sie dieselben entry_id Werte über alle Exporte hinweg und bestätigen Sie die Konsistenz der Identifikatoren vor der Dateigenerierung.
  3. Exportiere die endgültige Tabelle als Ausgaben/FinalLexicon.xlsx und prüfe, ob alle erforderlichen Felder ausgefüllt sind, bevor du speicherst.
  4. Generiere und validiere den TBX-Export.
    1. Generiere eine TBX-Datei mit denselben entry_id Werten, um die Rückverfolgbarkeit zu erhalten.
    2. Validiere die TBX-Datei mit dem beabsichtigten TBX-Schema.
    3. Trage das Validierungsergebnis in Logs/run_notes.txt28 auf.
  5. Archiviere alle Logs, Parameterdateien, eingefrorenen Ressourcen und Ausgaben im versionierten Ordner und Lexicon_v1/ und notiere das Archivdatum sowie die Dateianzahl in Logs/run_notes.txt.
  6. Stellen Sie die Skripte, eingefrorenen Ressourcen und Parameterprotokolle als ergänzende Dateien bereit, einschließlich Ausgaben/userdict_zh_v1.txt, Ausgaben/domain_keywords_v1.csv, Ausgaben/term_map_zh2en_v1.xlsx, Logs/thresholds.txt und Logs/alignment_log.txt.
  7. Stellen Sie eine berechtigungsfreigegebene Verifikationsteilmenge des Korpus bereit, die dieselbe Dateistruktur und dasselbe Ausgabeschema verwendet, damit Leser den Workflow auf der freigegebenen Teilmenge29 reproduzieren können.
    VORSICHT: Bevor Sie Zusatzmaterialien teilen, bestätigen Sie, dass im Veröffentlichungspaket keine urheberrechtlich geschützten Volltexte, sensible Kennungen oder unautorisierte institutionelle Ressourcen enthalten sind.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Korpusmontage und Reinigungserträge
Nach dem in Tabelle 1 gezeigten Korpusdesign wurde ein registriertes zweisprachiges Korpus aus Museums- und Ausstellungstexten, Kulturerbebeschreibungen und besucherfreundlichen Tourismusmaterialien zusammengestellt. Nach der Reinigung umfasste der Korpus 12 chinesische und 8 englische Dokumente, insgesamt 47.843 chinesische und 32.193 englischeZeichen 30. Das Korpus behielt die beabsichtigte...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Der Hauptwert dieses Protokolls liegt in seiner Fähigkeit, eine Terminologieaufgabe, die oft informell behandelt wird, in einen reproduzierbaren und überprüfbaren Workflow umzuwandeln. Im keramischen Kulturtourismus sind viele Begriffe sowohl technischer als auch interpretativer Natur: Sie beziehen sich nicht nur auf Materialien, Ofentypen, Brennphasen oder dekorative Stile, sondern auch darauf, wie diese Konzepte den Besuchern in Etiketten, Erzählungen und Bildungsmaterialien vermittelt...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären, dass sie keine konkurrierenden finanziellen oder nicht-finanziellen Interessen in Bezug auf dieses Werk haben.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken den Praktikern des keramischen Kulturtourismus und dem Museumspersonal, die während des Korpusaufbaus und der Validierung Zugang zu Textmaterialien und Domain-Feedback bereitgestellt haben. Die Autoren danken auch den beiden unabhängigen Domain-Annotatoren für ihre sorgfältige Überprüfung der Ausrichtungskandidaten und konstruktive Kommentare zum Eintragsdesign. Diese Arbeit wurde vom Forschungsprojekt der Jiangxi Association of Higher Education mit dem Titel "Studie zur intelligenten englischen Übersetzung chinesischer keramischer Tourismusterminologie basierend auf DeepSeek und seinem Multikanal-Verbreitungsmodell" unterstützt (Zuschuss Nr. WY-D-115).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Computer workstationHardwareJeder moderne Computer, der in der Lage ist, Python 3.11 auszuführen und Textkorpora zu verarbeiten; ≥8 GB RAM empfohlenKeine Katalognummer erforderlich
Quelle: Generisch (jeder Lieferant)
BetriebssystemSoftwareWindows 10/11, macOS oder Linux (genaue OS-Version in logs/run_notes.txt aufzeichnen)Version in run_notes.txt aufgezeichnet
Quelle: System-installiert
PythonSoftwarePython 3.11Version in logs/pip_freeze.txt aufgezeichnet
Quelle: Python Software Foundation Distribution
jiebaSoftware-Bibliothek0.42.1jieba==0.42.1
Quelle: PyPI-Paketrepository
spaCySoftware-Bibliothek3.7.2spacy==3.7.2
Quelle: PyPI-Paketrepository
Englisches Pipeline-ModellNLP-Modellen_core_web_sm 3.7.1 (spaCy Model-Paket)en_core_web_sm==3.7.1; Installation in run_notes.txt aufgezeichnet
Quelle: spaCy Model-Repository
scikit-learnSoftware-Bibliothek1.4.2scikit-learn==1.4.2
Quelle: PyPI-Paketrepository
RapidFuzzSoftware-Bibliothek3.6.1RapidFuzz==3.6.1
Quelle: PyPI-Paketrepository
TabellenkalkulationseditorSoftwareJede Software, die .xlsx-Dateien bearbeiten kannZum Anzeigen/Bearbeiten von SourceRegister.xlsx, CorpusStats.xlsx, Candidates/Shortlist-Dateien verwendet
Quelle: Generisch (jeder Lieferant)
TexteditorSoftwareJede Software, die .txt- und.csv-Dateien bearbeiten kannZum Anzeigen/Bearbeiten von logs/.txt und resources/.csv verwendet
Quelle: Generisch (jeder Lieferant)
UTF-8 Text-KonvertierungstoolSoftwareJedes Tool, das Dokumente in UTF-8-Plaintext exportieren kannVerwendet in Schritt 2.3; genaue Methode in run_notes.txt aufgezeichnet
Quelle: Generisch (jeder Lieferant)
SourceRegister-VorlageDateivorlageSourceRegister.xlsx mit den Feldern: source_id, title, owner/publisher, language, genre, access_date, license_noteAls outputs/SourceRegister_v1.xlsx eingefroren
Quelle: In dieser Studie erstellt
Corpus-Statistik-VorlageDateivorlageCorpusStats.xlsx mit den Feldern: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetWährend Schritt 3.6 generiert
Quelle: In dieser Studie erstellt
Chinesisches BenutzerwörterbuchRessourcendateiresources/userdict_zh.txt (Domänenspezifische Begriffsliste zur Unterstützung der Segmentierung)Eingefrorene Kopie gespeichert; Prüfsumme in thresholds.txt aufgezeichnet
Quelle: In dieser Studie erstellt/kuratiert
Domänen-SchlüsselwortzuordnungRessourcendateiresources/domain_keywords.csv mit domain_tag-PrioritätsregelnAls outputs/domain_keywords_v1.csv eingefroren; Prüfsumme in alignment_log.txt aufgezeichnet
Quelle: In dieser Studie erstellt/kuratiert
Chinesisch-Englisch BegriffszuordnungstabelleRessourcendateiresources/term_map_zh2en.xlsx mit den Spalten term_zh und term_zh_enAls outputs/term_map_zh2en_v1.xlsx eingefroren; Abdeckung in alignment_log.txt aufgezeichnet
Quelle: In dieser Studie erstellt/kuratiert
SchwellenwertprotokollProtokolldateilogs/thresholds.txt (Muster, Schwellenwerte, Bibliotheksversionen, Ressourcenprüfsummen)Erforderlich für deterministische Wiederholungen
Quelle: In dieser Studie generiert
AbgleichprotokollProtokolldateilogs/alignment_log.txt (Gewichte, k, Cutoffs, Vektorisierer-Einstellungen, Zuordnungsabdeckung, Map-Prüfsummen)Erforderlich für deterministische Wiederholungen
Quelle: In dieser Studie generiert
AnnotationsblattDateivorlagevalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisions, adjudication, rationale)Als outputs/Annotation_v1.xlsx nach Schritt 6.6 eingefroren
Quelle: In dieser Studie erstellt
AuswertungsausgabeAusgabedateioutputs/Evaluation.xlsx (rohe Übereinstimmung, Cohen’s κ, Totals)In Schritt 6.4 erstellt
Quelle: In dieser Studie generiert
Letzter LexikonexportAusgabedateioutputs/FinalLexicon.xlsx gemäß Tabelle 2 SchemaIn Schritt 7.2 erstellt
Quelle: In dieser Studie generiert
TBX-ExportAusgabedateiTBX-Datei, generiert aus FinalLexicon.xlsx mit stabiler entry_id-ZuordnungValidierungsergebnis in run_notes.txt aufgezeichnet
Quelle: In dieser Studie generiert

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

VerhaltenAusgabe 233Ausgabe 233AlleAusgabeLeerer WertAusgabezweisprachige TerminologieLexikonkonstruktionautomatische Termextraktionzweisprachige TermausrichtungExpertenvalidierungTBX TermBase eXchangeInterpretation des kulturellen ErbesChinesisch Englisch bersetzung

Verwandte Artikel