Articolo metodologico

Un protocollo riproducibile per la costruzione di un lessico culturale culturale ceramico cinese–inglese utilizzando corpora registrati

DOI:

10.3791/71320

3 luglio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo costruisce un lessico culturale ceramico cinese–inglese utilizzando corpora bilingui registrati, pulizia standardizzata, estrazione dei termini candidati, allineamento in classifica di similarità e validazione da esperti con adjudicazione. Utilizzando questo flusso di lavoro, sono state esportate 60 voci verificate con definizioni, esempi di utilizzo, record di provenienza e output compatibili con TBX.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Costruire risorse di terminologia bilingue per il turismo culturale ceramico è una sfida perché i testi rilevanti sono spesso frammentati, le scelte di traduzione sono incoerenti e i flussi di lavoro di costruzione riutilizzabili sono raramente documentati. Questo protocollo presenta un flusso di lavoro riproducibile e passo dopo passo per costruire un lessico culturale ceramico cinese–inglese attraverso registrazione e pulizia dei corpus, estrazione dei termini candidati, allineamento bilingue e validazione da esperti con adjudicazione. Applicato a un corpus bilingue registrato, il flusso di lavoro generava i termini candidati selezionati in cinese e inglese, produceva coppie di termini bilingue classificate e manteneva allineamenti validati dopo una revisione indipendente di esperti. Il lessico finalizzato ha esportato 60 voci verificate con moduli di termini bilingui, tag di dominio, tipi di traduzione, definizioni bilingui, esempi d'uso, record di provenienza e output interoperabili come file Excel e TBX. Per supportare trasparenza e rirunabilità, il protocollo registra anche soglie, versioni dei pacchetti, risorse congelate e decisioni di validazione durante tutto il flusso di lavoro. Questo rende la procedura verificabile e più facile da adattare ad altri ambiti del turismo storico. Quando trasferiti in un nuovo dominio, gli utenti possono estendere la lista delle parole chiave del dominio, aggiornare la risorsa bilingue di mappatura e regolare un piccolo numero di soglie di lista e somiglianza in base alla dimensione del corpus e alla densità terminologica.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il turismo culturale è diventato un importante motore dello sviluppo delle destinazioni, poiché i viaggiatori cercano sempre più esperienze basate sul patrimonio che siano significative piuttosto che puramente ricreative. A livello politico e industriale, le organizzazioni internazionali hanno ripetutamente sottolineato il valore di collegare il turismo alla cultura e migliorare l'interpretazione, la documentazione e la comunicazione tra i diversi beni del patrimonio. In questo contesto più ampio, il turismo culturale ceramico è particolarmente ricco di termini perché i visitatori incontrano regolarmente concetti specializzati relativi a materiali, smalti e processi di cottura, tecnologie dei forni, motivi stilistici, tipi di reperti e narrazioni artigianali. Questi termini spesso hanno significati tecnici che non sono facilmente trasmessi tramite parafrasi casuali, e le scelte di traduzione possono influenzare direttamente ciò che i visitatori comprendono dalle etichette, dall'interpretazione guidata e dai materialididattici 2. Allo stesso tempo, i quadri di riferimento del patrimonio hanno sottolineato che la salvaguardia del patrimonio culturale immateriale dipende dalla trasmissione sostenuta della conoscenza e dalla consapevolezza pubblica, entrambe necessità di un linguaggio accurato, accessibile e contestualmente appropriato per l'interpretazione el'educazione 3.

Nonostante questa domanda, le risorse di terminologia bilingue per il turismo culturale ceramico rimangono frammentate e incoerenti. Attraverso etichette museali, testi espositivi, pagine di guide turistiche e descrizioni del patrimonio, lo stesso concetto può essere rappresentato in modo diverso tra istituzioni, regioni e contesticomunicativi. Tale variazione non è solo stilistica. Può influenzare la comprensione dei visitatori, ridurre la comparabilità delle descrizioni tra i siti e indebolire la credibilità percepita della comunicazione sulpatrimonio 5. La ricerca terminologica ha da tempo sostenuto che le risorse termali di alta qualità dovrebbero essere orientate al concetto, supportate da definizioni esplicite e ancorate a prove rintracciabili come fonti, contesti e registri di controlloqualità 6. Tuttavia, molti team di dominio mancano ancora di un flusso di lavoro che possa trasformare sistematicamente testi dispersi in un lessico bilingue curato, preservando al contempo regole decisionali trasparenti, procedure riproducibili e outputriutilizzabili 7. Rispetto alla compilazione manuale ad hoc, un protocollo standardizzato offre una documentazione più chiara, una validazione più coerente e condizioni migliori per aggiornamento, audit e riutilizzo tra istituzioni.

Per affrontare queste sfide, un protocollo pratico per la costruzione di lessico bilingue deve organizzare due compiti collegati: la scoperta dei termini candidati e l'allineamento bilingue. Per la scoperta dei termini, l'estrazione automatica basata su corpus può ridurre la dipendenza dalla raccolta completamente manuale combinando schemi linguistici con evidenze statistiche, facilitando l'identificazione di terminologia rilevante al dominio ascala 8. Nei contesti del patrimonio culturale, tuttavia, la costruzione dei corpi raramente è semplice. I materiali di partenza spesso differiscono per stile, registro e scopo comunicativo, e possono contenere nomi specifici di dominio e convenzioni descrittivemiste 9. Queste caratteristiche rendono particolarmente importante la registrazione trasparente dei parametri e regole di elaborazione stabili. Per l'allineamento bilingue, i metodi computazionali possono generare coppie candidate classificate cross-language confrontando forme di termini e i loro contesti d'uso circostanti, dopodiché gli esperti di dominio possono verificare se le coppie proposte sono concettualmente appropriate10. In questo protocollo, l'automazione viene utilizzata per generare e classificare prima i candidati plausibili, mentre la revisione degli esperti viene utilizzata per confermarli o respingerli successivamente. Questa combinazione migliora l'efficienza senza rimuovere il giudizio interpretativo dalla decisione finale. Poiché la terminologia del patrimonio spesso comporta implicazioni culturali ed educative, i revisori devono essere in grado di esaminare le prove dietro ogni coppia proposta invece di affidarsi a un outputopaco 11.

Qui viene presentato un protocollo passo dopo passo e verificabile per costruire un lessico culturale ceramico cinese–inglese a partire da fonti testuali registrate. Il flusso di lavoro standardizza la registrazione e la pulizia dei corpus, l'estrazione bilingue dei candidati, la generazione di coppie classificate, la revisione a due annotatori con adjudicazione e il completamento dell'inserimento finale sotto uno schema fisso. Integrando il journaling delle versioni, il controllo delle soglianze, le risorse congelate e la validazione degli esperti, il protocollo migliora la riproducibilità, l'auditabilità e la standardizzazione rispetto a flussi di lavoro meno strutturati che costruiscono terminologia. Per supportare il riutilizzo a lungo termine nella gestione della terminologia e nella traduzione, il lessico finalizzato può anche essere esportato in formato TermBase eXchange (TBX), uno standard allineato ISO per lo scambio strutturato di datiterminologici 12.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha utilizzato solo dati testuali pubblici o autorizzati dall'istituzione e non ha coinvolto soggetti umani o animali. Non era richiesta alcuna approvazione etica istituzionale.

1. Crea lo spazio di lavoro del progetto

  1. Crea una cartella progetto e le seguenti sottocartelle: corpus_raw, corpus_clean, candidati, allineamento, validazione, output, log e risorse.
  2. Crea il log di esecuzione e registra le impostazioni dell'ambiente.
    1. Crea log/run_notes.txt.
    2. Annota la data/ora di produzione, la versione del sistema operativo e l'ambito del progetto come "terminologia del turismo culturale ceramico cinese-inglese".
    3. Imposta l'interprete Python su Python 3.11 e registra queste informazioni in log/run_notes.txt.
  3. Esegui python -m pip freeze > logs/pip_freeze.txt e conferma che log/pip_freeze.txt siano stati generati e non sianovuoti 13.
  4. Crea il file di dipendenza e installa l'ambiente software.
    1. Crea risorse/requirements.txt.
    2. Elenca le versioni del pacchetto base usate in questo protocollo come segue: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 e RapidFuzz==3.6.1.
    3. Registra il comando di installazione nei log/run_notes.txt.
    4. Installa en_core_web_sm==3.7.1. 1.4.5 Esegui python -m spacy, valida e registra la versione del modello convalidata nei log/run_notes.txt.
      NOTA: Conferma che sia i log/pip_freeze.txt che i log/run_notes.txt esistano e siano non vuoti prima di procedere.

2. Compilare un corpus bilingue bilanciato e registrare le fonti

  1. Seleziona le fonti per corrispondere alla composizione bilingue e di genere mostrata nella Tabella 1 e assegna a ciascun documento un source_id unico, come S001 o S00214.
  2. Crea SourceRegister.xlsx e registra, per ogni documento, source_id, titolo, proprietario/editore, lingua, genere, access_date e license_note.
  3. Converti ogni documento in testo semplice UTF-8, nomina ogni file come source_id_lang.txt (ad esempio, S001_zh.txt o S001_en.txt) e salva i file in corpus_raw.
  4. Salva una copia congelata del registro come output/SourceRegister_v1.xlsx e registra la data di congelamento e i totali del documento (n_docs_zh e n_docs_en) nei log/run_notes.txt.
    NOTA: Il protocollo può essere messo in pausa qui. Se riprendi più tardi, non modificare nessun source_id incarico.
    ATTENZIONE: Usa solo testi accessibili al pubblico o autorizzati dall'istituzione. Non ridistribuire testi integrali protetti da copyright senza un permesso esplicito.

3. Pulire e normalizzare i file di corpus

  1. Rimuovere le righe solo di navigazione, le righe solo URL e le intestazioni o footer duplicati ripetuti in almeno tre documenti. Tieni tutte le linee rimanenti nel loro ordineoriginale 15.
  2. Mantenere la punteggiatura che può far parte di termini multiparola o composti durante la pulizia, inclusi il trattino (-), la barra (/), le parentesi ( e )) e il punto centrale (·).
  3. Normalizzare il testo cinese convertendo caratteri alfanumerici a piena larghezza in caratteri a metà larghezza e standardizzando le forme di parentesi in ( e ).
  4. Normalizzare il testo inglese comprimendo gli spazi bianchi ripetuti in un unico spazio e standardizzando tutte le varianti del trattino al trattino ASCII (-) preservando i composti con trattino.
  5. Salva ogni file pulito su corpus_clean usando lo stesso nome source_id_lang.txt file di corpus_raw.
  6. Registra source_id, lang, n_chars_before, n_chars_after, timestamp e cleaning_ruleset impostati come v1.0 nelle uscite/CorpusStats.xlsx16.
    NOTA: Per ogni linguaggio, verifica che ogni file in corpus_raw abbia un corrispondente file pulito in corpus_clean con lo stesso suffisso source_id e linguaggio.
    ATTENZIONE: Rimuovere informazioni personali come nomi, numeri di telefono ed indirizzi email durante la preelaborazione se tali informazioni compaiono nel testo grezzo.

4. Estrazione dei termini candidati in cinese e inglese

  1. Segmentare il testo cinese usando jieba versione 0.42.1 con le risorse/userdict_zh.txt fisse del dizionario utente e mantenere i candidati che corrispondono a 2–8 caratteri cinesi consecutivi o a 2–6 caratteri cinesi separati da un delimitatore17 mantenuto.
  2. Elaborare il testo inglese usando spaCy versione 3.7.2 con en_core_web_sm versione 3.7.1 e mantenere solo frasi nominali e composti composti con trattino contenenti 1–5 token18.
  3. Calcola la frequenza come il numero totale di occorrenze di ciascun candidato nel corpus pulito e calcola doc_freq come il numero di file source_id distinti contenenti quel candidato almeno una volta.
  4. Applica le soglie di shortlist mantenendo solo i candidati con doc_freq ≥ 2 e frequenza ≥ 3 e scarta i candidatirimanenti 19.
    NOTA: Queste soglie di selezione sono state selezionate per un corpus relativamente piccolo e bilanciato per generi. Per corpora più grandi o più eterogenei, le soglie possono essere regolate dopo l'ispezione del pilota.
  5. Esporta candidati/Candidates_ZH.xlsx e candidati/Candidates_EN.xlsx con le colonne termine, frequenza, doc_freq, example_source_id e example_snippet.
  6. Esporta candidati/Shortlist_ZH.xlsx e candidati/Shortlist_EN.xlsx usando le stesse colonne, con estratti cinesi mostrati come ±20 caratteri e frammenti in inglese come ±10 token attorno a un evento attestato.
  7. Registra i nomi e le versioni del tokenizzatore o dei tagger, i modelli dei candidati e le soglie della shortlist in log/thresholds.txt.
  8. Calcola un checksum per risorse/userdict_zh.txt, registralo nei log/thresholds.txt e salva una copia congelata come output/userdict_zh_v1.txt20.
    NOTA: Apri Shortlist_ZH.xlsx e Shortlist_EN.xlsx e conferma che entrambi i file contengano righe diverse da zero e campi example_snippet popolati.

5. Generare candidati per allineamento bilingue e classificare le coppie di termini

  1. Per ogni termine cinese selezionato, raccogliere finestre di contesto di ±20 caratteri cinesi attorno a ogni occorrenza e concatenare fino a cinque finestre per formare una stringa di contesto chiamata ctx_zh.
  2. Per ogni termine inglese selezionato, raccogli finestre di contesto di ±10 token attorno a ogni occorrenza e concatena fino a cinque finestre per formare una stringa di contesto chiamata ctx_en.
  3. Crea e congela la risorsa di mappatura bilingue.
    1. Crea risorse/term_map_zh2en.xlsx con le colonne term_zh e term_zh_en.
    2. Popolare il file utilizzando un processo autorizzato come i glossari istituzionali esistenti, le liste di termini bilingui precedentemente accettate e la normalizzazione basata su regole.
    3. Salva la mappatura congelata come output/term_map_zh2en_v1.xlsx.
    4. Registra la data di congelamento, la mappatura della copertura e registra il checksum nei log/alignment_log.txt. NOTA: Quando si adatta questo flusso di lavoro a un nuovo dominio, inizia la risorsa di mappatura con una lista seed di termini di dominio ad alta frequenza ed espandi la tabella tra una replica completa e l'altra, anziché durante il punteggio.
  4. Mappare ogni term_zh in una forma analoga all'inglese term_zh_en usando la mappatura congelata e mantieni la stessa risorsa di mappatura per tutta larun 21.
  5. Genera ctx_zh_en applicando la mappatura congelata a ctx_zh, sostituendo le occorrenze di term_zh corrispondenti con term_zh_en lasciando tutto il testo invariato.
  6. Registra la procedura di mappatura e normalizzazione.
    1. Registra la procedura di mappatura in log/alignment_log.txt.
    2. Registra tutte le regole di normalizzazione, inclusa la minuscolo e la normalizzazione del trattino, in log/alignment_log.txt.
  7. Calcola il punteggio di somiglianza delle stringhe S_str usando RapidFuzz versione 3.6.1 token_sort_ratio per confrontare le stringhe di termini inglesi normalizzate tra term_zh_en e term_en e dividere il risultato per 100 per scalare il punteggio nell'intervallo [0, 1]22.
  8. Calcola il punteggio di similarità contestuale S_ctx.
    1. Usa scikit-learn versione 1.4.2 e TfidfVectorizer con parametri fissi minuscole=True, ngram_range=(1, 2), min_df=1, max_df=0.95 e stop_words="english"23.
    2. Adatta il vettoriatore sull'insieme combinato di stringhe di ctx_en e ctx_zh_en della corsa corrente.
    3. Calcolare S_ctx come la somiglianza coseno tra ogni stringa ctx_zh_en e ciascuna stringa ctx_en.
      NOTA: TF-IDF rappresenta l'importanza relativa delle parole e delle frasi brevi in ogni finestra di contesto, e la somiglianza coseno viene utilizzata per confrontare le rappresentazioni contestuali risultanti.
  9. Calcola il punteggio finale di somiglianza e classifica le coppie candidate.
    1. Calcola il punteggio finale come S = 0,60 × S_str + 0,40 × S_ctx.
    2. Per ogni termine cinese, mantenere i primi k = 3 candidati in inglese classificati per S.
    3. Rimuovi i duplicati mantenendo l'istanza con il punteggio più alto per ogni coppia unica (term_zh, term_en).
    4. Registra k, i pesi dei punteggi e il numero totale di coppie esportate in log/alignment_log.txt24.
      NOTA: Lo schema di ponderazione e il valore di k sono stati selezionati per mantenere un insieme di revisioni gestibile preservando al contempo alternative plausibili. Per corpora più grandi o terminologia più variabile, queste impostazioni possono essere regolate dopo i test pilota.
  10. Assegna i valori domain_tag usando la mappa chiave fissa risorse/domain_keywords.csv e il seguente ordine di priorità: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    NOTA: Quando trasferisci il flusso di lavoro in un altro dominio di oggetto, sostituire la keyword map e rivedere l'ordine di priorità prima di rieseguire l'intera pipeline.
  11. Salva una copia congelata della keyword map come output/domain_keywords_v1.csv e registra il checksum nei log/alignment_log.txt.
  12. Esporta l'allineamento/AlignmentPairs.xlsx con le colonne pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en e evidence_snippet_zh_en.
  13. Etichetta ogni coppia come auto_accept, revisiona o auto_reject usando i seguenti cutoff: S ≥ 0,90, 0,75 ≤ S ≤ 0,89, e S < 0,75, e annota i cutoff e i conteggi in ogni gruppo di etichette in log/alignment_log.txt.
    NOTA: In un ambiente desktop standard comparabile a quello utilizzato in questo studio, la generazione del contesto, l'adattamento TF-IDF e la valutazione della similarità per un corpus di questa dimensione sono stati completati in pochi minuti.
    NOTA: Ispeziona casualmente almeno 10 righe nel AlignmentPairs.xlsx e conferma che evidence_snippet_zh_en sia presente e che term_zh_en non sia vuota per i casi mappati.
    ATTENZIONE: Tieni tutte le risorse di mappatura fissate durante una run. Non aggiornare la tabella di mappa bilingue o la mappa delle parole chiave dopo l'inizio del punteggio.

6. Verifica delle coppie di termini tramite annotazione e arbitraggio esperti

  1. Crea validazione/Annotation.xlsx con le colonne pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, adjudicazione e razionalità.
  2. Prepara una linea guida di annotazione di una pagina che definisca l'equivalenza concettuale nel turismo culturale ceramico, traduzioni esplicative accettabili e casi di esclusione come sovrapposizione parziale, rendering eccessivamente generici e tipi di artefatti26 discorniciati.
  3. Istruire due annotatori a etichettare indipendentemente ogni coppia come include o esclude utilizzando i frammenti di prove forniti, e non permettere agli annotatori di visualizzare le decisioni dell'altro.
  4. Rivedere tutti i disaccordi dopo l'annotazione indipendente e annotare la decisione finale e una giustificazione in una frase nelle colonne di decisione e motivazione.
  5. Calcola l'accordo grezzo e il κ di Cohen usando le etichette di includere ed escludere e registrare le metriche di accordo e i totali di includere ed escludere nelle uscite/Evaluation.xlsx27.
  6. Esaminare le coppie escluse per identificare schemi sistematici di falsi positivi e salvare i modelli rifiutati più frequenti nei log/rule_update_v1.txt.
  7. Salva una copia congelata del file di annotazione completata come output/Annotation_v1.xlsx e non cambiare le etichette agitate dopo questo punto.
    NOTA: Il protocollo può essere messo in pausa qui. Se riprendi in seguito, non rivedere decisioni di validazione bloccate.

7. Finalizzare il lessico ed esportare

  1. Popola il lessico finale utilizzando i campi di voce riassunti nella Tabella 2, inclusi i moduli dei termini bilingue, le parti del discorso, i tag di dominio, il tipo di traduzione, le definizioni bilingui, gli esempi d'uso, le informazioni sulla provenienza e i flag di qualità.
  2. Usa gli stessi valori di entry_id in tutte le esportazioni e conferma la coerenza degli identificatori prima della generazione dei file.
  3. Esporta il foglio di calcolo finale come output/FinalLexicon.xlsx e verifica che tutti i campi richiesti siano popolati prima di salvare.
  4. Genera e convalida l'esportazione TBX.
    1. Genera un file TBX usando gli stessi valori entry_id per preservare la tracciabilità.
    2. Valida il file TBX rispetto allo schema TBX previsto.
    3. Registra il risultato della validazione nei log/run_notes.txt28.
  5. Archivia tutti i log, file parametri, risorse congelate e output nelle cartelle versionate output/Lexicon_v1/ e registra la data di archivio e il conteggio dei file nei log/run_notes.txt.
  6. Fornire gli script, le risorse congelate e i log dei parametri come File Supplementari, inclusi output/userdict_zh_v1.txt, output/domain_keywords_v1.csv, output/term_map_zh2en_v1.xlsx, log/thresholds.txt e logs/alignment_log.txt.
  7. Fornire un sottoinsieme di verifica autorizzato del corpus utilizzando la stessa struttura di file e schema di output, così che i lettori possano riprodurre il flusso di lavoro sul sottoinsiemerilasciato 29.
    ATTENZIONE: Prima di condividere materiali supplementari, verifica che non siano inclusi testi completi protetti da copyright, identificatori sensibili o risorse istituzionali non autorizzate nel pacchetto di rilascio.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rendimento di assemblaggio e pulizia dei corpi
Seguendo il disegno del corpus mostrato nella Tabella 1, è stato assemblato un corpus bilingue registrato con testi museali ed espositivi, descrizioni del patrimonio e materiali turistici rivolti ai visitatori. Dopo la pulizia, il corpus comprendeva 12 documenti cinesi e 8 documenti inglesi, per un totale di 47.843 caratteri cinesi e30 caratteri inglesi. Il corpus mantenne la combi...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il principale valore di questo protocollo risiede nella sua capacità di trasformare un compito terminologico spesso gestito informalmente in un flusso di lavoro riproducibile e revisionabile. Nel turismo culturale ceramico, molti termini sono sia tecnici che interpretativi: si riferiscono non solo a materiali, tipi di forni, fasi di cottura o stili decorativi, ma anche a come questi concetti vengono comunicati ai visitatori tramite etichette, narrazioni e materiali educativi

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi finanziari o non finanziari concorrenti legati a quest'opera.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori ringraziano i professionisti del turismo culturale ceramico e il personale museale che hanno fornito accesso a materiali testuali e feedback di dominio durante la costruzione e la validazione dei corpus. Gli autori ringraziano inoltre i due annotatori indipendenti di dominio per la loro attenta revisione dei candidati all'allineamento e per i commenti costruttivi sul design delle voci. Questo lavoro è stato supportato dal progetto di ricerca dell'Associazione dell'Istruzione Superiore del Jiangxi intitolato "Studio sulla traduzione intelligente inglese della terminologia turistica cinese della ceramica basata su DeepSeek e il suo modello di diffusione multicanale" (Grant No. WY-D-115).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Computer workstationHardwareQualsiasi computer moderno in grado di eseguire Python 3.11 ed elaborare corpora di testo; si consigliano > 8 GB di RAMNessun numero di catalogo richiesto
Fonte: Generico (qualsiasi fornitore)
Sistema operativoSoftwareWindows 10/11, macOS o Linux (registrare la versione esatta del sistema operativo in logs/run_notes.txt)Versione registrata in run_notes.txt
Fonte: Installato di sistema
PythonSoftwarePython 3.11Versione registrata in logs/pip_freeze.txt
Fonte: Distribuzione della Python Software Foundation
jiebaLibreria software0.42.1jieba==0.42.1
Fonte: Repository di pacchetti PyPI
spaCyLibreria software3.7.2spacy==3.7.2
Fonte: Repository di pacchetti PyPI
Modello di pipeline ingleseModello NLPen_core_web_sm 3.7.1 (pacchetto modello spaCy)en_core_web_sm==3.7.1; installazione registrata in run_notes.txt
Fonte: Repository modelli spaCy
scikit-learnLibreria software1.4.2scikit-learn==1.4.2
Fonte: Repository di pacchetti PyPI
RapidFuzzLibreria software3.6.1RapidFuzz==3.6.1
Fonte: Repository di pacchetti PyPI
Editor di fogli di calcoloSoftwareQualsiasi software in grado di modificare file.xlsxUtilizzato per visualizzare/modificare SourceRegister.xlsx, CorpusStats.xlsx, file Candidates/Shortlist
Fonte: Generico (qualsiasi fornitore)
Editor di testo pianoSoftwareQualsiasi software in grado di modificare file.txt e.csvUtilizzato per visualizzare/modificare logs/.txt e resources/.csv
Fonte: Generico (qualsiasi fornitore)
Strumento di conversione testo UTF-8SoftwareQualsiasi strumento in grado di esportare documenti in testo piano UTF-8Utilizzato nel Passo 2.3; metodo esatto registrato in run_notes.txt
Fonte: Generico (qualsiasi fornitore)
Modello SourceRegisterModello di fileSourceRegister.xlsx con campi: source_id, title, owner/publisher, language, genre, access_date, license_noteCongelato come outputs/SourceRegister_v1.xlsx
Fonte: Creato in questo studio
Modello di statistiche del corpusModello di fileCorpusStats.xlsx con campi: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGenera durante il Passo 3.6
Fonte: Creato in questo studio
Dizionario utente cineseFile di risorsaresources/userdict_zh.txt (elenco di termini specifici di dominio per il supporto della segmentazione)Copia congelata salvata; checksum registrato in thresholds.txt
Fonte: Creato/curato in questo studio
Mappa parole chiave di dominioFile di risorsaresources/domain_keywords.csv con regole di priorità domain_tagCongelato come outputs/domain_keywords_v1.csv; checksum registrato in alignment_log.txt
Fonte: Creato/curato in questo studio
Tabella di mappatura termini cinese-ingleseFile di risorsaresources/term_map_zh2en.xlsx con colonne term_zh e term_zh_enCongelato come outputs/term_map_zh2en_v1.xlsx; copertura registrata in alignment_log.txt
Fonte: Creato/curato in questo studio
File di log delle soglieFile di loglogs/thresholds.txt (pattern, soglie, versioni delle librerie, checksum delle risorse)Richiesto per re-esecuzioni deterministiche
Fonte: Generato in questo studio
File di log dell'allineamentoFile di loglogs/alignment_log.txt (pesi, k, cutoff, impostazioni del vettorizzatore, copertura della mappatura, checksum della mappa)Richiesto per re-esecuzioni deterministiche
Fonte: Generato in questo studio
Foglio di annotazioneModello di filevalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decisioni, arbitrato, giustificazione)Congelato come outputs/Annotation_v1.xlsx dopo il Passo 6.6
Fonte: Creato in questo studio
Output di valutazioneFile di outputoutputs/Evaluation.xlsx (accordo grezzo, Cohen’s κ, totali)Prodotto nel Passo 6.4
Fonte: Generato in questo studio
Esportazione del lessico finaleFile di outputoutputs/FinalLexicon.xlsx seguendo lo schema della Tabella 2Prodotto nel Passo 7.2
Fonte: Generato in questo studio
Esportazione TBXFile di outputFile TBX generato da FinalLexicon.xlsx con mappatura entry_id stabileRisultato di validazione registrato in run_notes.txt
Fonte: Generato in questo studio

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

ComportamentoNumero 233Numero 233TuttiNumeroValore vuotoNumeroterminologia bilinguecostruzione di lessiciestrazione automatica di terminiallineamento di termini bilinguevalidazione espertaTBX TermBase eXchangeinterpretazione del patrimonio culturaletraduzione cinese inglese

Articoli correlati