מאמר שיטה

פרוטוקול שכפול לבניית לקסיקון תיירות תרבותית קרמית סינית-אנגלית באמצעות קורפורה רשומה

DOI:

10.3791/71320

3 ביולי 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה בונה לקסיקון תיירות תרבותית קרמית סינית-אנגלית באמצעות קורפוסים דו-לשוניים רשומים, ניקוי סטנדרטי, חילוץ מונחים מועמדים, יישור דירוגי דמיון, ואימות מקצועי באמצעות שיפוט. באמצעות תהליך עבודה זה, 60 רשומות מאומתות יוצאו עם הגדרות, דוגמאות שימוש, רשומות מקור ופלטים תואמי TBX.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בניית משאבי מונחים דו-לשוניים לתיירות תרבותית קרמית היא מאתגרת, משום שטקסטים רלוונטיים לעיתים קרובות מפוצלים, בחירות התרגום אינן עקביות, ותהליכי בנייה רב-פעמיים מתועדים לעיתים רחוקות. פרוטוקול זה מציג תהליך עבודה חוזר, שלב אחר שלב, לבניית לקסיקון תיירות תרבותית קרמית סינית-אנגלית באמצעות רישום וניקוי קורפוס, חילוץ מונחים מועמדים, התאמה דו-לשונית ואימות מקצועי עם שיפוט. כאשר יושמה על קורפוס דו-לשוני רשום, זרימת העבודה יצרה מונחים מועמדים בסינית ובאנגלית שנבחרו לרשימה קצרה, יצרה זוגות מונחים דו-לשוניים מדורגים, ושמרה על יישורים מאומתים לאחר סקירת מומחים עצמאית. הלקסיקון הסופי ייצא 60 ערכים מאומתים עם צורות מונח דו-לשוניות, תגי תחום, סוגי תרגום, הגדרות דו-לשוניות, דוגמאות שימוש, רשומות מקור ופלטים אינטרופרביליים כמו קבצי Excel ו-TBX. כדי לתמוך בשקיפות וביכולת הפעלה חוזרת, הפרוטוקול גם רושם ספים, גרסאות חבילה, משאבים קפואים והחלטות אימות לאורך כל תהליך העבודה. דבר זה הופך את התהליך לביקורת וקל יותר להתאים לתחומי תיירות מורשת אחרים. כאשר המשתמשים מועברים לדומיין חדש, הם יכולים להרחיב את רשימת מילות המפתח של הדומיין, לעדכן את משאב המיפוי הדו-לשוני, ולהתאים מספר קטן של רשימות קצרות וספי דמיון בהתאם לגודל הקורפוס ולצפיפות המונחים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תיירות תרבותית הפכה למניע חשוב בפיתוח יעדים, כאשר מטיילים מחפשים יותר ויותר חוויות מבוססות מורשת שהן משמעותיותולא פנאי בלבד. ברמת המדיניות והתעשייה, ארגונים בינלאומיים הדגישו שוב ושוב את הערך שבקישור תיירות לתרבות ושיפור הפרשנות, התיעוד והתקשורת בין נכסי מורשת מגוונים. בהקשר רחב זה, תיירות תרבותית קרמית עשירה במיוחד במונחים, שכן מבקרים נתקלים לעיתים קרובות במושגים מיוחדים הקשורים לחומרים, תהליכי זיגוג ושריפה, טכנולוגיות תנור, מוטיבים סגנוניים, סוגי חפצים ונרטיבים של תהליכי מלאכה. מונחים אלו נושאים לעיתים משמעויות טכניות שלא קל להעביר באמצעות פרפרזה מזדמנת, ובחירות תרגום יכולות לעצב ישירות את מה שהמבקרים מבינים מתוויות, פרשנות מודרכת וחומרי לימוד2. במקביל, מסגרות המורשת הדגישו כי שמירה על מורשת תרבותית בלתי מוחשית תלויה בהעברת ידע מתמשכת ובמודעות ציבורית, ששניהם דורשים שפה מדויקת, נגישה ומתאימה להקשר לפרשנות ולחינוך3.

למרות הביקוש הזה, משאבי המונחים הדו-לשוניים לתיירות תרבותית קרמית נותרו מפולגים ולא עקביים. בין תוויות מוזיאונים, טקסטים לתערוכה, דפי מדריך תיירות ותיאורי מורשת, אותו מושג עשוי להיות מוצג באופן שונה בין מוסדות, אזורים וסביבות תקשורתיות4. שונות כזו אינה רק סגנונית. היא יכולה להשפיע על הבנת המבקרים, להפחית את ההשוואה בין תיאורים בין אתרים, ולהחליש את האמינות הנתפסת של תקשורת מורשת5. מחקרי טרמינולוגיה טוענים זמן רב כי משאבי מונחים איכותיים צריכים להיות ממוקדי מושג, נתמכים בהגדרות מפורשות, ומעוגנים בראיות ניתנות למעקב כגון מקורות, הקשרים ורשומות בקרת איכות6. עם זאת, צוותי דומיין רבים עדיין חסרים זרימת עבודה שיכולה להפוך באופן שיטתי טקסטים מפוזרים ללקסיקון דו-לשוני אוצר, תוך שמירה על כללי החלטה שקופים, נהלים ניתנים לשחזור ותוצרים רב-פעמיים7. בהשוואה לאיסוף ידני אד-הוק, פרוטוקול סטנדרטי מציע תיעוד ברור יותר, אימות עקבי יותר ותנאים טובים יותר לעדכון, ביקורת ושימוש חוזר בין מוסדות.

כדי להתמודד עם אתגרים אלו, פרוטוקול מעשי לבניית לקסיקונים דו-לשוני צריך לארגן שתי משימות מקושרות: גילוי מונחים מועמדים והתאמה דו-לשונית. לצורך גילוי מונחים, חילוץ אוטומטי מבוסס קורפוס יכול להפחית את התלות באיסוף ידני מלא על ידי שילוב דפוסים לשוניים עם ראיות סטטיסטיות, מה שמקל על זיהוי מונחים רלוונטיים לתחום בקנה מידה8. בהקשרים של מורשת תרבותית, לעומת זאת, בניית קורפוס היא לעיתים נדירות פשוטה. חומרי המקור לעיתים קרובות שונים בסגנון, ברישום ובמטרת התקשורת, והם עשויים להכיל שמות ספציפיים לתחום וקונבנציות תיאוריות מעורבות9. תכונות אלו הופכות את הקלטת הפרמטרים השקופה וכללי העיבוד היציבים לחשובים במיוחד. ליישור דו-לשוני, שיטות חישוביות יכולות ליצור זוגות מועמדים מדורגים בין-שפה על ידי השוואת צורות מונחים והקשרים לשימוש הסובבים אותם, ולאחר מכן מומחי תחום יכולים לוודא אם הזוגות המוצעים מתאימים מושגית10. בפרוטוקול זה, אוטומציה משמשת ליצירת ודרג מועמדים סבירים תחילה, בעוד שביקורת מומחים משמשת לאישור או דחייה לאחר מכן. שילוב זה משפר את היעילות מבלי להסיר שיפוט פרשני מההחלטה הסופית. מכיוון שמונחי מורשת נושאים לעיתים השלכות תרבותיות וחינוכיות, על הסוקרים להיות מסוגלים לבחון את הראיות שמאחורי כל זוג מוצע במקום להסתמך על תוצאה אטומה11.

כאן מוצג פרוטוקול שלב אחר שלב וביקורת לבניית לקסיקון תיירות תרבותית קרמית סינית-אנגלית ממקורות טקסט רשומים. תהליך העבודה מאחד רישום וניקוי קורפוס, חילוץ מועמדים דו-לשוני, יצירת זוגות מדורגים, סקירת שני מערכים עם שיפוט, והשלמת רישום סופי תחת סכימה קבועה. על ידי שילוב רישום גרסאות, בקרת סף, משאבים קפואים ואימות מומחה, הפרוטוקול משפר את השחזוריות, הביקורת והסטנדרטיזציה ביחס לתהליכי עבודה פחות מובנים לבניית מונחים. כדי לתמוך בשימוש חוזר ארוך טווח בניהול מונחים ופרקטיקות תרגום, ניתן לייצא את הלקסיקון הסופי גם בפורמט TermBase eXchange (TBX), תקן המיושר ל-ISO להחלפת נתונים מונחים מובנים12.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה השתמש רק בנתונים טקסטואליים זמינים לציבור או באישור מוסד ולא כלל נבדקים אנושיים או בעלי חיים. לא נדרשה אישור מוסדי מוסדי.

1. ליצור את מרחב העבודה של הפרויקט

  1. צור תיקיית פרויקט ותיקיות המשנה הבאות: corpus_raw, corpus_clean, מועמדים, יישור, אימות, פלטים, יומנים ומשאבים.
  2. צור את יומן הריצה והקלט את הגדרות הסביבה.
    1. צור יומנים/run_notes.txt.
    2. רשם את תאריך/שעת הריצה, גרסת מערכת ההפעלה והיקף הפרויקט כ"מונחי תיירות תרבותית קרמית סינית-אנגלית".
    3. הגדר את מפרש הפייתון ל-Python 3.11 והקלט את המידע הזה ביולוגים/run_notes.txt.
  3. הרץ פייתון -m pip freeze > logs/pip_freeze.txt וודא ש-logs/pip_freeze.txt נוצר ואינו ריק13.
  4. צור את קובץ התלות והתקן את סביבת התוכנה.
    1. צור משאבים/requirements.txt.
    2. רשום את גרסאות החבילות המרכזיות ששימשו בפרוטוקול זה כך: jieba==0.42.1, spacesy==3.7.2, scikit-learn==1.4.2, ו-RapidFuzz==3.6.1.
    3. הקליט את פקודת ההתקנה ביולוגים/run_notes.txt.
    4. התקן en_core_web_sm==3.7.1. 1.4.5 להריץ פייתון -m spacy, לאמת ולרשום את גרסת המודל המאומתת בלוגרים/run_notes.txt.
      הערה: וודא שגם logs/pip_freeze.txt וגם logs/run_notes.txt קיימים ואינם ריקים לפני שממשיכים.

2. הרכבת קורפוס ומקורות רישום דו-לשוני מאוזנים

  1. בחרו מקורות שיתאימו להרכב הדו-לשוני והז'אנרי המוצגים בטבלה 1 והקצו לכל מסמך source_id ייחודי, כמו S001 או S00214.
  2. צור SourceRegister.xlsx והקלט, עבור כל מסמך, source_id, כותרת, בעלים/מוציא לאור, שפה, ז'אנר, access_date license_note.
  3. המרו כל מסמך לטקסט פשוט של UTF-8, קנו שם לכל קובץ כ-source_id_lang.txt (למשל, S001_zh.txt או S001_en.txt), ושמרו את הקבצים ב-corpus_raw.
  4. שמור עותק קפוא של הרשומה כפלט/SourceRegister_v1.xlsx ורשם את תאריך ההקפאה ואת סכומי המסמכים (n_docs_zh ו-n_docs_en) ביומני/run_notes.txt.
    הערה: הפרוטוקול עשוי להיות מושהה כאן. אם ממשיכים מאוחר יותר, אל תשנה משימות source_id.
    אזהרה: השתמש רק בטקסטים הנגישים לציבור או המורשים על ידי מוסדות. אין להפיץ מחדש טקסטים מלאים מוגנים בזכויות יוצרים ללא אישור מפורש.

3. לנקות ולנרמל קבצי קורפוס

  1. הסר שורות ניווט בלבד, שורות עם כתובת URL בלבד, וכותרות או תחתונים כפולים שחזרו על פני לפחות שלושה מסמכים. שמור על כל השורות הנותרות בסדר המקורישלהן 15.
  2. שמרו על סימני פיסוק שעשויים להיות חלק ממונחים מרובי מילים או מורכבים במהלך הניקוי, כולל מקף (-), קו (/), סוגריים (( ו)) ונקודה אמצעית (·).
  3. נרמול טקסט סיני על ידי המרת תווים אלפאנומריים ברוחב מלא לתווים ברוחב חצי וסטנדרטיזציה של צורות סוגריים ל־( ו־).
  4. נרמול הטקסט באנגלית על ידי קיזול רווח לבן חוזר למרווח אחד וסטנדרטיזציה של כל וריאציות מקף למקף ASCII (-) תוך שמירה על תרכובות מקף.
  5. שמור כל קובץ מנוקה corpus_clean עם אותו שם קובץ source_id_lang.txt כמו ב-corpus_raw.
  6. הקלט source_id, לנג, n_chars_before, n_chars_after, טיימסטמפ ו-cleaning_ruleset מוגדר כגרסה 1.0 בפלט/CorpusStats.xlsx16.
    הערה: לכל שפה, ודאו שלכל קובץ ב-corpus_raw יש קובץ נקי מתאים corpus_clean עם אותו source_id וסיומת שפה.
    אזהרה: הסר מידע אישי כגון שמות, מספרי טלפון וכתובות דוא"ל במהלך העיבוד המוקדם אם מידע כזה מופיע בטקסט הגולמי.

4. חילוץ מונחים מועמדים בסינית ובאנגלית

  1. סגמנט טקסט סיני באמצעות גרסה jieba 0.42.1 עם משאבי מילון משתמש קבוע/userdict_zh.txt ושמור מועמדים שמתאימים ל-2–8 תווים סיניים רצופים או 2–6 תווים סיניים מופרדים על ידי מבחןאחד שנשמר 17.
  2. עבדו טקסט באנגלית באמצעות spaCy גרסה 3.7.2 עם גרסת 3.7.1 en_core_web_sm ושמרו רק ביטויי שם עצם ותרכובות מקף המכילים 1–5 אסימונים18.
  3. חשב תדר כמספר ההופעות הכולל של כל מועמד על פני הקורפוס המנוקה וחשב doc_freq כמספר קבצי source_id נפרדים המכילים את אותו מועמד לפחות פעם אחת.
  4. החלו את סף הרשימה הקצרה על ידי שמירת מועמדים עם doc_freq ≥ 2 ותדר ≥ 3 בלבד, ודחו את שארהמועמדים 19.
    הערה: סף הרשימה הקצרה נבחר עבור קורפוס קטן יחסית מאוזן בין ז'אנר. עבור קורפוסים גדולים או הטרוגניים יותר, ניתן להתאים את הספים לאחר בדיקת הטייס.
  5. ייצוא מועמדים/Candidates_ZH.xlsx ומועמדים/Candidates_EN.xlsx עם העמודות מונח, תדר, doc_freq, example_source_id ו-example_snippet.
  6. ייצוא מועמדים/Shortlist_ZH.xlsx ומועמדים/Shortlist_EN.xlsx באמצעות אותן עמודות, כאשר קטעים סיניים מוצגים כ-±20 תווים וקטעים באנגלית כ-±10 אסימונים סביב אירוע אחד שמתועד לכך.
  7. רשמו את שמות הטוקנייזר או התייגרים וגרסאותיהם, דפוסי מועמדים, וספי רשימות קצרות ביומנים/thresholds.txt.
  8. חשב סכום ביקורת למשאבים/userdict_zh.txt, רשם אותו ביומני thresholds.txt, ושמור עותק קפוא כפלט/userdict_zh_v1.txt20.
    הערה: פתח Shortlist_ZH.xlsx ו-Shortlist_EN.xlsx וודא ששני הקבצים מכילים שורות שאינן אפס ושדות example_snippet מאוכלסים.

5. יצירת מועמדים דו-לשוניים וזוגות מונחים לדרג

  1. לכל מונח סיני שנבחר, אסוף חלונות הקשר של ±20 תווים סיניים סביב כל הופעה ומחבר עד חמישה חלונות ליצירת מחרוזת הקשר אחת בשם ctx_zh.
  2. לכל מונח אנגלי שנבחר, יש לאסוף חלונות הקשר של ±10 טוקנים סביב כל אירוע ולחבר עד חמישה חלונות ליצירת מחרוזת הקשר אחת בשם ctx_en.
  3. צור והקפא את משאב המיפוי הדו-לשוני.
    1. צור משאבים/term_map_zh2en.xlsx עם העמודות term_zh ו-term_zh_en.
    2. למלא את הקובץ באמצעות תהליך מורשה כגון מילונים מוסדיים קיימים, רשימות מונחים דו-לשוניים שהתקבלו בעבר, ונרמול מבוסס כללים.
    3. שמור את המיפוי הקפוא כפלט/term_map_zh2en_v1.xlsx.
    4. רשמו את תאריך ההקפאה, כיסוי המיפוי, והגישו את סכום הבדיקה ביומנים/alignment_log.txt. הערה: בעת התאמת תהליך עבודה זה לדומיין חדש, התחל את משאב המיפוי עם רשימת seed של מונחי דומיין בתדירות גבוהה והרחיב את הטבלה בין ריצות מלאות ולא במהלך הניקוד.
  4. מפים כל term_zh לצורה דומה לאנגלית term_zh_en באמצעות המיפוי הקפוא ושמרו על אותו משאב מיפוי לכל הריצה21.
  5. יצר ctx_zh_en על ידי החלת המיפוי הקפוא על ctx_zh, החלפת term_zh התואמת ב-term_zh_en תוך השארת כל שאר הטקסטים ללא שינוי.
  6. רשמו את תהליך המיפוי והנרמל.
    1. הקלט את תהליך המיפוי ביומנים/alignment_log.txt.
    2. רשמו את כל כללי הנרמליזציה, כולל נירמול באותיות קטנות ומקף, בלוגרים/alignment_log.txt.
  7. חשב את ציון הדמיון בין המחרוזות S_str באמצעות גרסה 3.6.1 של RapidFuzz token_sort_ratio להשוואה בין מחרוזות מונחים באנגלית מנורמלות בין term_zh_en ל-term_en ולחלק את התוצאה ב-100 כדי להתאים את הציון לטווח [0, 1]22.
  8. חשב את ציון הדמיון בהקשר S_ctx.
    1. השתמש בגרסת scikit-learn 1.4.2 וב-TfidfVectorizer עם הפרמטרים הקבועים קטנות=True, ngram_range=(1, 2), min_df=1, max_df=0.95, ו-stop_words=english"23.
    2. התקן את הווקטורייזר על קבוצת המחרוזות המשולבות של ctx_en ו-ctx_zh_en מהריצה הנוכחית.
    3. מחשבים S_ctx כדמיון הקוסינוס בין כל מחרוזת ctx_zh_en לכל מחרוזת ctx_en.
      הערה: TF-IDF מייצג את החשיבות היחסית של מילים וביטויים קצרים בכל חלון הקשר, ומשתמשים בדמיון קוסינוסי להשוואת ייצוגי ההקשר המתקבלים.
  9. חשב את ציון הדמיון הסופי ודרג את זוגות המועמדים.
    1. חשב את הניקוד הסופי כ-S = 0.60 × S_str + 0.40 × S_ctx.
    2. לכל מונח סיני, שמרו על ה-k המוביל = 3 מועמדים באנגלית המדורגים לפי S.
    3. הסרת כפילויות על ידי שמירת המופע עם הניקוד הגבוה ביותר לכל זוג ייחודי (term_zh, term_en).
    4. רשומה k, משקלי הניקוד, ומספר הזוגות המיוצאים ב-logs/alignment_log.txt 24.
      הערה: שיטת המשקל והערך של k נבחרו כדי לשמור על מערך סקירות שניתן לנהל תוך שמירה על חלופות סבירות. עבור קורפוסים גדולים יותר או מונחים משתנים יותר, ניתן להתאים הגדרות אלו לאחר ניסוי הפיילוט.
  10. הקצה ערכי domain_tag באמצעות משאבי/domain_keywords.csv מפת מילות מפתח קבועה וסדר עדיפויות הבא: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    הערה: בעת העברת זרימת העבודה לתחום נושא אחר, החלף את מפת מילות המפתח ועדכן את סדר העדיפויות לפני הרצת הצינור המלא.
  11. שמור עותק קפוא של מפת מילות המפתח כפלט/domain_keywords_v1.csv ורשום את סכום הבדיקה שלו ביומני/alignment_log.txt.
  12. ייצוא יישור/AlignmentPairs.xlsx עם העמודות pair_id, term_zh, term_en, term_zh_en, S, rank_within_zh, domain_tag, evidence_snippet_zh, evidence_snippet_en ו-evidence_snippet_zh_en.
  13. סומנו כל זוג כ-auto_accept, ביקורת או auto_reject באמצעות החיתוך הבא: S ≥ 0.90, 0.75 ≤ S ≤ 0.89, ו-S < 0.75, ורשמו את החיתוך והספירות בכל קבוצת תווית בלוגרים/alignment_log.txt.
    הערה: בסביבת שולחן עבודה סטנדרטית הדומה לזו ששימשה במחקר זה, יצירת הקשר, התאמת TF-IDF וניקוד דמיון עבור קורפוס בגודל כזה הושלמו תוך מספר דקות.
    הערה: בדוק באקראי לפחות 10 שורות AlignmentPairs.xlsx ואשר evidence_snippet_zh_en קיים ושה-term_zh_en אינו ריק עבור מקרים ממופים.
    אזהרה: שמור על כל משאבי המיפוי קבועים במהלך ריצה. אל תעדכן את טבלת המיפוי הדו-לשונית או את מפת מילות המפתח לאחר תחילת הניקוד.

6. אימות זוגות מונחים באמצעות הערות מקצועיות ושיפוט

  1. צור אימות/Annotation.xlsx עם העמודות pair_id, term_zh, term_en, term_zh_en, S, domain_tag, A1_decision, A2_decision, שיפוט ורציונל.
  2. הכן מדריך הערות בן עמוד אחד המגדיר שקילות מושגית בתיירות תרבותית קרמית, תרגומים הסבריים מקובלים, ומקרים של החרגה כגון חפיפה חלקית, הדמיות כלליות מדי, וסוגי חפצים לא תואמים26.
  3. הנחו שני מערשים לתייג כל זוג באופן עצמאי ככולל או מחוץ באמצעות קטעי הראיות שסופקו, ואל תאפשר למעירים לצפות בהחלטות זה של זה.
  4. בדוק את כל המחלוקות לאחר הערות עצמאיות ורשם את ההחלטה הסופית ואת ההסבר המשפטי במשפט אחד בעמודות השיפוט וההיגיון המשפטי.
  5. חשב את ההתאמה הגולמית ואת κ של כהן באמצעות תוויות הכללה והחרגה ורשמו את מדדי ההסכמה ואת הכלול והחרגה את הסך הכולל בפלטים/Evaluation.xlsx27.
  6. בדוק את הזוגות שהוחרגו כדי לזהות דפוסים שיטתיים-חיוביים שגויים ולשמור את הדפוסים שנדחו הכי נפוצים ביולוגים/rule_update_v1.txt.
  7. שמור עותק קפוא של קובץ ההערות שהושלם כפלט/Annotation_v1.xlsx ואל תשנה תוויות שהוחלטו לאחר נקודה זו.
    הערה: הפרוטוקול עשוי להיות מושהה כאן. אם ממשיכים מאוחר יותר, אל תשנה החלטות אימות קפואה.

7. לסיים את הלקסיקון ולייצוא

  1. מלא את הלקסיקון הסופי באמצעות שדות הערכים המסוכמים בטבלה 2, כולל צורות מונח דו-לשוניות, חלק דיבור, תגי תחום, סוג תרגום, הגדרות דו-לשוניות, דוגמאות שימוש, מידע מקור ודגלי איכות.
  2. השתמשו באותם ערכי entry_id בכל הייצוא ווודאו עקביות מזהה לפני יצירת קבצים.
  3. ייצא את הגיליון האלקטרוני הסופי כפלט/FinalLexicon.xlsx וודא שכל השדות הנדרשים מאולסים לפני השמירה.
  4. יצר ואמת את ייצוא TBX.
    1. יצר קובץ TBX המשתמש באותם ערכי entry_id כדי לשמור על מעקבות.
    2. אמת את קובץ TBX מול סכמת TBX המיועדת.
    3. רשום את תוצאת האימות ביולוגים/run_notes.txt28.
  5. ארכוב את כל היוגמים, קבצי הפרמטרים, המשאבים הקפואים והפלטים בתיקיית הפלט/Lexicon_v1/ ורשם את תאריך הארכיון וספירת הקבצים ביומנים/run_notes.txt.
  6. ספק את הסקריפטים, המשאבים הקפואים, ויומני הפרמטרים כקבצים משלימים, כולל פלט/userdict_zh_v1.txt, פלט/domain_keywords_v1.csv, פלט/term_map_zh2en_v1.xlsx, יומני/thresholds.txt ויוגים/alignment_log.txt.
  7. ספק תת-קבוצה מאושרת באישור של הקורפוס באמצעות אותו מבנה קובץ וסכימת פלט, כדי שהקוראים יוכלו לשחזר את זרימת העבודה בתת-הקבוצה29 שפורסמה.
    אזהרה: לפני שיתוף חומרים משלימים, ודאו שאין טקסטים מלאים מוגנים בזכויות יוצרים, מזהים רגישים או משאבים מוסדיים לא מורשים כלולים בחבילת השחרור.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הרכבת קורפוס ותפוקת ניקוי
בהמשך לעיצוב הקורפוס המוצג בטבלה 1, הורכב קורפוס דו-לשוני רשום מטקסטים של מוזיאונים ותערוכה, תיאורי מורשת וחומרי תיירות הפונים למבקרים. לאחר הניקוי, הקורפוס כלל 12 מסמכים סיניים ו-8 מסמכים באנגלית, בסך הכל 47,843 תווים סיניים ו-32,193 תווים באנגלית. הקורפוס שמר על השילוב המיועד של חומרים טכניים, פרשניים ותיירותיים. הרכב הקורפוס הסופי התבסס על טווחי היעד שהוגדרו בטבלה 1.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הערך העיקרי של פרוטוקול זה טמון ביכולתו להפוך משימת טרמינולוגיה שמטופלת לעיתים באופן לא פורמלי לזרימת עבודה שניתן לשחזר ולסקירה. בתיירות תרבותית קרמית, מונחים רבים הם גם טכניים וגם פרשניים: הם מתייחסים לא רק לחומרים, סוגי תנורים, שלבי שריפה או סגנונות דקורטיביים, אלא גם לאופן שבו מושגים אלו מועברים למבקרים בתוויות, נרטיבים וחומרי לימוד36. לכן, שונות דו-לשונית בתחום זה אינה סוגיה סגנונית קטנה. הוא יכול לשנות את מה שהמבקרים מבינים וכיצד משמעות תרבותית מועברת בין פלט...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי אין להם אינטרסים פיננסיים או לא-פיננסיים מתחרים הקשורים לעבודה זו.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מודים לאנשי התיירות התרבותית הקרמית ולצוות המוזיאון שסיפקו גישה לחומרים טקסטואליים ולמשוב על הדומיין במהלך בניית הקורפוס והאישור. המחברים גם מודים לשני המפרשים העצמאיים של הדומיין על סקירתם המדוקדקת של מועמדים ליישור ועל הערותיהם הבונות על עיצוב הכניסה. עבודה זו נתמכה על ידי פרויקט מחקר של איגוד ההשכלה הגבוהה של ג'יאנגשי שכותרתו "מחקר על תרגום תבוני לאנגלית של מונחי תיירות קרמיקה סינית בהתבסס על DeepSeek ומודל ההפצה הרב-ערוצי שלה" (מענק מס' WY-D-115).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
תחנת עבודה ממוחשבתחומרהכל מחשב מודרני המסוגל להריץ את Python 3.11 ולעבד קורפוס טקסט; מומלץ ≥8 GB RAMאין צורך במספר קטלוג
מקור: גנרי (כל ספק)
מערכת הפעלהתוכנהWindows 10/11, macOS, או Linux (רשום את גרסת ה-OS המדויקת ב-logs/run_notes.txt)הגרסה רשומה ב-run_notes.txt
מקור: מותקן במערכת
PythonתוכנהPython 3.11הגרסה רשומה ב-logs/pip_freeze.txt
מקור: חלוקת Python Software Foundation
jiebaספריית תוכנה0.42.1jieba==0.42.1
מקור: מאגר חבילות PyPI
spaCyספריית תוכנה3.7.2spacy==3.7.2
מקור: מאגר חבילות PyPI
מודל צינור אנגליתמודל NLPen_core_web_sm 3.7.1 (חבילת מודל spaCy)en_core_web_sm==3.7.1; התקנה רשומה ב-run_notes.txt
מקור: מאגר מודל spaCy
scikit-learnספריית תוכנה1.4.2scikit-learn==1.4.2
מקור: מאגר חבילות PyPI
RapidFuzzספריית תוכנה3.6.1RapidFuzz==3.6.1
מקור: מאגר חבילות PyPI
עורך גיליונות אלקטרונייםתוכנהכל תוכנה המסוגלת לערוך קבצי.xlsxמשמש לצפייה/עריכה של SourceRegister.xlsx, CorpusStats.xlsx, קבצי Candidates/Shortlist
מקור: גנרי (כל ספק)
עורך טקסט פשוטתוכנהכל תוכנה המסוגלת לערוך קבצי.txt ו-.csvמשמש לצפייה/עריכה של logs/.txt ו-resources/.csv
מקור: גנרי (כל ספק)
כלי המרה לטקסט UTF-8תוכנהכל כלי המסוגל לייצא מסמכים לטקסט פשוט UTF-8משמש בשלב 2.3; השיטה המדויקת רשומה ב-run_notes.txt
מקור: גנרי (כל ספק)
תבנית SourceRegisterתבנית קובץSourceRegister.xlsx עם שדות: source_id, כותרת, בעלים/מו"ל, שפה, ז'אנר, תאריך גישה, הערת רישיוןמוקפאה כ-outputs/SourceRegister_v1.xlsx
מקור: נוצרה במחקר זה
תבנית סטטיסטיקות קורפוסתבנית קובץCorpusStats.xlsx עם השדות: source_id, שפה, n_chars_before, n_chars_after, חותמת זמן, ערכת כללים לניקוינוצרת במהלך שלב 3.6
מקור: נוצרה במחקר זה
מילון משתמש סיניקובץ משאבresources/userdict_zh.txt (רשימת מונחים ספציפית לתחום לתמיכה בפילוח)העתק קפוא נשמר; ביקורת התוצאה רשומה ב-thresholds.txt
מקור: נוצר/אוצר במחקר זה
מפת מילות מפתח לתחוםקובץ משאבresources/domain_keywords.csv עם כללי עדיפות domain_tagמוקפאה כ-outputs/domain_keywords_v1.csv; ביקורת התוצאה רשומה ב-alignment_log.txt
מקור: נוצר/אוצר במחקר זה
טבלת מיפוי מונחים סינית-אנגליתקובץ משאבresources/term_map_zh2en.xlsx עם העמודות term_zh ו-term_zh_enמוקפאת כ-outputs/term_map_zh2en_v1.xlsx; כיסוי רשום ב-alignment_log.txt
מקור: נוצר/אוצר במחקר זה
יומן סףקובץ יומןlogs/thresholds.txt (דפוסים, ספים, גרסאות ספריות, ביקורת תוצאה של משאבים)נדרש להפעלות חוזרות דטרמיניסטיות
מקור: נוצר במחקר זה
יומן יישורקובץ יומןlogs/alignment_log.txt (משקלים, k, ספים, הגדרות וקטוריזציה, כיסוי מיפוי, ביקורת תוצאה של מיפוי)נדרש להפעלות חוזרות דטרמיניסטיות
מקור: נוצר במחקר זה
גיליון ביצוע ביצועיםתבנית קובץvalidation/Annotation.xlsx (מזהה צמד, term_zh, term_en, S, החלטות, הכרעה, נימוק)מוקפאה כ-outputs/Annotation_v1.xlsx לאחר שלב 6.6
מקור: נוצר במחקר זה
פלט הערכהקובץ פלטoutputs/Evaluation.xlsx (הסכמה גולמית, Cohen’s κ, סה״כ)מיוצר בשלב 6.4
מקור: נוצר במחקר זה
ייצוא לקסיקון סופיקובץ פלטoutputs/FinalLexicon.xlsx על פי תוכנית טבלה 2מיוצר בשלב 7.2
מקור: נוצר במחקר זה
ייצוא TBXקובץ פלט

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

233233TBX TermBase eXchange

מאמרים קשורים