مقالة منهجية

بروتوكول قابل للتكرار لبناء معجم سياحة ثقافية صينية-إنجليزية للسيراميك باستخدام الكوربورا المسجلة

DOI:

10.3791/71320

يوليو 3, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يبني هذا البروتوكول معجم سياحي ثقافي صيني-إنجليزي باستخدام مجموعات ثنائية اللغة مسجلة، وتنظيف موحد، واستخراج مصطلحات المرشحين، وتوافق التصنيف التشابه، والتحقق الخبير مع التقييم. باستخدام هذا السير العملي، تم تصدير 60 إدخالا موثقا مع تعريفات، أمثلة استخدام، سجلات المصدر، ومخرجات متوافقة مع TBX.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعد بناء موارد مصطلحات ثنائية اللغة للسياحة الثقافية الخزفية تحديا لأن النصوص ذات الصلة غالبا ما تكون مجزأة، وخيارات الترجمة غير متسقة، ونادرا ما يتم توثيق سير عمل البناء القابل لإعادة الاستخدام. يقدم هذا البروتوكول سير عمل قابل للتكرار خطوة بخطوة لبناء معجم سياحة ثقافية صينية-إنجليزية للسيراميك من خلال تسجيل وتنظيف المجموعات، واستخراج مصطلحات المرشحين، وتوافق اللغتين، والتحقق من الخبراء مع التحكيم. عند تطبيقه على مجموعة مسجلات ثنائية اللغة، أنتج سير العمل مصطلحات مرشحة صينية وإنجليزية تم اختيارها بشكل مختصر، وأنتج أزواج مصطلحات ثنائية اللغة مصنفة، واحتفظ بالتوافق المعتمد بعد مراجعة خبراء مستقلة. قام المعجم النهائي بتصدير 60 مدخلا موثقا مع أشكال مصطلحات ثنائية اللغة، وعلامات المجالات، وأنواع الترجمة، والتعريفات ثنائية اللغة، وأمثلة الاستخدام، وسجلات المصدر، ومخرجات قابلة للتشغيل البيني مثل ملفات Excel وTBX. لدعم الشفافية وإعادة التشغيل، يسجل البروتوكول أيضا العتبات، وإصدارات الحزم، والموارد المجمدة، وقرارات التحقق طوال سير العمل. وهذا يجعل العملية قابلة للتدقيق وأسهل في التكيف مع مجالات السياحة التراثية الأخرى. عند نقلها إلى نطاق جديد، يمكن للمستخدمين توسيع قائمة الكلمات المفتاحية للنطاق، وتحديث مورد الربط ثنائي اللغة، وتعديل عدد قليل من عتبات القائمة المختصرة والتشابه وفقا لحجم المجموعة وكثافة المصطلحات.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أصبحت السياحة الثقافية محركا مهما لتطوير الوجهات حيث يبحث المسافرون بشكل متزايد عن تجارب قائمة على التراث وذات معنى بدلا من كونها ترفيهية بحتة. على مستوى السياسات والصناعة، أكدت المنظمات الدولية مرارا على قيمة ربط السياحة بالثقافة وتحسين التفسير والتوثيق والتواصل عبر الأصول التراثية المتنوعة. ضمن هذا السياق الأوسع، تتميز السياحة الثقافية الخزفية بكثرة المصطلحات لأن الزوار يواجهون بانتظام مفاهيم متخصصة تتعلق بالمواد، وعمليات التزجيج والحرق، وتقنيات الأفران، والزخارف الأسلوبية، وأنواع القطع الأثرية، وسرديات العمليات الحرفية. غالبا ما تحمل هذه المصطلحات معان تقنية يصعب نقلها بسهولة من خلال إعادة الصياغة العفوية، ويمكن لاختيارات الترجمة أن تشكل مباشرة ما يفهمه الزوار من التسميات، والتفسير الموجه، والمواد التعليمية2. وفي الوقت نفسه، أكدت أطر التراث أن حماية التراث الثقافي غير المادي تعتمد على نقل المعرفة المستمر والوعي العام، وكلاهما يتطلب لغة دقيقة وسهلة الوصول ومناسبة للسياق للتفسير والتعليم3.

على الرغم من هذا الطلب، لا تزال مصادر المصطلحات ثنائية اللغة للسياحة الثقافية الخزفية مجزأة وغير متسقة. عبر ملصقات المتاحف، ونصوص المعرض، وصفحات أدلة السياحة، ووصف التراث، قد يعرض نفس المفهوم بشكل مختلف عبر المؤسسات والمناطق والبيئات التواصلية4. هذا التنوع ليس مجرد أسلوب أسلوبي. يمكن أن يؤثر على فهم الزوار، ويقلل من قابلية المقارنة بين الأوصاف عبر المواقع، ويضعف المصداقية المتصورة لتواصل التراث5. لطالما جادل بحث المصطلحات بأن الموارد المصطلحية عالية الجودة يجب أن تكون موجهة نحو المفاهيم، مدعومة بتعريفات صريحة، ومستندة إلى أدلة قابلة للتتبع مثل المصادر والسياقات وسجلات مراقبة الجودة6. ومع ذلك، لا تزال العديد من فرق المجال تفتقر إلى سير عمل يمكنه تحويل النصوص المتفرقة بشكل منهجي إلى معجم ثنائي اللغة مختارا مع الحفاظ على قواعد القرار الشفافة، والإجراءات القابلة للتكرار، والمخرجات القابلة لإعادة الاستخدام.7. مقارنة بالتجميع اليدوي العشوائي، يوفر البروتوكول الموحد توثيقا أوضح، وتحقق أكثر اتساقا، وظروفا أفضل للتحديث والتدقيق وإعادة الاستخدام عبر المؤسسات.

لمواجهة هذه التحديات، يجب أن ينظم بروتوكول عملي لبناء المعجم ثنائي اللغة مهمتين مرتبطتين: اكتشاف المصطلحات المرشحة والتوافق ثنائي اللغة. بالنسبة لاكتشاف المصطلحات، يمكن للاستخراج التلقائي القائم على المجموعات أن يقلل الاعتماد على الجمع اليدوي الكامل من خلال دمج الأنماط اللغوية مع الأدلة الإحصائية، مما يسهل تحديد المصطلحات ذات الصلة بالمجال على المقياس8. أما في بيئات التراث الثقافي، فلا بد أن يكون بناء المجموعات الجماعية بسيطا. غالبا ما تختلف المواد المصدرية في الأسلوب والسجل والغرض التواصلي، وقد تحتوي على أسماء خاصة بالمجال واتفاقيات وصفية مختلطة.9. تجعل هذه الميزات تسجيل المعلمات الشفاف وقواعد المعالجة المستقرة أمرا خاصا الأهمية. بالنسبة للمحاذاة ثنائية اللغة، يمكن للطرق الحاسوبية توليد أزواج مرشحة مرتبة عبر اللغات من خلال مقارنة أشكال المصطلحات وسياقاتها المحيطة بها، وبعد ذلك يمكن لخبراء المجال التحقق مما إذا كانت الأزواج المقترحة مناسبة مفاهيميا10. في هذا البروتوكول، تستخدم الأتمتة لتوليد وترتيب المرشحين المحتملين أولا، بينما تستخدم مراجعة الخبراء لتأكيدهم أو رفضهم بعد ذلك. هذا المزيج يحسن الكفاءة دون إزالة الحكم التفسيري من القرار النهائي. نظرا لأن مصطلحات التراث غالبا ما تحمل دلالات ثقافية وتعليمية، يجب أن يكون المراجعون قادرين على فحص الأدلة وراء كل زوج مقترح بدلا من الاعتمادعلى مخرج غير شفاف.

هنا، يعرض بروتوكول خطوة بخطوة وقابل للتدقيق لبناء معجم سياحي ثقافي صيني-إنجليزي من مصادر نصية مسجلة. يقوم سير العمل بتوحيد تسجيل المجموعات وتنظيفها، واستخراج المرشحين ثنائي اللغة، وتوليد الأزواج المصنفة، ومراجعة التعليقات المزدوجة مع التحكيم، وإكمال الإدخال النهائي ضمن مخطط ثابت. من خلال دمج تسجيل الإصدارات، والتحكم في العتبات، والموارد المجمدة، والتحقق من الخبراء، يحسن البروتوكول قابلية التكرار، وقابلية التدقيق، والتوحيد القياسي مقارنة بسير العمل الأقل تنظيما لبناء المصطلحات. لدعم إعادة الاستخدام على المدى الطويل في إدارة المصطلحات وممارسات الترجمة، يمكن أيضا تصدير المعجم النهائي بصيغة تبادل المصطلحات (TBX)، وهو معيار متوافق مع ISO لتبادل البيانات المصطلحية الهيكلية12.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

استخدمت هذه الدراسة فقط بيانات نصية متاحة للجمهور أو معتمدة من المؤسسة ولم تشمل مواضيع بشرية أو حيوانية. لم تكن هناك حاجة لأي موافقة أخلاقية مؤسسية.

1. إنشاء مساحة عمل المشروع

  1. أنشئ مجلد مشروع والمجلدات الفرعية التالية: corpus_raw، corpus_clean، المرشحون، المحاذاة، التحقق، المخرجات، السجلات، والموارد.
  2. أنشئ سجل الجري وسجل إعدادات البيئة.
    1. أنشئ السجلات/run_notes.txt.
    2. سجل تاريخ التشغيل/الوقت، ونسخة نظام التشغيل، ونطاق المشروع ك "مصطلحات السياحة الثقافية الصينية-الإنجليزية الخزفية".
    3. قم بتعيين مفسر بايثون على بايثون 3.11 وسجل هذه المعلومات في السجلات/run_notes.txt.
  3. شغل بايثون -m pip freeze > logs/pip_freeze.txt وتأكد من أن logs/pip_freeze.txt تم إنشاؤه وليس فارغا13.
  4. أنشئ ملف الاعتماد وقم بتثبيت بيئة البرمجيات.
    1. أنشئ الموارد/requirements.txt.
    2. سرد نسخ الحزم الأساسية المستخدمة في هذا البروتوكول كما يلي: jieba==0.42.1، spacy==3.7.2، scikit-learn==1.4.2، و RapidFuzz==3.6.1.
    3. سجل أمر التثبيت في logs/run_notes.txt.
    4. تثبيت en_core_web_sm==3.7.1. 1.4.5 تشغيل python -m spacy، التحقق من صحة وتسجيل نسخة النموذج المعتمدة في logs/run_notes.txt.
      ملاحظة: تأكد من وجود كل من log/pip_freeze.txt وlogs/run_notes.txt وغير فارغين قبل المتابعة.

2. تجميع مجموعة متوازنة ثنائية اللغة ومصادر سجلات

  1. اختر المصادر التي تتطابق مع التكوين ثنائي اللغة والنوع الموضح في الجدول 1 وخصص لكل مستند source_id فريد، مثل S001 أو S00214.
  2. أنشئ SourceRegister.xlsx وسجل، لكل وثيقة، source_id، عنوان، مالك/ناشر، لغة، نوع، access_date، و license_note.
  3. حول كل مستند إلى نص UTF-8 العادي، وسم كل ملف باسم source_id_lang.txt (مثل S001_zh.txt أو S001_en.txt)، واحفظ الملفات في corpus_raw.
  4. احفظ نسخة مجمدة من السجل كمخرجات/SourceRegister_v1.xlsx وسجل تاريخ التجميد وإجمالي المستندات (n_docs_zh و n_docs_en) في سجلات/run_notes.txt.
    ملاحظة: يمكن إيقاف البروتوكول مؤقتا هنا. إذا استأنفت لاحقا، لا تغير أي source_id الواجبات.
    تحذير: استخدم فقط النصوص المتاحة للجمهور أو المعتمدة من المؤسسة. لا تعيد توزيع النصوص الكاملة المحمية بحقوق النشر دون إذن صريح.

3. تنظيف وتطبيع ملفات الكوربوس

  1. قم بإزالة أسطر التنقل فقط، والخطوط التي تعتمد فقط على URL، والرؤوس أو التذييلات المكررة التي تتكرر عبر ثلاثة مستندات على الأقل. احتفظ بجميع الخطوط المتبقية بالترتيب الأصلي15.
  2. احتفظ بعلامات الترقيم التي قد تشكل جزءا من الكلمات المتعددة أو المصطلحات المركبة أثناء التنظيف، بما في ذلك الشرطة (-)، والشرطة (/)، والأقواس (( و ))، والنقطة الوسطى (·).
  3. تطبيع النص الصيني عن طريق تحويل الأحرف الأبجدية الرقمية كاملة العرض إلى أحرف نصف العرض وتوحيد أشكال الأقواس إلى ( و ).
  4. تطبيع النص الإنجليزي عن طريق دمج المساحات البيضاء المتكررة في مساحة واحدة وتوحيد جميع متغيرات الشرطة مع شرطة ASCII (-) مع الحفاظ على المركبات المركبة ذات الشرطة.
  5. احفظ كل ملف تم تنظيفه في corpus_clean باستخدام نفس اسم source_id_lang.txt الملف كما في corpus_raw.
  6. سجل source_id، واللغة اللغوية و n_chars_before و n_chars_after، والطابع الزمني، و cleaning_ruleset مضبوطة ك v1.0 في الإخراج/CorpusStats.xlsx16.
    ملاحظة: لكل لغة، تحقق من أن كل ملف في corpus_raw يحتوي على ملف منظف مقابل في corpus_clean بنفس source_id ولاحقة اللغة.
    تحذير: قم بإزالة المعلومات الشخصية مثل الأسماء وأرقام الهواتف وعناوين البريد الإلكتروني أثناء المعالجة المسبقة إذا ظهرت هذه المعلومات في النص الخام.

4. استخراج مصطلحات المرشحين بالصينية والإنجليزية

  1. قسم النص الصيني باستخدام jieba الإصدار 0.42.1 مع موارد/userdict_zh.txt القاموس الثابت، واحتفظ بالمرشحين الذين يتطابقون إما بين 2–8 أحرف صينية متتالية أو 2–6 أحرف صينية مفصولة بفاصل واحدمحفوظ 17.
  2. معالجة النص الإنجليزي باستخدام spaCy الإصدار 3.7.2 مع en_core_web_sm الإصدار 3.7.1 واحتفظ فقط بعبارات الأسماء والمركبات المركبة بالشرطة التي تحتوي على 1–5 رموز18.
  3. احسب التردد كإجمالي عدد تكرارات كل مرشح عبر النسخة المنظفة و doc_freq كعدد ملفات source_id المميزة التي تحتوي على ذلك المرشح مرة واحدة على الأقل.
  4. طبق حدود القائمة المختصرة بالاحتفاظ فقط بالمرشحين الذين لديهم doc_freq ≥ 2 وعدد الترددات ≥ 3 واستبعد المرشحين المتبقين19.
    ملاحظة: تم اختيار هذه القوائم المختصرة لمجموعة صغيرة نسبيا متوازنة من حيث الأنواع. بالنسبة للمجموعات الأكبر أو الأكثر تنوعا، يمكن تعديل العتبات بعد فحص الطيار.
  5. تصدير المرشحين/Candidates_ZH.xlsx والمرشحين/Candidates_EN.xlsx مع الأعمدة المصطلح، التردد، doc_freq، example_source_id، و example_snippet.
  6. تصدير المرشحين/Shortlist_ZH.xlsx والمرشحين/Shortlist_EN.xlsx باستخدام نفس الأعمدة، مع عرض مقتطفات صينية ب ±20 حرفا، ومقتطفات إنجليزية كرموز ±10 حول ظهور موثق واحد.
  7. سجل أسماء وإصدارات الرمز أو الوسوم، وأنماط المرشحين، وحدود القائمة المختصرة في السجلات/thresholds.txt.
  8. احسب مجموع التحقق للموارد/userdict_zh.txt، وسجلها في السجلات/thresholds.txt، وحفظ نسخة مجمدة كمخرجات/userdict_zh_v1.txt20.
    ملاحظة: افتح Shortlist_ZH.xlsx و Shortlist_EN.xlsx وتأكد من أن كلا الملفين يحتويان على صفوف غير صفرية وحقول example_snippet مملوءة.

5. توليد مرشحين للمحاذاة ثنائية اللغة وأزواج مصطلحات الترتيب

  1. لكل مصطلح صيني مختصر، اجمع نوافذ السياق من ±20 حرفا صينيا حول كل ظهور وربطت حتى خمس نوافذ لتشكيل سلسلة سياق واحدة تسمى ctx_zh.
  2. لكل مصطلح إنجليزي تم اختياره اختصارا، اجمع نوافذ السياق من ±10 رموز حول كل ظهور ودمج حتى خمس نوافذ لتشكيل سلسلة سياق واحدة تسمى ctx_en.
  3. إنشاء وتجميد مورد الخرائط ثنائي اللغة.
    1. أنشئ موارد/term_map_zh2en.xlsx باستخدام الأعمدة term_zh و term_zh_en.
    2. ملء الملف باستخدام عملية معتمدة مثل القاموس المؤسسية القائمة، وقوائم المصطلحات ثنائية اللغة المقبولة سابقا، والتطبيع القائم على القواعد.
    3. احفظ التعيين المجمد كمخرجات/term_map_zh2en_v1.xlsx.
    4. سجل تاريخ التجميد، تغطية الخرائط، وملف التحقق في السجلات/alignment_log.txt. ملاحظة: عند تكييف هذا سير العمل مع نطاق جديد، ابدأ مورد التعيين بقائمة بذور لمصطلحات النطاق عالية التردد ووسع الجدول بين إعادة التشغيل الكاملة بدلا من أثناء التقييم.
  4. قم بتعيين كل term_zh إلى شكل مشابه للإنجليزية term_zh_en باستخدام التعيين المجمد واحتفظ بنفس مورد التعيين طوال الجولة21.
  5. قم بتوليد ctx_zh_en عن طريق تطبيق التعيين المجمد على ctx_zh، واستبدال term_zh المناسبات ب term_zh_en مع ترك جميع النصوص الأخرى دون تغيير.
  6. سجل عملية التعيين والتطبيع.
    1. سجل إجراء التعيين في السجلات/alignment_log.txt.
    2. سجل جميع قواعد التطبيع، بما في ذلك الطباعة بالأحرف الصغيرة وتطبيع الشرطة، في السجلات/alignment_log.txt.
  7. احسب درجة تشابه السلاسل النصية S_str باستخدام نسخة RapidFuzz 3.6.1 token_sort_ratio لمقارنة سلاسل المصطلحات الإنجليزية المطبعة بين term_zh_en و term_en وقسم النتيجة على 100 لتعديل الدرجة إلى النطاق [0, 1]22.
  8. احسب درجة التشابه في السياق S_ctx.
    1. استخدم نسخة scikit-learn 1.4.2 وTfidfVectorizer مع المعلمات الثابتة صغير=صحيح، ngram_range=(1, 2)، min_df=1، max_df=0.95، و stop_words="إنجليزي"23.
    2. قم بتركيب المتجهة على مجموعة السلاسل المجمعة من ctx_en و ctx_zh_en من السلسلة الحالية.
    3. احسب S_ctx كتشابه جيب تمام بين كل وتر ctx_zh_en وكل وتر ctx_en.
      ملاحظة: يمثل TF-IDF الأهمية النسبية للكلمات والعبارات القصيرة في كل نافذة سياقية، ويستخدم التشابه الجيب التمامي لمقارنة تمثيلات السياق الناتجة.
  9. احسب درجة التشابه النهائية وصنف أزواج المرشحين.
    1. احسب الدرجة النهائية ك S = 0.60 × S_str + 0.40 × S_ctx.
    2. لكل مصطلح صيني، احتفظ بالأعلى k = 3 مرشحين إنجليزيين مصنفين حسب S.
    3. إزالة النسخ المكررة عن طريق الاحتفاظ بأعلى حالة تقييم لكل زوج فريد (term_zh، term_en).
    4. سجل k، أوزان النقاط، وإجمالي عدد الأزواج المصدرة باللوغار/alignment_log.txt24.
      ملاحظة: تم اختيار نظام الوزن وقيمة k للحفاظ على مجموعة مراجعة قابلة للإدارة مع الحفاظ على بدائل معقولة. بالنسبة للمجموعات الأكبر أو المصطلحات الأكثر تغيرا، يمكن تعديل هذه الإعدادات بعد الاختبار التجريبي.
  10. قم بتعيين قيم domain_tag باستخدام موارد وموارد domain_keywords.csv الثابتة للكلمات المفتاحية وترتيب الأولوية التالي: kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25.
    ملاحظة: عند نقل سير العمل إلى مجال موضوع آخر، استبدل خريطة الكلمات المفتاحية وقم بمراجعة ترتيب الأولوية قبل إعادة تشغيل خط الأنابيب الكامل.
  11. حفظ نسخة مجمدة من خريطة الكلمات المفتاحية كمخرجات/domain_keywords_v1.csv وسجل مجموعتها في السجلات/alignment_log.txt.
  12. تصدير محاذاة/AlignmentPairs.xlsx مع الأعمدة pair_id، term_zh، term_en، term_zh_en، S، rank_within_zh، domain_tag، evidence_snippet_zh، evidence_snippet_en، و evidence_snippet_zh_en.
  13. قم بتسمية كل زوج ك auto_accept أو مراجعة أو auto_reject باستخدام القطع التالية: S ≥ 0.90، 0.75 ≤ S ≤ 0.89، و S < 0.75، وسجل القطع والعدد في كل مجموعة من التصنيفات في سجلات / alignment_log.txt.
    ملاحظة: على بيئة سطح مكتب قياسية مماثلة لتلك المستخدمة في هذه الدراسة، تم الانتهاء من توليد السياق، وتركيب TF-IDF، وتقييم التشابه لمجموعة بهذا الحجم خلال عدة دقائق.
    ملاحظة: افحص عشوائيا على الأقل 10 صفوف في AlignmentPairs.xlsx وتأكد من وجود evidence_snippet_zh_en وأن term_zh_en غير فارغ للحالات المحددة.
    تحذير: حافظ على تثبيت جميع موارد التعيين خلال الجولة. لا تحدث جدول التعيين ثنائي اللغة أو خريطة الكلمات المفتاحية بعد بدء التقييم.

6. التحقق من أزواج الحدود من خلال التعليق التوضيحي والتقييم الخبير

  1. أنشئ تحقق/Annotation.xlsx باستخدام الأعمدة pair_id، term_zh، term_en، term_zh_en، S، domain_tag، A1_decision، A2_decision، التحكيم، والمنطق.
  2. أعد دليلا توضيحيا من صفحة واحدة يحدد التكافؤ المفاهيمي في السياحة الثقافية الخزفية، والترجمات التفسيرية المقبولة، وحالات الاستبعاد مثل التداخل الجزئي، والتمثيلات العامة بشكل مفرط، وأنواع القطع الأثرية غير المتطابقة26.
  3. أمر اثنين من المعلقين بوضع علامة مستقلة على كل زوج ك"تضمين أو استبعاد" باستخدام مقتطفات الأدلة المقدمة، ولا تسمح للمعلقين بمشاهدة قرارات بعضهم البعض.
  4. راجع جميع الخلافات بعد التعليق المستقل وسجل القرار النهائي ومبررات من جملة واحدة في عمودي الحكم والمنطق.
  5. احسب التوافق الخام وκ كوهين باستخدام الإدراج واستبعاد التسميات وتسجيل مقاييس الاتفاق، ويشمل واستبعاد الإجمالي بالمخرجات/Evaluation.xlsx27.
  6. راجع الأزواج المستبعدة لتحديد الأنماط الإيجابية الكاذبة المنهجية وحفظ الأنماط المرفوضة الأكثر تكرارا في السجلات/rule_update_v1.txt.
  7. حفظ نسخة مجمدة من ملف التعليقات المكتملة كمخرجات/Annotation_v1.xlsx ولا تغير التسميات التي تم البت عليها بعد هذه النقطة.
    ملاحظة: يمكن إيقاف البروتوكول مؤقتا هنا. إذا استأنفت لاحقا، لا تراجع أي قرارات تحقق مجمدة.

7. إنهاء المعجم والتصدير

  1. ملء المعجم النهائي باستخدام حقول الإدخال الملخصة في الجدول 2، بما في ذلك أشكال المصطلحات ثنائية اللغة، أجزاء الكلام، علامات النطاق، نوع الترجمة، التعريفات ثنائية اللغة، أمثلة الاستخدام، معلومات المصدر، وأعلام الجودة.
  2. استخدم نفس قيم entry_id عبر جميع الصادرات وتأكد من اتساق المعرف قبل إنشاء الملفات.
  3. صدر الجدول النهائي كمخرجات/FinalLexicon.xlsx وتحقق من أن جميع الحقول المطلوبة ملؤة قبل الحفظ.
  4. قم بإنشاء والتحقق من تصدير TBX.
    1. إنشاء ملف TBX باستخدام نفس قيم entry_id للحفاظ على قابلية التتبع.
    2. تحقق من صحة ملف TBX مقابل مخطط TBX المقصود.
    3. سجل نتيجة التحقق في logs/run_notes.txt28.
  5. أرشفة جميع السجلات، ملفات المعلمات، الموارد المجمدة، والمخرجات في مخرجات المجلد المعدل Lexicon_v1 وتسجيل تاريخ الأرشفة وعدد الملفات في السجلات/run_notes.txt.
  6. قدم السكريبتات والموارد المجمدة وسجلات المعلمات كملفات تكميلية، بما في ذلك المخرجات/userdict_zh_v1.txt، والمخرجات/domain_keywords_v1.csv، والمخرجات/term_map_zh2en_v1.xlsx، والسجلات/thresholds.txt، والسجلات/alignment_log.txt.
  7. توفير مجموعة تحقق معتمدة من النص باستخدام نفس هيكل الملف ومخطط الإخراج حتى يتمكن القراء من إعادة إنتاج سير العمل على المجموعة الفرعية29 التي تم إصدارها.
    تحذير: قبل مشاركة المواد الإضافية، تأكد من عدم تضمين أي نصوص كاملة محمية بحقوق الطبع والنشر، أو معرفات حساسة، أو موارد مؤسسية غير مصرح بها في حزمة الإصدار.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تجميع الكوربوس وعائد التنظيف
وفقا لتصميم المجموعة الموضحة في الجدول 1، تم تجميع مجموعة ثنائية اللغة مسجلة من نصوص المتاحف والمعارض، ووصف التراث، ومواد سياحية موجهة للزوار. بعد التنظيف، تألف المجموع من 12 وثيقة صينية و8 وثائق إنجليزية، بمجموع 47,843 حرفا صينيا و32,193 حرفا إنجليزيا30. احتفظت المجموعة بمزيج المقصود من المواد التقنية والتفسيرية والموجهة للسياحة. اتبعت التركيبة النهائية النطاقات المستهدفة المحددة في الجدول ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تكمن القيمة الرئيسية لهذا البروتوكول في قدرته على تحويل مهمة مصطلحات غالبا ما تدار بشكل غير رسمي إلى سير عمل قابل للتكرار والمراجعة. في السياحة الثقافية الخزفية، العديد من المصطلحات تقنية وتفسيرية في آن واحد: فهي لا تشير فقط إلى المواد، وأنواع الأفران، ومراحل الحرق، أو الأنماط الزخرفية، بل أيضا إلى كيفية نقل هذه المفاهيم للزوار من خلال الملصقات والسرديات والمواد التعليمية36. لهذا السبب، فإن التنوع الثنائي في هذا المجال ليس مسألة أسلوبية ثانوية. يمكن أن تغير ما يفه...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنه لا توجد مصالح مالية أو غير مالية متنافسة تتعلق بهذا العمل.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكر المؤلفون ممارسي السياحة الثقافية الخزفية وموظفي المتحف الذين وفروا الوصول إلى المواد النصية وتغذية الفعل المتعلقة بالمجالات أثناء بناء المجموعة والتحقق. كما يشكر المؤلفون المعنيين المستقلين على مراجعتهم الدقيقة لمرشحي المحاذاة وتعليقاتهم البناءة على تصميم المشاركات. وقد دعم هذا العمل مشروع بحثي تابع لجمعية جيانغشي للتعليم العالي بعنوان "دراسة حول الترجمة الذكية للإنجليزية لمصطلحات السياحة الصينية الخزفية بناء على ديب سيك ونموذج النشر متعدد القنوات" (منحة رقم. WY-D-115).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
محطات عمل الحاسوبالأجهزةأي جهاز كمبيوتر حديث قادر على تشغيل Python 3.11 ومعالجة نصوص المجاميع؛ ≥8 GB من ذاكرة الوصول العشوائي موصى بهالا يلزم رقم كتالوج
المصدر: عام (أي مورد)
نظام التشغيلالبرمجياتWindows 10/11، macOS، أو Linux (سجل النسخة الدقيقة لنظام التشغيل في logs/run_notes.txt)النسخة مسجلة في run_notes.txt
المصدر: مثبت على النظام
PythonالبرمجياتPython 3.11النسخة مسجلة في logs/pip_freeze.txt
المصدر: توزيع مؤسسة برمجيات Python
jiebaمكتبة برمجيات0.42.1jieba==0.42.1
المصدر: مستودع حزم PyPI
spaCyمكتبة برمجيات3.7.2spacy==3.7.2
المصدر: مستودع حزم PyPI
نموذج القناة الإنجليزيةنموذج المعالجة اللغوية الطبيعيةen_core_web_sm 3.7.1 (حزمة نموذج spaCy)en_core_web_sm==3.7.1؛ التسجيل مسجل في run_notes.txt
المصدر: مستودع نماذج spaCy
scikit-learnمكتبة برمجيات1.4.2scikit-learn==1.4.2
المصدر: مستودع حزم PyPI
RapidFuzzمكتبة برمجيات3.6.1RapidFuzz==3.6.1
المصدر: مستودع حزم PyPI
محرر جداول البياناتالبرمجياتأي برنامج قادر على تعديل ملفات.xlsxيستخدم لعرض/تحرير SourceRegister.xlsx، CorpusStats.xlsx، ملفات Candidates/Shortlist
المصدر: عام (أي مورد)
محرر النصوص العاديةالبرمجياتأي برنامج قادر على تعديل ملفات.txt و.csvيستخدم لعرض/تحرير logs/.txt وresources/.csv
المصدر: عام (أي مورد)
أداة تحويل النص العادي إلى UTF-8البرمجياتأي أداة قادرة على تصدير المستندات إلى نصوص عادية بصيغة UTF-8يستخدم في الخطوة 2.3؛ تم تسجيل الطريقة الدقيقة في run_notes.txt
المصدر: عام (أي مورد)
قالب SourceRegisterقالب ملفSourceRegister.xlsx مع الحقول: source_id، title، owner/publisher، language، genre، access_date، license_noteتم تجميده كمخرجات/SourceRegister_v1.xlsx
المصدر: تم إنشاؤه في هذه الدراسة
قالب إحصائيات المجاميعقالب ملفCorpusStats.xlsx مع الحقول: source_id، lang، n_chars_before، n_chars_after، timestamp، cleaning_rulesetتم إنشاؤه أثناء الخطوة 3.6
المصدر: تم إنشاؤه في هذه الدراسة
قاموس المستخدم الصينيملف المواردresources/userdict_zh.txt (قائمة مصطلحات محددة النطاق لدعم التقسيم)نسخة محفوظة؛ تم تسجيل المجموع الحسابي في thresholds.txt
المصدر: تم إنشاؤه/تنظيمه في هذه الدراسة
خريطة الكلمات المفتاحية للمجالملف المواردresources/domain_keywords.csv مع قواعد أولوية domain_tagتم تجميده كمخرجات/domain_keywords_v1.csv؛ تم تسجيل المجموع الحسابي في alignment_log.txt
المصدر: تم إنشاؤه/تنظيمه في هذه الدراسة
جدول ربط المصطلحات من الصينية إلى الإنجليزيةملف المواردresources/term_map_zh2en.xlsx مع الأعمدة term_zh وterm_zh_enتم تجميده كمخرجات/term_map_zh2en_v1.xlsx؛ تم تسجيل التغطية في alignment_log.txt
المصدر: تم إنشاؤه/تنظيمه في هذه الدراسة
سجل العتباتملف السجلlogs/thresholds.txt (النقوش، العتبات، إصدارات المكتبات، فهارس الموارد)مطلوب لإعادة التشغيل الحتمي
المصدر: تم إنشاؤه في هذه الدراسة
سجل المحاذاةملف السجلlogs/alignment_log.txt (الأوزان، k، القطع، إعدادات المنظِّم، تغطية الربط، فهارس الربط)مطلوب لإعادة التشغيل الحتمي
المصدر: تم إنشاؤه في هذه الدراسة
ورقة التعليقاتقالب ملفvalidation/Annotation.xlsx (pair_id، term_zh، term_en، S، القرارات، التحكيم، المبررات)تم تجميده كمخرجات/Annotation_v1.xlsx بعد الخطوة 6.6
المصدر: تم إنشاؤه في هذه الدراسة
مخرج التقييمملف المخرجoutputs/Evaluation.xlsx (الاتفاق الخام، كوهين’s κ، الإجماليات)تم إنتاجه في الخطوة 6.4
المصدر: تم إنشاؤه في هذه الدراسة
تصدير المعجم النهائيملف المخرجoutputs/FinalLexicon.xlsx باتباع مخطط الجدول 2تم إنتاجه في الخطوة 7.2
المصدر: تم إنشاؤه في هذه الدراسة
تصدير TBXملف المخرجملف TBX المتولد من FinalLexicon.xlsx مع تعيين مستقر لـ entry_idتم تسجيل نتيجة التحقق في run_notes.txt
المصدر: تم إنشاؤه في هذه الدراسة

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

233 233 TBX

مقالات ذات صلة